大模型核心原理 / 什么是大语言模型
CHAPTER 02 · TOPIC 01

什么是大语言模型

大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。

一句话理解

大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。

阅读前置

建议先阅读第 01 章

本文关注

LLM 的本质定义、参数规模与模型能力、Scaling Laws:大模型的"物理定律"

所在知识层

技术地基 · 大模型核心原理

文章导航
主教学视觉什么是大语言模型 · 知识结构

点击图中节点可定位到对应正文。

核心主题关系与流向

引言

大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。


1. LLM 的本质定义

1.1 一句话定义

**大语言模型是一个在海量文本上训练的、基于 Transformer 架构的自回归概率模型,其核心能力是预测给定上下文后最可能出现的下一个 token。**

这个定义包含四个关键要素:

要素含义
海量文本训练模型从互联网规模的文本数据中学习语言模式和世界知识
Transformer 架构使用自注意力机制处理序列数据(详见下一章)
自回归逐 token 生成,每一步基于前面所有已生成的 token
概率模型输出的是下一个 token 的概率分布,而非确定性结果

1.2 自回归生成的工作原理

LLM 生成文本的过程,本质上是一个接一个地预测 token:

语义 SVG 重绘什么是大语言模型 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

Step 1: P(下一个token …"真" (概率 0.15), "不" …选择 "真"
查看原文结构
Step 1: P(下一个token | "今天天气") → "真" (概率 0.15), "不" (0.12), "很" (0.10), ...
选择 "真"
语义 SVG 重绘什么是大语言模型 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

Step 2: P(下一个token …"不" (0.30), "好" (0.…选择 "好"
查看原文结构
Step 2: P(下一个token | "今天天气真") → "不" (0.30), "好" (0.25), "是" (0.08), ...
选择 "好"
语义 SVG 重绘什么是大语言模型 · 结构 3

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

Step 3: P(下一个token …"啊" (0.20), "。" (0.…选择 "!"
查看原文结构
Step 3: P(下一个token | "今天天气真好") → "啊" (0.20), "。" (0.18), "!" (0.15), ...
选择 "!"

关键洞察: 虽然 LLM 每一步只做"预测下一个 token"这一件简单的事,但当模型足够大、训练数据足够多时,这个简单任务的副产品是模型学会了语言的语法、语义、逻辑推理、世界知识等复杂能力。

1.3 Token 的概念

Token ≠ 字/词

Token 是 LLM 处理文本的基本单位,由分词器(Tokenizer)将文本切分而成:

语义 SVG 重绘什么是大语言模型 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

英文示例:"Hello, how are you…"Hello", ",", " how…(6 tokens)
查看原文结构
英文示例:
"Hello, how are you?" → ["Hello", ",", " how", " are", " you", "?"]
(6 tokens)
语义 SVG 重绘什么是大语言模型 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

中文示例:"今天天气真好""今天", "天气", "真", "好…(取决于分词器)
查看原文结构
中文示例:
"今天天气真好" → ["今天", "天气", "真", "好"] 或 ["今", "天", "天", "气", "真", "好"]
(取决于分词器)
语义 SVG 重绘什么是大语言模型 · 结构 3

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

代码示例:"def hello():""def", " hello", "(…
查看原文结构
代码示例:
"def hello():" → ["def", " hello", "(", ")", ":"]

为什么 Token 很重要:

  • 模型的上下文窗口以 token 计数(如 128K tokens)
  • 训练成本以 token 计数(如 10T tokens 的训练数据)
  • API 定价以 token 计数(输入/输出每百万 token 的价格)
  • 一个英文单词约 1.3 tokens,一个中文字约 1.5-2 tokens

2. 参数规模与模型能力

2.1 什么是"参数"

模型的参数就是神经网络中所有的权重(weights)和偏置(biases),它们是模型在训练过程中"学习"到的知识:

语义 SVG 重绘什么是大语言模型

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

一个简单的神经元:output = w₁x₁ + w₂x…权重(可学习) 偏置(可学习)
查看原文结构
一个简单的神经元:
output = w₁x₁ + w₂x₂ + w₃x₃ + b
           ↑                    ↑
        权重(可学习)      偏置(可学习)

参数量的量级对比:

模型参数量类比
GPT-2 (2019)1.5B约等于人脑突触连接数的 0.001%
GPT-3 (2020)175B约等于人脑突触连接数的 0.1%
GPT-4 (2023)估计 ~1.8T(MoE)接近人脑突触连接数
LLaMA 3 405B405B开源最大稠密模型之一

2.2 模型参数的存储

  • FP32(全精度):每个参数 4 字节 → 70B 模型需要 280GB 内存
  • FP16(半精度):每个参数 2 字节 → 70B 模型需要 140GB 内存
  • INT8(8位量化):每个参数 1 字节 → 70B 模型需要 70GB 内存
  • INT4(4位量化):每个参数 0.5 字节 → 70B 模型需要 35GB 内存

这就是为什么大模型需要多张 GPU 才能运行——单张 GPU 通常只有 24-80GB 显存。


3. Scaling Laws:大模型的"物理定律"

3.1 核心规律

Scaling Laws 描述了模型性能与三个关键变量之间的幂律关系:

公式视图什么是大语言模型 · 关系式

把公式、变量和含义拆开呈现,便于对照阅读。

模型性能(Loss) = f(参数量 N, 数据量 D, 计算量 C)
三条独立的幂律:
L(N) ∝ N^(-α)固定数据和计算,增大模型
L(D) ∝ D^(-β)固定模型和计算,增大数据
L(C) ∝ C^(-γ)固定模型和数据,增大计算

关键发现: 这些关系在跨越多个数量级的范围内都成立——从几百万参数到几千亿参数,性能提升是平滑且可预测的。

3.2 Chinchilla 最优

DeepMind 的 Chinchilla 论文(2022)给出了给定计算预算下的最优分配策略:

语义 SVG 重绘什么是大语言模型

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

→ 参数量和数据量应该同比例增长
查看原文结构
→ 参数量和数据量应该同比例增长

对比实际模型:

模型参数量训练 tokens是否 Chinchilla 最优
GPT-3 (175B)175B300B否(参数太多,数据不够)
Chinchilla (70B)70B1.4T
LLaMA 2 (70B)70B2T
LLaMA 3 (405B)405B15T+接近最优

3.3 涌现能力(Emergent Abilities)

定义: 某些能力在小模型中几乎不存在,但当模型规模超过某个阈值后突然出现。

已观察到的涌现能力:

能力出现的模型规模说明
少样本学习~10B+仅给几个示例就能学会新任务
思维链推理~100B+能进行多步骤逻辑推理
代码生成~10B+能编写可运行的程序
指令遵循~10B+能理解和遵循复杂的文字指令
算术推理~100B+能解决多位数加减乘除

关于涌现的争议:

  • 一些研究者认为涌现可能部分是由于评估指标的离散性(如精确匹配)造成的假象
  • 如果使用连续指标(如 BLEU、ROUGE),性能提升往往是平滑的
  • 但无论如何,大模型确实在许多任务上展现出小模型不具备的能力

4. LLM 与传统 NLP 模型的根本区别

4.1 范式对比

语义 SVG 重绘什么是大语言模型 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

传统 NLP:任务定义标注数据训练专用模型部署(每个任务一个模型)
查看原文结构
传统 NLP:
  任务定义 → 标注数据 → 训练专用模型 → 部署
  (每个任务一个模型)
语义 SVG 重绘什么是大语言模型 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

LLM:海量数据预训练通用模型提示/微调多任务应用(一个模型服务所有任务)
查看原文结构
LLM:
  海量数据 → 预训练通用模型 → 提示/微调 → 多任务应用
  (一个模型服务所有任务)
维度传统 NLPLLM
模型数量每个任务一个专用模型一个通用模型
训练数据需要任务特定的标注数据预训练无需标注数据(自监督)
泛化能力只能处理训练过的任务能处理未见过的任务(零样本)
开发成本每个新任务需要重新开发新任务只需修改提示词
性能上限受限于标注数据量受限于预训练数据量和模型规模

4.2 LLM 的能力层次

可以将 LLM 的能力理解为多个层次:

TEXT
第 5 层:创造性能力
  写诗、编故事、提出新想法

第 4 层:推理能力
  数学推理、逻辑推理、因果推理

第 3 层:知识能力
  事实问答、概念解释、知识关联

第 2 层:语义能力
  理解含义、情感分析、意图识别

第 1 层:语法能力
  生成合乎语法的句子、文本分类

小模型(< 1B)通常只具备第 1-2 层能力,而大模型(100B+)可以在第 4-5 层展现令人惊讶的表现。


5. LLM 的局限性

5.1 核心局限

局限说明示例
幻觉模型会生成看似合理但事实错误的内容编造不存在的论文引用
知识截止模型只知道训练数据截止日期之前的信息无法回答最新新闻
数学能力有限大数计算、精确推理仍然困难12345 × 67890 = ?
缺乏真实理解基于统计模式而非真正的语义理解可能被对抗性输入欺骗
一致性问题相同问题的不同措辞可能得到矛盾答案正问和反问给出不同答案
无法自我更新训练后知识固定,不能自主学习需要重新训练才能修正错误

5.2 这些局限的应对方案

局限应对方案
幻觉RAG(检索增强生成)、事实核查
知识截止RAG、定期重新训练
数学能力代码解释器(让模型写代码计算)
缺乏理解更好的对齐技术、更多训练数据
一致性问题更好的 RLHF、Constitutional AI
无法更新在线学习、持续预训练

6. 本章小结

核心要点:

  1. LLM 的本质是"下一个 token 预测器",但这个简单目标在大模型上产生了涌现式的复杂能力
  2. Scaling Laws 是理解和预测大模型行为的"物理定律"
  3. 涌现能力使得大模型在某些规模阈值后突然具备新能力
  4. LLM 相比传统 NLP 是范式级的革新——从"一任务一模型"到"一模型多任务"
  5. LLM 有明确的局限性,但这些局限正在被 RAG、工具调用、推理模型等技术逐步弥补

相关章节


延伸阅读

  • Kaplan, J. et al. (2020). "Scaling Laws for Neural Language Models". arXiv:2001.08361
  • Hoffmann, J. et al. (2022). "Training Compute-Optimal Large Language Models". NeurIPS
  • Wei, J. et al. (2022). "Emergent Abilities of Large Language Models". TMLR
  • Schaeffer, R. et al. (2023). "Emergent Abilities of Large Language Models are Mirages". arXiv:2404.02935