什么是大语言模型
大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。
大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。
建议先阅读第 01 章
LLM 的本质定义、参数规模与模型能力、Scaling Laws:大模型的"物理定律"
技术地基 · 大模型核心原理
文章导航
点击图中节点可定位到对应正文。
引言
大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。
1. LLM 的本质定义
1.1 一句话定义
**大语言模型是一个在海量文本上训练的、基于 Transformer 架构的自回归概率模型,其核心能力是预测给定上下文后最可能出现的下一个 token。**
这个定义包含四个关键要素:
| 要素 | 含义 |
|---|---|
| 海量文本训练 | 模型从互联网规模的文本数据中学习语言模式和世界知识 |
| Transformer 架构 | 使用自注意力机制处理序列数据(详见下一章) |
| 自回归 | 逐 token 生成,每一步基于前面所有已生成的 token |
| 概率模型 | 输出的是下一个 token 的概率分布,而非确定性结果 |
1.2 自回归生成的工作原理
LLM 生成文本的过程,本质上是一个接一个地预测 token:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
Step 1: P(下一个token | "今天天气") → "真" (概率 0.15), "不" (0.12), "很" (0.10), ...
选择 "真"根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
Step 2: P(下一个token | "今天天气真") → "不" (0.30), "好" (0.25), "是" (0.08), ...
选择 "好"根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
Step 3: P(下一个token | "今天天气真好") → "啊" (0.20), "。" (0.18), "!" (0.15), ...
选择 "!"关键洞察: 虽然 LLM 每一步只做"预测下一个 token"这一件简单的事,但当模型足够大、训练数据足够多时,这个简单任务的副产品是模型学会了语言的语法、语义、逻辑推理、世界知识等复杂能力。
1.3 Token 的概念
Token ≠ 字/词
Token 是 LLM 处理文本的基本单位,由分词器(Tokenizer)将文本切分而成:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
英文示例:
"Hello, how are you?" → ["Hello", ",", " how", " are", " you", "?"]
(6 tokens)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
中文示例:
"今天天气真好" → ["今天", "天气", "真", "好"] 或 ["今", "天", "天", "气", "真", "好"]
(取决于分词器)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
代码示例:
"def hello():" → ["def", " hello", "(", ")", ":"]为什么 Token 很重要:
- 模型的上下文窗口以 token 计数(如 128K tokens)
- 训练成本以 token 计数(如 10T tokens 的训练数据)
- API 定价以 token 计数(输入/输出每百万 token 的价格)
- 一个英文单词约 1.3 tokens,一个中文字约 1.5-2 tokens
2. 参数规模与模型能力
2.1 什么是"参数"
模型的参数就是神经网络中所有的权重(weights)和偏置(biases),它们是模型在训练过程中"学习"到的知识:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
一个简单的神经元:
output = w₁x₁ + w₂x₂ + w₃x₃ + b
↑ ↑
权重(可学习) 偏置(可学习)参数量的量级对比:
| 模型 | 参数量 | 类比 |
|---|---|---|
| GPT-2 (2019) | 1.5B | 约等于人脑突触连接数的 0.001% |
| GPT-3 (2020) | 175B | 约等于人脑突触连接数的 0.1% |
| GPT-4 (2023) | 估计 ~1.8T(MoE) | 接近人脑突触连接数 |
| LLaMA 3 405B | 405B | 开源最大稠密模型之一 |
2.2 模型参数的存储
- FP32(全精度):每个参数 4 字节 → 70B 模型需要 280GB 内存
- FP16(半精度):每个参数 2 字节 → 70B 模型需要 140GB 内存
- INT8(8位量化):每个参数 1 字节 → 70B 模型需要 70GB 内存
- INT4(4位量化):每个参数 0.5 字节 → 70B 模型需要 35GB 内存
这就是为什么大模型需要多张 GPU 才能运行——单张 GPU 通常只有 24-80GB 显存。
3. Scaling Laws:大模型的"物理定律"
3.1 核心规律
Scaling Laws 描述了模型性能与三个关键变量之间的幂律关系:
把公式、变量和含义拆开呈现,便于对照阅读。
模型性能(Loss) = f(参数量 N, 数据量 D, 计算量 C)三条独立的幂律:L(N) ∝ N^(-α)固定数据和计算,增大模型L(D) ∝ D^(-β)固定模型和计算,增大数据L(C) ∝ C^(-γ)固定模型和数据,增大计算关键发现: 这些关系在跨越多个数量级的范围内都成立——从几百万参数到几千亿参数,性能提升是平滑且可预测的。
3.2 Chinchilla 最优
DeepMind 的 Chinchilla 论文(2022)给出了给定计算预算下的最优分配策略:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
→ 参数量和数据量应该同比例增长对比实际模型:
| 模型 | 参数量 | 训练 tokens | 是否 Chinchilla 最优 |
|---|---|---|---|
| GPT-3 (175B) | 175B | 300B | 否(参数太多,数据不够) |
| Chinchilla (70B) | 70B | 1.4T | 是 |
| LLaMA 2 (70B) | 70B | 2T | 是 |
| LLaMA 3 (405B) | 405B | 15T+ | 接近最优 |
3.3 涌现能力(Emergent Abilities)
定义: 某些能力在小模型中几乎不存在,但当模型规模超过某个阈值后突然出现。
已观察到的涌现能力:
| 能力 | 出现的模型规模 | 说明 |
|---|---|---|
| 少样本学习 | ~10B+ | 仅给几个示例就能学会新任务 |
| 思维链推理 | ~100B+ | 能进行多步骤逻辑推理 |
| 代码生成 | ~10B+ | 能编写可运行的程序 |
| 指令遵循 | ~10B+ | 能理解和遵循复杂的文字指令 |
| 算术推理 | ~100B+ | 能解决多位数加减乘除 |
关于涌现的争议:
- 一些研究者认为涌现可能部分是由于评估指标的离散性(如精确匹配)造成的假象
- 如果使用连续指标(如 BLEU、ROUGE),性能提升往往是平滑的
- 但无论如何,大模型确实在许多任务上展现出小模型不具备的能力
4. LLM 与传统 NLP 模型的根本区别
4.1 范式对比
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
传统 NLP:
任务定义 → 标注数据 → 训练专用模型 → 部署
(每个任务一个模型)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
LLM:
海量数据 → 预训练通用模型 → 提示/微调 → 多任务应用
(一个模型服务所有任务)| 维度 | 传统 NLP | LLM |
|---|---|---|
| 模型数量 | 每个任务一个专用模型 | 一个通用模型 |
| 训练数据 | 需要任务特定的标注数据 | 预训练无需标注数据(自监督) |
| 泛化能力 | 只能处理训练过的任务 | 能处理未见过的任务(零样本) |
| 开发成本 | 每个新任务需要重新开发 | 新任务只需修改提示词 |
| 性能上限 | 受限于标注数据量 | 受限于预训练数据量和模型规模 |
4.2 LLM 的能力层次
可以将 LLM 的能力理解为多个层次:
第 5 层:创造性能力
写诗、编故事、提出新想法
第 4 层:推理能力
数学推理、逻辑推理、因果推理
第 3 层:知识能力
事实问答、概念解释、知识关联
第 2 层:语义能力
理解含义、情感分析、意图识别
第 1 层:语法能力
生成合乎语法的句子、文本分类小模型(< 1B)通常只具备第 1-2 层能力,而大模型(100B+)可以在第 4-5 层展现令人惊讶的表现。
5. LLM 的局限性
5.1 核心局限
| 局限 | 说明 | 示例 |
|---|---|---|
| 幻觉 | 模型会生成看似合理但事实错误的内容 | 编造不存在的论文引用 |
| 知识截止 | 模型只知道训练数据截止日期之前的信息 | 无法回答最新新闻 |
| 数学能力有限 | 大数计算、精确推理仍然困难 | 12345 × 67890 = ? |
| 缺乏真实理解 | 基于统计模式而非真正的语义理解 | 可能被对抗性输入欺骗 |
| 一致性问题 | 相同问题的不同措辞可能得到矛盾答案 | 正问和反问给出不同答案 |
| 无法自我更新 | 训练后知识固定,不能自主学习 | 需要重新训练才能修正错误 |
5.2 这些局限的应对方案
| 局限 | 应对方案 |
|---|---|
| 幻觉 | RAG(检索增强生成)、事实核查 |
| 知识截止 | RAG、定期重新训练 |
| 数学能力 | 代码解释器(让模型写代码计算) |
| 缺乏理解 | 更好的对齐技术、更多训练数据 |
| 一致性问题 | 更好的 RLHF、Constitutional AI |
| 无法更新 | 在线学习、持续预训练 |
6. 本章小结
核心要点:
- LLM 的本质是"下一个 token 预测器",但这个简单目标在大模型上产生了涌现式的复杂能力
- Scaling Laws 是理解和预测大模型行为的"物理定律"
- 涌现能力使得大模型在某些规模阈值后突然具备新能力
- LLM 相比传统 NLP 是范式级的革新——从"一任务一模型"到"一模型多任务"
- LLM 有明确的局限性,但这些局限正在被 RAG、工具调用、推理模型等技术逐步弥补
相关章节
- Transformer 架构深度剖析 — LLM 底层依赖的核心架构
- 预训练原理与工程实践 — 模型的语言能力与世界知识从何而来
- Scaling Laws 与涌现能力 — 规模如何驱动性能提升与能力涌现
- 大模型时代(2020-至今) — LLM 崛起的历史脉络
延伸阅读
- Kaplan, J. et al. (2020). "Scaling Laws for Neural Language Models". arXiv:2001.08361
- Hoffmann, J. et al. (2022). "Training Compute-Optimal Large Language Models". NeurIPS
- Wei, J. et al. (2022). "Emergent Abilities of Large Language Models". TMLR
- Schaeffer, R. et al. (2023). "Emergent Abilities of Large Language Models are Mirages". arXiv:2404.02935