Scaling Laws 与涌现能力
Scaling Laws(缩放定律)是大模型时代最重要的发现之一——模型性能随着参数量、数据量和计算量的增加呈现可预测的幂律增长。而涌现能力(Emergent Abilities)则是模型规模达到某个阈值后突然展现的新能力。理解这两个概念对把握 AI 发展脉络至关重要。
一句话理解
Scaling Laws(缩放定律)是大模型时代最重要的发现之一——模型性能随着参数量、数据量和计算量的增加呈现可预测的幂律增长。而涌现能力(Emergent Abilities)则是模型规模达到某个阈值后突然展现的新能力。理解这两个概念对把握 AI 发展脉络至关重要。
阅读前置
建议完成原理与安全章节
本文关注
Scaling Laws、涌现能力、Scaling 的未来方向
所在知识层
未来方向 · 前沿趋势与未来
文章导航
点击图中节点可定位到对应正文。
核心主题关系与流向
引言
Scaling Laws(缩放定律)是大模型时代最重要的发现之一——模型性能随着参数量、数据量和计算量的增加呈现可预测的幂律增长。而涌现能力(Emergent Abilities)则是模型规模达到某个阈值后突然展现的新能力。理解这两个概念对把握 AI 发展脉络至关重要。
1. Scaling Laws
1.1 基本定律
TEXT
Kaplan et al. (2020) 发现:
模型损失 L 与三个变量的关系:
L ∝ N^(-α) (N = 参数量, α ≈ 0.076)
L ∝ D^(-β) (D = 数据量, β ≈ 0.095)
L ∝ C^(-γ) (C = 计算量, γ ≈ 0.050)
核心洞察:
- 更大的模型 + 更多的数据 + 更多的计算 = 更好的性能
- 三者的增长需要协调(不能只加大一个)
- 性能提升是可预测的(幂律关系)1.2 Chinchilla 定律
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
示例:
7B 模型 → 最优训练数据 ≈ 140B tokens
70B 模型 → 最优训练数据 ≈ 1.4T tokens
175B 模型 → 最优训练数据 ≈ 3.5T tokens根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
LLaMA 的实践:
LLaMA-2-7B: 2T tokens(远超 Chinchilla 最优)
LLaMA-2-70B: 2T tokens
→ 数据量远超参数量需求,效果更好1.3 Scaling 的经济账
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
模型规模 GPU (A100) 时间 成本估算
───────────────────────────────────────────
7B 128 块 ~1 天 ~$5,000
13B 256 块 ~2 天 ~$20,000
70B 512 块 ~7 天 ~$150,000
405B 2048 块 ~30 天 ~$2,500,0002. 涌现能力
2.1 什么是涌现
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
参数量 涌现的能力
─────────────────────────
~1B 基本的语言理解和生成
~10B 少样本学习(Few-shot Learning)
~50B 链式思维推理(Chain-of-Thought)
~100B 复杂数学推理、代码生成
~500B 多步推理、指令遵循、工具使用2.2 涌现能力的争议
TEXT
关于涌现的两种观点:
观点 A: 涌现是真实的(Wei et al., 2022)
- 某些能力在小模型上完全不存在
- 只在超过阈值后才出现
- 这是规模带来的质变
观点 B: 涌现是测量假象(Schaeffer et al., 2023)
- 涌现可能是因为评估指标不够精细
- 使用更细粒度的指标,能力提升是平滑的
- "突然出现"只是因为之前没有达到评估的阈值
当前共识:
- 某些涌现是真实的(如复杂推理)
- 某些涌现是测量问题(如简单任务)
- 规模带来的能力提升总体上是连续的3. Scaling 的未来方向
3.1 超越参数规模
TEXT
传统 Scaling: 更多参数 + 更多数据 + 更多计算
新方向:
1. 数据质量 Scaling
不追求数据量,而是追求数据质量
用高质量数据训练小模型 > 用低质量数据训练大模型
2. 推理时 Scaling(Test-time Compute)
模型不变,但在推理时投入更多计算
如: 多步推理、自我验证、搜索
OpenAI o1 的成功证明了这一方向
3. 专业化 Scaling
不追求通用大模型,而是在特定领域深入
如: 代码模型、数学模型、科学模型
4. 效率 Scaling
更高效的架构(MoE、SSM)
用更少的资源达到更好的效果3.2 推理时 Scaling
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
传统方式:
训练时投入更多计算 → 推理时快速生成根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
推理时 Scaling:
模型在推理时"思考更久"→ 生成更好的回答4. 本章小结
| 概念 | 要点 |
|---|---|
| Scaling Laws | 性能随参数/数据/计算幂律增长 |
| Chinchilla | 参数和数据应同步增长(20B tokens/1B params) |
| 涌现能力 | 规模阈值后突然出现的新能力 |
| 推理 Scaling | 推理时投入更多计算提升质量 |
| 未来方向 | 数据质量 + 推理计算 + 专业化 + 效率 |
相关章节
- 什么是大语言模型 — 模型基础:理解 Scaling 所作用的对象
- 预训练原理与工程实践 — 训练规模与算力投入的工程落地
- AGI 之路 — 规模能否通向 AGI?
延伸阅读
- Kaplan, J. et al. (2020). "Scaling Laws for Neural Language Models". arXiv
- Hoffmann, J. et al. (2022). "Training Compute-Optimal Large Language Models". NeurIPS
- Wei, J. et al. (2022). "Emergent Abilities of Large Language Models". TMLR
- OpenAI (2024). "Learning to Reason with LLMs" (o1 technical report)