前沿趋势与未来 / Scaling Laws 与涌现能力
CHAPTER 11 · TOPIC 01

Scaling Laws 与涌现能力

Scaling Laws(缩放定律)是大模型时代最重要的发现之一——模型性能随着参数量、数据量和计算量的增加呈现可预测的幂律增长。而涌现能力(Emergent Abilities)则是模型规模达到某个阈值后突然展现的新能力。理解这两个概念对把握 AI 发展脉络至关重要。

一句话理解

Scaling Laws(缩放定律)是大模型时代最重要的发现之一——模型性能随着参数量、数据量和计算量的增加呈现可预测的幂律增长。而涌现能力(Emergent Abilities)则是模型规模达到某个阈值后突然展现的新能力。理解这两个概念对把握 AI 发展脉络至关重要。

阅读前置

建议完成原理与安全章节

本文关注

Scaling Laws、涌现能力、Scaling 的未来方向

所在知识层

未来方向 · 前沿趋势与未来

文章导航
主教学视觉Scaling Laws 与涌现能力 · 知识结构

点击图中节点可定位到对应正文。

核心主题关系与流向

引言

Scaling Laws(缩放定律)是大模型时代最重要的发现之一——模型性能随着参数量、数据量和计算量的增加呈现可预测的幂律增长。而涌现能力(Emergent Abilities)则是模型规模达到某个阈值后突然展现的新能力。理解这两个概念对把握 AI 发展脉络至关重要。


1. Scaling Laws

1.1 基本定律

TEXT
Kaplan et al. (2020) 发现:

模型损失 L 与三个变量的关系:

L ∝ N^(-α)   (N = 参数量, α ≈ 0.076)
L ∝ D^(-β)   (D = 数据量, β ≈ 0.095)
L ∝ C^(-γ)   (C = 计算量, γ ≈ 0.050)

核心洞察:
- 更大的模型 + 更多的数据 + 更多的计算 = 更好的性能
- 三者的增长需要协调(不能只加大一个)
- 性能提升是可预测的(幂律关系)

1.2 Chinchilla 定律

语义 SVG 重绘Scaling Laws 与涌现能力 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

示例:7B 模型最优训练数据 ≈ 140B token…70B 模型最优训练数据 ≈ 1.4T token…175B 模型
查看原文结构
示例:
  7B 模型 → 最优训练数据 ≈ 140B tokens
  70B 模型 → 最优训练数据 ≈ 1.4T tokens
  175B 模型 → 最优训练数据 ≈ 3.5T tokens
语义 SVG 重绘Scaling Laws 与涌现能力 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

查看原文结构
LLaMA 的实践:
  LLaMA-2-7B: 2T tokens(远超 Chinchilla 最优)
  LLaMA-2-70B: 2T tokens
  → 数据量远超参数量需求,效果更好

1.3 Scaling 的经济账

语义 SVG 重绘Scaling Laws 与涌现能力

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

查看原文结构
模型规模    GPU (A100)    时间      成本估算
───────────────────────────────────────────
7B          128 块        ~1 天     ~$5,000
13B         256 块        ~2 天     ~$20,000
70B         512 块        ~7 天     ~$150,000
405B        2048 块       ~30 天    ~$2,500,000

2. 涌现能力

2.1 什么是涌现

语义 SVG 重绘Scaling Laws 与涌现能力

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入与上下文参数量 涌现的能力系统核心1B 基本的语言理解和生成10B 少样本学习(Few-shot Learni…50B 链式思维推理(Chain-of-Thoug…工具、结果与反馈100B 复杂数学推理、代码生成500B 多步推理、指令遵循、工具使用
查看原文结构
参数量    涌现的能力
─────────────────────────
~1B       基本的语言理解和生成
~10B      少样本学习(Few-shot Learning)
~50B      链式思维推理(Chain-of-Thought)
~100B     复杂数学推理、代码生成
~500B     多步推理、指令遵循、工具使用

2.2 涌现能力的争议

TEXT
关于涌现的两种观点:

观点 A: 涌现是真实的(Wei et al., 2022)
  - 某些能力在小模型上完全不存在
  - 只在超过阈值后才出现
  - 这是规模带来的质变

观点 B: 涌现是测量假象(Schaeffer et al., 2023)
  - 涌现可能是因为评估指标不够精细
  - 使用更细粒度的指标,能力提升是平滑的
  - "突然出现"只是因为之前没有达到评估的阈值

当前共识:
  - 某些涌现是真实的(如复杂推理)
  - 某些涌现是测量问题(如简单任务)
  - 规模带来的能力提升总体上是连续的

3. Scaling 的未来方向

3.1 超越参数规模

TEXT
传统 Scaling: 更多参数 + 更多数据 + 更多计算

新方向:

1. 数据质量 Scaling
   不追求数据量,而是追求数据质量
   用高质量数据训练小模型 > 用低质量数据训练大模型
   
2. 推理时 Scaling(Test-time Compute)
   模型不变,但在推理时投入更多计算
   如: 多步推理、自我验证、搜索
   OpenAI o1 的成功证明了这一方向

3. 专业化 Scaling
   不追求通用大模型,而是在特定领域深入
   如: 代码模型、数学模型、科学模型

4. 效率 Scaling
   更高效的架构(MoE、SSM)
   用更少的资源达到更好的效果

3.2 推理时 Scaling

语义 SVG 重绘Scaling Laws 与涌现能力 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

传统方式:训练时投入更多计算推理时快速生成
查看原文结构
传统方式:
  训练时投入更多计算 → 推理时快速生成
语义 SVG 重绘Scaling Laws 与涌现能力 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

推理时 Scaling:模型在推理时"思考更久"生成更好的回答
查看原文结构
推理时 Scaling:
  模型在推理时"思考更久"→ 生成更好的回答

4. 本章小结

概念要点
Scaling Laws性能随参数/数据/计算幂律增长
Chinchilla参数和数据应同步增长(20B tokens/1B params)
涌现能力规模阈值后突然出现的新能力
推理 Scaling推理时投入更多计算提升质量
未来方向数据质量 + 推理计算 + 专业化 + 效率

相关章节


延伸阅读

  • Kaplan, J. et al. (2020). "Scaling Laws for Neural Language Models". arXiv
  • Hoffmann, J. et al. (2022). "Training Compute-Optimal Large Language Models". NeurIPS
  • Wei, J. et al. (2022). "Emergent Abilities of Large Language Models". TMLR
  • OpenAI (2024). "Learning to Reason with LLMs" (o1 technical report)