AI 发展简史 / 大模型时代(2020–至今)
CHAPTER 01 · TOPIC 06

大模型时代(2020–至今)

2020 年,OpenAI 发布的 GPT-3 以 1750 亿参数震惊世界,展示了大模型"涌现能力"的惊人潜力。2022 年末,ChatGPT 的发布将 AI 从学术实验室推向了全球公众的视野。此后短短两年间,大模型的能力边界以令人瞠目的速度扩展——从文本生成到多模态理解,从对话助手到自主智能体…

一句话理解

2020 年,OpenAI 发布的 GPT-3 以 1750 亿参数震惊世界,展示了大模型"涌现能力"的惊人潜力。2022 年末,ChatGPT 的发布将 AI 从学术实验室推向了全球公众的视野。此后短短两年间,大模型的能力边界以令人瞠目的速度扩展——从文本生成到多模态理解,从对话助手到自主智能体…

阅读前置

无需技术基础

本文关注

GPT-3:Scaling Laws 的第一次大规模验证(2020)、ChatGPT:AI 的"iPhone 时刻"(2022)、GPT-4 与多模态时代(2023)

所在知识层

历史坐标 · AI 发展简史

文章导航
主教学视觉大模型时代(2020–至今) · 知识结构

点击图中节点可定位到对应正文。

事件 / 阶段演进方向

引言

2020 年,OpenAI 发布的 GPT-3 以 1750 亿参数震惊世界,展示了大模型"涌现能力"的惊人潜力。2022 年末,ChatGPT 的发布将 AI 从学术实验室推向了全球公众的视野。此后短短两年间,大模型的能力边界以令人瞠目的速度扩展——从文本生成到多模态理解,从对话助手到自主智能体。本章记录这场正在进行的革命。


1. GPT-3:Scaling Laws 的第一次大规模验证(2020)

1.1 GPT-3 的规模与能力

2020 年 6 月,OpenAI 发布了 GPT-3,这是当时最大的语言模型

参数数值
参数量1750 亿(175B)
训练数据约 570GB 文本(Common Crawl + Wikipedia + Books + 代码)
上下文窗口2048 tokens
架构Transformer Decoder-only,96 层,96 个注意力头
训练成本估计约 460 万美元(使用 Microsoft Azure 超算)

GPT-3 展示的关键能力:

  • 少样本学习(Few-shot Learning):只需给几个示例,模型就能理解任务
  • 零样本学习(Zero-shot Learning):仅凭文字描述就能完成从未见过的任务
  • 代码生成:虽然不完美,但能生成可运行的简单程序
  • 文本创作:能写出连贯的短篇小说、新闻文章

1.2 Scaling Laws:大模型的"物理定律"

2020 年,OpenAI 的 Jared Kaplan 等人发表了关于 Scaling Laws 的重要论文:

核心发现: 模型性能(用 Loss 衡量)与以下三个因素呈幂律关系:

公式视图大模型时代(2020–至今) · 关系式

把公式、变量和含义拆开呈现,便于对照阅读。

L(N) ∝ N^(-0.076)模型性能随参数量 N 增长
L(D) ∝ D^(-0.095)模型性能随数据量 D 增长
L(C) ∝ C^(-0.050)模型性能随计算量 C 增长

这意味着:

  • 增大模型、数据或算力中的任何一个,性能都会可预测地提升
  • 这种提升是平滑的、没有明显瓶颈的
  • 可以通过小规模实验预测大规模模型的性能

Scaling Laws 的战略意义:

  • 为"越大越好"的策略提供了理论依据
  • 使得大模型训练变成了一个"工程问题"而非"科研赌博"
  • 直接推动了 Google、Meta、Anthropic 等公司的大模型军备竞赛

1.3 Chinchilla Scaling Laws(2022)

DeepMind 在 2022 年的 Chinchilla 论文中修正了 Scaling Laws:

  • 发现之前的模型普遍"过度参数化"——参数量太大但训练数据不够
  • 最优策略:参数量和数据量应该同比例增长
  • 例如:一个 70B 参数的模型应该用 1.4T tokens 的数据训练
  • Chinchilla(70B 参数 + 1.4T tokens)的性能超过了更大的 Gopher(280B 参数 + 300B tokens)

2. ChatGPT:AI 的"iPhone 时刻"(2022)

2.1 从 GPT-3 到 ChatGPT

GPT-3 虽然强大,但普通用户难以直接使用。2022 年的几个关键进展将大模型推向了大众:

InstructGPT(2022.01):OpenAI 通过人类反馈的微调(RLHF)让 GPT-3 学会遵循指令:

  • 收集人类标注的"好回答"和"坏回答"
  • 训练奖励模型(Reward Model)学习人类偏好
  • 使用 PPO(Proximal Policy Optimization)算法优化模型
  • 结果:模型输出更有帮助、更安全、更诚实

ChatGPT(2022.11.30):基于 GPT-3.5 的对话界面产品

2.2 ChatGPT 的爆发式增长

里程碑时间
发布2022 年 11 月 30 日
100 万用户5 天
3000 万用户约 2 个月
1 亿月活约 2 个月(历史上最快达到 1 亿用户的产品)
GPT-4 版本发布2023 年 3 月

2.3 为什么 ChatGPT 如此成功

  • 交互方式自然:对话式交互比 API 调用或命令行门槛低得多
  • 能力足够好:能写邮件、解释概念、写代码、翻译——覆盖日常高频需求
  • 即时满足:几秒钟内给出高质量回答
  • RLHF 的效果:回答风格友好、有条理、乐于帮助——用户体验极佳

3. GPT-4 与多模态时代(2023)

3.1 GPT-4(2023.03)

OpenAI 在 2023 年 3 月发布了 GPT-4:

关键升级:

  • 多模态:能同时理解文本和图像
  • 性能大幅提升:在法律、医学等专业考试中达到人类前 10% 水平
  • 更长的上下文窗口(8K → 后续扩展到 32K → 128K)
  • 更好的指令遵循和安全性

GPT-4 在各考试中的表现:

考试GPT-3.5 排名GPT-4 排名
律师考试(Bar Exam)后 10%前 10%
SAT 数学中等前 1%
GRE 写作中等偏下前 25%
美国医学执照考试不及格通过

3.2 2023 年的大模型军备竞赛

GPT-4 之后,各大公司纷纷推出竞品:

时间公司产品特点
2023.02GoogleBard(后更名 Gemini)集成搜索,后来发展出多模态
2023.03AnthropicClaude强调安全和长上下文
2023.07MetaLLaMA 2开源,推动开源生态
2023.09MistralMistral 7B小模型效率标杆
2023.12GoogleGemini 1.0原生多模态架构

4. 开源生态的爆发

4.1 LLaMA 系列的催化效应

LLaMA(2023.02):Meta 发布的 Large Language Model Meta AI

  • 7B / 13B / 33B / 65B 四个规模
  • 在同等计算预算下性能最优
  • 权重意外泄露后,开源社区迅速跟进微调

LLaMA 2(2023.07):正式开源商用

  • 7B / 13B / 70B 三个规模
  • 提供了 Chat 版本(经过 RLHF 微调)
  • 开源许可允许商业使用,极大推动了产业应用

LLaMA 3(2024.04)

  • 8B / 70B / 405B 三个规模
  • 405B 模型性能接近 GPT-4
  • 训练数据量超过 15T tokens

4.2 其他重要开源模型

模型公司特色
Mistral / MixtralMistral AIMoE 架构,高效推理
Qwen 系列阿里巴巴中文能力强,多模态
DeepSeek 系列DeepSeek高性价比,推理能力突出
Yi 系列零一万物中英双语,长上下文
InternLM上海 AI Lab工具调用能力强
Phi 系列Microsoft小模型,教科书质量数据训练
GemmaGoogle轻量级开源模型

4.3 开源 vs 闭源的关系

语义 SVG 重绘大模型时代(2020–至今)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

闭源领先开源追赶闭源再突破开源再追赶
查看原文结构
闭源领先 → 开源追赶 → 闭源再突破 → 开源再追赶

5. 推理模型的兴起(2024)

5.1 OpenAI o1 系列

2024 年 9 月,OpenAI 发布了 o1(原代号 "Strawberry"),开创了"推理模型"新范式:

核心理念:

  • 在回答问题前进行长链"思考"(chain of thought)
  • 类似于人类的 System 2 思维——慢思考、深推理
  • 通过强化学习训练模型学会自我纠错和策略调整
  • 在数学、编程、科学推理上取得突破性进展

o1 的表现:

  • 国际数学奥林匹克预赛:从 GPT-4 的 13% 跃升至 83%
  • Codeforces 编程竞赛:达到前 500 名水平(约前 1%)
  • 推理时间越长,准确率越高(可通过算力换取性能)

5.2 DeepSeek-R1

2025 年初,中国公司 DeepSeek 发布了 R1:

  • 开源的推理模型,性能媲美 o1
  • 使用纯强化学习训练(无需监督数据做冷启动)
  • 成本远低于 OpenAI 的闭源模型
  • 引发了全球对中国 AI 能力的重新评估

5.3 推理模型的意义

推理模型标志着大模型从"快速直觉回答"向"深度思考回答"的转变:

  • 不是更大,而是更聪明
  • 通过更长的思考时间换取更高的准确性
  • 特别适合数学、科学、编程等需要严密推理的领域

6. Agent 浪潮(2024–至今)

6.1 从对话到行动

2024 年开始,AI 行业的关注焦点从"大模型本身"转向"用大模型驱动的智能体":

Agent 的核心演进:

语义 SVG 重绘大模型时代(2020–至今)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

查看原文结构
2022: 对话机器人(ChatGPT)
  ↓
2023: 工具调用助手(Function Calling)
  ↓
2024: 半自主 Agent(能操作浏览器、文件系统)
  ↓
2025: 多 Agent 协作系统(自主完成复杂任务)

6.2 关键 Agent 产品

产品公司能力
DevinCognition第一个"AI 软件工程师"
Claude Computer UseAnthropic操作桌面应用
OpenAI Codex / OperatorOpenAI代码生成 + Web 操作
ManusMonica AI通用 Agent
GitHub Copilot WorkspaceMicrosoft端到端软件开发

6.3 MCP 协议(2024.11)

Anthropic 发布了 Model Context Protocol,为 Agent 与外部工具的交互制定了标准化协议:

  • 类似于 AI 领域的"USB-C 接口"
  • 定义了 Host → Client → Server 的三层架构
  • 让任何 Agent 都能接入任何工具
  • 迅速获得了行业广泛支持

7. 多模态统一

7.1 文本-图像-音频-视频的全面覆盖

模态代表产品能力
文本生成GPT-4, Claude 3.5专业级写作和分析
图像理解GPT-4V, Gemini描述、分析、推理图像内容
图像生成DALL·E 3, Midjourney v6高保真图像生成
视频生成Sora, Runway Gen-3文本到视频
语音对话GPT-4o 实时语音自然、有情感的语音交互
视频理解Gemini 1.5 Pro理解长达数小时的视频

7.2 统一模型的趋势

  • GPT-4o(2024.05):统一模型同时处理文本、图像、音频
  • Gemini 1.5 Pro:原生多模态架构,100 万 token 上下文
  • 趋势:从"多个专用模型"走向"一个通用模型"

8. AI 安全与治理的加速

8.1 安全研究的紧迫性

随着大模型能力的飞速提升,安全问题也日益突出:

  • 对齐问题:如何确保超级智能系统的行为符合人类意图?
  • 深度伪造:AI 生成的文本、图像、视频越来越难辨别真伪
  • 就业冲击:编程、客服、写作等岗位面临替代风险
  • 军事应用:自主武器系统的伦理争议

8.2 全球治理动态

时间事件
2023.07联合国安理会首次讨论 AI 安全
2023.10美国拜登政府发布 AI 行政命令
2023.11首届全球 AI 安全峰会(英国 Bletchley Park)
2024.03欧盟 AI Act 正式通过
2024-2025中国发布多项生成式 AI 管理办法

9. 本章小结

阶段时间标志性事件
Scaling 验证2020–2021GPT-3、Scaling Laws
公众爆发2022–2023ChatGPT、GPT-4
开源追赶2023–2024LLaMA 2/3、Mistral、Qwen
推理模型2024–2025o1/o3、DeepSeek-R1
Agent 浪潮2024–至今Devin、Computer Use、MCP

大模型时代的核心特征:

  1. Scaling 仍然有效:更大模型 + 更多数据 = 更强能力,这个规律至今未被打破
  2. 涌现能力:模型在某些规模阈值处会突然出现新能力,无法从小模型外推
  3. 产品化速度极快:从论文到产品的周期从数年缩短到数月
  4. 开源与闭源双轮驱动:竞争推动整个领域快速进步
  5. 安全与能力并重:AI 能力的每一次飞跃都伴随着安全担忧的加剧

相关章节


延伸阅读

  • Brown, T. et al. (2020). "Language Models are Few-Shot Learners". NeurIPS
  • Kaplan, J. et al. (2020). "Scaling Laws for Neural Language Models". arXiv:2001.08361
  • Hoffmann, J. et al. (2022). "Training Compute-Optimal Large Language Models". NeurIPS
  • Ouyang, L. et al. (2022). "Training Language Models to Follow Instructions with Human Feedback". NeurIPS
  • Anthropic (2024). "Introducing Model Context Protocol". anthropic.com/news