大模型时代(2020–至今)
2020 年,OpenAI 发布的 GPT-3 以 1750 亿参数震惊世界,展示了大模型"涌现能力"的惊人潜力。2022 年末,ChatGPT 的发布将 AI 从学术实验室推向了全球公众的视野。此后短短两年间,大模型的能力边界以令人瞠目的速度扩展——从文本生成到多模态理解,从对话助手到自主智能体…
2020 年,OpenAI 发布的 GPT-3 以 1750 亿参数震惊世界,展示了大模型"涌现能力"的惊人潜力。2022 年末,ChatGPT 的发布将 AI 从学术实验室推向了全球公众的视野。此后短短两年间,大模型的能力边界以令人瞠目的速度扩展——从文本生成到多模态理解,从对话助手到自主智能体…
无需技术基础
GPT-3:Scaling Laws 的第一次大规模验证(2020)、ChatGPT:AI 的"iPhone 时刻"(2022)、GPT-4 与多模态时代(2023)
历史坐标 · AI 发展简史
文章导航
- 引言
- 1. GPT-3:Scaling Laws 的第一次大规模验证(2020)
- 1.1 GPT-3 的规模与能力
- 1.2 Scaling Laws:大模型的"物理定律"
- 1.3 Chinchilla Scaling Laws(2022)
- 2. ChatGPT:AI 的"iPhone 时刻"(2022)
- 2.1 从 GPT-3 到 ChatGPT
- 2.2 ChatGPT 的爆发式增长
- 2.3 为什么 ChatGPT 如此成功
- 3. GPT-4 与多模态时代(2023)
- 3.1 GPT-4(2023.03)
- 3.2 2023 年的大模型军备竞赛
- 4. 开源生态的爆发
- 4.1 LLaMA 系列的催化效应
- 4.2 其他重要开源模型
- 4.3 开源 vs 闭源的关系
- 5. 推理模型的兴起(2024)
- 5.1 OpenAI o1 系列
- 5.2 DeepSeek-R1
- 5.3 推理模型的意义
- 6. Agent 浪潮(2024–至今)
- 6.1 从对话到行动
- 6.2 关键 Agent 产品
- 6.3 MCP 协议(2024.11)
- 7. 多模态统一
- 7.1 文本-图像-音频-视频的全面覆盖
- 7.2 统一模型的趋势
- 8. AI 安全与治理的加速
- 8.1 安全研究的紧迫性
- 8.2 全球治理动态
- 9. 本章小结
- 相关章节
- 延伸阅读
点击图中节点可定位到对应正文。
引言
2020 年,OpenAI 发布的 GPT-3 以 1750 亿参数震惊世界,展示了大模型"涌现能力"的惊人潜力。2022 年末,ChatGPT 的发布将 AI 从学术实验室推向了全球公众的视野。此后短短两年间,大模型的能力边界以令人瞠目的速度扩展——从文本生成到多模态理解,从对话助手到自主智能体。本章记录这场正在进行的革命。
1. GPT-3:Scaling Laws 的第一次大规模验证(2020)
1.1 GPT-3 的规模与能力
2020 年 6 月,OpenAI 发布了 GPT-3,这是当时最大的语言模型:
| 参数 | 数值 |
|---|---|
| 参数量 | 1750 亿(175B) |
| 训练数据 | 约 570GB 文本(Common Crawl + Wikipedia + Books + 代码) |
| 上下文窗口 | 2048 tokens |
| 架构 | Transformer Decoder-only,96 层,96 个注意力头 |
| 训练成本 | 估计约 460 万美元(使用 Microsoft Azure 超算) |
GPT-3 展示的关键能力:
- 少样本学习(Few-shot Learning):只需给几个示例,模型就能理解任务
- 零样本学习(Zero-shot Learning):仅凭文字描述就能完成从未见过的任务
- 代码生成:虽然不完美,但能生成可运行的简单程序
- 文本创作:能写出连贯的短篇小说、新闻文章
1.2 Scaling Laws:大模型的"物理定律"
2020 年,OpenAI 的 Jared Kaplan 等人发表了关于 Scaling Laws 的重要论文:
核心发现: 模型性能(用 Loss 衡量)与以下三个因素呈幂律关系:
把公式、变量和含义拆开呈现,便于对照阅读。
L(N) ∝ N^(-0.076)模型性能随参数量 N 增长L(D) ∝ D^(-0.095)模型性能随数据量 D 增长L(C) ∝ C^(-0.050)模型性能随计算量 C 增长这意味着:
- 增大模型、数据或算力中的任何一个,性能都会可预测地提升
- 这种提升是平滑的、没有明显瓶颈的
- 可以通过小规模实验预测大规模模型的性能
Scaling Laws 的战略意义:
- 为"越大越好"的策略提供了理论依据
- 使得大模型训练变成了一个"工程问题"而非"科研赌博"
- 直接推动了 Google、Meta、Anthropic 等公司的大模型军备竞赛
1.3 Chinchilla Scaling Laws(2022)
DeepMind 在 2022 年的 Chinchilla 论文中修正了 Scaling Laws:
- 发现之前的模型普遍"过度参数化"——参数量太大但训练数据不够
- 最优策略:参数量和数据量应该同比例增长
- 例如:一个 70B 参数的模型应该用 1.4T tokens 的数据训练
- Chinchilla(70B 参数 + 1.4T tokens)的性能超过了更大的 Gopher(280B 参数 + 300B tokens)
2. ChatGPT:AI 的"iPhone 时刻"(2022)
2.1 从 GPT-3 到 ChatGPT
GPT-3 虽然强大,但普通用户难以直接使用。2022 年的几个关键进展将大模型推向了大众:
InstructGPT(2022.01):OpenAI 通过人类反馈的微调(RLHF)让 GPT-3 学会遵循指令:
- 收集人类标注的"好回答"和"坏回答"
- 训练奖励模型(Reward Model)学习人类偏好
- 使用 PPO(Proximal Policy Optimization)算法优化模型
- 结果:模型输出更有帮助、更安全、更诚实
ChatGPT(2022.11.30):基于 GPT-3.5 的对话界面产品
2.2 ChatGPT 的爆发式增长
| 里程碑 | 时间 |
|---|---|
| 发布 | 2022 年 11 月 30 日 |
| 100 万用户 | 5 天 |
| 3000 万用户 | 约 2 个月 |
| 1 亿月活 | 约 2 个月(历史上最快达到 1 亿用户的产品) |
| GPT-4 版本发布 | 2023 年 3 月 |
2.3 为什么 ChatGPT 如此成功
- 交互方式自然:对话式交互比 API 调用或命令行门槛低得多
- 能力足够好:能写邮件、解释概念、写代码、翻译——覆盖日常高频需求
- 即时满足:几秒钟内给出高质量回答
- RLHF 的效果:回答风格友好、有条理、乐于帮助——用户体验极佳
3. GPT-4 与多模态时代(2023)
3.1 GPT-4(2023.03)
OpenAI 在 2023 年 3 月发布了 GPT-4:
关键升级:
- 多模态:能同时理解文本和图像
- 性能大幅提升:在法律、医学等专业考试中达到人类前 10% 水平
- 更长的上下文窗口(8K → 后续扩展到 32K → 128K)
- 更好的指令遵循和安全性
GPT-4 在各考试中的表现:
| 考试 | GPT-3.5 排名 | GPT-4 排名 |
|---|---|---|
| 律师考试(Bar Exam) | 后 10% | 前 10% |
| SAT 数学 | 中等 | 前 1% |
| GRE 写作 | 中等偏下 | 前 25% |
| 美国医学执照考试 | 不及格 | 通过 |
3.2 2023 年的大模型军备竞赛
GPT-4 之后,各大公司纷纷推出竞品:
| 时间 | 公司 | 产品 | 特点 |
|---|---|---|---|
| 2023.02 | Bard(后更名 Gemini) | 集成搜索,后来发展出多模态 | |
| 2023.03 | Anthropic | Claude | 强调安全和长上下文 |
| 2023.07 | Meta | LLaMA 2 | 开源,推动开源生态 |
| 2023.09 | Mistral | Mistral 7B | 小模型效率标杆 |
| 2023.12 | Gemini 1.0 | 原生多模态架构 |
4. 开源生态的爆发
4.1 LLaMA 系列的催化效应
LLaMA(2023.02):Meta 发布的 Large Language Model Meta AI
- 7B / 13B / 33B / 65B 四个规模
- 在同等计算预算下性能最优
- 权重意外泄露后,开源社区迅速跟进微调
LLaMA 2(2023.07):正式开源商用
- 7B / 13B / 70B 三个规模
- 提供了 Chat 版本(经过 RLHF 微调)
- 开源许可允许商业使用,极大推动了产业应用
LLaMA 3(2024.04):
- 8B / 70B / 405B 三个规模
- 405B 模型性能接近 GPT-4
- 训练数据量超过 15T tokens
4.2 其他重要开源模型
| 模型 | 公司 | 特色 |
|---|---|---|
| Mistral / Mixtral | Mistral AI | MoE 架构,高效推理 |
| Qwen 系列 | 阿里巴巴 | 中文能力强,多模态 |
| DeepSeek 系列 | DeepSeek | 高性价比,推理能力突出 |
| Yi 系列 | 零一万物 | 中英双语,长上下文 |
| InternLM | 上海 AI Lab | 工具调用能力强 |
| Phi 系列 | Microsoft | 小模型,教科书质量数据训练 |
| Gemma | 轻量级开源模型 |
4.3 开源 vs 闭源的关系
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
闭源领先 → 开源追赶 → 闭源再突破 → 开源再追赶5. 推理模型的兴起(2024)
5.1 OpenAI o1 系列
2024 年 9 月,OpenAI 发布了 o1(原代号 "Strawberry"),开创了"推理模型"新范式:
核心理念:
- 在回答问题前进行长链"思考"(chain of thought)
- 类似于人类的 System 2 思维——慢思考、深推理
- 通过强化学习训练模型学会自我纠错和策略调整
- 在数学、编程、科学推理上取得突破性进展
o1 的表现:
- 国际数学奥林匹克预赛:从 GPT-4 的 13% 跃升至 83%
- Codeforces 编程竞赛:达到前 500 名水平(约前 1%)
- 推理时间越长,准确率越高(可通过算力换取性能)
5.2 DeepSeek-R1
2025 年初,中国公司 DeepSeek 发布了 R1:
- 开源的推理模型,性能媲美 o1
- 使用纯强化学习训练(无需监督数据做冷启动)
- 成本远低于 OpenAI 的闭源模型
- 引发了全球对中国 AI 能力的重新评估
5.3 推理模型的意义
推理模型标志着大模型从"快速直觉回答"向"深度思考回答"的转变:
- 不是更大,而是更聪明
- 通过更长的思考时间换取更高的准确性
- 特别适合数学、科学、编程等需要严密推理的领域
6. Agent 浪潮(2024–至今)
6.1 从对话到行动
2024 年开始,AI 行业的关注焦点从"大模型本身"转向"用大模型驱动的智能体":
Agent 的核心演进:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
2022: 对话机器人(ChatGPT)
↓
2023: 工具调用助手(Function Calling)
↓
2024: 半自主 Agent(能操作浏览器、文件系统)
↓
2025: 多 Agent 协作系统(自主完成复杂任务)6.2 关键 Agent 产品
| 产品 | 公司 | 能力 |
|---|---|---|
| Devin | Cognition | 第一个"AI 软件工程师" |
| Claude Computer Use | Anthropic | 操作桌面应用 |
| OpenAI Codex / Operator | OpenAI | 代码生成 + Web 操作 |
| Manus | Monica AI | 通用 Agent |
| GitHub Copilot Workspace | Microsoft | 端到端软件开发 |
6.3 MCP 协议(2024.11)
Anthropic 发布了 Model Context Protocol,为 Agent 与外部工具的交互制定了标准化协议:
- 类似于 AI 领域的"USB-C 接口"
- 定义了 Host → Client → Server 的三层架构
- 让任何 Agent 都能接入任何工具
- 迅速获得了行业广泛支持
7. 多模态统一
7.1 文本-图像-音频-视频的全面覆盖
| 模态 | 代表产品 | 能力 |
|---|---|---|
| 文本生成 | GPT-4, Claude 3.5 | 专业级写作和分析 |
| 图像理解 | GPT-4V, Gemini | 描述、分析、推理图像内容 |
| 图像生成 | DALL·E 3, Midjourney v6 | 高保真图像生成 |
| 视频生成 | Sora, Runway Gen-3 | 文本到视频 |
| 语音对话 | GPT-4o 实时语音 | 自然、有情感的语音交互 |
| 视频理解 | Gemini 1.5 Pro | 理解长达数小时的视频 |
7.2 统一模型的趋势
- GPT-4o(2024.05):统一模型同时处理文本、图像、音频
- Gemini 1.5 Pro:原生多模态架构,100 万 token 上下文
- 趋势:从"多个专用模型"走向"一个通用模型"
8. AI 安全与治理的加速
8.1 安全研究的紧迫性
随着大模型能力的飞速提升,安全问题也日益突出:
- 对齐问题:如何确保超级智能系统的行为符合人类意图?
- 深度伪造:AI 生成的文本、图像、视频越来越难辨别真伪
- 就业冲击:编程、客服、写作等岗位面临替代风险
- 军事应用:自主武器系统的伦理争议
8.2 全球治理动态
| 时间 | 事件 |
|---|---|
| 2023.07 | 联合国安理会首次讨论 AI 安全 |
| 2023.10 | 美国拜登政府发布 AI 行政命令 |
| 2023.11 | 首届全球 AI 安全峰会(英国 Bletchley Park) |
| 2024.03 | 欧盟 AI Act 正式通过 |
| 2024-2025 | 中国发布多项生成式 AI 管理办法 |
9. 本章小结
| 阶段 | 时间 | 标志性事件 |
|---|---|---|
| Scaling 验证 | 2020–2021 | GPT-3、Scaling Laws |
| 公众爆发 | 2022–2023 | ChatGPT、GPT-4 |
| 开源追赶 | 2023–2024 | LLaMA 2/3、Mistral、Qwen |
| 推理模型 | 2024–2025 | o1/o3、DeepSeek-R1 |
| Agent 浪潮 | 2024–至今 | Devin、Computer Use、MCP |
大模型时代的核心特征:
- Scaling 仍然有效:更大模型 + 更多数据 = 更强能力,这个规律至今未被打破
- 涌现能力:模型在某些规模阈值处会突然出现新能力,无法从小模型外推
- 产品化速度极快:从论文到产品的周期从数年缩短到数月
- 开源与闭源双轮驱动:竞争推动整个领域快速进步
- 安全与能力并重:AI 能力的每一次飞跃都伴随着安全担忧的加剧
相关章节
- 深度学习革命(2012–2019) — 前情:Transformer 与预训练范式的确立
- 什么是大语言模型 — 大模型的原理详解
- Transformer 架构深度剖析 — 大模型的技术根基
- 闭源模型(OpenAI-Anthropic-Google) — 今日大模型的市场格局
延伸阅读
- Brown, T. et al. (2020). "Language Models are Few-Shot Learners". NeurIPS
- Kaplan, J. et al. (2020). "Scaling Laws for Neural Language Models". arXiv:2001.08361
- Hoffmann, J. et al. (2022). "Training Compute-Optimal Large Language Models". NeurIPS
- Ouyang, L. et al. (2022). "Training Language Models to Follow Instructions with Human Feedback". NeurIPS
- Anthropic (2024). "Introducing Model Context Protocol". anthropic.com/news