闭源模型(OpenAI / Anthropic / Google)
闭源模型由少数几家公司掌控,代表了大模型能力的最高天花板。OpenAI、Anthropic 和 Google 三大阵营各自发展出独特的技术路线和产品哲学。本章深度剖析每家公司的核心模型、技术特色和发展策略。
闭源模型由少数几家公司掌控,代表了大模型能力的最高天花板。OpenAI、Anthropic 和 Google 三大阵营各自发展出独特的技术路线和产品哲学。本章深度剖析每家公司的核心模型、技术特色和发展策略。
了解大语言模型基本概念
OpenAI:从非营利到行业领导者、Anthropic:安全优先的挑战者、Google DeepMind:原生多模态
生态格局 · 主流大模型全景
文章导航
- 引言
- 1. OpenAI:从非营利到行业领导者
- 1.1 公司背景
- 1.2 GPT 系列演进
- 1.3 GPT-4 的技术推测
- 1.4 o1/o3 推理模型
- 1.5 OpenAI 的产品矩阵
- 2. Anthropic:安全优先的挑战者
- 2.1 公司背景
- 2.2 Claude 系列演进
- 2.3 Anthropic 的技术特色
- 2.4 Claude 的能力特点
- 3. Google DeepMind:原生多模态
- 3.1 公司背景
- 3.2 Gemini 系列
- 3.3 Gemini 的技术特色
- 3.4 Google 的其他 AI 产品
- 4. 三大闭源模型对比
- 4.1 能力对比(截至 2025 年初)
- 4.2 定价对比(API,每百万 token)
- 4.3 技术路线差异
- 5. 闭源模型的战略思考
- 5.1 闭源的优势
- 5.2 闭源的风险
- 6. 本章小结
- 相关章节
- 延伸阅读
点击图中节点可定位到对应正文。
引言
闭源模型由少数几家公司掌控,代表了大模型能力的最高天花板。OpenAI、Anthropic 和 Google 三大阵营各自发展出独特的技术路线和产品哲学。本章深度剖析每家公司的核心模型、技术特色和发展策略。
1. OpenAI:从非营利到行业领导者
1.1 公司背景
- 创立:2015 年,由 Sam Altman、Elon Musk、Greg Brockman 等创立
- 初始使命:"确保通用人工智能(AGI)造福全人类"
- 结构变化:2019 年转为"有限盈利"结构(capped-profit),允许接受外部投资
- 核心人物:Sam Altman(CEO)、Ilya Sutskever(前首席科学家,2024 年离职创办 SSI)
1.2 GPT 系列演进
| 模型 | 发布时间 | 参数量 | 关键突破 |
|---|---|---|---|
| GPT-1 | 2018.06 | 117M | 验证了预训练+微调范式 |
| GPT-2 | 2019.02 | 1.5B | 零样本学习,因安全考虑延迟公开 |
| GPT-3 | 2020.06 | 175B | 少样本学习,Scaling Laws 验证 |
| GPT-3.5 | 2022.11 | 未公开 | ChatGPT 的基础模型 |
| GPT-4 | 2023.03 | ~1.8T(MoE) | 多模态,专业考试前 10% |
| GPT-4 Turbo | 2023.11 | 未公开 | 128K 上下文,降价 |
| GPT-4o | 2024.05 | 未公开 | 统一多模态,实时语音 |
| o1 | 2024.09 | 未公开 | 推理模型,慢思考范式 |
| o3 | 2024.12 | 未公开 | 更强的推理能力 |
1.3 GPT-4 的技术推测
OpenAI 从未公开 GPT-4 的技术细节,但业界普遍推测:
架构:Mixture of Experts (MoE)
- 总参数量约 1.8T
- 8 个专家,每次激活 2 个
- 实际每次推理使用约 280B 参数
训练:
- 约 13T tokens 的训练数据
- 约 25,000 张 A100 GPU 训练数月
多模态:
- 文本和图像共享同一个 Transformer 架构
- 视觉编码器可能是类似 CLIP 的架构1.4 o1/o3 推理模型
核心理念:System 2 思维
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
传统模型(GPT-4):
问题 → 快速生成回答(类似人类直觉/System 1)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
推理模型(o1/o3):
问题 → 长时间内部推理(思考链)→ 生成回答
(类似人类深度思考/System 2)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
思考过程对用户不可见(显示为"thinking"状态)
思考时间越长 → 准确率越高o1 的关键表现:
- AIME 数学竞赛:GPT-4 的 13% → o1 的 83%
- Codeforces 编程:达到前 500 名水平
- 国际科学奥林匹克:金牌水平
- 博士级科学问题推理:显著优于 GPT-4
1.5 OpenAI 的产品矩阵
| 产品 | 定位 |
|---|---|
| ChatGPT | 面向消费者的对话产品 |
| API Platform | 面向开发者的模型接口 |
| ChatGPT Enterprise | 企业级解决方案 |
| Codex / GitHub Copilot | 代码生成(与微软合作) |
| DALL·E | 图像生成 |
| Sora | 视频生成 |
| Whisper | 语音识别 |
| Operator | Web 操作 Agent |
2. Anthropic:安全优先的挑战者
2.1 公司背景
- 创立:2021 年,由 Dario Amodei 和 Daniela Amodei 兄妹从 OpenAI 离职后创立
- 核心理念:AI 安全是第一优先级
- 融资:Google 投资约 20 亿美元,Amazon 投资 40 亿美元
- 核心人物:Dario Amodei(CEO)、Daniela Amodei(总裁)
2.2 Claude 系列演进
| 模型 | 发布时间 | 特点 |
|---|---|---|
| Claude 1 | 2023.03 | 首个公开模型,强调安全 |
| Claude 2 | 2023.07 | 100K 上下文,性能提升 |
| Claude 3 Haiku | 2024.03 | 快速轻量模型 |
| Claude 3 Sonnet | 2024.03 | 平衡模型 |
| Claude 3 Opus | 2024.03 | 最强旗舰模型 |
| Claude 3.5 Sonnet | 2024.06 | 超越 Opus 的性价比之王 |
| Claude 3.5 Haiku | 2024.10 | 升级版快速模型 |
| Claude 4 | 2025 | 下一代模型 |
2.3 Anthropic 的技术特色
Constitutional AI(CAI):
- 模型根据一组"宪法原则"自我批评和修正
- 减少对人类标注的依赖
- 详见对齐技术章节
长上下文能力:
- Claude 3.5 Sonnet 支持 200K tokens 上下文
- 在"大海捞针"测试中表现接近完美
- 适合处理长文档、代码库等场景
Computer Use(2024.10):
- Claude 3.5 Sonnet 能够操作桌面应用
- 通过截图理解屏幕 → 模拟鼠标键盘操作
- 第一个支持 Computer Use 的主流 LLM
MCP 协议(2024.11):
- Model Context Protocol——Agent 工具生态的标准协议
- 详见 MCP 协议详解
2.4 Claude 的能力特点
| 维度 | 表现 |
|---|---|
| 写作质量 | 业界领先,风格自然、少"AI 味" |
| 代码能力 | 与 GPT-4 相当 |
| 安全性 | 拒绝率低但安全,"不回避"策略 |
| 长文档理解 | 200K 上下文,处理能力强 |
| 指令遵循 | 精准、不啰嗦 |
3. Google DeepMind:原生多模态
3.1 公司背景
- Google Brain:2011 年成立,Jeff Dean 领导
- DeepMind:2010 年创立,2014 年被 Google 收购,Demis Hassabis 领导
- 合并:2023 年 Google Brain 与 DeepMind 合并为 Google DeepMind
- 核心优势:强大的基础研究能力 + Google 的计算资源
3.2 Gemini 系列
| 模型 | 发布时间 | 特点 |
|---|---|---|
| Gemini 1.0 Ultra | 2023.12 | 首款旗舰,多模态原生 |
| Gemini 1.0 Pro | 2023.12 | 中等规模 |
| Gemini 1.0 Nano | 2023.12 | 端侧模型 |
| Gemini 1.5 Pro | 2024.02 | 100 万 token 上下文 |
| Gemini 1.5 Flash | 2024.05 | 快速推理 |
| Gemini 2.0 | 2024.12 | 下一代,Agent 能力增强 |
3.3 Gemini 的技术特色
原生多模态架构:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
传统多模态(GPT-4V):
文本模型 + 视觉编码器 → 拼接后处理根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
Gemini 原生多模态:
文本、图像、音频、视频 → 统一编码 → 同一个 Transformer 处理
→ 真正的跨模态理解,而非"翻译"后处理超长上下文:
- Gemini 1.5 Pro:支持 100 万 token(后扩展至 200 万)
- 能够处理:1 小时视频、11 小时音频、数千页文档
- 使用 Ring Attention 等高效注意力机制
MoE 架构:
- Gemini 1.0 Ultra 被推测使用 MoE 架构
- 允许在保持推理效率的同时扩大模型规模
3.4 Google 的其他 AI 产品
| 产品 | 领域 | 特点 |
|---|---|---|
| PaLM / PaLM 2 | LLM | Gemini 的前身 |
| AlphaFold | 生物学 | 蛋白质结构预测 |
| AlphaCode | 编程 | 竞赛级代码生成 |
| Imagen | 图像生成 | 高保真图像 |
| Veo | 视频生成 | 高质量视频 |
| NotebookLM | 知识助手 | 文档理解和问答 |
4. 三大闭源模型对比
4.1 能力对比(截至 2025 年初)
| 维度 | GPT-4o | Claude 3.5 Sonnet | Gemini 2.0 |
|---|---|---|---|
| 文本生成 | 优秀 | 优秀(写作最强) | 优秀 |
| 代码 | 优秀 | 优秀 | 优秀 |
| 数学推理 | 优秀 | 良好 | 良好 |
| 多模态 | 文本+图像+音频 | 文本+图像 | 文本+图像+音频+视频 |
| 上下文窗口 | 128K | 200K | 1M-2M |
| 推理模型 | o1/o3 | 待发布 | 待发布 |
| Agent 能力 | Operator | Computer Use + MCP | Project Mariner |
| 安全性 | 好 | 最好(CAI) | 好 |
4.2 定价对比(API,每百万 token)
| 模型 | 输入 | 输出 |
|---|---|---|
| GPT-4o | $2.50 | $10.00 |
| GPT-4o mini | $0.15 | $0.60 |
| Claude 3.5 Sonnet | $3.00 | $15.00 |
| Claude 3.5 Haiku | $0.80 | $4.00 |
| Gemini 1.5 Pro | $1.25 | $5.00 |
| Gemini 1.5 Flash | $0.075 | $0.30 |
注:价格持续变化,请以各公司官网为准。
4.3 技术路线差异
| 维度 | OpenAI | Anthropic | |
|---|---|---|---|
| 核心理念 | 能力优先 | 安全优先 | 多模态优先 |
| 对齐方法 | RLHF | Constitutional AI | 多种方法 |
| 产品策略 | 全栈产品 | API + Claude.ai | 融入 Google 生态 |
| 开源态度 | 完全闭源 | 完全闭源 | 部分开源(Gemma) |
| 差异化 | 推理模型(o1/o3) | 长上下文+安全 | 原生多模态+超长上下文 |
5. 闭源模型的战略思考
5.1 闭源的优势
- 能力天花板:拥有最多的计算资源和数据
- 产品整合:端到端的产品体验
- 安全性:更可控的输出和安全机制
- 持续更新:无需用户管理模型版本
5.2 闭源的风险
- 供应商锁定:数据和流程依赖特定平台
- 价格不透明:定价策略可能随时变化
- 数据隐私:需要将数据发送给第三方
- 可审计性差:无法检查模型内部机制
6. 本章小结
三大闭源阵营各有特色:
- OpenAI:能力最强、产品最全、推理模型领先
- Anthropic:安全最好、写作最自然、Agent 工具生态先锋
- Google:多模态最强、上下文最长、与 Google 生态深度整合
选择建议:
- 追求最强能力 → GPT-4o / o3
- 追求安全和写作质量 → Claude 3.5 Sonnet
- 追求长文档和多模态 → Gemini 2.0
- 追求性价比 → GPT-4o mini / Gemini Flash
相关章节
- 开源模型(LLaMA / Mistral / Qwen / DeepSeek) — 大模型的另一条技术路线,可本地部署与定制
- 模型能力评测体系 — 如何客观地比较这些模型的能力
- 模型选型与 Agent 适配 — 将模型选型落地到 Agent 应用
- 大模型时代(2020-至今) — 这些模型诞生的历史背景
延伸阅读
- OpenAI (2023). "GPT-4 Technical Report". arXiv:2303.08774
- Anthropic (2024). "The Claude Model Family". anthropic.com
- Google DeepMind (2024). "Gemini 1.5: Unlocking Multimodal Understanding". arXiv:2403.05530