主流大模型全景 / 闭源模型(OpenAI / Anthropic / Google)
CHAPTER 03 · TOPIC 01

闭源模型(OpenAI / Anthropic / Google)

闭源模型由少数几家公司掌控,代表了大模型能力的最高天花板。OpenAI、Anthropic 和 Google 三大阵营各自发展出独特的技术路线和产品哲学。本章深度剖析每家公司的核心模型、技术特色和发展策略。

一句话理解

闭源模型由少数几家公司掌控,代表了大模型能力的最高天花板。OpenAI、Anthropic 和 Google 三大阵营各自发展出独特的技术路线和产品哲学。本章深度剖析每家公司的核心模型、技术特色和发展策略。

阅读前置

了解大语言模型基本概念

本文关注

OpenAI:从非营利到行业领导者、Anthropic:安全优先的挑战者、Google DeepMind:原生多模态

所在知识层

生态格局 · 主流大模型全景

文章导航
主教学视觉闭源模型(OpenAI / Anthropic / Google) · 知识结构

点击图中节点可定位到对应正文。

核心主题关系与流向

引言

闭源模型由少数几家公司掌控,代表了大模型能力的最高天花板。OpenAI、Anthropic 和 Google 三大阵营各自发展出独特的技术路线和产品哲学。本章深度剖析每家公司的核心模型、技术特色和发展策略。


1. OpenAI:从非营利到行业领导者

1.1 公司背景

  • 创立:2015 年,由 Sam Altman、Elon Musk、Greg Brockman 等创立
  • 初始使命:"确保通用人工智能(AGI)造福全人类"
  • 结构变化:2019 年转为"有限盈利"结构(capped-profit),允许接受外部投资
  • 核心人物:Sam Altman(CEO)、Ilya Sutskever(前首席科学家,2024 年离职创办 SSI)

1.2 GPT 系列演进

模型发布时间参数量关键突破
GPT-12018.06117M验证了预训练+微调范式
GPT-22019.021.5B零样本学习,因安全考虑延迟公开
GPT-32020.06175B少样本学习,Scaling Laws 验证
GPT-3.52022.11未公开ChatGPT 的基础模型
GPT-42023.03~1.8T(MoE)多模态,专业考试前 10%
GPT-4 Turbo2023.11未公开128K 上下文,降价
GPT-4o2024.05未公开统一多模态,实时语音
o12024.09未公开推理模型,慢思考范式
o32024.12未公开更强的推理能力

1.3 GPT-4 的技术推测

OpenAI 从未公开 GPT-4 的技术细节,但业界普遍推测:

TEXT
架构:Mixture of Experts (MoE)
  - 总参数量约 1.8T
  - 8 个专家,每次激活 2 个
  - 实际每次推理使用约 280B 参数

训练:
  - 约 13T tokens 的训练数据
  - 约 25,000 张 A100 GPU 训练数月

多模态:
  - 文本和图像共享同一个 Transformer 架构
  - 视觉编码器可能是类似 CLIP 的架构

1.4 o1/o3 推理模型

核心理念:System 2 思维

语义 SVG 重绘闭源模型(OpenAI / Anthropic / Google) · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

传统模型(GPT-4):问题快速生成回答(类似人类直觉/Syste…
查看原文结构
传统模型(GPT-4):
  问题 → 快速生成回答(类似人类直觉/System 1)
语义 SVG 重绘闭源模型(OpenAI / Anthropic / Google) · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

推理模型(o1/o3):问题长时间内部推理(思考链)生成回答(类似人类深度思考/System 2)
查看原文结构
推理模型(o1/o3):
  问题 → 长时间内部推理(思考链)→ 生成回答
  (类似人类深度思考/System 2)
语义 SVG 重绘闭源模型(OpenAI / Anthropic / Google) · 结构 3

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

思考过程对用户不可见(显示为"thin…思考时间越长准确率越高
查看原文结构
思考过程对用户不可见(显示为"thinking"状态)
思考时间越长 → 准确率越高

o1 的关键表现:

  • AIME 数学竞赛:GPT-4 的 13% → o1 的 83%
  • Codeforces 编程:达到前 500 名水平
  • 国际科学奥林匹克:金牌水平
  • 博士级科学问题推理:显著优于 GPT-4

1.5 OpenAI 的产品矩阵

产品定位
ChatGPT面向消费者的对话产品
API Platform面向开发者的模型接口
ChatGPT Enterprise企业级解决方案
Codex / GitHub Copilot代码生成(与微软合作)
DALL·E图像生成
Sora视频生成
Whisper语音识别
OperatorWeb 操作 Agent

2. Anthropic:安全优先的挑战者

2.1 公司背景

  • 创立:2021 年,由 Dario Amodei 和 Daniela Amodei 兄妹从 OpenAI 离职后创立
  • 核心理念:AI 安全是第一优先级
  • 融资:Google 投资约 20 亿美元,Amazon 投资 40 亿美元
  • 核心人物:Dario Amodei(CEO)、Daniela Amodei(总裁)

2.2 Claude 系列演进

模型发布时间特点
Claude 12023.03首个公开模型,强调安全
Claude 22023.07100K 上下文,性能提升
Claude 3 Haiku2024.03快速轻量模型
Claude 3 Sonnet2024.03平衡模型
Claude 3 Opus2024.03最强旗舰模型
Claude 3.5 Sonnet2024.06超越 Opus 的性价比之王
Claude 3.5 Haiku2024.10升级版快速模型
Claude 42025下一代模型

2.3 Anthropic 的技术特色

Constitutional AI(CAI):

  • 模型根据一组"宪法原则"自我批评和修正
  • 减少对人类标注的依赖
  • 详见对齐技术章节

长上下文能力:

  • Claude 3.5 Sonnet 支持 200K tokens 上下文
  • 在"大海捞针"测试中表现接近完美
  • 适合处理长文档、代码库等场景

Computer Use(2024.10):

  • Claude 3.5 Sonnet 能够操作桌面应用
  • 通过截图理解屏幕 → 模拟鼠标键盘操作
  • 第一个支持 Computer Use 的主流 LLM

MCP 协议(2024.11):

  • Model Context Protocol——Agent 工具生态的标准协议
  • 详见 MCP 协议详解

2.4 Claude 的能力特点

维度表现
写作质量业界领先,风格自然、少"AI 味"
代码能力与 GPT-4 相当
安全性拒绝率低但安全,"不回避"策略
长文档理解200K 上下文,处理能力强
指令遵循精准、不啰嗦

3. Google DeepMind:原生多模态

3.1 公司背景

  • Google Brain:2011 年成立,Jeff Dean 领导
  • DeepMind:2010 年创立,2014 年被 Google 收购,Demis Hassabis 领导
  • 合并:2023 年 Google Brain 与 DeepMind 合并为 Google DeepMind
  • 核心优势:强大的基础研究能力 + Google 的计算资源

3.2 Gemini 系列

模型发布时间特点
Gemini 1.0 Ultra2023.12首款旗舰,多模态原生
Gemini 1.0 Pro2023.12中等规模
Gemini 1.0 Nano2023.12端侧模型
Gemini 1.5 Pro2024.02100 万 token 上下文
Gemini 1.5 Flash2024.05快速推理
Gemini 2.02024.12下一代,Agent 能力增强

3.3 Gemini 的技术特色

原生多模态架构:

语义 SVG 重绘闭源模型(OpenAI / Anthropic / Google) · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入 / 表示传统多模态(GPT-4V)核心架构文本模型 + 视觉编码器拼接后处理输出 / 应用
查看原文结构
传统多模态(GPT-4V):
  文本模型 + 视觉编码器 → 拼接后处理
语义 SVG 重绘闭源模型(OpenAI / Anthropic / Google) · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

Gemini 原生多模态:文本、图像、音频、视统一编码同一个 Transformer 处理真正的跨模态理解,而非"翻译"后处理
查看原文结构
Gemini 原生多模态:
  文本、图像、音频、视频 → 统一编码 → 同一个 Transformer 处理
  → 真正的跨模态理解,而非"翻译"后处理

超长上下文:

  • Gemini 1.5 Pro:支持 100 万 token(后扩展至 200 万)
  • 能够处理:1 小时视频、11 小时音频、数千页文档
  • 使用 Ring Attention 等高效注意力机制

MoE 架构:

  • Gemini 1.0 Ultra 被推测使用 MoE 架构
  • 允许在保持推理效率的同时扩大模型规模

3.4 Google 的其他 AI 产品

产品领域特点
PaLM / PaLM 2LLMGemini 的前身
AlphaFold生物学蛋白质结构预测
AlphaCode编程竞赛级代码生成
Imagen图像生成高保真图像
Veo视频生成高质量视频
NotebookLM知识助手文档理解和问答

4. 三大闭源模型对比

4.1 能力对比(截至 2025 年初)

维度GPT-4oClaude 3.5 SonnetGemini 2.0
文本生成优秀优秀(写作最强)优秀
代码优秀优秀优秀
数学推理优秀良好良好
多模态文本+图像+音频文本+图像文本+图像+音频+视频
上下文窗口128K200K1M-2M
推理模型o1/o3待发布待发布
Agent 能力OperatorComputer Use + MCPProject Mariner
安全性最好(CAI)

4.2 定价对比(API,每百万 token)

模型输入输出
GPT-4o$2.50$10.00
GPT-4o mini$0.15$0.60
Claude 3.5 Sonnet$3.00$15.00
Claude 3.5 Haiku$0.80$4.00
Gemini 1.5 Pro$1.25$5.00
Gemini 1.5 Flash$0.075$0.30

注:价格持续变化,请以各公司官网为准。

4.3 技术路线差异

维度OpenAIAnthropicGoogle
核心理念能力优先安全优先多模态优先
对齐方法RLHFConstitutional AI多种方法
产品策略全栈产品API + Claude.ai融入 Google 生态
开源态度完全闭源完全闭源部分开源(Gemma)
差异化推理模型(o1/o3)长上下文+安全原生多模态+超长上下文

5. 闭源模型的战略思考

5.1 闭源的优势

  • 能力天花板:拥有最多的计算资源和数据
  • 产品整合:端到端的产品体验
  • 安全性:更可控的输出和安全机制
  • 持续更新:无需用户管理模型版本

5.2 闭源的风险

  • 供应商锁定:数据和流程依赖特定平台
  • 价格不透明:定价策略可能随时变化
  • 数据隐私:需要将数据发送给第三方
  • 可审计性差:无法检查模型内部机制

6. 本章小结

三大闭源阵营各有特色:

  • OpenAI:能力最强、产品最全、推理模型领先
  • Anthropic:安全最好、写作最自然、Agent 工具生态先锋
  • Google:多模态最强、上下文最长、与 Google 生态深度整合

选择建议:

  • 追求最强能力 → GPT-4o / o3
  • 追求安全和写作质量 → Claude 3.5 Sonnet
  • 追求长文档和多模态 → Gemini 2.0
  • 追求性价比 → GPT-4o mini / Gemini Flash

相关章节


延伸阅读

  • OpenAI (2023). "GPT-4 Technical Report". arXiv:2303.08774
  • Anthropic (2024). "The Claude Model Family". anthropic.com
  • Google DeepMind (2024). "Gemini 1.5: Unlocking Multimodal Understanding". arXiv:2403.05530