开源模型(LLaMA / Mistral / Qwen / DeepSeek)
开源模型是大模型生态中不可或缺的力量。它们让研究者和开发者能够在本地运行、微调和定制大模型,推动了 AI 技术的民主化。本章深度剖析主流开源模型的架构、训练策略和生态影响。
开源模型是大模型生态中不可或缺的力量。它们让研究者和开发者能够在本地运行、微调和定制大模型,推动了 AI 技术的民主化。本章深度剖析主流开源模型的架构、训练策略和生态影响。
了解大语言模型基本概念
Meta LLaMA 系列、Mistral AI:欧洲的开源先锋、阿里 Qwen 系列
生态格局 · 主流大模型全景
文章导航
- 引言
- 1. Meta LLaMA 系列
- 1.1 LLaMA 1(2023.02)
- 1.2 LLaMA 2(2023.07)
- 1.3 LLaMA 3(2024.04)
- 1.4 LLaMA 的生态影响
- 2. Mistral AI:欧洲的开源先锋
- 2.1 公司背景
- 2.2 Mistral 7B(2023.09)
- 2.3 Mixtral 8x7B(2023.12)
- 2.4 Mistral 后续模型
- 3. 阿里 Qwen 系列
- 3.1 发展历程
- 3.2 Qwen 2.5 的技术特色
- 3.3 Qwen 的竞争优势
- 4. DeepSeek:高性价比的破局者
- 4.1 公司背景
- 4.2 DeepSeek V2/V3
- 4.3 DeepSeek R1(2025.01)
- 5. 其他重要开源模型
- 5.1 国产模型
- 5.2 国际模型
- 6. 开源模型的综合对比
- 6.1 能力排名(2025 年初)
- 6.2 选型指南
- 7. 开源生态的工具链
- 7.1 模型获取与使用
- 7.2 微调工具
- 8. 本章小结
- 相关章节
- 延伸阅读
点击图中节点可定位到对应正文。
引言
开源模型是大模型生态中不可或缺的力量。它们让研究者和开发者能够在本地运行、微调和定制大模型,推动了 AI 技术的民主化。本章深度剖析主流开源模型的架构、训练策略和生态影响。
1. Meta LLaMA 系列
1.1 LLaMA 1(2023.02)
Meta AI 发布的 Large Language Model Meta AI:
- 提供 7B / 13B / 33B / 65B 四个规模
- 训练数据:1.4T tokens(Common Crawl + Wikipedia + GitHub 等)
- 在同等计算预算下性能最优(验证了 Chinchilla 最优策略)
- 最初仅供研究使用,但权重意外泄露后社区迅速跟进
架构特点:
- Pre-Norm + RMSNorm
- SwiGLU 激活函数
- RoPE 位置编码
- 这些设计后来成为开源模型的标准配置
1.2 LLaMA 2(2023.07)
正式开源商用,极大推动了产业应用:
| 规模 | 参数量 | 训练数据 | 上下文 |
|---|---|---|---|
| 7B | 7B | 2T tokens | 4K |
| 13B | 13B | 2T tokens | 4K |
| 70B | 70B | 2T tokens | 4K |
- 相比 LLaMA 1:训练数据增加 40%,上下文翻倍
- 提供 Chat 版本(SFT + RLHF 微调)
- 商用许可:允许商业使用(月活 < 7 亿)
1.3 LLaMA 3(2024.04)
重大升级:
| 规模 | 参数量 | 训练数据 | 上下文 |
|---|---|---|---|
| 8B | 8B | 15T+ tokens | 8K |
| 70B | 70B | 15T+ tokens | 8K |
| 405B | 405B | 15T+ tokens | 128K |
关键改进:
- 词表从 32K 扩大到 128K(改善多语言支持)
- 使用 GQA(Grouped-Query Attention)
- 405B 模型性能接近 GPT-4
- 训练效率大幅提升
1.4 LLaMA 的生态影响
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
LLaMA 1 泄露 → 社区微调(Alpaca、Vicuna)→ 开源 LLM 生态诞生
LLaMA 2 开源 → 企业级应用 → 产业界广泛采用
LLaMA 3 开源 → 接近闭源水平 → 开源 vs 闭源差距大幅缩小2. Mistral AI:欧洲的开源先锋
2.1 公司背景
- 创立:2023 年,由前 DeepMind 和 Meta 研究者创立
- 总部:法国巴黎
- 融资:超过 20 亿欧元
- 策略:开源小模型 + 闭源大模型的双轨策略
2.2 Mistral 7B(2023.09)
仅 7B 参数就超越了 LLaMA 2 13B,成为当时的效率标杆:
关键创新——滑动窗口注意力(Sliding Window Attention, SWA):
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
多层堆叠后,信息可以跨窗口传播:
第 1 层:token 看到最近 4096 个 token
第 2 层:每个 token 的表示已包含 4096 个 token 的信息
→ 有效感受野 = 2 × 4096
第 L 层:有效感受野 = L × 40962.3 Mixtral 8x7B(2023.12)
引入 MoE(Mixture of Experts)架构:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
效果:
性能接近 70B 模型
推理速度接近 13B 模型
→ 极高的性能/成本比2.4 Mistral 后续模型
| 模型 | 时间 | 特点 |
|---|---|---|
| Mistral Large | 2024.02 | 闭源旗舰模型 |
| Codestral | 2024.05 | 代码专用模型 |
| Mistral Large 2 | 2024.07 | 123B MoE 模型 |
| Pixtral | 2024.09 | 多模态模型 |
| Mistral Small 3 | 2025.01 | 24B 高效模型 |
3. 阿里 Qwen 系列
3.1 发展历程
Qwen(通义千问)是阿里巴巴的大模型系列,在中文能力和开源生态方面表现突出:
| 模型 | 时间 | 特点 |
|---|---|---|
| Qwen 1.0 | 2023.08 | 首个开源版本 |
| Qwen 1.5 | 2024.02 | 性能大幅提升 |
| Qwen 2 | 2024.06 | GQA、更大词表 |
| Qwen 2.5 | 2024.09 | 全面的开源矩阵 |
| QwQ | 2024.11 | 推理模型 |
3.2 Qwen 2.5 的技术特色
模型矩阵:
- 0.5B / 1.5B / 3B / 7B / 14B / 32B / 72B 全覆盖
- 每个规模都有 Base 和 Instruct 版本
- 另有 Qwen2.5-Coder(代码专用)和 Qwen2.5-Math(数学专用)
技术特点:
- 词表 152K(中文效率显著优于 LLaMA)
- GQA 注意力
- 最大 128K 上下文
- 在中文基准测试中领先
3.3 Qwen 的竞争优势
| 优势 | 说明 |
|---|---|
| 中文能力 | 词表大、中文数据多、中文基准领先 |
| 开源矩阵 | 从 0.5B 到 72B 全覆盖 |
| 专用模型 | Coder、Math、VL(视觉语言)版本 |
| Agent 能力 | 原生支持工具调用 |
4. DeepSeek:高性价比的破局者
4.1 公司背景
- 创立:由量化私募基金幻方量化创立
- 策略:追求极致的性价比(用更少的资源训练更强的模型)
- 开源态度:完全开源,包括技术报告
4.2 DeepSeek V2/V3
DeepSeek V2(2024.05):
- 236B 总参数,每次推理激活 21B
- MoE 架构 + MLA(Multi-head Latent Attention)
- 训练成本仅为 LLaMA 3 405B 的约 1/10
MLA(Multi-head Latent Attention):
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
传统 MHA:每个头的 K 和 V 独立存储 → KV Cache 大
DeepSeek MLA:将 K 和 V 压缩到低维潜在空间
→ KV Cache 减少约 90%
→ 推理效率大幅提升
→ 性能损失可忽略DeepSeek V3(2024.12):
- 671B 总参数,每次推理激活 37B
- 训练成本约 560 万美元(极其高效)
- 性能接近 GPT-4o 和 Claude 3.5 Sonnet
- 使用 FP8 混合精度训练(首次大规模验证)
4.3 DeepSeek R1(2025.01)
开源推理模型,性能媲美 OpenAI o1:
训练方法:
- 纯强化学习(GRPO 算法),无需监督数据做冷启动
- 模型自主学会推理、反思、自我纠错
- 训练过程中出现"Aha Moment"——模型自发学会重新审视问题
关键表现:
- AIME 2024:79.8%(接近 o1)
- Codeforces:达到约 2000 分(前 5%)
- MATH-500:97.3%
- 开源了 R1-Zero 和多个蒸馏版本
DeepSeek R1 的意义:
- 证明了开源社区可以复现闭源的推理模型能力
- 纯 RL 训练表明不需要大量人类标注数据
- 蒸馏版本(1.5B-70B)让端侧推理成为可能
- 引发了全球对 AI 研发效率的重新思考
5. 其他重要开源模型
5.1 国产模型
| 模型 | 公司 | 特点 |
|---|---|---|
| Yi 系列 | 零一万物(李开复) | 中英双语,34B/6B |
| Baichuan | 百川智能 | 中文优化 |
| InternLM | 上海 AI Lab | 工具调用强,学术导向 |
| ChatGLM | 智谱 AI / 清华 | 早期中文 LLM 先驱 |
| MiniCPM | 面壁智能 / 清华 | 小模型效率优化 |
5.2 国际模型
| 模型 | 公司 | 特点 |
|---|---|---|
| Gemma | 轻量级开源模型(2B/7B) | |
| Phi 系列 | Microsoft | 教科书数据训练,小而强 |
| DBRX | Databricks | 132B MoE,企业级 |
| Falcon | TII(阿联酋) | 早期开源先锋 |
| OLMo | AI2 | 完全开放(数据+代码+模型) |
| SmolLM | HuggingFace | 超小模型(135M-1.7B) |
6. 开源模型的综合对比
6.1 能力排名(2025 年初)
| 排名 | 模型 | 综合能力 | 特色 |
|---|---|---|---|
| 1 | DeepSeek V3 | ★★★★★ | 性价比之王 |
| 2 | LLaMA 3.1 405B | ★★★★★ | 最接近闭源 |
| 3 | Qwen 2.5 72B | ★★★★☆ | 中文最强 |
| 4 | Mistral Large 2 | ★★★★☆ | 欧洲标杆 |
| 5 | DeepSeek R1 | ★★★★☆ | 推理能力最强 |
| 6 | LLaMA 3.1 70B | ★★★★☆ | 社区生态最好 |
6.2 选型指南
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 企业私有部署 | LLaMA 3.1 70B / Qwen 2.5 72B | 社区成熟、中文友好 |
| 端侧/手机 | Qwen 2.5 3B / Phi-3 Mini | 小而强 |
| 编程 | DeepSeek Coder / Qwen2.5-Coder | 代码专项优化 |
| 学术研究 | LLaMA 3 / OLMo | 开放数据和方法 |
| 性价比优先 | DeepSeek V3 / Qwen 2.5 | 性能/成本比最高 |
| 推理任务 | DeepSeek R1 | 开源推理模型 |
7. 开源生态的工具链
7.1 模型获取与使用
| 工具 | 用途 |
|---|---|
| HuggingFace | 模型托管和下载 |
| ModelScope | 国内模型托管 |
| Ollama | 一键本地运行 |
| llama.cpp | CPU/GPU 混合推理 |
7.2 微调工具
| 工具 | 特点 |
|---|---|
| LLaMA-Factory | 一站式微调平台 |
| Axolotl | 灵活的微调框架 |
| Unsloth | 极致优化,2x 速度 |
| SWIFT | 阿里开源的微调框架 |
8. 本章小结
| 系列 | 开发者 | 核心优势 |
|---|---|---|
| LLaMA | Meta | 社区最大、生态最成熟 |
| Mistral | Mistral AI | 效率高、MoE 先锋 |
| Qwen | 阿里巴巴 | 中文最强、矩阵最全 |
| DeepSeek | DeepSeek | 性价比最高、推理最强 |
相关章节
- 闭源模型(OpenAI / Anthropic / Google) — 与开源路线对照的商业闭源阵营
- 模型 API 与部署方案 — 开源模型的本地部署与服务化
- 微调技术(Fine-tuning) — 开源模型可自由微调定制
- 预训练原理与工程实践 — 这些模型背后的训练原理
延伸阅读
- Touvron, H. et al. (2023). "LLaMA: Open and Efficient Foundation Language Models". arXiv:2302.13971
- Jiang, A.Q. et al. (2023). "Mistral 7B". arXiv:2310.06825
- Qwen Team (2024). "Qwen2.5 Technical Report". arXiv
- DeepSeek AI (2024). "DeepSeek-V3 Technical Report". arXiv
- DeepSeek AI (2025). "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning". arXiv