主流大模型全景 / 开源模型(LLaMA / Mistral / Qwen / DeepSeek)
CHAPTER 03 · TOPIC 02

开源模型(LLaMA / Mistral / Qwen / DeepSeek)

开源模型是大模型生态中不可或缺的力量。它们让研究者和开发者能够在本地运行、微调和定制大模型,推动了 AI 技术的民主化。本章深度剖析主流开源模型的架构、训练策略和生态影响。

一句话理解

开源模型是大模型生态中不可或缺的力量。它们让研究者和开发者能够在本地运行、微调和定制大模型,推动了 AI 技术的民主化。本章深度剖析主流开源模型的架构、训练策略和生态影响。

阅读前置

了解大语言模型基本概念

本文关注

Meta LLaMA 系列、Mistral AI:欧洲的开源先锋、阿里 Qwen 系列

所在知识层

生态格局 · 主流大模型全景

文章导航
主教学视觉开源模型(LLaMA / Mistral / Qwen / DeepSeek) · 知识结构

点击图中节点可定位到对应正文。

核心主题关系与流向

引言

开源模型是大模型生态中不可或缺的力量。它们让研究者和开发者能够在本地运行、微调和定制大模型,推动了 AI 技术的民主化。本章深度剖析主流开源模型的架构、训练策略和生态影响。


1. Meta LLaMA 系列

1.1 LLaMA 1(2023.02)

Meta AI 发布的 Large Language Model Meta AI:

  • 提供 7B / 13B / 33B / 65B 四个规模
  • 训练数据:1.4T tokens(Common Crawl + Wikipedia + GitHub 等)
  • 在同等计算预算下性能最优(验证了 Chinchilla 最优策略
  • 最初仅供研究使用,但权重意外泄露后社区迅速跟进

架构特点:

  • Pre-Norm + RMSNorm
  • SwiGLU 激活函数
  • RoPE 位置编码
  • 这些设计后来成为开源模型的标准配置

1.2 LLaMA 2(2023.07)

正式开源商用,极大推动了产业应用:

规模参数量训练数据上下文
7B7B2T tokens4K
13B13B2T tokens4K
70B70B2T tokens4K
  • 相比 LLaMA 1:训练数据增加 40%,上下文翻倍
  • 提供 Chat 版本(SFT + RLHF 微调)
  • 商用许可:允许商业使用(月活 < 7 亿)

1.3 LLaMA 3(2024.04)

重大升级:

规模参数量训练数据上下文
8B8B15T+ tokens8K
70B70B15T+ tokens8K
405B405B15T+ tokens128K

关键改进:

  • 词表从 32K 扩大到 128K(改善多语言支持)
  • 使用 GQA(Grouped-Query Attention)
  • 405B 模型性能接近 GPT-4
  • 训练效率大幅提升

1.4 LLaMA 的生态影响

语义 SVG 重绘开源模型(LLaMA / Mistral / Qwen / DeepSeek)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

LLaMA 1 泄露社区微调(Alpaca、Vicuna)开源 LLM 生态诞LLaMA 2 开源企业级应用产业界广泛采用
查看原文结构
LLaMA 1 泄露 → 社区微调(Alpaca、Vicuna)→ 开源 LLM 生态诞生
LLaMA 2 开源 → 企业级应用 → 产业界广泛采用
LLaMA 3 开源 → 接近闭源水平 → 开源 vs 闭源差距大幅缩小

2. Mistral AI:欧洲的开源先锋

2.1 公司背景

  • 创立:2023 年,由前 DeepMind 和 Meta 研究者创立
  • 总部:法国巴黎
  • 融资:超过 20 亿欧元
  • 策略:开源小模型 + 闭源大模型的双轨策略

2.2 Mistral 7B(2023.09)

仅 7B 参数就超越了 LLaMA 2 13B,成为当时的效率标杆:

关键创新——滑动窗口注意力(Sliding Window Attention, SWA):

语义 SVG 重绘开源模型(LLaMA / Mistral / Qwen / DeepSeek)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入与上下文多层堆叠后,信息可以跨窗口传播:系统核心第 1 层:token 看到最近 4096 个 t…第 2 层:每个 token 的表示已包含 409…有效感受野 = 2 × 4096工具、结果与反馈第 L 层:有效感受野 = L × 4096
查看原文结构
多层堆叠后,信息可以跨窗口传播:
  第 1 层:token 看到最近 4096 个 token
  第 2 层:每个 token 的表示已包含 4096 个 token 的信息
          → 有效感受野 = 2 × 4096
  第 L 层:有效感受野 = L × 4096

2.3 Mixtral 8x7B(2023.12)

引入 MoE(Mixture of Experts)架构:

语义 SVG 重绘开源模型(LLaMA / Mistral / Qwen / DeepSeek)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

效果:性能接近 70B 模推理速度接近 13B 模型极高的性能/成本比
查看原文结构
效果:
  性能接近 70B 模型
  推理速度接近 13B 模型
  → 极高的性能/成本比

2.4 Mistral 后续模型

模型时间特点
Mistral Large2024.02闭源旗舰模型
Codestral2024.05代码专用模型
Mistral Large 22024.07123B MoE 模型
Pixtral2024.09多模态模型
Mistral Small 32025.0124B 高效模型

3. 阿里 Qwen 系列

3.1 发展历程

Qwen(通义千问)是阿里巴巴的大模型系列,在中文能力和开源生态方面表现突出:

模型时间特点
Qwen 1.02023.08首个开源版本
Qwen 1.52024.02性能大幅提升
Qwen 22024.06GQA、更大词表
Qwen 2.52024.09全面的开源矩阵
QwQ2024.11推理模型

3.2 Qwen 2.5 的技术特色

模型矩阵:

  • 0.5B / 1.5B / 3B / 7B / 14B / 32B / 72B 全覆盖
  • 每个规模都有 Base 和 Instruct 版本
  • 另有 Qwen2.5-Coder(代码专用)和 Qwen2.5-Math(数学专用)

技术特点:

  • 词表 152K(中文效率显著优于 LLaMA)
  • GQA 注意力
  • 最大 128K 上下文
  • 在中文基准测试中领先

3.3 Qwen 的竞争优势

优势说明
中文能力词表大、中文数据多、中文基准领先
开源矩阵从 0.5B 到 72B 全覆盖
专用模型Coder、Math、VL(视觉语言)版本
Agent 能力原生支持工具调用

4. DeepSeek:高性价比的破局者

4.1 公司背景

  • 创立:由量化私募基金幻方量化创立
  • 策略:追求极致的性价比(用更少的资源训练更强的模型)
  • 开源态度:完全开源,包括技术报告

4.2 DeepSeek V2/V3

DeepSeek V2(2024.05):

  • 236B 总参数,每次推理激活 21B
  • MoE 架构 + MLA(Multi-head Latent Attention)
  • 训练成本仅为 LLaMA 3 405B 的约 1/10

MLA(Multi-head Latent Attention):

语义 SVG 重绘开源模型(LLaMA / Mistral / Qwen / DeepSeek)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

查看原文结构
传统 MHA:每个头的 K 和 V 独立存储 → KV Cache 大
DeepSeek MLA:将 K 和 V 压缩到低维潜在空间
  → KV Cache 减少约 90%
  → 推理效率大幅提升
  → 性能损失可忽略

DeepSeek V3(2024.12):

  • 671B 总参数,每次推理激活 37B
  • 训练成本约 560 万美元(极其高效)
  • 性能接近 GPT-4o 和 Claude 3.5 Sonnet
  • 使用 FP8 混合精度训练(首次大规模验证)

4.3 DeepSeek R1(2025.01)

开源推理模型,性能媲美 OpenAI o1:

训练方法:

  • 纯强化学习(GRPO 算法),无需监督数据做冷启动
  • 模型自主学会推理、反思、自我纠错
  • 训练过程中出现"Aha Moment"——模型自发学会重新审视问题

关键表现:

  • AIME 2024:79.8%(接近 o1)
  • Codeforces:达到约 2000 分(前 5%)
  • MATH-500:97.3%
  • 开源了 R1-Zero 和多个蒸馏版本

DeepSeek R1 的意义:

  • 证明了开源社区可以复现闭源的推理模型能力
  • 纯 RL 训练表明不需要大量人类标注数据
  • 蒸馏版本(1.5B-70B)让端侧推理成为可能
  • 引发了全球对 AI 研发效率的重新思考

5. 其他重要开源模型

5.1 国产模型

模型公司特点
Yi 系列零一万物(李开复)中英双语,34B/6B
Baichuan百川智能中文优化
InternLM上海 AI Lab工具调用强,学术导向
ChatGLM智谱 AI / 清华早期中文 LLM 先驱
MiniCPM面壁智能 / 清华小模型效率优化

5.2 国际模型

模型公司特点
GemmaGoogle轻量级开源模型(2B/7B)
Phi 系列Microsoft教科书数据训练,小而强
DBRXDatabricks132B MoE,企业级
FalconTII(阿联酋)早期开源先锋
OLMoAI2完全开放(数据+代码+模型)
SmolLMHuggingFace超小模型(135M-1.7B)

6. 开源模型的综合对比

6.1 能力排名(2025 年初)

排名模型综合能力特色
1DeepSeek V3★★★★★性价比之王
2LLaMA 3.1 405B★★★★★最接近闭源
3Qwen 2.5 72B★★★★☆中文最强
4Mistral Large 2★★★★☆欧洲标杆
5DeepSeek R1★★★★☆推理能力最强
6LLaMA 3.1 70B★★★★☆社区生态最好

6.2 选型指南

场景推荐模型理由
企业私有部署LLaMA 3.1 70B / Qwen 2.5 72B社区成熟、中文友好
端侧/手机Qwen 2.5 3B / Phi-3 Mini小而强
编程DeepSeek Coder / Qwen2.5-Coder代码专项优化
学术研究LLaMA 3 / OLMo开放数据和方法
性价比优先DeepSeek V3 / Qwen 2.5性能/成本比最高
推理任务DeepSeek R1开源推理模型

7. 开源生态的工具链

7.1 模型获取与使用

工具用途
HuggingFace模型托管和下载
ModelScope国内模型托管
Ollama一键本地运行
llama.cppCPU/GPU 混合推理

7.2 微调工具

工具特点
LLaMA-Factory一站式微调平台
Axolotl灵活的微调框架
Unsloth极致优化,2x 速度
SWIFT阿里开源的微调框架

8. 本章小结

系列开发者核心优势
LLaMAMeta社区最大、生态最成熟
MistralMistral AI效率高、MoE 先锋
Qwen阿里巴巴中文最强、矩阵最全
DeepSeekDeepSeek性价比最高、推理最强

相关章节


延伸阅读

  • Touvron, H. et al. (2023). "LLaMA: Open and Efficient Foundation Language Models". arXiv:2302.13971
  • Jiang, A.Q. et al. (2023). "Mistral 7B". arXiv:2310.06825
  • Qwen Team (2024). "Qwen2.5 Technical Report". arXiv
  • DeepSeek AI (2024). "DeepSeek-V3 Technical Report". arXiv
  • DeepSeek AI (2025). "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning". arXiv