模型能力评测体系
如何客观地比较不同大模型的能力?这是一个看似简单实则极其复杂的问题。本章全面介绍当前主流的评测基准、排行榜以及评测的局限性,帮助你建立科学的模型能力评估框架。
一句话理解
如何客观地比较不同大模型的能力?这是一个看似简单实则极其复杂的问题。本章全面介绍当前主流的评测基准、排行榜以及评测的局限性,帮助你建立科学的模型能力评估框架。
阅读前置
了解大语言模型基本概念
本文关注
核心评测基准、排行榜、评测的局限性与陷阱
所在知识层
生态格局 · 主流大模型全景
文章导航
点击图中节点可定位到对应正文。
核心主题关系与流向
引言
如何客观地比较不同大模型的能力?这是一个看似简单实则极其复杂的问题。本章全面介绍当前主流的评测基准、排行榜以及评测的局限性,帮助你建立科学的模型能力评估框架。
1. 核心评测基准
1.1 通用知识
| 基准 | 全称 | 内容 | 评测方式 |
|---|---|---|---|
| MMLU | Massive Multitask Language Understanding | 57 个学科的选择题 | 四选一准确率 |
| MMLU-Pro | MMLU 增强版 | 更难、选项更多(10 选 1) | 减少猜对概率 |
| ARC | AI2 Reasoning Challenge | 小学/初中科学题 | 需要推理而非记忆 |
| HellaSwag | 常识推理 | 选择最合理的句子续写 | 测试常识理解 |
| WinoGrande | 常识推理 | 解决代词指代歧义 | 测试语言理解 |
MMLU 分数参考:
- GPT-4:86.4%
- Claude 3.5 Sonnet:88.7%
- LLaMA 3.1 405B:85.2%
- DeepSeek V3:88.5%
- 人类专家:~89.8%
1.2 数学推理
| 基准 | 内容 | 难度 |
|---|---|---|
| GSM8K | 小学数学应用题(8.5K 题) | 中等 |
| MATH | 竞赛级数学(12.5K 题) | 高 |
| AIME | 美国数学邀请赛 | 极高 |
| IMO | 国际数学奥林匹克 | 顶尖 |
GSM8K 分数参考:
- GPT-4:92%
- o1:97%+
- Claude 3.5 Sonnet:96%+
- DeepSeek R1:97%+
1.3 代码能力
| 基准 | 内容 | 评测方式 |
|---|---|---|
| HumanEval | 164 个 Python 函数 | 生成代码通过率(pass@1) |
| MBPP | 基础 Python 编程题 | 通过率 |
| SWE-bench | 真实 GitHub issue 修复 | 端到端解决率 |
| Codeforces | 竞赛编程 | Elo 评分 |
| LiveCodeBench | 持续更新的编程题 | 防止数据泄露 |
HumanEval 分数参考:
- GPT-4:67%(原始)→ 90%+(带 CoT)
- Claude 3.5 Sonnet:92%+
- DeepSeek V3:90%+
1.4 长文本理解
| 基准 | 内容 | 评测方式 |
|---|---|---|
| Needle in a Haystack | 在长文本中找特定信息 | 检索准确率 |
| LongBench | 多种长文本任务 | 综合分数 |
| RULER | 可控难度的长文本测试 | 多种子任务 |
| InfiniteBench | 超长文本(> 100K) | 理解和检索 |
1.5 多语言能力
| 基准 | 内容 |
|---|---|
| MMMLU | MMLU 的多语言版本 |
| MEGA | 多语言多任务评测 |
| C-Eval | 中文综合评测 |
| CMMLU | 中文 MMLU |
| SuperCLUE | 中文对话能力评测 |
2. 排行榜
2.1 LMSYS Chatbot Arena
最接近"真实用户体验"的排行榜:
TEXT
评测方式:
1. 用户匿名向两个模型提问(不知道哪个是哪个)
2. 用户选择更好的回答
3. 使用 ELO 评分系统计算模型排名
4. 持续收集数据,排名动态更新
优势:
- 真实用户、真实问题
- 无法刷榜(双盲对比)
- 覆盖多种使用场景
劣势:
- 依赖用户主观判断
- 热门模型可能获得更多投票
- 排名波动较大2.2 OpenCompass
由上海 AI Lab 维护的综合评测平台:
- 覆盖 70+ 评测数据集
- 包含学科知识、语言理解、推理、代码等多维度
- 定期更新,覆盖最新模型
2.3 其他排行榜
| 排行榜 | 维护者 | 特点 |
|---|---|---|
| HuggingFace Open LLM Leaderboard | HuggingFace | 开源模型评测 |
| Stanford HELM | Stanford | 全面但更新慢 |
| BigBench | 200+ 多样化任务 | |
| AlpacaEval | Stanford | 自动评测 |
3. 评测的局限性与陷阱
3.1 数据污染(Data Contamination)
TEXT
问题:模型可能在训练数据中"见过"评测题目
表现:评测分数虚高,不代表真实泛化能力
检测方法:
- 在训练数据中搜索评测题目
- 对比"训练前发布"的基准 vs "训练后发布"的基准
- 使用持续更新的基准(如 LiveCodeBench)3.2 刷榜(Benchmark Gaming)
- 在训练数据中刻意包含评测题目的变体
- 针对特定基准优化,牺牲通用能力
- 发布"最佳超参数"但不说明搜索范围
3.3 评测不等于实际表现
TEXT
评测高分 ≠ 好用
原因:
- 评测通常是选择题或简答题,实际应用是开放式任务
- 评测不测试安全性、一致性、用户体验
- 评测可能遗漏重要能力(如创造力、同理心)
- 静态评测无法反映模型在新场景的表现3.4 如何选择评测指标
| 你的需求 | 关注的基准 |
|---|---|
| 知识问答 | MMLU、ARC |
| 数学推理 | GSM8K、MATH |
| 编程 | HumanEval、SWE-bench |
| 中文能力 | C-Eval、CMMLU |
| 长文档 | Needle in Haystack、LongBench |
| 综合体验 | Chatbot Arena |
| 实际应用 | 自己构建评测集 |
4. 构建自己的评测体系
4.1 为什么需要自建评测
通用基准无法覆盖你的特定场景。最佳实践是构建领域特定的评测集:
TEXT
步骤 1:定义评测维度
你的应用需要什么能力?(如:合同审查准确性、技术文档生成质量)
步骤 2:收集评测数据
从真实使用场景中收集 100-1000 个样本
步骤 3:建立评分标准
定义什么是"好回答"(如:准确性、完整性、格式规范)
步骤 4:自动+人工评估
自动指标(ROUGE、BLEU)+ 人工打分
步骤 5:持续迭代
定期更新评测数据,防止模型"学会"评测集4.2 LLM-as-Judge
用一个大模型(如 GPT-4)来评判其他模型的输出:
TEXT
优点:
- 成本低(比人工标注便宜 10-100 倍)
- 可扩展(可以同时评判数千个样本)
- 一致性高(比不同标注者之间更一致)
缺点:
- 可能有偏好偏差(倾向于自己的输出风格)
- 无法评估需要深度专业知识的任务
- 评判标准需要精心设计5. 本章小结
| 评测类型 | 推荐基准 | 用途 |
|---|---|---|
| 通用知识 | MMLU / MMLU-Pro | 横向对比模型基础能力 |
| 数学推理 | GSM8K / MATH / AIME | 评估逻辑推理能力 |
| 代码 | HumanEval / SWE-bench | 评估编程能力 |
| 中文 | C-Eval / CMMLU | 评估中文理解和生成 |
| 用户体验 | Chatbot Arena | 最接近真实使用感受 |
| 实际应用 | 自建评测集 | 评估特定场景表现 |
核心建议: 不要过度依赖单一基准的分数。选择模型时,应结合 Chatbot Arena 排名 + 相关基准分数 + 自己的实际测试体验。
相关章节
- 闭源模型(OpenAI / Anthropic / Google) — 评测所比较的主要对象
- 模型选型与 Agent 适配 — 评测结果如何指导选型
- Scaling Laws 与涌现能力 — 模型能力增长的底层规律
延伸阅读
- Hendrycks, D. et al. (2021). "Measuring Massive Multitask Language Understanding". ICLR
- Cobbe, K. et al. (2021). "Training Verifiers to Solve Math Word Problems". arXiv:2110.14168
- Chen, M. et al. (2021). "Evaluating Large Language Models Trained on Code". arXiv:2107.03374
- Chiang, W.L. et al. (2024). "Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference". arXiv