主流大模型全景 / 模型能力评测体系
CHAPTER 03 · TOPIC 03

模型能力评测体系

如何客观地比较不同大模型的能力?这是一个看似简单实则极其复杂的问题。本章全面介绍当前主流的评测基准、排行榜以及评测的局限性,帮助你建立科学的模型能力评估框架。

一句话理解

如何客观地比较不同大模型的能力?这是一个看似简单实则极其复杂的问题。本章全面介绍当前主流的评测基准、排行榜以及评测的局限性,帮助你建立科学的模型能力评估框架。

阅读前置

了解大语言模型基本概念

本文关注

核心评测基准、排行榜、评测的局限性与陷阱

所在知识层

生态格局 · 主流大模型全景

文章导航
主教学视觉模型能力评测体系 · 知识结构

点击图中节点可定位到对应正文。

核心主题关系与流向

引言

如何客观地比较不同大模型的能力?这是一个看似简单实则极其复杂的问题。本章全面介绍当前主流的评测基准、排行榜以及评测的局限性,帮助你建立科学的模型能力评估框架。


1. 核心评测基准

1.1 通用知识

基准全称内容评测方式
MMLUMassive Multitask Language Understanding57 个学科的选择题四选一准确率
MMLU-ProMMLU 增强版更难、选项更多(10 选 1)减少猜对概率
ARCAI2 Reasoning Challenge小学/初中科学题需要推理而非记忆
HellaSwag常识推理选择最合理的句子续写测试常识理解
WinoGrande常识推理解决代词指代歧义测试语言理解

MMLU 分数参考:

  • GPT-4:86.4%
  • Claude 3.5 Sonnet:88.7%
  • LLaMA 3.1 405B:85.2%
  • DeepSeek V3:88.5%
  • 人类专家:~89.8%

1.2 数学推理

基准内容难度
GSM8K小学数学应用题(8.5K 题)中等
MATH竞赛级数学(12.5K 题)
AIME美国数学邀请赛极高
IMO国际数学奥林匹克顶尖

GSM8K 分数参考:

  • GPT-4:92%
  • o1:97%+
  • Claude 3.5 Sonnet:96%+
  • DeepSeek R1:97%+

1.3 代码能力

基准内容评测方式
HumanEval164 个 Python 函数生成代码通过率(pass@1)
MBPP基础 Python 编程题通过率
SWE-bench真实 GitHub issue 修复端到端解决率
Codeforces竞赛编程Elo 评分
LiveCodeBench持续更新的编程题防止数据泄露

HumanEval 分数参考:

  • GPT-4:67%(原始)→ 90%+(带 CoT)
  • Claude 3.5 Sonnet:92%+
  • DeepSeek V3:90%+

1.4 长文本理解

基准内容评测方式
Needle in a Haystack在长文本中找特定信息检索准确率
LongBench多种长文本任务综合分数
RULER可控难度的长文本测试多种子任务
InfiniteBench超长文本(> 100K)理解和检索

1.5 多语言能力

基准内容
MMMLUMMLU 的多语言版本
MEGA多语言多任务评测
C-Eval中文综合评测
CMMLU中文 MMLU
SuperCLUE中文对话能力评测

2. 排行榜

2.1 LMSYS Chatbot Arena

最接近"真实用户体验"的排行榜:

TEXT
评测方式:
1. 用户匿名向两个模型提问(不知道哪个是哪个)
2. 用户选择更好的回答
3. 使用 ELO 评分系统计算模型排名
4. 持续收集数据,排名动态更新

优势:
- 真实用户、真实问题
- 无法刷榜(双盲对比)
- 覆盖多种使用场景

劣势:
- 依赖用户主观判断
- 热门模型可能获得更多投票
- 排名波动较大

2.2 OpenCompass

由上海 AI Lab 维护的综合评测平台:

  • 覆盖 70+ 评测数据集
  • 包含学科知识、语言理解、推理、代码等多维度
  • 定期更新,覆盖最新模型

2.3 其他排行榜

排行榜维护者特点
HuggingFace Open LLM LeaderboardHuggingFace开源模型评测
Stanford HELMStanford全面但更新慢
BigBenchGoogle200+ 多样化任务
AlpacaEvalStanford自动评测

3. 评测的局限性与陷阱

3.1 数据污染(Data Contamination)

TEXT
问题:模型可能在训练数据中"见过"评测题目
表现:评测分数虚高,不代表真实泛化能力

检测方法:
- 在训练数据中搜索评测题目
- 对比"训练前发布"的基准 vs "训练后发布"的基准
- 使用持续更新的基准(如 LiveCodeBench)

3.2 刷榜(Benchmark Gaming)

  • 在训练数据中刻意包含评测题目的变体
  • 针对特定基准优化,牺牲通用能力
  • 发布"最佳超参数"但不说明搜索范围

3.3 评测不等于实际表现

TEXT
评测高分 ≠ 好用

原因:
- 评测通常是选择题或简答题,实际应用是开放式任务
- 评测不测试安全性、一致性、用户体验
- 评测可能遗漏重要能力(如创造力、同理心)
- 静态评测无法反映模型在新场景的表现

3.4 如何选择评测指标

你的需求关注的基准
知识问答MMLU、ARC
数学推理GSM8K、MATH
编程HumanEval、SWE-bench
中文能力C-Eval、CMMLU
长文档Needle in Haystack、LongBench
综合体验Chatbot Arena
实际应用自己构建评测集

4. 构建自己的评测体系

4.1 为什么需要自建评测

通用基准无法覆盖你的特定场景。最佳实践是构建领域特定的评测集:

TEXT
步骤 1:定义评测维度
  你的应用需要什么能力?(如:合同审查准确性、技术文档生成质量)

步骤 2:收集评测数据
  从真实使用场景中收集 100-1000 个样本

步骤 3:建立评分标准
  定义什么是"好回答"(如:准确性、完整性、格式规范)

步骤 4:自动+人工评估
  自动指标(ROUGE、BLEU)+ 人工打分

步骤 5:持续迭代
  定期更新评测数据,防止模型"学会"评测集

4.2 LLM-as-Judge

用一个大模型(如 GPT-4)来评判其他模型的输出:

TEXT
优点:
- 成本低(比人工标注便宜 10-100 倍)
- 可扩展(可以同时评判数千个样本)
- 一致性高(比不同标注者之间更一致)

缺点:
- 可能有偏好偏差(倾向于自己的输出风格)
- 无法评估需要深度专业知识的任务
- 评判标准需要精心设计

5. 本章小结

评测类型推荐基准用途
通用知识MMLU / MMLU-Pro横向对比模型基础能力
数学推理GSM8K / MATH / AIME评估逻辑推理能力
代码HumanEval / SWE-bench评估编程能力
中文C-Eval / CMMLU评估中文理解和生成
用户体验Chatbot Arena最接近真实使用感受
实际应用自建评测集评估特定场景表现

核心建议: 不要过度依赖单一基准的分数。选择模型时,应结合 Chatbot Arena 排名 + 相关基准分数 + 自己的实际测试体验。

相关章节


延伸阅读

  • Hendrycks, D. et al. (2021). "Measuring Massive Multitask Language Understanding". ICLR
  • Cobbe, K. et al. (2021). "Training Verifiers to Solve Math Word Problems". arXiv:2110.14168
  • Chen, M. et al. (2021). "Evaluating Large Language Models Trained on Code". arXiv:2107.03374
  • Chiang, W.L. et al. (2024). "Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference". arXiv