扩展:评估方法调研
在线 Notebook
对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明。
概览
5.6 节介绍了评估的基本框架。本节深入调研主流 Benchmark 的设计细节、人工评估的实施方法,以及新兴评估技术。
主流 Benchmark 详解
MMLU(Massive Multitask Language Understanding)
规模: 57 个学科,约 15,908 道题
格式: 4 选 1 多选题
来源: 人工整理的考试题(SAT、GRE、专业资格考试等)
覆盖学科(示例):
STEM:数学、物理、化学、计算机科学、工程
人文:历史、哲学、法律、经济
医学:临床知识、解剖学、药理学
社会:心理学、社会学、政治学局限:
- 多选题格式不能测试生成能力
- 部分题目已被包含在训练数据中(数据污染)
- 不同语言版本(C-Eval)难度不完全可比
当前水平(2025): GPT-4o ~88%,LLaMA-3.1-70B ~86%,人类专家 ~89%
HumanEval
规模: 164 个 Python 编程题
格式: 给定函数签名和文档字符串,生成函数体
评估方式: 运行测试用例,pass@k(k 次尝试中至少 1 次通过)
# 示例题目
def has_close_elements(numbers: List[float], threshold: float) -> bool:
"""Check if in given list of numbers, are any two numbers closer to each
other than given threshold.
>>> has_close_elements([1.0, 2.0, 3.0], 0.5)
False
>>> has_close_elements([1.0, 2.8, 3.0, 4.0, 5.0, 2.0], 0.3)
True
"""局限: 只有 164 题,样本量小;题目已广为人知,可能被训练数据污染。
当前水平(2025): GPT-4o ~90%(pass@1),DeepSeek-R1 ~92%
GSM8K(Grade School Math 8K)
规模: 8,500 道小学数学应用题
格式: 自然语言题目,生成解题过程和答案
特点: 需要多步推理(平均 2-8 步)
题目:Janet的鸭子每天下16个蛋。她每天早上吃3个,
用4个烤松饼给朋友。剩下的她以每个2美元的价格
在农贸市场出售。她每天赚多少钱?
解题:
每天产蛋:16
消耗:3 + 4 = 7
出售:16 - 7 = 9
收入:9 × 2 = 18美元当前水平(2025): GPT-4o ~97%,DeepSeek-R1 ~97%,小模型(7B)~75-85%
MT-Bench
规模: 80 个多轮对话问题,分 8 个类别
格式: 两轮对话,GPT-4 打分(1-10)
类别: 写作、角色扮演、推理、数学、编程、知识提取、STEM、人文
评估流程:
1. 模型回答第一轮问题
2. 模型回答第二轮追问(测试多轮一致性)
3. GPT-4 对每轮回答打分
4. 计算平均分优点: 测试多轮对话能力,比单轮 Benchmark 更接近真实使用。
局限: GPT-4 评判者有自我偏好(倾向于 OpenAI 风格的回答)。
IFEval(Instruction Following Evaluation)
规模: 541 个带格式要求的指令
格式: 规则检查(不需要 LLM 评判)
示例指令:
"写一篇关于气候变化的文章,要求:
1. 字数在 300-400 词之间
2. 包含至少 3 个段落
3. 不使用'重要'这个词
4. 以问句结尾"
评估:自动检查每个约束是否满足优点: 完全自动化,无需 LLM 评判,结果可复现。
局限: 只测试格式遵循,不测试内容质量。
中文评估
C-Eval
规模: 52 个中文学科,13,948 道题
格式: 4 选 1,覆盖中国高考、考研、职业资格考试
特点: 包含大量中国特色知识(历史、法律、医学)
当前水平(2025): Qwen2.5-72B ~92%,GPT-4o ~88%
CMMLU
规模: 67 个主题,11,528 道题
特点: 比 C-Eval 更多中国本土化内容,包含港澳台地区知识
GAOKAO-Bench
特点: 使用真实高考题目,贴近中国教育场景,难度分布真实。
人工评估实施
偏好标注流程
1. 准备问题集(覆盖多种任务类型)
2. 两个模型各自生成回答(匿名)
3. 标注者选择更好的回答(或平局)
4. 计算胜率(Win Rate)
5. 用 Bootstrap 计算置信区间标注一致性(Inter-Annotator Agreement):
- Cohen's Kappa > 0.6:一致性良好
- 通常需要 3 个标注者,取多数票
标注指南要点:
- 准确性(事实是否正确)
- 有用性(是否回答了问题)
- 安全性(是否包含有害内容)
- 流畅性(语言是否自然)
Chatbot Arena 机制
ELO 排名系统:
初始分数:所有模型 1000 分
每次对比:
胜者 +K × (1 - 预期胜率)
败者 -K × 预期胜率
K = 32(标准值)
预期胜率 = 1 / (1 + 10^((对手分数-自己分数)/400))优点: 大规模(数百万次对比)、真实用户、真实问题。
局限: 用户偏好可能偏向冗长、自信的回答;不同语言用户分布不均。
新兴评估方法
LLM-as-Judge
用强模型(GPT-4、Claude)评估弱模型,替代人工评估。
Prompt 设计要点:
- 明确评估维度(准确性、有用性、安全性)
- 要求给出评分理由(减少随机性)
- 使用参考答案(减少幻觉)
- 随机化回答顺序(减少位置偏见)已知偏见:
- 位置偏见:倾向于选择第一个或最后一个回答
- 冗长偏见:倾向于更长的回答
- 自我偏好:GPT-4 倾向于 GPT-4 风格的回答
HELMET(Holistic Evaluation of LLMs)
覆盖长上下文能力的综合评估框架,测试:
- 长文档问答
- 多文档摘要
- 代码补全(长上下文)
- 检索增强生成
LiveBench
核心思想: 使用最新发布的题目(新闻、论文、竞赛),避免数据污染。每月更新。
评估的最佳实践
1. 使用多个 Benchmark,不依赖单一指标
2. 关注置信区间,小差距可能不显著
3. 结合自动评估和人工评估
4. 在目标任务上做专项评估(不只看通用 Benchmark)
5. 检查数据污染(用 n-gram 重叠检测)
6. 报告评估细节(few-shot 数量、prompt 格式、温度参数)返回: 第5章:LLM基础
