⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

扩展:评估方法调研

在线 Notebook

对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明

所属章节: 第5章:LLM基础 | 5.6 模型评估


概览

5.6 节介绍了评估的基本框架。本节深入调研主流 Benchmark 的设计细节、人工评估的实施方法,以及新兴评估技术。


主流 Benchmark 详解

MMLU(Massive Multitask Language Understanding)

规模: 57 个学科,约 15,908 道题
格式: 4 选 1 多选题
来源: 人工整理的考试题(SAT、GRE、专业资格考试等)

覆盖学科(示例):

STEM:数学、物理、化学、计算机科学、工程
人文:历史、哲学、法律、经济
医学:临床知识、解剖学、药理学
社会:心理学、社会学、政治学

局限:

  • 多选题格式不能测试生成能力
  • 部分题目已被包含在训练数据中(数据污染)
  • 不同语言版本(C-Eval)难度不完全可比

当前水平(2025): GPT-4o ~88%,LLaMA-3.1-70B ~86%,人类专家 ~89%


HumanEval

规模: 164 个 Python 编程题
格式: 给定函数签名和文档字符串,生成函数体
评估方式: 运行测试用例,pass@k(k 次尝试中至少 1 次通过)

python
# 示例题目
def has_close_elements(numbers: List[float], threshold: float) -> bool:
    """Check if in given list of numbers, are any two numbers closer to each
    other than given threshold.
    >>> has_close_elements([1.0, 2.0, 3.0], 0.5)
    False
    >>> has_close_elements([1.0, 2.8, 3.0, 4.0, 5.0, 2.0], 0.3)
    True
    """

局限: 只有 164 题,样本量小;题目已广为人知,可能被训练数据污染。

当前水平(2025): GPT-4o ~90%(pass@1),DeepSeek-R1 ~92%


GSM8K(Grade School Math 8K)

规模: 8,500 道小学数学应用题
格式: 自然语言题目,生成解题过程和答案
特点: 需要多步推理(平均 2-8 步)

题目:Janet的鸭子每天下16个蛋。她每天早上吃3个,
      用4个烤松饼给朋友。剩下的她以每个2美元的价格
      在农贸市场出售。她每天赚多少钱?

解题:
  每天产蛋:16
  消耗:3 + 4 = 7
  出售:16 - 7 = 9
  收入:9 × 2 = 18美元

当前水平(2025): GPT-4o ~97%,DeepSeek-R1 ~97%,小模型(7B)~75-85%


MT-Bench

规模: 80 个多轮对话问题,分 8 个类别
格式: 两轮对话,GPT-4 打分(1-10)
类别: 写作、角色扮演、推理、数学、编程、知识提取、STEM、人文

评估流程:

1. 模型回答第一轮问题
2. 模型回答第二轮追问(测试多轮一致性)
3. GPT-4 对每轮回答打分
4. 计算平均分

优点: 测试多轮对话能力,比单轮 Benchmark 更接近真实使用。
局限: GPT-4 评判者有自我偏好(倾向于 OpenAI 风格的回答)。


IFEval(Instruction Following Evaluation)

规模: 541 个带格式要求的指令
格式: 规则检查(不需要 LLM 评判)

示例指令:
  "写一篇关于气候变化的文章,要求:
   1. 字数在 300-400 词之间
   2. 包含至少 3 个段落
   3. 不使用'重要'这个词
   4. 以问句结尾"

评估:自动检查每个约束是否满足

优点: 完全自动化,无需 LLM 评判,结果可复现。
局限: 只测试格式遵循,不测试内容质量。


中文评估

C-Eval

规模: 52 个中文学科,13,948 道题
格式: 4 选 1,覆盖中国高考、考研、职业资格考试
特点: 包含大量中国特色知识(历史、法律、医学)

当前水平(2025): Qwen2.5-72B ~92%,GPT-4o ~88%

CMMLU

规模: 67 个主题,11,528 道题
特点: 比 C-Eval 更多中国本土化内容,包含港澳台地区知识

GAOKAO-Bench

特点: 使用真实高考题目,贴近中国教育场景,难度分布真实。


人工评估实施

偏好标注流程

1. 准备问题集(覆盖多种任务类型)
2. 两个模型各自生成回答(匿名)
3. 标注者选择更好的回答(或平局)
4. 计算胜率(Win Rate)
5. 用 Bootstrap 计算置信区间

标注一致性(Inter-Annotator Agreement):

  • Cohen's Kappa > 0.6:一致性良好
  • 通常需要 3 个标注者,取多数票

标注指南要点:

  • 准确性(事实是否正确)
  • 有用性(是否回答了问题)
  • 安全性(是否包含有害内容)
  • 流畅性(语言是否自然)

Chatbot Arena 机制

ELO 排名系统:

初始分数:所有模型 1000 分
每次对比:
  胜者 +K × (1 - 预期胜率)
  败者 -K × 预期胜率
  K = 32(标准值)

预期胜率 = 1 / (1 + 10^((对手分数-自己分数)/400))

优点: 大规模(数百万次对比)、真实用户、真实问题。
局限: 用户偏好可能偏向冗长、自信的回答;不同语言用户分布不均。


新兴评估方法

LLM-as-Judge

用强模型(GPT-4、Claude)评估弱模型,替代人工评估。

Prompt 设计要点:

- 明确评估维度(准确性、有用性、安全性)
- 要求给出评分理由(减少随机性)
- 使用参考答案(减少幻觉)
- 随机化回答顺序(减少位置偏见)

已知偏见:

  • 位置偏见:倾向于选择第一个或最后一个回答
  • 冗长偏见:倾向于更长的回答
  • 自我偏好:GPT-4 倾向于 GPT-4 风格的回答

HELMET(Holistic Evaluation of LLMs)

覆盖长上下文能力的综合评估框架,测试:

  • 长文档问答
  • 多文档摘要
  • 代码补全(长上下文)
  • 检索增强生成

LiveBench

核心思想: 使用最新发布的题目(新闻、论文、竞赛),避免数据污染。每月更新。


评估的最佳实践

1. 使用多个 Benchmark,不依赖单一指标
2. 关注置信区间,小差距可能不显著
3. 结合自动评估和人工评估
4. 在目标任务上做专项评估(不只看通用 Benchmark)
5. 检查数据污染(用 n-gram 重叠检测)
6. 报告评估细节(few-shot 数量、prompt 格式、温度参数)

返回: 第5章:LLM基础

本教程采用 CC BY-NC-SA 4.0 许可协议