8.4 评估与基准
核心问题: 如何判断一个 LLM 系统是否真的可上线?
在线 Notebook
对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明。
Benchmark 不等于线上质量
通用 Benchmark 可以评估基础能力,但不能直接代表业务效果。
原因:
- 业务输入分布不同
- 输出格式和安全要求不同
- 用户容忍度不同
- RAG、工具调用和权限逻辑不在通用 Benchmark 中
所以生产系统需要通用评估和业务评估两套体系。
离线评估
上线前至少准备:
- 黄金测试集:人工确认的高质量样本
- 边界样本:长文本、歧义问题、异常输入
- 回归集:历史失败案例
- 安全集:敏感、越权、注入攻击样本
常见指标:
- 准确率 / 通过率
- 格式符合率
- 引用正确率
- 拒答正确率
- 平均延迟和成本
在线监控
上线后需要持续监控:
- 请求量、错误率、超时率
- 首 token 延迟和总延迟
- 输入/输出 token 分布
- 检索命中率和空结果率
- 用户反馈和人工接管率
- 成本峰值和预算消耗
只监控服务可用性不够,还要监控回答质量和业务风险。
评估闭环
text
线上失败案例
↓
人工标注和归因
↓
加入回归集
↓
修 Prompt / RAG / 微调 / 工具
↓
重新评估
↓
灰度上线评估不是上线前的一次性动作,而是生产系统的一部分。
本节小结
- 通用 Benchmark 只能说明基础能力,不能替代业务评估
- 生产评估需要覆盖质量、格式、安全、延迟和成本
- 线上失败案例必须进入回归集
- 没有评估闭环,就无法稳定迭代 LLM 系统
下一节: 8.5 生产系统设计
