⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

8.4 评估与基准

核心问题: 如何判断一个 LLM 系统是否真的可上线?

在线 Notebook

对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明


Benchmark 不等于线上质量

通用 Benchmark 可以评估基础能力,但不能直接代表业务效果。

原因:

  • 业务输入分布不同
  • 输出格式和安全要求不同
  • 用户容忍度不同
  • RAG、工具调用和权限逻辑不在通用 Benchmark 中

所以生产系统需要通用评估和业务评估两套体系。


离线评估

上线前至少准备:

  • 黄金测试集:人工确认的高质量样本
  • 边界样本:长文本、歧义问题、异常输入
  • 回归集:历史失败案例
  • 安全集:敏感、越权、注入攻击样本

常见指标:

  • 准确率 / 通过率
  • 格式符合率
  • 引用正确率
  • 拒答正确率
  • 平均延迟和成本

在线监控

上线后需要持续监控:

  • 请求量、错误率、超时率
  • 首 token 延迟和总延迟
  • 输入/输出 token 分布
  • 检索命中率和空结果率
  • 用户反馈和人工接管率
  • 成本峰值和预算消耗

只监控服务可用性不够,还要监控回答质量和业务风险。


评估闭环

text
线上失败案例

人工标注和归因

加入回归集

修 Prompt / RAG / 微调 / 工具

重新评估

灰度上线

评估不是上线前的一次性动作,而是生产系统的一部分。


本节小结

  • 通用 Benchmark 只能说明基础能力,不能替代业务评估
  • 生产评估需要覆盖质量、格式、安全、延迟和成本
  • 线上失败案例必须进入回归集
  • 没有评估闭环,就无法稳定迭代 LLM 系统

下一节: 8.5 生产系统设计

本教程采用 CC BY-NC-SA 4.0 许可协议