⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

8.3 成本优化

核心问题: LLM 应用的成本来自哪里?如何在不明显牺牲质量的前提下降低成本?

在线 Notebook

对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明


成本来源

LLM 系统成本通常来自五类:

成本说明
输入 tokenprompt、检索内容、历史对话
输出 token模型生成内容
推理资源GPU、CPU、内存、网络
存储和检索向量库、日志、缓存
工程运维监控、告警、回归测试、人力

很多项目只看模型 API 单价,忽略了上下文长度、重试、RAG 检索和日志存储带来的成本。


降本策略

1. 缩短上下文

  • 删除无关历史对话
  • 对检索内容做重排序和截断
  • 把长文档先摘要再送入模型

2. 模型路由

text
简单任务 → 小模型
复杂任务 → 大模型
高风险任务 → 大模型 + 审核

路由的关键是先定义任务难度和失败成本。

3. 缓存

适合缓存的内容:

  • 高频问题
  • 文档检索结果
  • embedding 结果
  • 规则化 prompt 的中间输出

不适合缓存的内容:

  • 强个性化回答
  • 权限敏感数据
  • 高频变化的实时数据

4. 降级与回退

当成本、延迟或错误率超限时,系统应能降级:

  • 大模型切小模型
  • Agent 切 RAG
  • RAG 切 FAQ
  • 自动回答切人工处理

成本不要脱离质量看

成本优化不能只看便宜。需要同时看:

  • 每次成功回答成本
  • 每个有效用户成本
  • 错误回答带来的人工修复成本
  • 延迟导致的用户流失

便宜但错误率高的方案,实际总成本可能更高。


本节小结

  • LLM 成本来自 token、推理资源、检索、存储和运维
  • 控制上下文长度通常是最直接的降本手段
  • 模型路由、缓存和降级可以显著降低平均成本
  • 成本必须和质量、延迟、风险一起评估

下一节: 8.4 评估与基准

本教程采用 CC BY-NC-SA 4.0 许可协议