8.3 成本优化
核心问题: LLM 应用的成本来自哪里?如何在不明显牺牲质量的前提下降低成本?
在线 Notebook
对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明。
成本来源
LLM 系统成本通常来自五类:
| 成本 | 说明 |
|---|---|
| 输入 token | prompt、检索内容、历史对话 |
| 输出 token | 模型生成内容 |
| 推理资源 | GPU、CPU、内存、网络 |
| 存储和检索 | 向量库、日志、缓存 |
| 工程运维 | 监控、告警、回归测试、人力 |
很多项目只看模型 API 单价,忽略了上下文长度、重试、RAG 检索和日志存储带来的成本。
降本策略
1. 缩短上下文
- 删除无关历史对话
- 对检索内容做重排序和截断
- 把长文档先摘要再送入模型
2. 模型路由
text
简单任务 → 小模型
复杂任务 → 大模型
高风险任务 → 大模型 + 审核路由的关键是先定义任务难度和失败成本。
3. 缓存
适合缓存的内容:
- 高频问题
- 文档检索结果
- embedding 结果
- 规则化 prompt 的中间输出
不适合缓存的内容:
- 强个性化回答
- 权限敏感数据
- 高频变化的实时数据
4. 降级与回退
当成本、延迟或错误率超限时,系统应能降级:
- 大模型切小模型
- Agent 切 RAG
- RAG 切 FAQ
- 自动回答切人工处理
成本不要脱离质量看
成本优化不能只看便宜。需要同时看:
- 每次成功回答成本
- 每个有效用户成本
- 错误回答带来的人工修复成本
- 延迟导致的用户流失
便宜但错误率高的方案,实际总成本可能更高。
本节小结
- LLM 成本来自 token、推理资源、检索、存储和运维
- 控制上下文长度通常是最直接的降本手段
- 模型路由、缓存和降级可以显著降低平均成本
- 成本必须和质量、延迟、风险一起评估
下一节: 8.4 评估与基准
