⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

8.5 生产系统设计

核心问题: 一个生产级 LLM 系统需要哪些工程边界?

在线 Notebook

对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明


从 Demo 到生产

Demo 通常只关心“能不能回答”。生产系统还必须关心:

  • 失败时怎么办
  • 成本是否可控
  • 数据是否合规
  • 输出是否可追踪
  • 模型升级是否会回归
  • 高峰期是否稳定

生产化的核心不是把模型接上 API,而是把模型放进可观测、可回退、可治理的系统里。


典型架构

text
用户请求

鉴权 / 限流 / 审计

任务路由
  ├─ Prompt
  ├─ RAG
  ├─ Agent
  └─ 人工处理

模型推理

安全检查 / 格式校验

日志 / 监控 / 成本统计

用户响应

关键工程能力

能力作用
鉴权防止越权访问模型、知识库和工具
限流防止突发流量拖垮系统
路由根据任务选择模型和方案
回退主链路失败时降级到备用方案
审计记录请求、工具调用和关键决策
监控观察质量、延迟、成本和错误

上线风险

1. 幻觉

缓解方式:

  • RAG 引用来源
  • 高风险问题拒答
  • 输出校验
  • 人工审核

2. Prompt Injection

缓解方式:

  • 区分用户输入和系统指令
  • 检索内容只作为证据,不作为指令
  • 工具调用前做权限检查

3. 成本失控

缓解方式:

  • token 上限
  • 请求限流
  • 模型路由
  • 预算告警

4. 模型升级回归

缓解方式:

  • 固定回归集
  • 灰度发布
  • A/B 测试
  • 快速回滚

上线检查清单

  • [ ] 是否有业务评估集和回归集?
  • [ ] 是否设置 token、延迟和成本上限?
  • [ ] 是否有失败降级策略?
  • [ ] 是否记录 RAG 来源和 Agent 工具调用?
  • [ ] 是否有权限控制和审计日志?
  • [ ] 是否定义了模型升级和回滚流程?

本节小结

  • 生产级 LLM 系统必须可观测、可回退、可治理
  • RAG 和 Agent 会引入额外的权限、审计和失败路径
  • 成本、延迟、质量和安全需要同时监控
  • 上线后必须持续用真实失败案例更新评估集

下一步: 回到 第8章首页 复核生产闭环。

本教程采用 CC BY-NC-SA 4.0 许可协议