三、三方模型(API)
← 上一章:二、Coding Plan | 返回总览 | 下一章:四、CLI 种类 →
三方模型指通过 API 调用的第三方大语言模型服务,涵盖国际主流和国产模型。
国际主流模型 API
| 模型 | 厂商 | 特点 |
|---|---|---|
| Claude API (Opus 5.5) | Anthropic | 主力 Claude Opus 5.5(2026-09-22,claude-opus-5-5,$4/$20),1M 上下文。同期另有 Fable 5.1 / Mythos 5.1(2026-09-01):同权重、防护等级不同——Fable 为通用可用版,Mythos 为邀请制的可信访问版(面向网络安全与生命科学) |
| GPT-6 系列 | OpenAI | GPT-6 Astra(2026-09-03,1.05M 上下文)、GPT-6 Sol / Luna(2026-09-22,分旗舰与低成本档)。上一代 GPT-5.6 的 Sol / Terra / Luna 三档仍在役 |
| Gemini 系列 | Gemini 3.8 Flash / 3.8 Live 于 2026-09 发布;Pro 档仍为 Gemini 3.1 Pro;约 1M 上下文,多模态能力突出。Gemini 4 官方确认已进入预训练,尚未发布 |
⚠️ 上下文窗口的口径:表中的数值是厂商规格书里的上限,实际可用量受输出预留、计费方式与接入渠道影响。同一模型在不同云渠道(如 AWS Bedrock)的标注可能不一致,选型前请以你实际接入的那个渠道的文档为准。
国产主流模型 API
| 模型 | 厂商 | 特点 |
|---|---|---|
| DeepSeek-V4.1-Flash | 深度求索 | 2026-09-10 发布(API 名 deepseek-flash):552B MoE、原生多模态、1M 上下文;开源强推理,成本低,编码能力强 |
| Qwen3.8 系列 | 阿里 | 旗舰 Qwen3.8-Max(2026-08-03):总参 2.4T / 激活 95B,1M 上下文;另有 3.7-Max / 3.7-Plus / 3.6-Plus 等档位。中文理解精准 |
| Kimi K3 | 月之暗面 | Kimi K3(2026-07):2.8T 参数、原生视觉理解、1M 上下文;K2.8 Preview 于 2026-09-11 全量上线 Kimi Code,全档位 1M 上下文 |
| GLM-5.3 | 智谱 AI | 2026-08-14 上线,MoE 744B 总参 / 40B 激活;文本输入 1M、输出 128K。国内老牌模型,编码场景持续优化 |
| MiniMax M3 | MiniMax | 2026-06-01 发布:428B 总参 / 23B 激活、1M 上下文、原生多模态;另有音乐、语音、视频模型 |
模型聚合平台
- OpenRouter:统一 API 网关,支持 500+ 模型、80+ 提供商,OpenAI 兼容接口
- Hugging Face:提供开源模型托管和推理服务
模型选型对比
编程场景
| 模型 | 编码能力 | 价格 | 上下文 | 速度 | 中文代码注释 |
|---|---|---|---|---|---|
| Claude Opus 5.5 | ⭐⭐⭐⭐⭐ | 高 | 1M | 中 | ⭐⭐⭐⭐ |
| GPT-6 Astra | ⭐⭐⭐⭐⭐ | 高 | 1.05M | 中 | ⭐⭐⭐ |
| Gemini 3.8 Flash | ⭐⭐⭐⭐ | 中 | 1M | 快 | ⭐⭐⭐ |
| DeepSeek-V4.1-Flash | ⭐⭐⭐⭐ | 低 | 1M | 快 | ⭐⭐⭐⭐⭐ |
| Qwen3.8-Max | ⭐⭐⭐⭐ | 中 | 1M | 快 | ⭐⭐⭐⭐⭐ |
| Kimi K3 | ⭐⭐⭐⭐ | 中 | 1M | 快 | ⭐⭐⭐⭐⭐ |
| GLM-5.3 | ⭐⭐⭐ | 中 | 1M | 快 | ⭐⭐⭐⭐⭐ |
| MiniMax M3 | ⭐⭐⭐ | 中 | 1M | 快 | ⭐⭐⭐⭐ |
非编程场景
| 场景 | 首选 | 次选 | 理由 |
|---|---|---|---|
| 长文档分析 | Gemini 3.8 / GPT-6 Astra | Claude Opus 5.5 / Kimi K3 | 1M+ 上下文,原生多模态 |
| 中文写作 | Qwen3.8-Max / Kimi K3 | DeepSeek-V4.1-Flash | 中文理解精准,文风自然 |
| 多轮对话 | Claude Opus 5.5 | GPT-6 Astra | 指令遵循强,逻辑一致 |
| 多模态理解 | Gemini 3.8 | GPT-6 Astra | 原生多模态,图文理解强 |
| 低成本大批量 | DeepSeek-V4.1-Flash | GPT-6 Luna / Qwen3.7-Plus | 开源+低价,推理成本极低 |
| 语音/音乐生成 | MiniMax M3 | — | 原生语音和音乐模型 |
选型建议
- 日常编码 → Claude Opus 5.5 或 DeepSeek-V4.1-Flash(前者质量最高,后者性价比最佳)
- 中文项目优先 → Qwen3.8-Max / Kimi K3 / DeepSeek-V4.1-Flash:中文理解和生成最自然
- 长文档/多模态 → Gemini 3.8 或 GPT-6 Astra:1M+ 上下文窗口,原生多模态
- 低成本试验 → DeepSeek-V4.1-Flash / GPT-6 Luna:开源模型中编码能力最强,或大厂里最便宜的一档
- 不想分别对接 → OpenRouter:一个 API 调 500+ 模型、80+ 提供商,按需切换
延伸:三种不是「LLM」的模型形态
上面两张表列的都是可调用的 LLM API。但 2026 年「模型」这个词的外延已经扩大——选型时会遇到三类形态完全不同的东西,它们的评价标准(benchmark、延迟、成本)与 LLM 不通用。
| 形态 | 代表 | 它做什么 | 关键区别 |
|---|---|---|---|
| 决策模型 | Jev(TypeSafe AI) | 只输出带概率的类型化判定:分类、评分、真/假 | 不生成文本,结构上无法「胡说」;延迟 70–500ms(2026-09 发布) |
| 世界模型 | Genie 3、NVIDIA Cosmos、Marble、V-JEPA 2 | 理解并预测物理世界的演化,生成可交互环境 | 吃视频级算力;主战场是仿真与具身智能,尚不能直接替换 LLM |
| 专家混合(MoE) | 多数前沿开源模型 | 稀疏激活——推理时只调用部分「专家」子网络 | 是架构而非产品,决定推理成本与吞吐 |
决策模型:Jev
由 TypeSafe AI 于 2026-09 发布,创始人是前 OpenAI 研究员 Diogo Almeida(曾参与 ChatGPT 的指令遵循训练)。它属于「System One」路线:不生成任何文本,而是接收结构化状态(工单、消息、JSON),返回带校准置信度的答案。三种提问原语:
- Choice —— 从至多 255 个预设选项中选一个,附各选项概率
- Score —— 按 2–10 级的有序标准打分,结果可落在两级之间
- Noul —— 是/否判断,返回 0–1 的概率(名字取自 Bernoulli)
它的定位是「快慢分工」里的快判断层:昂贵的大模型负责规划(慢思考),高频、原子化的判断交给决策模型。价格约 $0.042 / 百万输入 token,输出不计费。
⚠️ 两个使用前提:① 官方与集成方(Pydantic)均提示 prompt injection 可影响其判定——不适合单独作为 agent 的安全门禁;② 计数、算术、日期处理不可靠,且英文优先,目前未向中国大陆开放。
世界模型(World Model)
目标是让模型理解物理世界如何演化,而不只是处理语言。2026 年分成两条技术路线:
- 生成式路线 —— 直接生成像素。Google DeepMind Genie 3(11B 参数自回归 Transformer,720p / 24fps)可实时生成可交互环境,2026-01 起经 Project Genie 向美国 AI Ultra 订阅者开放;Waymo 已用它微调出 Waymo World Model,专门生成现实中罕见的驾驶场景。NVIDIA Cosmos 是开源的世界基础模型平台,主要产出合成训练数据。
- 隐空间路线 —— 只预测表征、不重建像素。Meta V-JEPA 2 用约 100 万小时视频预训练,再加仅 62 小时机器人数据,即可零样本完成抓放操作。Yann LeCun 于 2026 年初离开 Meta 创办 AMI Labs,专攻这条 JEPA 路线。
目前主要用于自动驾驶仿真、机器人训练与内容生成,还不是能直接替换 LLM API 的产品。
专家混合(MoE)
MoE 是架构而非产品:模型内部有多个「专家」子网络,每次推理只激活其中一小部分。因此总参数量(决定能力上限)与激活参数量(决定推理成本)是两个不同的数——看到「总参数 235B / 激活 22B」这类标注就是这种情况。它是当前主流开源模型压低推理成本的通用手段,选型时应关注激活参数而非总参数。
