Skip to content

三、三方模型(API) ​

← 上一章:二、Coding Plan | 返回总览 | 下一章:四、CLI 种类 →

三方模型指通过 API 调用的第三方大语言模型服务,涵盖国际主流和国产模型。

国际主流模型 API ​

模型厂商特点
Claude API (Opus 5.5)Anthropic主力 Claude Opus 5.5(2026-09-22,claude-opus-5-5,$4/$20),1M 上下文。同期另有 Fable 5.1 / Mythos 5.1(2026-09-01):同权重、防护等级不同——Fable 为通用可用版,Mythos 为邀请制的可信访问版(面向网络安全与生命科学)
GPT-6 系列OpenAIGPT-6 Astra(2026-09-03,1.05M 上下文)、GPT-6 Sol / Luna(2026-09-22,分旗舰与低成本档)。上一代 GPT-5.6 的 Sol / Terra / Luna 三档仍在役
Gemini 系列GoogleGemini 3.8 Flash / 3.8 Live 于 2026-09 发布;Pro 档仍为 Gemini 3.1 Pro;约 1M 上下文,多模态能力突出。Gemini 4 官方确认已进入预训练,尚未发布

⚠️ 上下文窗口的口径:表中的数值是厂商规格书里的上限,实际可用量受输出预留、计费方式与接入渠道影响。同一模型在不同云渠道(如 AWS Bedrock)的标注可能不一致,选型前请以你实际接入的那个渠道的文档为准。

国产主流模型 API ​

模型厂商特点
DeepSeek-V4.1-Flash深度求索2026-09-10 发布(API 名 deepseek-flash):552B MoE、原生多模态、1M 上下文;开源强推理,成本低,编码能力强
Qwen3.8 系列阿里旗舰 Qwen3.8-Max(2026-08-03):总参 2.4T / 激活 95B,1M 上下文;另有 3.7-Max / 3.7-Plus / 3.6-Plus 等档位。中文理解精准
Kimi K3月之暗面Kimi K3(2026-07):2.8T 参数、原生视觉理解、1M 上下文;K2.8 Preview 于 2026-09-11 全量上线 Kimi Code,全档位 1M 上下文
GLM-5.3智谱 AI2026-08-14 上线,MoE 744B 总参 / 40B 激活;文本输入 1M、输出 128K。国内老牌模型,编码场景持续优化
MiniMax M3MiniMax2026-06-01 发布:428B 总参 / 23B 激活、1M 上下文、原生多模态;另有音乐、语音、视频模型

模型聚合平台 ​

  • OpenRouter:统一 API 网关,支持 500+ 模型、80+ 提供商,OpenAI 兼容接口
  • Hugging Face:提供开源模型托管和推理服务

模型选型对比 ​

编程场景 ​

模型编码能力价格上下文速度中文代码注释
Claude Opus 5.5⭐⭐⭐⭐⭐高1M中⭐⭐⭐⭐
GPT-6 Astra⭐⭐⭐⭐⭐高1.05M中⭐⭐⭐
Gemini 3.8 Flash⭐⭐⭐⭐中1M快⭐⭐⭐
DeepSeek-V4.1-Flash⭐⭐⭐⭐低1M快⭐⭐⭐⭐⭐
Qwen3.8-Max⭐⭐⭐⭐中1M快⭐⭐⭐⭐⭐
Kimi K3⭐⭐⭐⭐中1M快⭐⭐⭐⭐⭐
GLM-5.3⭐⭐⭐中1M快⭐⭐⭐⭐⭐
MiniMax M3⭐⭐⭐中1M快⭐⭐⭐⭐

非编程场景 ​

场景首选次选理由
长文档分析Gemini 3.8 / GPT-6 AstraClaude Opus 5.5 / Kimi K31M+ 上下文,原生多模态
中文写作Qwen3.8-Max / Kimi K3DeepSeek-V4.1-Flash中文理解精准,文风自然
多轮对话Claude Opus 5.5GPT-6 Astra指令遵循强,逻辑一致
多模态理解Gemini 3.8GPT-6 Astra原生多模态,图文理解强
低成本大批量DeepSeek-V4.1-FlashGPT-6 Luna / Qwen3.7-Plus开源+低价,推理成本极低
语音/音乐生成MiniMax M3—原生语音和音乐模型

选型建议 ​

  • 日常编码 → Claude Opus 5.5 或 DeepSeek-V4.1-Flash(前者质量最高,后者性价比最佳)
  • 中文项目优先 → Qwen3.8-Max / Kimi K3 / DeepSeek-V4.1-Flash:中文理解和生成最自然
  • 长文档/多模态 → Gemini 3.8 或 GPT-6 Astra:1M+ 上下文窗口,原生多模态
  • 低成本试验 → DeepSeek-V4.1-Flash / GPT-6 Luna:开源模型中编码能力最强,或大厂里最便宜的一档
  • 不想分别对接 → OpenRouter:一个 API 调 500+ 模型、80+ 提供商,按需切换

延伸:三种不是「LLM」的模型形态 ​

上面两张表列的都是可调用的 LLM API。但 2026 年「模型」这个词的外延已经扩大——选型时会遇到三类形态完全不同的东西,它们的评价标准(benchmark、延迟、成本)与 LLM 不通用。

形态代表它做什么关键区别
决策模型Jev(TypeSafe AI)只输出带概率的类型化判定:分类、评分、真/假不生成文本,结构上无法「胡说」;延迟 70–500ms(2026-09 发布)
世界模型Genie 3、NVIDIA Cosmos、Marble、V-JEPA 2理解并预测物理世界的演化,生成可交互环境吃视频级算力;主战场是仿真与具身智能,尚不能直接替换 LLM
专家混合(MoE)多数前沿开源模型稀疏激活——推理时只调用部分「专家」子网络是架构而非产品,决定推理成本与吞吐

决策模型:Jev ​

由 TypeSafe AI 于 2026-09 发布,创始人是前 OpenAI 研究员 Diogo Almeida(曾参与 ChatGPT 的指令遵循训练)。它属于「System One」路线:不生成任何文本,而是接收结构化状态(工单、消息、JSON),返回带校准置信度的答案。三种提问原语:

  • Choice —— 从至多 255 个预设选项中选一个,附各选项概率
  • Score —— 按 2–10 级的有序标准打分,结果可落在两级之间
  • Noul —— 是/否判断,返回 0–1 的概率(名字取自 Bernoulli)

它的定位是「快慢分工」里的快判断层:昂贵的大模型负责规划(慢思考),高频、原子化的判断交给决策模型。价格约 $0.042 / 百万输入 token,输出不计费。

⚠️ 两个使用前提:① 官方与集成方(Pydantic)均提示 prompt injection 可影响其判定——不适合单独作为 agent 的安全门禁;② 计数、算术、日期处理不可靠,且英文优先,目前未向中国大陆开放。

世界模型(World Model) ​

目标是让模型理解物理世界如何演化,而不只是处理语言。2026 年分成两条技术路线:

  • 生成式路线 —— 直接生成像素。Google DeepMind Genie 3(11B 参数自回归 Transformer,720p / 24fps)可实时生成可交互环境,2026-01 起经 Project Genie 向美国 AI Ultra 订阅者开放;Waymo 已用它微调出 Waymo World Model,专门生成现实中罕见的驾驶场景。NVIDIA Cosmos 是开源的世界基础模型平台,主要产出合成训练数据。
  • 隐空间路线 —— 只预测表征、不重建像素。Meta V-JEPA 2 用约 100 万小时视频预训练,再加仅 62 小时机器人数据,即可零样本完成抓放操作。Yann LeCun 于 2026 年初离开 Meta 创办 AMI Labs,专攻这条 JEPA 路线。

目前主要用于自动驾驶仿真、机器人训练与内容生成,还不是能直接替换 LLM API 的产品。

专家混合(MoE) ​

MoE 是架构而非产品:模型内部有多个「专家」子网络,每次推理只激活其中一小部分。因此总参数量(决定能力上限)与激活参数量(决定推理成本)是两个不同的数——看到「总参数 235B / 激活 22B」这类标注就是这种情况。它是当前主流开源模型压低推理成本的通用手段,选型时应关注激活参数而非总参数。

基于 CC BY-NC-SA 4.0 发布