主流模型选型指南
本文依据各厂商最新的官方模型页、API 文档和定价页更新。模型名、上下文与价格变动很快,代码上线前仍应再看一次链接中的原始页面。价格均为按量 API 的标价;缓存、长上下文、批处理、工具调用、地区与企业协议都可能改变实际账单。
模型选型的结果是要多个维度考虑的,一个真正能上线的决定,至少要同时回答五个问题:
- 模型能否完成业务任务
- 一次请求花多少钱
- 延迟是否可接受
- 数据能否按要求流转
- 以后升级或切换是否可控
例如,客服的核心指标往往是吞吐、稳定 JSON 和单位成本;编码 Agent 更关心多轮工具调用、长程执行和补丁质量;合同审阅则会受长文档、多模态和可追溯性影响。它们不该共用一份“旗舰模型优先”的结论。
“1M 上下文”表示单次请求可容纳的 token 上限,并不等于把 100 万 token 全塞进去就能得到同样可靠的答案。长输入会增加延迟和账单,也会降低多目标检索、细粒度引用等任务的稳定性。先检索、重排和压缩,再把最相关证据交给模型,通常仍是生产系统的默认做法。
选型前先统一比较口径
同一张表里出现的“模型名称”可能是产品名、API 别名或不可变快照。它们的稳定性不同,先区分清楚,后面的成本和效果数据才有意义。
| 需要核对的项 | 为什么重要 | 典型误区 |
|---|---|---|
| API 模型 ID 与版本策略 | 决定代码里到底调用什么,是否会自动升级 | 把 gpt-5.6 这类别名当作固定版本 |
| 上下文、最大输出、思维链预算 | 决定一次任务能装多少资料、能生成多长结果 | 只看输入窗口,不看最大输出和推理 token |
| 输入、输出、缓存、长上下文单价 | 决定真实账单 | 只比较“输入单价” |
| 模态与工具能力 | 决定能否看图、看视频、调函数、联网或执行代码 | 把模型能力和平台代管工具混为一谈 |
| 可用地域、数据政策、部署方式 | 决定合规和交付是否可行 | 先写完功能,最后才发现账号或数据要求不满足 |
| 评测集与回退方案 | 决定升级时是否可验证、故障时能否降级 | 用几轮主观聊天替代回归评测 |
上下文、最大输出和缓存是三件事
- 上下文窗口:输入、历史消息、工具结果、系统提示和输出通常共享的总预算。不同厂商的计数边界略有差异,应以对应 API 文档为准。
- 最大输出:模型这一次最多能生成的 token。长报告、代码生成和 Agent 工具循环都会被它限制。
- 缓存:复用相同前缀时,许多平台会降低输入费用。它节省的是重复输入,不会免费产生输出,也不能替代会话状态管理。
把“模型产品”与“接入平台”分开
同一个模型可由原厂、云厂商或聚合平台提供。模型权重、默认版本、速率限制、数据保留、价格、是否支持工具和地域合规都可能不同。本文的价格和模型 ID 优先按原厂或模型官方云平台写;如果改用第三方,必须重新核对其服务合同和控制台参数。
国际主流模型
OpenAI GPT-5.6 系列
OpenAI 的当前主线为 GPT-5.6 家族。官方将它拆成三个成本与能力档位:Sol 处理复杂专业工作,Terra 用于能力与成本的平衡,Luna 面向高吞吐、成本敏感的工作负载。三者都支持文本和图像输入、文本输出、函数调用、结构化输出及 Responses API 的工具能力。
| 模型产品 | API 模型 ID | 上下文 / 最大输出 | 标准价格(输入 / 缓存输入 / 输出,每百万 token) | 适合的起点 |
|---|---|---|---|---|
| GPT-5.6 Sol | gpt-5.6-sol | 1,050,000 / 128,000 | $5 / $0.50 / $30 | 复杂推理、难代码、关键 Agent 任务 |
| GPT-5.6 Terra | gpt-5.6-terra | 1,050,000 / 128,000 | $2 / $0.20 / $12 | 大多数生产功能、需要较好质量的工具调用 |
| GPT-5.6 Luna | gpt-5.6-luna | 1,050,000 / 128,000 | $0.20 / $0.02 / $1.20 | 分类、抽取、路由、批量生成和高频问答 |
当整个请求超过 272K token 时,GPT-5.6 的长上下文价格会提高:输入为标准价的 2 倍、输出为 1.5 倍。把“支持 1M”直接等同于“适合每次传 1M”,很容易低估成本和时延。
怎么选
- 先以
gpt-5.6-terra作为需要较强质量的通用基线,用真实数据确认它是否已经达标。 gpt-5.6-sol留给复杂架构、难 Bug、关键决策辅助和高价值 Agent。它的输出单价明显更高,应由评测结果而非直觉触发升级。gpt-5.6-luna用于输入输出结构固定、可自动验收的任务,例如意图分类、字段抽取、标签生成和路由。
工程注意点
gpt-5.6 是会跟随更新的别名,当前指向 Sol;要保证线上行为可回放,生产配置应采用官方提供的固定快照,而不是把别名当作不可变版本。GPT-5.6 的 reasoning.effort 支持从 none 到 max 的多档控制,pro 是推理模式而非另一个模型 ID。先在中低推理强度下测基线,再决定是否为少数困难请求开启更高档位。
Anthropic Claude 5 系列
Claude 当前常规选型可按 Fable、Opus、Sonnet、Haiku 四档理解。用户常说“Claude 已经是 Opus 5”,这一点是对的;但 Opus 5 不是该系列能力最高的广泛可用档位,长程 Agent 的最高档是 Claude Fable 5。
| 模型产品 | API 模型 ID | 上下文 / 最大输出 | 标准价格(输入 / 输出,每百万 token) | 定位 |
|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5 | 1M / 128K | $10 / $50 | 长程 Agent 的最高常规档位 |
| Claude Opus 5 | claude-opus-5 | 1M / 128K | $5 / $25 | 复杂 Agent 编程、企业工作、深度推理 |
| Claude Sonnet 5 | claude-sonnet-5 | 1M / 128K | $2 / $10 | 规模化编码、Agent 和企业流程的平衡档 |
| Claude Haiku 4.5 | claude-haiku-4-5 | 200K / 64K | $1 / $5 | 实时交互、高并发、子 Agent 与成本敏感任务 |
Fable 5、Opus 5 和 Sonnet 5 为 1M 上下文;Haiku 4.5 仍是 200K。做长文档或大仓库任务时,不能只根据“Claude 系列”这个品牌名做假设。
怎么选
- 编码、工具循环和企业工作流先测
claude-sonnet-5。它通常是质量、速度和成本的平衡点。 - 困难任务用
claude-opus-5;只有长程自主执行的收益足以覆盖成本时,再评估claude-fable-5。 - 需要大量并发的客服、抽取和子 Agent 不要习惯性上 Sonnet,
claude-haiku-4-5的速度和价格更合适,但其上下文更短。
Claude 5 的模型 ID 是固定快照式标识,不应把它理解为会自动追随下一代模型的“latest”别名。Sonnet 5 的新 tokenizer 会改变同一段文本的 token 数,迁移前应重新计算真实样本的 token 和总成本,而不是只比较每百万 token 标价。
Google Gemini 系列
Gemini 的长处不是单纯的文本对话,而是原生处理文本、图像、音频、视频和 PDF,并把 Google Search Grounding、URL Context、代码执行、文件搜索等能力放在同一开发者平台。当前应关注稳定的 Gemini 3.6 Flash、Gemini 3.5 Flash,以及仍可使用的 Gemini 2.5 Pro / Flash;预览模型应单独做版本风险管理。
| 模型 | API 模型 ID | 上下文 / 最大输出 | 适用场景 |
|---|---|---|---|
| Gemini 3.6 Flash | gemini-3.6-flash | 1,048,576 / 65,536 | 快速 Agent 循环、编码、空间推理、多模态任务 |
| Gemini 3.5 Flash | gemini-3.5-flash | 1,048,576 / 65,536 | 大规模子 Agent、多步骤工作流、长时程任务 |
| Gemini 2.5 Pro | gemini-2.5-pro | 1,048,576 / 65,536 | 复杂代码、数学、STEM 和大型资料分析 |
| Gemini 2.5 Flash | gemini-2.5-flash | 1,048,576 / 65,536 | 低延迟、大规模、需要思考的通用任务 |
Gemini 的计费会随着模型、输入模态、是否使用 Search Grounding、缓存与套餐变化。特别是联网搜索与多模态输入,不能用一行“文本输入/输出单价”代表全部成本。若任务需要视频理解、音频理解、Google 搜索接地或 URL 阅读,它很值得进入候选集;如果只做普通中文文本问答,应拿同一业务集与国内模型一起测,而不要靠品牌判断。
官方资料:模型目录、Gemini 3.6 Flash、长上下文说明、价格页。
国内主流模型
国内 API 的账号、网络、合同和数据治理通常更贴近本地企业交付,但不代表可以忽略评测。中文自然度、工具调用、复杂代码、超长上下文和多模态能力依然要由真实业务样本验证。
DeepSeek V4:Flash 与 Pro
DeepSeek 的官方 API 主线已从旧的 deepseek-chat / deepseek-reasoner 迁移到 V4。当前调用名为 deepseek-v4-flash 与 deepseek-v4-pro;它们都可以在思考和非思考模式间选择,不能再把“日常聊天”和“推理”当成两个固定的独立模型系列。
| 模型产品 | API 模型 ID | 当前底层版本 | 上下文 / 最大输出 | 标准价格(缓存命中 / 未命中输入 / 输出,每百万 token) |
|---|---|---|---|---|
| DeepSeek V4 Flash | deepseek-v4-flash | DeepSeek-V4-Flash-0731 | 1M / 384K | $0.0028 / $0.14 / $0.28 |
| DeepSeek V4 Pro | deepseek-v4-pro | DeepSeek-V4-Pro-0813 | 1M / 384K | $0.003625 / $0.435 / $0.87 |
怎么选
deepseek-v4-flash用于实时 Agent、批量生成、问答和成本敏感的业务。官方将它定位为低延迟、高性价比档,简单 Agent 任务可以先从它测起。deepseek-v4-pro处理复杂推理、困难代码、知识密集任务和高难 Agent 流程。只有在 Flash 的业务通过率不足时再升级,才能让路由规则保持简单。
两档都支持 JSON Output、Function/Tool Calls、OpenAI Responses API、Anthropic Messages 兼容层、FIM 与前缀续写等能力。Anthropic 兼容层把 opus* 映射到 V4 Pro、把 sonnet* / haiku* 映射到 V4 Flash,只是协议兼容,不代表实际调用了 Claude。
DeepSeek V4 的权重采用 MIT 许可,适合纳入私有化可行性评估;但 Flash 也有 284B 总参数、Pro 有 1.6T 总参数,开放权重不等于普通单机就能经济部署。私有化方案应先测目标吞吐、上下文长度、量化精度、显存和多卡通信,再谈硬件清单。官方价格页也提示价格可能调整,因此生产配置不要把本文数值写死在程序中。
官方资料:模型与定价、V4 发布说明、更新日志、Responses API。
通义千问 Qwen 系列
Qwen 当前的云端主线已从 Qwen2.5 进入 Qwen3.7 / 3.8。旧的“按 0.5B、7B、72B 逐档选 Qwen2.5”的表格既不能代表当前 API,也会把云服务型号与开源权重型号混在一起。下面是阿里云百炼国际站当前适合首先评估的三个档位。
| 模型产品 | API 模型 ID | 上下文 / 最大输出 | 当前标价口径 | 适用场景 |
|---|---|---|---|---|
| Qwen3.8-Max | qwen3.8-max | 1M / 128K | $2 输入,$6 输出;缓存命中 $0.25 / M | 复杂编码、专业知识工作、长程多模态 Agent |
| Qwen3.7-Plus | qwen3.7-plus | 1M / 128K | 输入 $0.40 / M 起,输出 $1.60 / M 起;按输入长度分档 | 多模态工具调用、GUI 操作、通用生产工作流 |
| Qwen3.7-Flash | qwen3.7-flash | 1M / 128K | 在输入不超过 32K 时,$0.03 输入、$0.13 输出 / M;更长输入另有分档 | 高吞吐多模态理解、搜索/CI Agent、低成本任务 |
三个档位都支持图像、文本和视频输入,输出为文本,并提供函数调用、结构化输出、联网搜索、缓存和批量推理。Qwen3.7-Plus 的特点是视觉与工具混合的 Agent 能力;Qwen3.7-Flash 适合高频小请求,但价格随单请求输入长度阶梯变化,长上下文不能按最低价估算。
Qwen 生态同时有云端 API、开源权重和第三方托管服务。需要私有化时,必须选择明确开放、许可适配且能在目标硬件上验证过的具体权重版本;不能因为“Qwen 有开源生态”就默认任一百炼 API 型号都可本地部署。
官方资料:推荐模型、Qwen3.8-Max、Qwen3.7-Plus、Qwen3.7-Flash。
智谱 GLM 系列
智谱当前的旗舰文本模型是 GLM-5.2,主打项目级工程上下文和长程任务执行;而 GLM-4.7-FlashX / Flash 则承担低成本或免费体验的入口。它不再是早期“GLM-4、GLM-4-Plus、GLM-4V”那一组简单分级。
| 模型产品 | 上下文 / 最大输出 | 标准价格(输入 / 输出,每百万 token) | 定位 |
|---|---|---|---|
| GLM-5.2 | 1M / 128K | ¥8 / ¥28;缓存命中 ¥2 | 长程工程任务、代码交付、复杂文本工作 |
| GLM-4.7 | 200K / 128K | 价格会随输入/输出长度分档 | 通用对话、推理、Agent 与编程 |
| GLM-4.7-FlashX | 200K / 128K | ¥0.5 / ¥3 | 高速、低成本中文写作、翻译、角色与通用任务 |
| GLM-4.7-Flash | 200K / 128K | 当前免费 | 快速验证和普惠体验,不应直接当作长期生产 SLA |
GLM 的适用位置
- 做项目级代码理解、较长工具链任务或需要 1M 中文上下文时,
GLM-5.2可以与 GPT-5.6 Terra/Sol、Claude Sonnet/Opus、DeepSeek V4 Pro 放在同一评测组。 - 大量中文轻任务先测
GLM-4.7-FlashX。它的 200K 窗口已经足够覆盖多数客服、摘要、抽取与普通 RAG 回答。 - 需要视觉理解或手机操作时,不要拿纯文本 GLM-5.2 去承担;应评估官方的
GLM-5V-Turbo、GLM-4.6V或AutoGLM-Phone等专用型号,并核实对应模态和权限。
智谱平台同时提供 OpenAI API 兼容、Claude API 兼容、模型部署、微调、搜索和知识库等能力。它们是平台功能,不是任何一个文本模型天然自带的本地能力。采购或集成时要把模型 token 成本和这些附加服务的计费、数据边界分开核算。
Kimi 系列
Kimi 的当前旗舰是 kimi-k3,定位为长程编程与端到端知识工作;代码优先可用 K2.7 Code,通用多模态与思考/非思考切换可选 K2.6。原来“最高 200K 上下文”的介绍已经过时。
| 模型产品 | API 模型 ID | 上下文 | 主要能力 | 价格口径 |
|---|---|---|---|---|
| Kimi K3 | kimi-k3 | 1,048,576 token | 长程编程、知识工作、视觉理解、工具调用;始终思考,可调推理强度 | 缓存命中 ¥2、未命中输入 ¥20、输出 ¥100 / M |
| Kimi K2.7 Code | kimi-k2.7-code | 256K | 多模态编码、工具调用和 Agent;仅思考模式 | 以当前 K2.7 Code 定价页为准 |
| Kimi K2.7 Code 高速版 | kimi-k2.7-code-highspeed | 256K | 与 K2.7 Code 同模型,优先输出速度 | 以当前 K2.7 Code 定价页为准 |
| Kimi K2.6 | kimi-k2.6 | 256K | 通用对话、Agent、视觉理解、复杂推理;可选思考或非思考 | 以当前 K2.6 定价页为准 |
kimi-k3 支持图片、视频、JSON Schema、工具调用、前缀续写、自动上下文缓存和推理强度控制。它适合代码 Agent、长资料研究与需要视觉反馈的知识工作,但输出单价较高,不能因为拥有 1M 窗口就把所有 RAG 文档都完整塞入。K2.7 Code 适合需要高速度的编程任务;需要通用多模态和可关闭思考模式时,再考虑 K2.6。
Kimi API 兼容 OpenAI API 格式。多轮工具调用时,官方要求将 API 返回的完整 assistant message 原样带入下一轮,不能只保留最终文本;否则工具调用状态和推理链路可能断裂。K3 的官方联网搜索正在更新,近期不宜把它作为生产流程的唯一外部信息来源。
官方资料:Kimi K3、K2.7 Code、模型定价、K3 定价。
一张表可以看清当前候选集有哪些
下面的矩阵用于缩小候选范围,不用于宣布绝对排名。能力强弱应以你的任务集复测为准。
| 目标 | 优先候选 | 选择理由 | 需要额外验证的风险 |
|---|---|---|---|
| 复杂代码与高价值 Agent | GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Pro、Qwen3.8-Max、GLM-5.2、Kimi K3 | 强推理、长上下文或长程执行能力 | 工具循环成功率、补丁可编译率、总 token 与时延 |
| 通用生产工作流 | GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.6/3.5 Flash、Qwen3.7-Plus、Kimi K2.6 | 能力和成本较平衡,多数支持结构化输出与工具调用 | 真实中文质量、稳定 JSON、可用地域 |
| 高并发、成本敏感 | GPT-5.6 Luna、Claude Haiku 4.5、DeepSeek V4 Flash、Qwen3.7-Flash、GLM-4.7-FlashX | 单价低或吞吐高 | 短上下文限制、复杂任务的失败率、缓存命中率 |
| 长文档或大仓库 | GPT-5.6 三档、Claude 5 的 Fable/Opus/Sonnet、Gemini、DeepSeek V4、Qwen3.7/3.8、GLM-5.2、Kimi K3 | 约 1M 上下文 | 长输入成本、定位细节的准确率、引用是否可追溯 |
| 多模态理解 | Gemini、Qwen3.7/3.8、Kimi K3/K2.6/K2.7 Code、GLM 视觉模型 | 原生图像、视频、音频或 PDF 输入 | 具体模型支持哪些模态,文件大小与媒体 token 计费 |
| 受控私有化 | DeepSeek V4 开放权重、明确开放的 Qwen 权重,或厂商私有实例方案 | 可按数据边界和硬件规划 | 许可证、显存、吞吐、量化损失、运维成本 |
为什么不再给“五星能力榜”
静态星级表会让读者误以为“综合五星”就能推导出自己的业务效果。实际结果会被提示词、数据质量、工具实现、语言、上下文组织、并发、温度与评测标准共同影响。更有用的做法是保留候选池,构建一套能重复执行的评测。
场景化选型
智能客服与结构化问答
这类任务更看重稳定格式、低延迟、拒答边界和单位成本,而不是极限推理。
- 用 DeepSeek V4 Flash、GPT-5.6 Luna、Qwen3.7-Flash 或 GLM-4.7-FlashX 建立低成本基线。
- 抽取失败、工具调用复杂或需要更好语言质量时,再与 GPT-5.6 Terra、Claude Sonnet 5、Qwen3.7-Plus 做 A/B 对照。
- 对每个模型强制校验 JSON Schema、敏感问题拒答、知识库无证据时的回答和 p95 延迟。
不要直接把旗舰模型放在所有客服流量前面。若 90% 的问题可由小档模型正确解决,路由只把难例升级,成本和延迟都会明显下降。
代码助手与编程 Agent
代码任务的验收必须落在仓库:能否定位文件、修改是否小而准确、能否通过编译/测试、工具调用失败时能否恢复。仅比较一次生成的代码片段没有价值。
| 任务难度 | 首轮候选 | 验证方式 |
|---|---|---|
| 补全、解释、小修复 | GPT-5.6 Terra/Luna、Claude Haiku 4.5、DeepSeek V4 Flash、Qwen3.7-Flash、Kimi K2.7 Code | 编译、单测、静态检查、diff 大小 |
| 多文件功能开发 | GPT-5.6 Terra、Claude Sonnet 5、DeepSeek V4 Pro、Qwen3.7-Plus、GLM-5.2、Kimi K3 | 任务完成率、工具调用成功率、回归测试、人工评审 |
| 架构或高风险排障 | GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Pro、Qwen3.8-Max、GLM-5.2、Kimi K3 | 方案正确性、变更风险、执行后测试和人工复核 |
模型支持工具不等于 Agent 已经可靠。Agent 框架仍需要超时、重试、幂等、权限隔离、命令白名单和人工接管机制。
内容创作与报告生成
中文品牌内容的质量不能只靠“中文模型更自然”这种经验判断。准备同一份写作 Brief,包括受众、禁用表达、事实资料、样稿和验收标准,让 Qwen、DeepSeek、GLM、Kimi 与国际模型生成多份盲测结果。把人工编辑时长、事实错误、风格一致性和采纳率记录下来,才有可复用的结论。
高价值报告应拆成“资料抽取 → 事实核对 → 结构规划 → 成文 → 引用检查”几个步骤。即使使用了推理模型,也不能把模型输出当成事实来源。
数据分析与报告自动化
模型可以帮助解释数据、生成 SQL 草案、整理异常和写报告,但不能替代数据校验。对于财务、风控、运营指标等任务:
- 让数据库或代码计算数值,模型只解释已验证的结果。
- 对 SQL 设置只读账号、表范围和行数上限;不要把生产写权限交给工具调用。
- 将计算输入、模型版本、提示词、工具结果和最终输出一起记录,便于复盘。
复杂推理可从 GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Pro、Gemini 2.5 Pro、GLM-5.2、Kimi K3 中选样对测;成本敏感的初步分类、表格说明和摘要可先走小档模型。
RAG 知识库问答
RAG 的核心不是把文档塞满上下文,而是把可引用、最相关、未过期的证据送进模型。推荐按下面的顺序搭建:
- 解析资料,保留来源、版本、段落位置和权限标签。
- 检索并重排,限制进入上下文的片段数量和总 token。
- 在提示词中要求“仅依据给定证据回答”;无证据时明确拒答或转人工。
- 输出答案时携带来源标识,离线评估答案正确性、引用正确性和无证据拒答率。
大窗口模型对整本手册、长合同和跨文件比较有帮助,但它不会消除权限控制、文档新旧版本、引用归因和检索质量这些问题。普通问答先从 DeepSeek V4 Flash、GPT-5.6 Luna/Terra、Qwen3.7-Flash/Plus、GLM-4.7-FlashX 或 Kimi K2.6 测起;只有上下文组织已优化仍不够时,再评估 1M 档或强推理档。
多模态资料分析
如果输入包含图纸、截图、音频、视频、扫描 PDF,不要只问“模型是否多模态”,还要核对:支持的文件类型、单文件大小、视频时长、分辨率、是否原生理解音频、媒体 token 价格、能否引用帧或页码。
- 需要 Google 搜索接地、URL 与长视频/音频能力时,优先测 Gemini。
- 需要多模态 Agent、GUI 或视觉驱动代码任务时,测 Qwen3.7/3.8、Kimi K3/K2.7 Code、GLM 视觉型号。
- 只需 OCR 或固定字段抽取时,专用 OCR/文档解析服务往往比用旗舰通用模型更稳定、更便宜。
数据不能出网或需要私有化
先确定数据分级、是否允许云端专有实例、日志保留期、密钥管理、审计和跨境要求,再选模型。模型参数量不是硬件规划的充分条件。实际部署至少要压测:目标上下文长度下的并发、首 token 延迟、生成吞吐、显存余量、故障恢复、量化精度和升级回滚。
可从三条路径选择:明确许可的开放权重自行部署、云厂商的专属/私有实例、或把敏感数据脱敏后使用公共 API。DeepSeek V4 和部分 Qwen 开源权重适合进入自建可行性评估;GLM 等平台提供私有实例方案。每一条都需要单独确认具体型号的许可与数据合同。
成本估算:按请求结构算,不按感觉算
基础公式
对于不含缓存和工具费用的文本请求:
单次成本 = 输入 token / 1,000,000 × 输入单价
+ 输出 token / 1,000,000 × 输出单价
日成本 = 单次成本 × 日请求数
若平台区分缓存命中、未命中输入、显式缓存创建、长上下文或思维链 token,应分别代入。使用联网搜索、文件搜索、代码执行、容器等代管工具时,再加上这些工具自己的计费。
一个可复算的示例
假设每天 10 万次请求,每次平均 500 输入 token + 200 输出 token,不考虑缓存和工具费:
| 模型 | 每日输入 / 输出 token | 按当前标价估算的日成本 | 说明 |
|---|---|---|---|
| GPT-5.6 Luna | 50M / 20M | $34 | $0.20 输入 + $1.20 输出 / M |
| DeepSeek V4 Flash | 50M / 20M | $12.60 | $0.14 未命中输入 + $0.28 输出 / M |
| Qwen3.7-Flash | 50M / 20M | $4.10 | 此例单请求输入低于 32K,按最低阶梯;长请求更贵 |
| Kimi K3 | 50M / 20M | ¥3,000 | ¥20 未命中输入 + ¥100 输出 / M |
这个例子只用于展示计算方法,不是采购报价。缓存命中率、输出长度、模型思考过程、长输入阶梯、汇率、批处理折扣和工具调用都会改变结果。真正选型时,先采集一周真实流量的 token 分布,再让候选模型重放。
预算有限时的模型路由
一套常见且可验证的路由方式如下:
请求进入
├─ 固定格式抽取、分类、短摘要 → 低成本模型
├─ 普通问答、RAG 回答、常规工具调用 → 平衡模型
├─ 长文档、复杂代码、多步推理 → 高能力模型
└─ 失败、低置信度、关键风险操作 → 高能力复核或人工处理
路由条件要来自可观测信号,例如文档长度、是否需要视觉输入、JSON 校验失败、检索证据不足、工具循环次数和业务风险等级。不要让模型自己随意宣称“我很难”,然后直接升级到昂贵模型。
把选型变成一次可重复的实验
1. 准备业务评测集
至少准备 30 到 100 条脱敏真实样本,并按任务类型标记:简单问答、边界问题、长文档、结构化输出、工具调用、多轮对话、异常输入和高风险请求。每条样本要有可验证的期望结果或人工评分规则。
2. 固定变量,只替换模型
同一轮对比中,保持系统提示、检索结果、工具定义、参数、最大输出和超时一致。否则测到的可能是提示词或框架差异,而不是模型差异。
from dataclasses import dataclass
@dataclass
class EvalResult:
model: str
passed: int
total: int
p95_latency_ms: int
input_tokens: int
output_tokens: int
estimated_cost: float
def evaluate(model: str, cases: list[dict]) -> EvalResult:
"""在这里固定 prompt、工具和超时,仅替换 model。"""
# 1. 调用模型并记录原始响应、token、耗时、工具轨迹
# 2. 用 JSON Schema、单测、引用校验或人工盲评判定结果
# 3. 汇总成功率、p95 延迟和实际成本
raise NotImplementedError
for candidate in ["low-cost", "balanced", "high-capability"]:
print(evaluate(candidate, cases=[]))
3. 不只看准确率
| 指标 | 适用任务 | 示例 |
|---|---|---|
| 任务成功率 | 客服、RAG、Agent | 是否答对、是否完成流程 |
| 格式合规率 | 抽取、接口编排 | JSON 是否通过 Schema 校验 |
| 引用正确率 | 知识库、报告 | 引用是否真的支持结论 |
| 工具调用成功率 | Agent | 参数是否正确、循环是否收敛 |
| 代码验证率 | 编程助手 | 编译、测试、静态检查是否通过 |
| p50 / p95 延迟 | 实时业务 | 用户实际等待时间 |
| 单任务成本 | 所有按量 API | 输入、输出、缓存和工具费之和 |
| 安全与越权率 | 企业场景 | 是否泄漏提示词、越过数据权限或执行危险操作 |
4. 上线时保留回滚能力
- 模型 ID、推理档位、温度、最大输出、系统提示与工具版本都进入配置和日志。
- 对会变化的别名设置升级评测门槛;能锁定快照的场景优先锁定。
- 为每个关键路由配置至少一个替代模型,并验证其输出格式、限流、地域和数据要求。
- 观察 token、缓存命中、错误码、超时、工具失败率和业务通过率;HTTP 200 不代表业务成功。
最终决策清单
在确定模型前,逐项确认:
- 目标模型 ID、API 版本、上下文、最大输出已从官方页核对。
- 使用了脱敏真实业务集,而不是只做自由聊天。
- 记录了成功率、p95 延迟、输入输出 token、缓存和工具费用。
- 长文档场景验证了证据定位与引用,未把 1M 窗口当成准确率保证。
- 数据地域、日志保留、权限、合同和部署方式满足要求。
- 已验证限流、超时、失败回退和模型升级后的回归结果。
- 高风险输出仍有业务规则、人工审核或可逆操作保护。
小结
当前的主线型号已经明显变化:OpenAI 应关注 GPT-5.6 的 Sol、Terra、Luna;Claude 应以 Fable 5、Opus 5、Sonnet 5、Haiku 4.5 分档;DeepSeek 已进入 V4 Flash/Pro;Qwen、GLM、Kimi 也都提供了 1M 档与更低成本档位。
这些产品并没有让选型变成“全都选 1M 上下文”。上下文只是约束之一。把候选模型放进同一套真实业务评测,按质量、延迟、成本、数据边界和可维护性做决定,才是能长期使用的选型方法。