跳到主要内容

主流模型选型指南

本文数据口径

本文依据各厂商最新的官方模型页、API 文档和定价页更新。模型名、上下文与价格变动很快,代码上线前仍应再看一次链接中的原始页面。价格均为按量 API 的标价;缓存、长上下文、批处理、工具调用、地区与企业协议都可能改变实际账单。

模型选型的结果是要多个维度考虑的,一个真正能上线的决定,至少要同时回答五个问题:

  • 模型能否完成业务任务
  • 一次请求花多少钱
  • 延迟是否可接受
  • 数据能否按要求流转
  • 以后升级或切换是否可控

例如,客服的核心指标往往是吞吐、稳定 JSON 和单位成本;编码 Agent 更关心多轮工具调用、长程执行和补丁质量;合同审阅则会受长文档、多模态和可追溯性影响。它们不该共用一份“旗舰模型优先”的结论。

不要把上下文窗口当作实际可用容量

“1M 上下文”表示单次请求可容纳的 token 上限,并不等于把 100 万 token 全塞进去就能得到同样可靠的答案。长输入会增加延迟和账单,也会降低多目标检索、细粒度引用等任务的稳定性。先检索、重排和压缩,再把最相关证据交给模型,通常仍是生产系统的默认做法。

选型前先统一比较口径

同一张表里出现的“模型名称”可能是产品名、API 别名或不可变快照。它们的稳定性不同,先区分清楚,后面的成本和效果数据才有意义。

需要核对的项为什么重要典型误区
API 模型 ID 与版本策略决定代码里到底调用什么,是否会自动升级gpt-5.6 这类别名当作固定版本
上下文、最大输出、思维链预算决定一次任务能装多少资料、能生成多长结果只看输入窗口,不看最大输出和推理 token
输入、输出、缓存、长上下文单价决定真实账单只比较“输入单价”
模态与工具能力决定能否看图、看视频、调函数、联网或执行代码把模型能力和平台代管工具混为一谈
可用地域、数据政策、部署方式决定合规和交付是否可行先写完功能,最后才发现账号或数据要求不满足
评测集与回退方案决定升级时是否可验证、故障时能否降级用几轮主观聊天替代回归评测

上下文、最大输出和缓存是三件事

  • 上下文窗口:输入、历史消息、工具结果、系统提示和输出通常共享的总预算。不同厂商的计数边界略有差异,应以对应 API 文档为准。
  • 最大输出:模型这一次最多能生成的 token。长报告、代码生成和 Agent 工具循环都会被它限制。
  • 缓存:复用相同前缀时,许多平台会降低输入费用。它节省的是重复输入,不会免费产生输出,也不能替代会话状态管理。

把“模型产品”与“接入平台”分开

同一个模型可由原厂、云厂商或聚合平台提供。模型权重、默认版本、速率限制、数据保留、价格、是否支持工具和地域合规都可能不同。本文的价格和模型 ID 优先按原厂或模型官方云平台写;如果改用第三方,必须重新核对其服务合同和控制台参数。

国际主流模型

OpenAI GPT-5.6 系列

OpenAI 的当前主线为 GPT-5.6 家族。官方将它拆成三个成本与能力档位:Sol 处理复杂专业工作,Terra 用于能力与成本的平衡,Luna 面向高吞吐、成本敏感的工作负载。三者都支持文本和图像输入、文本输出、函数调用、结构化输出及 Responses API 的工具能力。

模型产品API 模型 ID上下文 / 最大输出标准价格(输入 / 缓存输入 / 输出,每百万 token)适合的起点
GPT-5.6 Solgpt-5.6-sol1,050,000 / 128,000$5 / $0.50 / $30复杂推理、难代码、关键 Agent 任务
GPT-5.6 Terragpt-5.6-terra1,050,000 / 128,000$2 / $0.20 / $12大多数生产功能、需要较好质量的工具调用
GPT-5.6 Lunagpt-5.6-luna1,050,000 / 128,000$0.20 / $0.02 / $1.20分类、抽取、路由、批量生成和高频问答

当整个请求超过 272K token 时,GPT-5.6 的长上下文价格会提高:输入为标准价的 2 倍、输出为 1.5 倍。把“支持 1M”直接等同于“适合每次传 1M”,很容易低估成本和时延。

怎么选

  • 先以 gpt-5.6-terra 作为需要较强质量的通用基线,用真实数据确认它是否已经达标。
  • gpt-5.6-sol 留给复杂架构、难 Bug、关键决策辅助和高价值 Agent。它的输出单价明显更高,应由评测结果而非直觉触发升级。
  • gpt-5.6-luna 用于输入输出结构固定、可自动验收的任务,例如意图分类、字段抽取、标签生成和路由。

工程注意点

gpt-5.6 是会跟随更新的别名,当前指向 Sol;要保证线上行为可回放,生产配置应采用官方提供的固定快照,而不是把别名当作不可变版本。GPT-5.6 的 reasoning.effort 支持从 nonemax 的多档控制,pro 是推理模式而非另一个模型 ID。先在中低推理强度下测基线,再决定是否为少数困难请求开启更高档位。

官方资料:模型目录SolTerraLuna定价

Anthropic Claude 5 系列

Claude 当前常规选型可按 Fable、Opus、Sonnet、Haiku 四档理解。用户常说“Claude 已经是 Opus 5”,这一点是对的;但 Opus 5 不是该系列能力最高的广泛可用档位,长程 Agent 的最高档是 Claude Fable 5。

模型产品API 模型 ID上下文 / 最大输出标准价格(输入 / 输出,每百万 token)定位
Claude Fable 5claude-fable-51M / 128K$10 / $50长程 Agent 的最高常规档位
Claude Opus 5claude-opus-51M / 128K$5 / $25复杂 Agent 编程、企业工作、深度推理
Claude Sonnet 5claude-sonnet-51M / 128K$2 / $10规模化编码、Agent 和企业流程的平衡档
Claude Haiku 4.5claude-haiku-4-5200K / 64K$1 / $5实时交互、高并发、子 Agent 与成本敏感任务
不是所有 Claude 档位都是 1M

Fable 5、Opus 5 和 Sonnet 5 为 1M 上下文;Haiku 4.5 仍是 200K。做长文档或大仓库任务时,不能只根据“Claude 系列”这个品牌名做假设。

怎么选

  • 编码、工具循环和企业工作流先测 claude-sonnet-5。它通常是质量、速度和成本的平衡点。
  • 困难任务用 claude-opus-5;只有长程自主执行的收益足以覆盖成本时,再评估 claude-fable-5
  • 需要大量并发的客服、抽取和子 Agent 不要习惯性上 Sonnet,claude-haiku-4-5 的速度和价格更合适,但其上下文更短。

Claude 5 的模型 ID 是固定快照式标识,不应把它理解为会自动追随下一代模型的“latest”别名。Sonnet 5 的新 tokenizer 会改变同一段文本的 token 数,迁移前应重新计算真实样本的 token 和总成本,而不是只比较每百万 token 标价。

官方资料:模型概览选型说明上下文窗口定价

Google Gemini 系列

Gemini 的长处不是单纯的文本对话,而是原生处理文本、图像、音频、视频和 PDF,并把 Google Search Grounding、URL Context、代码执行、文件搜索等能力放在同一开发者平台。当前应关注稳定的 Gemini 3.6 FlashGemini 3.5 Flash,以及仍可使用的 Gemini 2.5 Pro / Flash;预览模型应单独做版本风险管理。

模型API 模型 ID上下文 / 最大输出适用场景
Gemini 3.6 Flashgemini-3.6-flash1,048,576 / 65,536快速 Agent 循环、编码、空间推理、多模态任务
Gemini 3.5 Flashgemini-3.5-flash1,048,576 / 65,536大规模子 Agent、多步骤工作流、长时程任务
Gemini 2.5 Progemini-2.5-pro1,048,576 / 65,536复杂代码、数学、STEM 和大型资料分析
Gemini 2.5 Flashgemini-2.5-flash1,048,576 / 65,536低延迟、大规模、需要思考的通用任务

Gemini 的计费会随着模型、输入模态、是否使用 Search Grounding、缓存与套餐变化。特别是联网搜索与多模态输入,不能用一行“文本输入/输出单价”代表全部成本。若任务需要视频理解、音频理解、Google 搜索接地或 URL 阅读,它很值得进入候选集;如果只做普通中文文本问答,应拿同一业务集与国内模型一起测,而不要靠品牌判断。

官方资料:模型目录Gemini 3.6 Flash长上下文说明价格页

国内主流模型

国内 API 的账号、网络、合同和数据治理通常更贴近本地企业交付,但不代表可以忽略评测。中文自然度、工具调用、复杂代码、超长上下文和多模态能力依然要由真实业务样本验证。

DeepSeek V4:Flash 与 Pro

DeepSeek 的官方 API 主线已从旧的 deepseek-chat / deepseek-reasoner 迁移到 V4。当前调用名为 deepseek-v4-flashdeepseek-v4-pro;它们都可以在思考和非思考模式间选择,不能再把“日常聊天”和“推理”当成两个固定的独立模型系列。

模型产品API 模型 ID当前底层版本上下文 / 最大输出标准价格(缓存命中 / 未命中输入 / 输出,每百万 token)
DeepSeek V4 Flashdeepseek-v4-flashDeepSeek-V4-Flash-07311M / 384K$0.0028 / $0.14 / $0.28
DeepSeek V4 Prodeepseek-v4-proDeepSeek-V4-Pro-08131M / 384K$0.003625 / $0.435 / $0.87

怎么选

  • deepseek-v4-flash 用于实时 Agent、批量生成、问答和成本敏感的业务。官方将它定位为低延迟、高性价比档,简单 Agent 任务可以先从它测起。
  • deepseek-v4-pro 处理复杂推理、困难代码、知识密集任务和高难 Agent 流程。只有在 Flash 的业务通过率不足时再升级,才能让路由规则保持简单。

两档都支持 JSON Output、Function/Tool Calls、OpenAI Responses API、Anthropic Messages 兼容层、FIM 与前缀续写等能力。Anthropic 兼容层把 opus* 映射到 V4 Pro、把 sonnet* / haiku* 映射到 V4 Flash,只是协议兼容,不代表实际调用了 Claude。

DeepSeek V4 的权重采用 MIT 许可,适合纳入私有化可行性评估;但 Flash 也有 284B 总参数、Pro 有 1.6T 总参数,开放权重不等于普通单机就能经济部署。私有化方案应先测目标吞吐、上下文长度、量化精度、显存和多卡通信,再谈硬件清单。官方价格页也提示价格可能调整,因此生产配置不要把本文数值写死在程序中。

官方资料:模型与定价V4 发布说明更新日志Responses API

通义千问 Qwen 系列

Qwen 当前的云端主线已从 Qwen2.5 进入 Qwen3.7 / 3.8。旧的“按 0.5B、7B、72B 逐档选 Qwen2.5”的表格既不能代表当前 API,也会把云服务型号与开源权重型号混在一起。下面是阿里云百炼国际站当前适合首先评估的三个档位。

模型产品API 模型 ID上下文 / 最大输出当前标价口径适用场景
Qwen3.8-Maxqwen3.8-max1M / 128K$2 输入,$6 输出;缓存命中 $0.25 / M复杂编码、专业知识工作、长程多模态 Agent
Qwen3.7-Plusqwen3.7-plus1M / 128K输入 $0.40 / M 起,输出 $1.60 / M 起;按输入长度分档多模态工具调用、GUI 操作、通用生产工作流
Qwen3.7-Flashqwen3.7-flash1M / 128K在输入不超过 32K 时,$0.03 输入、$0.13 输出 / M;更长输入另有分档高吞吐多模态理解、搜索/CI Agent、低成本任务

三个档位都支持图像、文本和视频输入,输出为文本,并提供函数调用、结构化输出、联网搜索、缓存和批量推理。Qwen3.7-Plus 的特点是视觉与工具混合的 Agent 能力;Qwen3.7-Flash 适合高频小请求,但价格随单请求输入长度阶梯变化,长上下文不能按最低价估算。

Qwen 生态同时有云端 API、开源权重和第三方托管服务。需要私有化时,必须选择明确开放、许可适配且能在目标硬件上验证过的具体权重版本;不能因为“Qwen 有开源生态”就默认任一百炼 API 型号都可本地部署。

官方资料:推荐模型Qwen3.8-MaxQwen3.7-PlusQwen3.7-Flash

智谱 GLM 系列

智谱当前的旗舰文本模型是 GLM-5.2,主打项目级工程上下文和长程任务执行;而 GLM-4.7-FlashX / Flash 则承担低成本或免费体验的入口。它不再是早期“GLM-4、GLM-4-Plus、GLM-4V”那一组简单分级。

模型产品上下文 / 最大输出标准价格(输入 / 输出,每百万 token)定位
GLM-5.21M / 128K¥8 / ¥28;缓存命中 ¥2长程工程任务、代码交付、复杂文本工作
GLM-4.7200K / 128K价格会随输入/输出长度分档通用对话、推理、Agent 与编程
GLM-4.7-FlashX200K / 128K¥0.5 / ¥3高速、低成本中文写作、翻译、角色与通用任务
GLM-4.7-Flash200K / 128K当前免费快速验证和普惠体验,不应直接当作长期生产 SLA

GLM 的适用位置

  • 做项目级代码理解、较长工具链任务或需要 1M 中文上下文时,GLM-5.2 可以与 GPT-5.6 Terra/Sol、Claude Sonnet/Opus、DeepSeek V4 Pro 放在同一评测组。
  • 大量中文轻任务先测 GLM-4.7-FlashX。它的 200K 窗口已经足够覆盖多数客服、摘要、抽取与普通 RAG 回答。
  • 需要视觉理解或手机操作时,不要拿纯文本 GLM-5.2 去承担;应评估官方的 GLM-5V-TurboGLM-4.6VAutoGLM-Phone 等专用型号,并核实对应模态和权限。

智谱平台同时提供 OpenAI API 兼容、Claude API 兼容、模型部署、微调、搜索和知识库等能力。它们是平台功能,不是任何一个文本模型天然自带的本地能力。采购或集成时要把模型 token 成本和这些附加服务的计费、数据边界分开核算。

官方资料:模型概览GLM-5.2官方定价

Kimi 系列

Kimi 的当前旗舰是 kimi-k3,定位为长程编程与端到端知识工作;代码优先可用 K2.7 Code,通用多模态与思考/非思考切换可选 K2.6。原来“最高 200K 上下文”的介绍已经过时。

模型产品API 模型 ID上下文主要能力价格口径
Kimi K3kimi-k31,048,576 token长程编程、知识工作、视觉理解、工具调用;始终思考,可调推理强度缓存命中 ¥2、未命中输入 ¥20、输出 ¥100 / M
Kimi K2.7 Codekimi-k2.7-code256K多模态编码、工具调用和 Agent;仅思考模式以当前 K2.7 Code 定价页为准
Kimi K2.7 Code 高速版kimi-k2.7-code-highspeed256K与 K2.7 Code 同模型,优先输出速度以当前 K2.7 Code 定价页为准
Kimi K2.6kimi-k2.6256K通用对话、Agent、视觉理解、复杂推理;可选思考或非思考以当前 K2.6 定价页为准

kimi-k3 支持图片、视频、JSON Schema、工具调用、前缀续写、自动上下文缓存和推理强度控制。它适合代码 Agent、长资料研究与需要视觉反馈的知识工作,但输出单价较高,不能因为拥有 1M 窗口就把所有 RAG 文档都完整塞入。K2.7 Code 适合需要高速度的编程任务;需要通用多模态和可关闭思考模式时,再考虑 K2.6

Kimi API 兼容 OpenAI API 格式。多轮工具调用时,官方要求将 API 返回的完整 assistant message 原样带入下一轮,不能只保留最终文本;否则工具调用状态和推理链路可能断裂。K3 的官方联网搜索正在更新,近期不宜把它作为生产流程的唯一外部信息来源。

官方资料:Kimi K3K2.7 Code模型定价K3 定价

一张表可以看清当前候选集有哪些

下面的矩阵用于缩小候选范围,不用于宣布绝对排名。能力强弱应以你的任务集复测为准。

目标优先候选选择理由需要额外验证的风险
复杂代码与高价值 AgentGPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Pro、Qwen3.8-Max、GLM-5.2、Kimi K3强推理、长上下文或长程执行能力工具循环成功率、补丁可编译率、总 token 与时延
通用生产工作流GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.6/3.5 Flash、Qwen3.7-Plus、Kimi K2.6能力和成本较平衡,多数支持结构化输出与工具调用真实中文质量、稳定 JSON、可用地域
高并发、成本敏感GPT-5.6 Luna、Claude Haiku 4.5、DeepSeek V4 Flash、Qwen3.7-Flash、GLM-4.7-FlashX单价低或吞吐高短上下文限制、复杂任务的失败率、缓存命中率
长文档或大仓库GPT-5.6 三档、Claude 5 的 Fable/Opus/Sonnet、Gemini、DeepSeek V4、Qwen3.7/3.8、GLM-5.2、Kimi K3约 1M 上下文长输入成本、定位细节的准确率、引用是否可追溯
多模态理解Gemini、Qwen3.7/3.8、Kimi K3/K2.6/K2.7 Code、GLM 视觉模型原生图像、视频、音频或 PDF 输入具体模型支持哪些模态,文件大小与媒体 token 计费
受控私有化DeepSeek V4 开放权重、明确开放的 Qwen 权重,或厂商私有实例方案可按数据边界和硬件规划许可证、显存、吞吐、量化损失、运维成本

为什么不再给“五星能力榜”

静态星级表会让读者误以为“综合五星”就能推导出自己的业务效果。实际结果会被提示词、数据质量、工具实现、语言、上下文组织、并发、温度与评测标准共同影响。更有用的做法是保留候选池,构建一套能重复执行的评测。

场景化选型

智能客服与结构化问答

这类任务更看重稳定格式、低延迟、拒答边界和单位成本,而不是极限推理。

  1. 用 DeepSeek V4 Flash、GPT-5.6 Luna、Qwen3.7-Flash 或 GLM-4.7-FlashX 建立低成本基线。
  2. 抽取失败、工具调用复杂或需要更好语言质量时,再与 GPT-5.6 Terra、Claude Sonnet 5、Qwen3.7-Plus 做 A/B 对照。
  3. 对每个模型强制校验 JSON Schema、敏感问题拒答、知识库无证据时的回答和 p95 延迟。

不要直接把旗舰模型放在所有客服流量前面。若 90% 的问题可由小档模型正确解决,路由只把难例升级,成本和延迟都会明显下降。

代码助手与编程 Agent

代码任务的验收必须落在仓库:能否定位文件、修改是否小而准确、能否通过编译/测试、工具调用失败时能否恢复。仅比较一次生成的代码片段没有价值。

任务难度首轮候选验证方式
补全、解释、小修复GPT-5.6 Terra/Luna、Claude Haiku 4.5、DeepSeek V4 Flash、Qwen3.7-Flash、Kimi K2.7 Code编译、单测、静态检查、diff 大小
多文件功能开发GPT-5.6 Terra、Claude Sonnet 5、DeepSeek V4 Pro、Qwen3.7-Plus、GLM-5.2、Kimi K3任务完成率、工具调用成功率、回归测试、人工评审
架构或高风险排障GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Pro、Qwen3.8-Max、GLM-5.2、Kimi K3方案正确性、变更风险、执行后测试和人工复核

模型支持工具不等于 Agent 已经可靠。Agent 框架仍需要超时、重试、幂等、权限隔离、命令白名单和人工接管机制。

内容创作与报告生成

中文品牌内容的质量不能只靠“中文模型更自然”这种经验判断。准备同一份写作 Brief,包括受众、禁用表达、事实资料、样稿和验收标准,让 Qwen、DeepSeek、GLM、Kimi 与国际模型生成多份盲测结果。把人工编辑时长、事实错误、风格一致性和采纳率记录下来,才有可复用的结论。

高价值报告应拆成“资料抽取 → 事实核对 → 结构规划 → 成文 → 引用检查”几个步骤。即使使用了推理模型,也不能把模型输出当成事实来源。

数据分析与报告自动化

模型可以帮助解释数据、生成 SQL 草案、整理异常和写报告,但不能替代数据校验。对于财务、风控、运营指标等任务:

  • 让数据库或代码计算数值,模型只解释已验证的结果。
  • 对 SQL 设置只读账号、表范围和行数上限;不要把生产写权限交给工具调用。
  • 将计算输入、模型版本、提示词、工具结果和最终输出一起记录,便于复盘。

复杂推理可从 GPT-5.6 Sol、Claude Opus 5、DeepSeek V4 Pro、Gemini 2.5 Pro、GLM-5.2、Kimi K3 中选样对测;成本敏感的初步分类、表格说明和摘要可先走小档模型。

RAG 知识库问答

RAG 的核心不是把文档塞满上下文,而是把可引用、最相关、未过期的证据送进模型。推荐按下面的顺序搭建:

  1. 解析资料,保留来源、版本、段落位置和权限标签。
  2. 检索并重排,限制进入上下文的片段数量和总 token。
  3. 在提示词中要求“仅依据给定证据回答”;无证据时明确拒答或转人工。
  4. 输出答案时携带来源标识,离线评估答案正确性、引用正确性和无证据拒答率。

大窗口模型对整本手册、长合同和跨文件比较有帮助,但它不会消除权限控制、文档新旧版本、引用归因和检索质量这些问题。普通问答先从 DeepSeek V4 Flash、GPT-5.6 Luna/Terra、Qwen3.7-Flash/Plus、GLM-4.7-FlashX 或 Kimi K2.6 测起;只有上下文组织已优化仍不够时,再评估 1M 档或强推理档。

多模态资料分析

如果输入包含图纸、截图、音频、视频、扫描 PDF,不要只问“模型是否多模态”,还要核对:支持的文件类型、单文件大小、视频时长、分辨率、是否原生理解音频、媒体 token 价格、能否引用帧或页码。

  • 需要 Google 搜索接地、URL 与长视频/音频能力时,优先测 Gemini。
  • 需要多模态 Agent、GUI 或视觉驱动代码任务时,测 Qwen3.7/3.8、Kimi K3/K2.7 Code、GLM 视觉型号。
  • 只需 OCR 或固定字段抽取时,专用 OCR/文档解析服务往往比用旗舰通用模型更稳定、更便宜。

数据不能出网或需要私有化

先确定数据分级、是否允许云端专有实例、日志保留期、密钥管理、审计和跨境要求,再选模型。模型参数量不是硬件规划的充分条件。实际部署至少要压测:目标上下文长度下的并发、首 token 延迟、生成吞吐、显存余量、故障恢复、量化精度和升级回滚。

可从三条路径选择:明确许可的开放权重自行部署、云厂商的专属/私有实例、或把敏感数据脱敏后使用公共 API。DeepSeek V4 和部分 Qwen 开源权重适合进入自建可行性评估;GLM 等平台提供私有实例方案。每一条都需要单独确认具体型号的许可与数据合同。

成本估算:按请求结构算,不按感觉算

基础公式

对于不含缓存和工具费用的文本请求:

单次成本 = 输入 token / 1,000,000 × 输入单价
+ 输出 token / 1,000,000 × 输出单价

日成本 = 单次成本 × 日请求数

若平台区分缓存命中、未命中输入、显式缓存创建、长上下文或思维链 token,应分别代入。使用联网搜索、文件搜索、代码执行、容器等代管工具时,再加上这些工具自己的计费。

一个可复算的示例

假设每天 10 万次请求,每次平均 500 输入 token + 200 输出 token,不考虑缓存和工具费:

模型每日输入 / 输出 token按当前标价估算的日成本说明
GPT-5.6 Luna50M / 20M$34$0.20 输入 + $1.20 输出 / M
DeepSeek V4 Flash50M / 20M$12.60$0.14 未命中输入 + $0.28 输出 / M
Qwen3.7-Flash50M / 20M$4.10此例单请求输入低于 32K,按最低阶梯;长请求更贵
Kimi K350M / 20M¥3,000¥20 未命中输入 + ¥100 输出 / M

这个例子只用于展示计算方法,不是采购报价。缓存命中率、输出长度、模型思考过程、长输入阶梯、汇率、批处理折扣和工具调用都会改变结果。真正选型时,先采集一周真实流量的 token 分布,再让候选模型重放。

预算有限时的模型路由

一套常见且可验证的路由方式如下:

请求进入
├─ 固定格式抽取、分类、短摘要 → 低成本模型
├─ 普通问答、RAG 回答、常规工具调用 → 平衡模型
├─ 长文档、复杂代码、多步推理 → 高能力模型
└─ 失败、低置信度、关键风险操作 → 高能力复核或人工处理

路由条件要来自可观测信号,例如文档长度、是否需要视觉输入、JSON 校验失败、检索证据不足、工具循环次数和业务风险等级。不要让模型自己随意宣称“我很难”,然后直接升级到昂贵模型。

把选型变成一次可重复的实验

1. 准备业务评测集

至少准备 30 到 100 条脱敏真实样本,并按任务类型标记:简单问答、边界问题、长文档、结构化输出、工具调用、多轮对话、异常输入和高风险请求。每条样本要有可验证的期望结果或人工评分规则。

2. 固定变量,只替换模型

同一轮对比中,保持系统提示、检索结果、工具定义、参数、最大输出和超时一致。否则测到的可能是提示词或框架差异,而不是模型差异。

from dataclasses import dataclass


@dataclass
class EvalResult:
model: str
passed: int
total: int
p95_latency_ms: int
input_tokens: int
output_tokens: int
estimated_cost: float


def evaluate(model: str, cases: list[dict]) -> EvalResult:
"""在这里固定 prompt、工具和超时,仅替换 model。"""
# 1. 调用模型并记录原始响应、token、耗时、工具轨迹
# 2. 用 JSON Schema、单测、引用校验或人工盲评判定结果
# 3. 汇总成功率、p95 延迟和实际成本
raise NotImplementedError


for candidate in ["low-cost", "balanced", "high-capability"]:
print(evaluate(candidate, cases=[]))

3. 不只看准确率

指标适用任务示例
任务成功率客服、RAG、Agent是否答对、是否完成流程
格式合规率抽取、接口编排JSON 是否通过 Schema 校验
引用正确率知识库、报告引用是否真的支持结论
工具调用成功率Agent参数是否正确、循环是否收敛
代码验证率编程助手编译、测试、静态检查是否通过
p50 / p95 延迟实时业务用户实际等待时间
单任务成本所有按量 API输入、输出、缓存和工具费之和
安全与越权率企业场景是否泄漏提示词、越过数据权限或执行危险操作

4. 上线时保留回滚能力

  • 模型 ID、推理档位、温度、最大输出、系统提示与工具版本都进入配置和日志。
  • 对会变化的别名设置升级评测门槛;能锁定快照的场景优先锁定。
  • 为每个关键路由配置至少一个替代模型,并验证其输出格式、限流、地域和数据要求。
  • 观察 token、缓存命中、错误码、超时、工具失败率和业务通过率;HTTP 200 不代表业务成功。

最终决策清单

在确定模型前,逐项确认:

  • 目标模型 ID、API 版本、上下文、最大输出已从官方页核对。
  • 使用了脱敏真实业务集,而不是只做自由聊天。
  • 记录了成功率、p95 延迟、输入输出 token、缓存和工具费用。
  • 长文档场景验证了证据定位与引用,未把 1M 窗口当成准确率保证。
  • 数据地域、日志保留、权限、合同和部署方式满足要求。
  • 已验证限流、超时、失败回退和模型升级后的回归结果。
  • 高风险输出仍有业务规则、人工审核或可逆操作保护。

小结

当前的主线型号已经明显变化:OpenAI 应关注 GPT-5.6 的 Sol、Terra、Luna;Claude 应以 Fable 5、Opus 5、Sonnet 5、Haiku 4.5 分档;DeepSeek 已进入 V4 Flash/Pro;Qwen、GLM、Kimi 也都提供了 1M 档与更低成本档位。

这些产品并没有让选型变成“全都选 1M 上下文”。上下文只是约束之一。把候选模型放进同一套真实业务评测,按质量、延迟、成本、数据边界和可维护性做决定,才是能长期使用的选型方法。

🎁优惠