AI API 定价之所以难以比较,是因为最便宜的输入 token 费率很少会带来最便宜的生产工作流。输出 token 的价格可能是输入 token 的数倍,缓存提示词会改变账单,可能还会适用上下文长度分档,而更低价的模型可能需要更多重试或人工纠正。
本指南对 OpenAI、Anthropic Claude、Google Gemini 和阿里巴巴 Qwen 的代表性文本模型当前公开标价进行对比。它还会把这些费率换算到一个标准化工作负载中,这样你就能估算真实预算,而不只是依据每百万 token 的价格表来做选择。
价格核查: 费率已根据官方提供商页面在 2026 年 7 月 29 日进行核查。除非另有说明,价格均为每 100 万 token 的美元价格。提供商可能会更改模型名称、预览状态、区域可用性、上下文阈值、折扣和价格。在做出生产采购决策之前,请先确认链接中的官方页面。
快速答案:哪个 AI API 最便宜?
就原始 token 成本而言,Qwen 的低价模型是本次对比中最便宜的选项。Gemini 也非常有价格竞争力,尤其是在其 Flash 和 Flash-Lite 系列中。OpenAI 和 Claude 的标价通常更高,但当它们能为某个特定工作负载减少重试、工具错误、审查时间或回退流量时,其模型仍可能拥有最低的每次成功任务成本。
没有绝对的通用赢家:
- 先按任务质量选择: 用你自己的提示词、工具、Schema、语言和边缘情况进行测试。
- 分别看输入和输出: 以输出为主的生成任务,排名可能与分类或抽取截然不同。
- 计入失败成本: 重试、回退调用、人工审查以及客户可见错误都会影响有效价格。
- 重新核查折扣和阈值: 缓存、批处理、上下文长度、区域端点和首发定价都可能显著改变总成本。
AI API 定价对比表
下表将代表性模型分为旗舰、均衡和预算三个档位。这些是购买档位,并不表示质量或能力完全等同。
| 提供商 | 模型 | 对比档位 | 输入 / 100万 tokens | 输出 / 100万 tokens | 重要定价说明 |
|---|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | 旗舰级 | $5.00 | $30.00 | 标准文本 token 列表价格 |
| Anthropic | Claude Opus 5 | 旗舰级 | $5.00 | $25.00 | 标准提示和补全价格 |
| Gemini 3.1 Pro Preview | 旗舰级 | $2.00 | $12.00 | 所示费率适用于最高 200K tokens 的提示;超过该阈值将适用更高的长上下文档位 | |
| Alibaba Cloud | Qwen3.7-Max | 旗舰级 | $2.50 | $7.50 | 全球部署,最高 256K-token 上下文档位 |
| OpenAI | GPT-5.6 Terra | 均衡 | $2.50 | $15.00 | 标准文本 token 列表价格 |
| Anthropic | Claude Sonnet 5 | 均衡 | $2.00 | $10.00 | 截至 2026 年 8 月 31 日的优惠价格;自 2026 年 9 月 1 日起,输入 $3.00、输出 $15.00 |
| Gemini 3.6 Flash | 均衡 | $1.50 | $7.50 | 标准付费档位;Batch 单独列出 | |
| Alibaba Cloud | Qwen3.7-Plus | 均衡 | $0.40 | $1.60 | 全球部署,最高 256K-token 上下文档位 |
| OpenAI | GPT-5.6 Luna | 经济 | $1.00 | $6.00 | 标准文本 token 列表价格 |
| Anthropic | Claude Haiku 4.5 | 经济 | $1.00 | $5.00 | 标准提示和补全价格 |
| Gemini 3.5 Flash-Lite | 经济 | $0.30 | $2.50 | 标准付费档位;更低的 Batch 定价单独列出 | |
| Alibaba Cloud | Qwen3.7-Flash | 经济 | $0.03 | $0.13 | 所示全球部署费率适用于最高 32K tokens 的请求;更高上下文档位价格更高 |
官方来源:OpenAI API 定价,Anthropic Claude 定价,Gemini API 定价,以及 Alibaba Cloud Model Studio 定价。
归一化工作负载成本:1,000 个生产任务
在把相同的请求形态应用到每个候选模型之后,静态 token 费率会更有参考价值。假设某个工作负载处理:
- 1,000 个完成的任务
- 每个任务 20,000 个输入 tokens
- 每个任务 2,000 个输出 tokens
- 无缓存输入或批处理折扣
- 无重试或回退调用
这相当于2,000 万输入 tokens 和 200 万输出 tokens。
公式为:
workload cost = (input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
旗舰档位估算
| 模型 | 输入成本 | 输出成本 | 1,000 个任务总计 |
|---|---|---|---|
| GPT-5.6 Sol | $100.00 | $60.00 | $160.00 |
| Claude Opus 5 | $100.00 | $50.00 | $150.00 |
| Gemini 3.1 Pro Preview | $40.00 | $24.00 | $64.00 |
| Qwen3.7-Max | $50.00 | $15.00 | $65.00 |
平衡档估算
| 模型 | 输入成本 | 输出成本 | 1,000 个任务总计 |
|---|---|---|---|
| GPT-5.6 Terra | $50.00 | $30.00 | $80.00 |
| Claude Sonnet 5,入门价格 | $40.00 | $20.00 | $60.00 |
| Gemini 3.6 Flash | $30.00 | $15.00 | $45.00 |
| Qwen3.7-Plus | $8.00 | $3.20 | $11.20 |
按照 2026 年 9 月 1 日公布的费率,Claude Sonnet 5 的同样工作负载将变为 $90.00:输入 $60.00 加输出 $30.00。
预算档估算
| 模型 | 输入成本 | 输出成本 | 1,000 个任务总计 |
|---|---|---|---|
| GPT-5.6 Luna | $20.00 | $12.00 | $32.00 |
| Claude Haiku 4.5 | $20.00 | $10.00 | $30.00 |
| Gemini 3.5 Flash-Lite | $6.00 | $5.00 | $11.00 |
| Qwen3.7-Flash | $0.60 | $0.26 | $0.86 |
这些总额是算术比较,不是性能排名。一个每千个任务成本为 $11 的模型,如果只有 70% 的结果被接受,而一个 $30 的模型能达到 98% 的接受率,那么在实际中它并不更便宜。
比较每个成功任务的成本,而不是只看 token 成本
更适合生产环境的指标是 每个被接受结果的成本:
cost per accepted result = total model spend / accepted results
假设两个候选模型各自处理 1,000 个任务:
| 候选项 | 模型支出 | 被接受结果 | 每个被接受结果的成本 |
|---|---|---|---|
| 较低标价模型 | $20 | 700 | $0.0286 |
| 较高标价模型 | $30 | 980 | $0.0306 |
在这个例子中,较低价格的模型仍然略胜一筹,但差距远比标价差异看起来更小。把工程时间、客户升级处理,或对那 300 个被拒绝结果使用付费兜底方案算进去,排名可能会反转。
对于每个模型,至少记录:
- 接受率:通过自动和人工质量门槛的输出百分比。
- 重试率:需要再次调用同一模型的频率。
- 回退率:流量转移到更昂贵模型的频率。
- 平均输出长度:即使输入费率较低,冗长模型也可能产生更高的账单。
- 目标百分位延迟:未达到产品 SLA 的廉价模型可能无法使用。
- 工具和 schema 可靠性:无效的结构化输出或失败的工具调用会带来隐性成本。
- 人工审核分钟数:在业务工作流中,人工修正可能比 token 支出更占主导。
OpenAI API 定价如何运作
OpenAI 将未缓存输入、缓存输入和输出定价分开计算,并为受支持的模型列出 Batch 和 Flex 等额外处理选项。在上面的模型中,输出费率远高于输入费率,因此响应长度控制很重要。
如果你的应用已经围绕其 API 构建,并且所选模型在你的评估集上表现稳定,OpenAI 可能是一个很合适的选择。对于以 OpenAI 为先的团队,直接集成在运营上可能很简单。对于持续测试其他提供商的团队来说,维护独立的客户端、凭据、限制和报表的成本也会成为比较的一部分。
Claude API 定价如何运作
Anthropic 按输入和输出 token 对标准 Claude 请求定价,并为提示缓存、长上下文请求和批处理公布单独规则。Claude Sonnet 5 的导入期对预算尤其重要:在 2026 年 8 月启动的试点项目,不应在不调整的情况下将导入价延续到 9 月。
评估 Claude 定价时,应将长上下文行为、工具使用、代码质量以及工作流所需的审核量一并考虑。对于编程代理和复杂业务任务,如果模型无需人工干预就能完成更多任务,那么更高的 token 费率也可能是经济的。
Gemini API 定价如何运作
Google 列出了免费和付费的 Gemini API 层级、按模型区分的输入和输出费率,以及受支持模型的单独 Batch 费率。某些 Gemini 模型在上下文超过阈值时也会对提示进行不同定价,因此平均提示大小还不够——你需要请求大小的分布情况。
Gemini 的 Flash 和 Flash-Lite 系列对高吞吐工作负载很有吸引力,而 Pro 模型则面向更难的任务。Preview 标签也很重要:生产团队除了价格之外,还应验证生命周期状态、限制和迁移计划。
Qwen API 定价如何运作
阿里云 Model Studio 列出了全球部署的 Qwen 价格,并为若干模型提供了上下文长度分层。Qwen3.7-Flash 在公开表中对短请求极其便宜,但在更大的上下文窗口下费率会升高。因此,基准测试中应始终记录区域、部署模式以及准确的模型 ID。
Qwen 对于成本敏感路由、多语言应用,以及希望增加一个额外供应商候选项的团队来说很有吸引力。与所有模型家族一样,在将生产流量路由过去之前,请先测试质量、安全性、延迟、工具行为和区域可用性。
缓存输入、Batch 和上下文层级可能会改变赢家
标题式对比特意使用标准的未缓存同步费率。实际工作负载可能会更低——或偶尔更高——因为以下变量:
缓存输入
大量重复的系统提示、工具定义、策略和文档前缀可能符合缓存输入定价条件。请测量实际的缓存命中率,而不是假设每个重复 token 都能享受折扣。
批处理
OpenAI、Anthropic 和 Google 为支持的用例公布了折扣的异步或批处理选项。Batch 对评估、补充信息、离线分类和夜间文档处理很有价值,但它不能替代低延迟的交互式端点。
长上下文阈值
Gemini 和 Qwen 为部分模型公布了与上下文相关的层级,而 Anthropic 记录了长上下文定价条件。少数超大请求即使中位请求较小,也可能提高综合费率。
不同的分词器
来自某个供应商的一百万 token,并不一定等同于在另一个供应商的分词器下相同数量的源文本或代码。请使用实际调用中供应商返回的用量,而不是基于一个分词器去估算每个模型。
区域和平台差异
云市场、区域、数据驻留或托管平台的价格可能与供应商直接提供的全球 API 不同。请在评估表中将端点和计费实体与每个价格并列记录。
实用的 AI API 定价评估工作流
在选择默认模型之前,请使用以下七步流程:
- 冻结一个具有代表性的测试集。 包括常规提示、困难提示、长上下文、工具调用、结构化输出、多语言场景和已知失败模式。
- 固定精确的模型 ID。 不要对一个可能悄然迁移到更新模型的别名进行基准测试。
- 使用相同的验收标准运行每个候选项。 为任务准确性、格式有效性、安全性、延迟和审阅工作量打分。
- 记录供应商报告的用量。 为每次调用存储输入、缓存输入、输出、重试和错误。
- 应用正确的价格层级。 包括上下文阈值、缓存命中、批处理、促销期和区域费率。
- 计算每个已接受结果的成本。 包括回退和重试支出,而不仅仅是首次调用支出。
- 在生产环境中对胜出者进行金丝雀发布。 在扩大流量之前监控质量和成本漂移。
当供应商更改定价、发布新模型、退役预览版或修改别名时,多模型产品都应重复这个流程。
统一的 AI API 网关何时有帮助
当某一家供应商已经成为明确标准时,直接使用提供方账号是合理的。当一个产品需要在一个工作流中使用 OpenAI、在另一个工作流中使用 Claude、在高吞吐路径中使用 Gemini,以及在成本敏感或区域化路由中使用 Qwen 时,运营负担就会增加。
统一访问层可以通过提供一个凭证、一个 OpenAI 兼容端点,以及一个覆盖受支持模型的统一用量视图来减少集成开销。它并不会消除针对供应商特定能力进行测试或阅读当前定价规则的必要性。
Flatkey 专为这种多模型工作流而设计。你可以查看当前模型定价目录,比较候选项,并使用 OpenAI 兼容集成来更改模型 ID,而无需为每个提供商维护单独的客户端模式。实施细节可参见多模型提示测试工作流和AI API 成本跟踪指南。
AI API 定价对比清单
在批准某个提供商或模型之前,请确认:
- [ ] 已记录官方价格页面和核对日期。
- [ ] 已明确具体模型 ID、区域、端点和生命周期状态。
- [ ] 输入、缓存输入和输出费率是分开的。
- [ ] 已包含上下文长度阈值。
- [ ] 预测中包含了入门定价的到期日期。
- [ ] 批处理假设与产品的延迟需求一致。
- [ ] 实际分词器使用情况来自测试调用。
- [ ] 已包含重试、回退和人工复核成本。
- [ ] 已计算每个被接受结果的成本。
- [ ] 生产环境金丝雀验证了基准结果。
常见问题
Gemini API 比 OpenAI API 更便宜吗?
就这份 2026 年 7 月 29 日对比中的代表性模型和标准费率而言,Gemini 的原始 token 价格低于相应的 OpenAI 购买区间。不过,更好的生产价值仍取决于任务质量、输出长度、重试、延迟以及被接受结果率。
Claude API 比 OpenAI API 更贵吗?
这取决于所选模型。在这一快照中,Claude Opus 5 和 GPT-5.6 Sol 的输入费率都是 5 美元,而 Claude Opus 5 的输出费率更低。Claude Sonnet 5 的入门费率低于 GPT-5.6 Terra,但 Anthropic 公布的 Sonnet 5 较高费率将于 2026 年 9 月 1 日开始生效。
为什么 Qwen API 定价这么低?
阿里云针对不同工作负载定位了不同的 Qwen 模型和上下文层级。最低的 Qwen3.7-Flash 费率适用于较短上下文,而更高层级的成本更高。低标价仍应结合质量、延迟、可用性和运营要求进行验证。
哪家提供商为编码代理提供最便宜的 API?
仅凭 token 费率无法得出可靠答案。编码代理会生成冗长对话、重复工具 schema、产生大量输出,并可能带来昂贵的重试成本。应基准测试仓库导航、补丁质量、测试成功率、工具调用有效性以及人工介入情况,然后计算每个被接受的编码任务的成本。
应多久审查一次 AI API 定价?
至少每月审查一次官方价格,并且在提供商发布新模型、变更预览版、宣布引导期,或更新上下文与缓存规则时也要及时审查。高调用量团队应自动化价格版本检查,并在发生重大变更时发出提醒。
最终建议
使用定价表来创建候选名单,而不是做最终路由决策。在这个时间点的快照中,Qwen 和 Gemini 在许多区间的原始成本领先,而在那些质量和可靠性能够减少重试或审核的工作流中,OpenAI 和 Claude 可能足以证明更高费率的合理性。
更稳妥的方法很简单:基准测试准确的模型 ID,使用提供商报告的 token 用量,应用每一条定价规则,并以每个被接受任务的成本为优化目标。然后至少保留一个经过验证的备选方案,因为定价和模型性能的变化速度通常快于大多数生产路线图。



