Claude API 定价解析:token 费率、缓存写入与真实成本模型
如果你正在比较 Claude API 定价,时间是 2026 年 7 月 20 日星期一,最重要的一点是:Claude 并没有单一价格。Anthropic 的官方定价取决于模型层级、token 是输入还是输出、是否启用提示缓存、工作负载是否可以使用 Batch API,以及你是否添加了区域路由或数据驻留控制。
这正是大多数定价汇总文章的薄弱之处。它们复制了表格,却没有解释到底是什么在推动账单变化。本指南先从 Anthropic 的官方费率卡开始,再将其转化为产品团队可操作的成本计算。它还会覆盖这样一个节点:Claude API 定价 不再只是 Anthropic 的问题,而是一个关于跨多个模型家族进行共享计费、路由和访问的运营模型问题。
Claude API 定价一览
Anthropic 的官方 定价页面 按每百万 token 对 Claude API 用量定价。在 2026 年 7 月 20 日,对于大多数评估生产流量的团队来说,以下是最有用的当前条目:
| 模型 | 基础输入 | 5 分钟缓存写入 | 1 小时缓存写入 | 缓存命中 | 输出 |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | $1 / MTok | $1.25 / MTok | $2 / MTok | $0.10 / MTok | $5 / MTok |
| Claude Sonnet 4.6 | $3 / MTok | $3.75 / MTok | $6 / MTok | $0.30 / MTok | $15 / MTok |
| Claude Sonnet 5 | $2 / MTok,适用于 2026 年 8 月 31 日之前;自 2026 年 9 月 1 日起为 $3 / MTok | $2.50 / MTok 介绍期;$3.75 / MTok 标准 | $4 / MTok 介绍期;$6 / MTok 标准 | $0.20 / MTok 介绍期;$0.30 / MTok 标准 | $10 / MTok 介绍期;$15 / MTok 标准 |
| Claude Opus 4.8 | $5 / MTok | $6.25 / MTok | $10 / MTok | $0.50 / MTok | $25 / MTok |
上面的表格是当前 Claude API 定价 讨论的核心,但它仍然只是起点。
大多数团队对 Claude API 定价忽略了什么
有三个细节比另一个泛泛的模型层级摘要更重要。
1. 提示缓存会很快改变真实账单
Anthropic 表示,提示缓存相对于基础输入价格使用以下倍率:
| 缓存操作 | 倍率 | 含义 |
|---|---|---|
| 5 分钟缓存写入 | 1.25x | 你支付少量溢价来存储提示以便复用 |
| 1 小时缓存写入 | 2x | 你会为更长的缓存持续时间预先支付更多费用 |
| 缓存读取 | 0.1x | 一次缓存命中的成本是正常输入价格的 10% |
这就是为什么重复的系统提示、可重复使用的长指令、稳定的知识包以及文档审核上下文,实际成本可能远低于原始表格所显示的水平。Anthropic 明确指出,5 分钟缓存写入在一次缓存读取后即可回本,而 1 小时缓存写入则在两次读取后回本。
2. Batch API 定价将异步工作负载成本减半
Anthropic 的文档说明,Batch API 可为 输入和输出 token 都提供 50% 折扣。这对回填、离线分析、夜间评估任务,或不需要即时响应的大型文档审核队列尤其重要。
对许多团队来说,最快的降本方式并不是放弃 Claude,而是把合适的 Claude 工作负载迁移到批处理模式。
3. 分词器变化会扭曲天真的价格对比
Anthropic 还指出,Claude Opus 4.7 及之后的 Opus 模型,以及 Claude Sonnet 5 和更新的相关系列,使用了更新的分词器;对于相同文本,它们可能生成大约 多 30% 的 token。这并不意味着这些模型定价过高,而是说明你的真实 Claude API 定价 取决于你自己的提示词形态和输出风格,而不仅仅是标价。
按工作负载划分的 Claude API 定价
选择合适层级的最简单方法,是先从工作负载形态出发,而不是从品牌熟悉度出发。
| 工作负载 | 最佳默认层级 | 原因 | 主要注意事项 |
|---|---|---|---|
| 分类、抽取、短路由任务 | Claude Haiku 4.5 | 高吞吐工作中当前最低的入门价格 | 输出偏重的提示词仍可能抵消表面上的节省 |
| 通用产品聊天、摘要、助手流程 | Claude Sonnet 4.6 或 Sonnet 5 | 对大多数生产团队而言,在成本和质量之间达到最佳平衡 | Sonnet 5 的上市引导价格将于 2026 年 9 月 1 日结束 |
| 更难的编码、深度推理、复杂多步骤代理 | Claude Opus 4.8 | 具备最高能力上限的高端推理层级 | 输出 token 很贵,因此提示词纪律非常重要 |
| 回填、大批量分析、夜间处理 | 同一模型,但通过 Batch API | 同等模型质量,单位成本更低 | 不适合面向用户的交互式流程 |
这正是大多数搜索结果会跳过的部分。团队购买的不是某个模型名称,而是一种工作负载画像。
三个快速成本示例
这些示例使用 Anthropic 在 2026 年 7 月 20 日 的官方标价。
基于 Haiku 4.5 的轻量级支持分类器
假设一个月内有 20M 输入 token 和 4M 输出 token。
| 项目 | 成本计算 | 合计 |
|---|---|---|
| 输入 | 20 x $1 |
$20 |
| 输出 | 4 x $5 |
$20 |
| 总计 | $40 |
对于狭窄任务,Claude API 定价主要是一个输入量问题。
在 Sonnet 4.6 上带缓存命中的产品副驾
假设有 30M 个未缓存输入 token、50M 个缓存命中 token,以及 8M 个输出 token。
| 项目 | 成本计算 | 合计 |
|---|---|---|
| 未缓存输入 | 30 x $3 |
$90 |
| 缓存命中 | 50 x $0.30 |
$15 |
| 输出 | 8 x $15 |
$120 |
| 合计 | $225 |
这就是 Claude API 定价开始不再像一张简单费率表的地方。复用上下文会显著改变 Sonnet 的经济性。
通过 Batch API 在 Opus 4.8 上进行异步文档审查
假设有 12M 个输入 token 和 3M 个输出 token。
| 项目 | 标准 | Batch |
|---|---|---|
| 输入 | 12 x $5 = $60 |
12 x $2.50 = $30 |
| 输出 | 3 x $25 = $75 |
3 x $12.50 = $37.50 |
| 合计 | $135 | $67.50 |
对于离线工作,最有用的 Claude API 定价洞察往往不是“Opus 很贵”,而是“如果任务可以异步运行,高质量模型仍可能很经济”。
长上下文和区域定价说明
Anthropic 目前的定价文档还明确了两点:
- Claude Opus 4.6、Claude Opus 4.7、Claude Opus 4.8、Claude Sonnet 4.6,以及后续列出的当前系列,在标准定价下都包含完整的 100 万 token 上下文窗口。
- 对于 Claude 4.5 时代及之后的模型,区域或多区域端点选项可能会在全局路由基础上增加 10% 的溢价,而仅限美国的推理设置在支持的定价类别上可能适用 1.1x 的乘数。
这意味着隐藏成本驱动因素通常不是某种特殊的长上下文附加费,而是过大的提示词、未充分使用的缓存,或者改变乘数的驻留要求。
何时直接使用 Anthropic 访问就足够
当以下所有条件都成立时,直接使用 Anthropic 访问仍然是一个清晰的选择:
- Claude 是你在生产中唯一需要的模型家族。
- 计费可以保留在单一供应商关系内。
- 工程团队可以接受在一个系统中直接管理模型访问和支出。
- 财务和运维不需要在多个供应商之间共享一个统一的路由和发票界面。
如果这就是你的环境,那么网关可能为时过早。
当 Claude API 定价变成运营模式问题时
一旦团队不再只使用 Claude,购买决策就会改变。
这通常发生在:
- 你需要在一个集成层下同时接入 Claude 以及 GPT、Gemini、DeepSeek 或其他模型家族
- 财务希望使用一个余额或一张发票,而不是分散的各家供应商计费
- 工程希望在不同供应商之间使用同一个 base URL 和同一套密钥管理模式
- 运维希望获得模型级请求日志、共享配额,或者更清晰的支出审核路径
这正是大多数Claude API 定价相关文章没有覆盖到的空白。一旦团队进入多模型阶段,真正的问题就不只是 token 成本,而是协同成本。
Flatkey 的适用场景
Flatkey 的公开页面在 2026 年 7 月 20 日星期一审阅,支持一种明确且谨慎的价值主张:
- 首页将 Flatkey 定位为所有官方模型,一个 key,包括官方 GPT、Claude、Gemini、DeepSeek、Qwen、GLM 和 Seedance 的访问。
- 同一页面说明 Flatkey 会将请求路由到官方端点,支持一个 key 后面接入 160+ 前沿模型,并且每小时验证这些路由。
- 定价页面说明,一个余额可以通过一个 OpenAI 兼容网关跨越路由到GPT、Claude、Gemini、DeepSeek、图像、音频和视频。
- 该定价页面还说明,计量维度包括模型、token 类型和请求日志,并且企业版适合更大的月度用量、开票、采购、自定义路由折扣或团队级控制。
安全的结论不是 Flatkey 在每种情况下都能保证某个公开的 Claude 条目以固定比例低于 Anthropic 标价。更稳妥的结论是:当 Claude 只是技术栈的一部分时,评估Claude API 定价的团队,或许也会需要一个更简单的控制平面。
如果这正是你的情况,请先查看当前的 Flatkey 定价页面,然后结合你更广泛的模型路由工作流,再对照 AI API Gateway Architecture: One Key, Model Routing, and the End of Provider Account Sprawl 以及 OpenRouter alternative for Claude API access: Flatkey vs OpenRouter for teams。
FAQ
Claude API 目前的定价是多少?
截至 2026 年 7 月 20 日,Anthropic 的官方定价页面列出了当前 Claude 家族按每百万 token 计价的价格,并提供单独的 prompt 缓存列、批处理价格以及地区定价说明。对许多团队来说,最相关的条目是 Haiku 4.5、Sonnet 4.6、Sonnet 5 的入门定价以及 Opus 4.8。
Claude API 定价只和输入与输出 token 有关吗?
不是。真实的Claude API 定价还取决于 prompt 缓存、批处理、tokenization 行为、长提示词的形态,以及所选部署路径适用的任何驻留或地区定价调整。
prompt 缓存真的会降低 Claude API 成本吗?
是的。Anthropic 的定价文档说明,缓存读取的费用为正常输入价格的 10%。对于重复的提示上下文,这在初次缓存写入之后,能够显著降低该工作负载的有效成本。
Batch API 什么时候重要?
只要 Claude 工作负载是异步的,它就很重要。Anthropic 表示,Batch API 的定价在输入和输出 token 上都提供 50% 的折扣,这会改变大规模离线任务的经济性。
团队什么时候应该超越 Anthropic 的直接费率卡来考虑?
当 Claude 不再是唯一在用的提供商时,团队就应该超越直接费率卡来考虑。到那时,碎片化计费、路由和访问带来的运营成本,几乎可能与原始 token 支出同样重要。
结论
评估 Claude API 定价 的最佳方式,是不要只问一个数字,而是开始问四个问题:
- 哪一档 Claude 套餐最适合该工作负载?
- 该工作负载能否受益于提示缓存?
- 是否有任何部分可以转向 Batch API 定价?
- Claude 仍然是团队唯一需要运营的模型家族吗?
Anthropic 目前的文档回答了前面三个问题。如果第四个问题开始变得重要,那么下一步就不只是比较价格,而是比较控制平面。
请先查看当前的 Anthropic 定价文档,然后在 Flatkey pricing 上比较你更广泛的模型访问和计费需求。



