登录联系我们免费开始
Cost, Billing, and Ops2026年7月27日Flatkey Team

DeepSeek API 定价(2026):对比 OpenAI、Claude、Gemini 和 Qwen

通过最新代币费率、可复现的工作负载计算、缓存注意事项和定时刷新流程,对比 DeepSeek API 定价与 OpenAI、Claude、Gemini 和 Qwen。

DeepSeek API 定价(2026):对比 OpenAI、Claude、Gemini 和 Qwen

DeepSeek API 定价低到足以引人关注,但原始 token 费率只是生产预算中的第一项。缓存行为、输出长度、thinking tokens、批处理资格、上下文层级、重试以及模型生命周期变化,都会影响实际成本。

本指南使用截至 2026 年 7 月 27 日核实的官方公开定价,对 DeepSeek 与具有代表性的 OpenAI、Anthropic Claude、Google Gemini 和阿里巴巴 Qwen 模型进行比较。它还展示了一个可复现的单次请求成本示例,以及一个可供你的团队在提供商费率变化时复用的刷新工作流。

定价快照:提供商定价会频繁变化。请将下面的每个数字都视为带日期的对比结果,并在购买积分或设置生产路由策略之前,先核实所链接的第一方定价页面。

DeepSeek API 定价概览

DeepSeek 的官方 API 表目前以两个 V4 模型 ID 为中心。两者都支持非思考和思考模式,并且自动上下文缓存可以显著降低重复输入的价格。

DeepSeek 模型 缓存命中输入 / 100 万 tokens 缓存未命中输入 / 100 万 tokens 输出 / 100 万 tokens 公布的并发上限
deepseek-v4-flash $0.0028 $0.14 $0.28 2,500
deepseek-v4-pro $0.003625 $0.435 $0.87 500

来源:DeepSeek 模型与定价

缓存命中输入与缓存未命中输入之间的差距异常大。这使得提示词结构和重复上下文在经济上变得非常重要。对于一个反复发送相同策略、模式、文档前缀或长系统提示词的工作负载,即使总 token 数看起来相似,其行为也可能与临时聊天工作负载截然不同。

并发性也属于定价讨论的一部分。如果应用需要额外的队列、回退或重试才能达到流量目标,那么更低的 token 费率并不一定会带来更低的成功请求成本。

DeepSeek 与 OpenAI、Claude、Gemini 和 Qwen 的定价对比

没有任何一种跨提供商的模型能做到完全一一对应。下表使用当前具有代表性的文本模型来统一输入和输出计费机制——并不是要宣称质量、延迟、上下文行为或工具性能相同。

提供商和模型 标准输入 / 1M 缓存输入 / 1M 输出 / 1M 重要定价条件
DeepSeek V4 Flash $0.14 $0.0028 $0.28 自动上下文缓存;思考和非思考模式
DeepSeek V4 Pro $0.435 $0.003625 $0.87 公开并发上限低于 Flash
OpenAI GPT-5.4 $2.50 $0.25 $15.00 批处理和低优先级处理可能改变实际成本
Anthropic Claude Sonnet 5 $2.00 $0.20 $10.00 截至 2026 年 8 月 31 日的介绍性定价;标准定价从 9 月 1 日开始
Google Gemini 3.6 Flash $1.50 $0.15 plus storage $7.50 标准付费层;Batch 和 Flex 列出更低费率
Alibaba Qwen3.7-Max $1.65 可用上下文缓存折扣 $4.951 标价;地区、上下文层级和临时促销可能会改变计费

官方参考:OpenAI API pricingAnthropic Claude pricingGemini API pricing,以及 Alibaba Cloud Model Studio pricing

最显而易见的结论是:在这份快照中,DeepSeek 公开的文本 token 费率明显更低。但运营层面的结论并不那么简单。不同提供商的模型在能力、输出行为、包含的推理 token、服务层级、区域可用性、缓存实现和生命周期稳定性方面各不相同。生产环境中的对比需要同时看价格和工作负载证据。

可复现的单次请求成本对比

假设一次成功请求使用:

  • 2,000 个未缓存输入 token
  • 500 个输出 token
  • 标准同步处理
  • 不包含工具、grounding、图像、音频或存储费用
  • 没有重试或失败请求
  • 没有量级承诺或临时折扣

公式为:

request cost = (input tokens / 1,000,000 × input rate) + (output tokens / 1,000,000 × output rate)

模型 每次请求成本 10,000 次请求成本
DeepSeek V4 Flash $0.000420 $4.20
DeepSeek V4 Pro $0.001305 $13.05
Qwen3.7-Max $0.005776 $57.76
Gemini 3.6 Flash $0.006750 $67.50
Claude Sonnet 5,入门费率 $0.009000 $90.00
GPT-5.4 $0.012500 $125.00

这些数字只是算术结果,并不是经过质量调整后的排名。如果某个模型生成的回答更长、需要更多重试、需要额外的工具调用,或者在目标任务上的失败率更高,那么表面上的 token 价格优势就可能缩小,甚至反转。

如需更深入的预算方法,请使用一个按 AI API 请求计费的成本框架,将重试和成功结果纳入计算,而不仅仅是 token。

为什么缓存经济性可能主导 DeepSeek 成本

如果每次请求都使用标准输入费率,而重复上下文持续命中缓存,那么就会高估 DeepSeek 的支出。反过来,如果提示词变化过大而无法受益,则也可能低估支出。

请分别跟踪以下字段:

  1. 可缓存输入 token: 稳定前缀、共享指令、重复文档或 schema。
  2. 缓存命中输入 token: 实际按提供商缓存命中费率计费的部分。
  3. 缓存未命中输入 token: 按全额费率计费的新输入或已修改输入。
  4. 输出 token: 包括提供商将其计为输出的推理或思考 token。
  5. 缓存存储和写入费用: 适用于按存储时长或缓存创建单独计费的提供商。

不要在未经测量的情况下,把某一家提供商假设的缓存命中率直接套用到另一家提供商的预测中。DeepSeek 自动缓存、OpenAI cached input、Anthropic prompt caching、Gemini context caching 和 Qwen context caching 的规则和收费结构并不相同。

批量折扣很有用——但不可互换

OpenAI 宣布了 50% 的 Batch API 折扣。Anthropic 的 Batch API 也对输入和输出 token 提供 50% 折扣。Gemini 3.6 Flash 列出的 Batch 输入价格为每百万 token $0.75,输出价格为 $3.75,是其标准付费层费率的一半。Qwen 的定价文档区分了标价、批量折扣、上下文层级和临时区域促销。

只有当工作负载可以接受异步完成窗口,并且所选模型或端点符合资格时,批量定价才有帮助。不要用批量费率去预测交互式聊天、代理循环或对延迟敏感的生产请求。

在选择最便宜的 API 之前,需要先规范化的五个因素

1. 比较每个成功任务的成本

将同一组具有代表性的评估集通过每个候选模型运行。记录 token、重试、工具调用、延迟和任务成功情况。用总支出除以成功结果数。

2. 区分思考型和非思考型工作负载

DeepSeek V4 支持两种模式。Qwen3.7-Max 也支持思考和非思考模式,而 Gemini 在所对比模型的输出定价中包含思考 token。面向短答案支持流程的模型与面向重推理的 agent 不应共用一个混合估算值。

3. 保持上下文分层可见

一些提供商会对更大的提示词提高费率,或按输入长度公布分层价格。如果生产提示词可能跨越某个层级边界,就应显式建模该边界,而不是对每个请求都使用最便宜的那一行。

4. 衡量重试和回退开销

有用的分子是所有提供商支出,包括失败尝试。有用的分母是已完成的业务任务。这正是可观测性和集中式请求日志开始成为定价分析一部分的地方。

5. 跟踪模型别名和退役日期

别名可能会切换到新的快照,而模型也可能被退役或重新定价。在稳定性很重要的地方固定版本,记录回退行为,并指定负责人审查提供商生命周期通知。

直接使用 DeepSeek 还是统一 API 网关

当一个团队使用一个模型家族、一个计费账户和一个区域时,直接使用提供商访问就可能足够。随着团队增加提供商特定的密钥、发票格式、速率限制、回退路径和使用控制,运营负担会随之增长。

统一访问层可以通过集中请求日志、支出可见性、配额和路由策略来简化比较。它不会让不同模型变得相同,团队仍应验证模型特定行为和端点支持。

Flatkey 为多个模型家族提供一个兼容 OpenAI 的网关,并带有集中式使用跟踪。先查看当前模型定价和可用路由,再根据你的工作负载和区域将它们与直接提供商定价进行比较。

在制定候选清单时,你还可以使用更广泛的AI 模型定价对比以及更聚焦的DeepSeek vs Qwen 成本指南

DeepSeek 定价的定期刷新工作流

大家对 DeepSeek 定价的关注度很高,而且费率表可能会快速变化。请将此页面——以及你的内部成本模型——视为需要持续维护的资产。

刷新步骤 需收集的证据 审批问题
检查 DeepSeek 官方定价 模型 ID、缓存命中输入、缓存未命中输入、输出、并发 费率或模型名称是否有变更?
检查生命周期公告 别名变更、退役日期、版本映射 生产代码是否需要迁移?
刷新对比供应商 当前 OpenAI、Claude、Gemini 和 Qwen 的代表性费率 对比是否仍然公平且明确说明了限定条件?
重新计算工作负载 输入、输出、缓存、批处理、重试、成功任务 某个工作负载的经济最优方案是否发生了变化?
审查区域条件 可用性、税费、促销、货币、服务等级 本地成本是否存在实质性差异?
验证内部路由 定价页面、对比指南、配额内容 所有转化和教育链接是否仍然可用?
记录检查日期 源 URL、审阅者、变更字段、下次审查 页面是否已准备好重新发布?

请按月安排此审查,并在供应商宣布新的旗舰模型、退役、促销或计费变更时触发非周期性检查。

常见问题

DeepSeek API 多少钱?

截至 2026 年 7 月 27 日,DeepSeek 公布的 V4 Flash 价格为:每百万缓存未命中输入 token $0.14、每百万缓存命中输入 token $0.0028,以及每百万输出 token $0.28。V4 Pro 的对应价格分别为 $0.435、$0.003625 和 $0.87。请在预算前重新核对官方定价页面。

DeepSeek 比 OpenAI、Claude、Gemini 和 Qwen 更便宜吗?

在这份带日期的快照中,其公开的文本 token 费率低于代表性模型。这并不能证明每个成功任务的总成本最低。输出长度、重试、能力、缓存、批处理资格以及运维都会产生影响。

DeepSeek 对缓存输入收费更低吗?

是的。官方 V4 表单列出了单独的缓存命中输入费率,且远低于缓存未命中费率。实际节省取决于生产请求是否会产生缓存命中。

我应该比较供应商费率还是网关费率?

两者都要比较。直接供应商费率可建立基准。网关定价则应结合其包含的访问、计费、路由、可观测性、支持和运营控制来评估。

DeepSeek 定价页面应多久更新一次?

对于商业对比页面来说,每月更新是一个实用的基准。如果出现模型发布、退役公告、定价变更或重大促销,也应立即刷新。

决策规则

先从官方 token 表开始,但不要止步于此。测量一个具有代表性的工作负载,将缓存输入与未缓存输入分开,包含输出和重试,并比较每个成功任务的成本。然后安排来源审查,这样今天便宜的路线就不会变成明天过时的假设。

了解 Flatkey 定价,比较当前模型路由,并将刷新工作流付诸实践。