登录联系我们免费开始
Cost, Billing, and Ops2026年7月28日Cxj

DeepSeek API 与 Qwen API:面向成本敏感工作流的对比——2026 成本指南

对比 DeepSeek 和 Qwen API 的定价,涵盖 2026 年 7 月 28 日的标价、缓存盈亏平衡计算、批处理成本、生命周期风险以及针对不同工作负载的建议。

DeepSeek API 与 Qwen API:面向成本敏感工作流的对比——2026 成本指南

如果你的主要约束是 API 支出,那么DeepSeek API vs Qwen API 的选择已经不再能靠记忆轻易判断。两家提供商都调整了其低成本模型线,最便宜的路径取决于四件事:未缓存输入、缓存输入、输出量,以及你的工作负载是否可以使用批量推理。

本指南已根据第一方定价和模型生命周期文档进行核对,核对日期为2026 年 7 月 28 日,星期二。简短答案如下:

  • 对于大多数未缓存、已缓存和批量文本工作负载,Qwen Flash 的原始标价更低。
  • DeepSeek V4 Flash 提供非常低的缓存命中率和更简单的全球直连端点,但其更高的缓存未命中和输出费率意味着,你需要异常高的缓存占比请求组合,这一优势才可能影响账单。
  • DeepSeek V4 Pro 可以作为与更高价 Qwen 档位对比时、以成本优先的推理候选,但模型质量并不可互换。应测试成功任务成本,而不只是 token 数。
  • 不要在 Qwen Turbo 上启动新的工作流。阿里云列出的退役日期是2026 年 11 月 30 日,并建议以 Qwen Flash 作为替代。

DeepSeek vs Qwen:按工作流划分的成本结论

工作流 成本优先默认选择 原因 上线前验证
短对话或抽取 Qwen Flash 更低的输入和输出标价 区域、确切模型快照、质量底线
大批量离线评估 Qwen 批量推理 符合条件的模型可享受输入和输出 50% 折扣 确切模型和区域是否支持批量
重复长上下文 大多数情况下选 Qwen Flash 在普通命中率下,Qwen 更低的基础价格会抵消 DeepSeek 的缓存折扣 衡量缓存命中率以及缓存创建/存储成本
极度依赖缓存的输入 两者都计算 DeepSeek 的缓存输入很便宜,但未命中和输出更贵 token 比例、命中率、输出量
重推理任务 测试 DeepSeek V4 Pro 和相应的 Qwen 档位 DeepSeek Pro 公开的输出定价低于 Qwen 3.7 Plus 准确率、重试、工具调用、延迟
最快的直连提供商接入 DeepSeek 一个有文档说明的全球 OpenAI 兼容基础 URL 数据区域和采购要求
频繁切换模型 共享网关和日志 运营切换成本可能会抹平 token 节省 路由、余额、可观测性、回滚

这是一项成本比较,而不是通用的模型排名。一个需要更多重试、更长提示词或人工纠正的模型,即使 token 价格更低,也可能最终更贵。

当前 DeepSeek API 定价

DeepSeek 的定价页面于 7 月 28 日更新,列出了两个 V4 文本模型。价格按每一百万 token 计算。

模型 缓存命中输入 缓存未命中输入 输出 上下文 最大输出
deepseek-v4-flash $0.0028 $0.14 $0.28 1M 384K
deepseek-v4-pro $0.003625 $0.435 $0.87 1M 384K

DeepSeek 记录了自动上下文缓存,并公开了单独的命中和未命中价格。它还提供了一个与 OpenAI 兼容的端点 https://api.deepseek.com,以及一个与 Anthropic 兼容的端点 https://api.deepseek.com/anthropic

最引人注目的数字是 V4 Flash 的缓存命中价格:它仅为缓存未命中费率的 2%。但这个折扣不应孤立评估。一次未命中的成本仍然是 Qwen Flash 第一档标准输入费率的六倍多,而且 DeepSeek V4 Flash 的输出成本也更高。

当前的 Qwen API 定价

阿里云 Model Studio 按模型、输入长度、输出模式和部署区域列出 Qwen 价格。对于输入最多 128K tokens 的全球部署,相关的低成本行如下:

模型 标准输入 输出 隐式缓存命中 显式缓存命中 批量折扣
qwen3.5-flash $0.022 $0.216 标准输入价格的 20% 标准输入价格的 10% 受支持的批处理任务可享受 50% 折扣

对于新加坡部署模式,同一页面将 qwen-flash 列为输入 $0.05、输出 $0.40,适用于最多 128K 的提示词。这一区域差异说明,合理的 Qwen 预测必须记录部署模式和端点,而不是照搬某个醒目的单一数字。

Qwen 的缓存同样需要精确建模:

  • 隐式缓存命中按标准输入价格的 20% 计费。
  • 显式缓存命中按标准输入价格的 10% 计费。
  • 显式缓存创建按标准输入价格的 125% 计费,缓存存储则单独计费。
  • 批量推理可让符合条件的模型享受输入和输出 50% 的折扣,但不要假设这些折扣会叠加,除非提供商明确文档说明了该模型和区域可同时使用。

阿里云还指出,qwen-flash 是一个滚动别名。当可复现性很重要时,请固定到某个带日期的模型 ID,然后在该快照退役之前安排迁移测试。

三种工作负载计算

以下公式使用公开挂牌价,而不是临时促销或议价合同。它们只比较直接来自提供商的 token 费用,不包括税费、网络费用、缓存存储和工程人力成本。

场景 1:短篇未缓存聊天

假设:

  • 10,000 次请求
  • 每次请求 1,000 个输入 token
  • 每次请求 500 个输出 token
  • 无缓存命中
  • Qwen 全球 qwen3.5-flash 第一档定价
路由 输入计算 输出计算 估算总计
DeepSeek V4 Flash 10M × $0.14 = $1.40 5M × $0.28 = $1.40 $2.80
Qwen 3.5 Flash 10M × $0.022 = $0.22 5M × $0.216 = $1.08 $1.30

对于这种请求形态,按公开标价计算,Qwen 的成本大约低 54%。如果你使用不同的 Qwen 区域、超过第一个输入档位,或者需要足够多的重试来抵消 token 优势,结果可能会发生变化。

场景 2:90% 缓存命中的重复长上下文

假设:

  • 10,000 次请求
  • 每次请求 10,000 个输入 token
  • 每次请求 1,000 个输出 token
  • 90% 的输入 token 按缓存命中费率计费
  • Qwen 使用隐式缓存
路由 缓存未命中输入 缓存命中输入 输出 估算总计
DeepSeek V4 Flash 10M × $0.14 = $1.40 90M × $0.0028 = $0.252 10M × $0.28 = $2.80 $4.452
Qwen 3.5 Flash 10M × $0.022 = $0.22 90M × $0.0044 = $0.396 10M × $0.216 = $2.16 $2.776

DeepSeek 的缓存命中费率更低,但在这个 90% 命中的场景中,Qwen 仍然胜出,因为 Qwen 的未命中和输出价格更低。

仅就输入而言,只有当缓存命中占比大约达到 98.7% 或更高 时,DeepSeek V4 Flash 才会比 Qwen 的隐式缓存组合更便宜。一旦计入输出 token,所需命中率还会更高。使用 Qwen 的显式缓存时,其命中价格本身低于 DeepSeek,不过还必须把创建和存储费用算进去。

场景 3:离线批处理

假设:

  • 1 亿个输入 token
  • 2,000 万个输出 token
  • Qwen 模型和区域符合公开的 50% 批处理折扣资格
  • 由于 DeepSeek 的定价页面未公布等效的批处理折扣,因此按标准同步标价计算
路由 计算 估算总计
DeepSeek V4 Flash (100M × $0.14) + (20M × $0.28) $19.60
Qwen 3.5 Flash batch 50% × [(100M × $0.022) + (20M × $0.216)] $3.26

对于可容忍延迟的评估、标注、摘要或合成数据任务,是否符合批处理资格可能比细微的缓存差异更重要。在批准预测之前,请确认你的具体模型、部署模式和任务类型都符合资格。

更好的盈亏平衡公式

不要只比较单个 token 价格单元,而要使用下面这个工作表:

monthly_cost =
  uncached_input_millions × uncached_input_rate
  + cached_input_millions × cached_input_rate
  + output_millions × output_rate
  + cache_creation_cost
  + cache_storage_cost
  + retry_cost
  + platform_or_network_fees

然后计算每个成功任务的成本:

successful_task_cost = monthly_cost / accepted_outputs

第二个数值可以捕捉到令牌表忽略的运营成本。如果更便宜的路径会产生更多无效 JSON、工具调用失败、冗长的推理轨迹或人工复核,那么它的真实成本可能更高。

影响总成本的运营差异

地区与端点设计

DeepSeek 文档说明了一个全球直接端点。Qwen 使用与部署模式和地区绑定的阿里云 Model Studio 端点。区域配置可以改善治理,但也会影响模型可用性、价格行、凭据和故障切换设计。

在每次审批中记录以下字段:

  • 提供方和确切的模型 ID
  • 部署地区或模式
  • 基础 URL
  • 输入长度档位
  • 思考或非思考输出模式
  • 缓存方式
  • 批处理资格
  • 价格核对日期

模型生命周期

Qwen Turbo 计划于 2026 年 11 月 30 日退役,阿里云建议使用 Qwen Flash 作为替代。新系统不应把 Turbo 熟悉的名称或更低的非思考输出行视为长期节省方案。

滚动别名适合实验,但会引入静默变更风险。在生产中固定到带日期的版本,维护一个小型评估集,并在退役前测试下一个版本。

质量与重试预算

不要把 DeepSeek V4 Flash 和 Qwen Flash 当作会产生相同结果的模型来比较。应基于实际任务评估每条路径:抽取准确率、代码测试通过率、工具调用完成率、结构化输出有效性、延迟和人工接受率。

一个实用的路由门槛是:

  1. 拒绝低于质量底线的模型。
  2. 在通过筛选的方案中比较每个被接受输出的成本。
  3. 加上重试和回退成本。
  4. 用回滚阈值对更便宜的路径进行金丝雀发布。
  5. 在生产流量运行第一周后重新计算。

如需可重复的测试框架,请使用 多模型提示测试工作流。如需更广泛的费率背景,请比较当前的 AI 模型定价对比 和 Flatkey 的 定价页面

何时选择 DeepSeek 更合适

在以下情况下,DeepSeek 值得先测试:

  • 你想要一个简单的全球直接端点。
  • 你的工作负载具有极高且经测量的缓存复用率。
  • DeepSeek V4 Pro 以低于你测试的 Qwen 档位的成功任务成本,满足推理质量底线。
  • 你的团队已经可靠地运行 DeepSeek,而迁移工作会超过预期节省。

何时选择 Qwen 更合适

在以下情况下,Qwen 值得先测试:

  • 原始令牌成本是主要约束。
  • 你运行的是短或中等长度的未缓存提示。
  • 你有可容忍延迟、且符合批处理推理条件的作业。
  • 你可以有效使用显式或隐式缓存。
  • 阿里云的区域化部署模式符合你的合规和运营要求。

FAQ

DeepSeek 在 2026 年会比 Qwen 更便宜吗?

并非全方位如此。在 7 月 28 日的公开标价下,Qwen 3.5 Flash 在本指南中的短期未缓存、90% 缓存命中以及符合条件的批处理示例里都更便宜。DeepSeek 仍可能在成功任务成本、运维简化,或某个特定的高阶对比中胜出。

哪个 API 更适合高频自动化?

如果工作可以使用批量推理,或者对低延迟不敏感,先测试 Qwen Flash。若缓存复用率极高,或其输出质量能减少重试,也一并测试 DeepSeek。选择每个已接受结果成本最低的方案。

DeepSeek 的缓存价格会让它在 RAG 中更便宜吗?

不一定。DeepSeek 的缓存命中输入价格非常低,但其缓存未命中和输出费率高于 Qwen 3.5 Flash 的第一档费率。在决定前,请测量实际命中率、提示词到输出的比例,以及 Qwen 的缓存方式。

我应该在新应用中使用 Qwen Turbo 吗?

不。阿里云已将 Qwen Turbo 的退役日期列为 2026 年 11 月 30 日,并建议迁移到 Qwen Flash。

API 定价应该多久复查一次?

对于活跃的生产路线,按月复查;一旦提供商更改模型 ID、退役日期、缓存规则、批处理支持、区域可用性或公开标价,也应立即复查。

以生产流量为依据选择,而不是看表面费率

对于大多数成本敏感型文本工作流,截至 2026 年 7 月 28 日,Qwen Flash 是更低价的起点。对于那些其端点简洁性、缓存行为或任务质量能降低总运营成本的场景,DeepSeek 仍值得测试。

保存请求形态工作表,固定精确的模型版本,并保持路线可逆。如果你想在不重写客户端代码的情况下,在一个地方测试两个提供商,可以从 Flatkey 集成入门 开始,运行相同的评估集,只有在每次成功成本数据稳定后再将生产流量切过去。