如果你的主要约束是 API 支出,那么DeepSeek API vs Qwen API 的选择已经不再能靠记忆轻易判断。两家提供商都调整了其低成本模型线,最便宜的路径取决于四件事:未缓存输入、缓存输入、输出量,以及你的工作负载是否可以使用批量推理。
本指南已根据第一方定价和模型生命周期文档进行核对,核对日期为2026 年 7 月 28 日,星期二。简短答案如下:
- 对于大多数未缓存、已缓存和批量文本工作负载,Qwen Flash 的原始标价更低。
- DeepSeek V4 Flash 提供非常低的缓存命中率和更简单的全球直连端点,但其更高的缓存未命中和输出费率意味着,你需要异常高的缓存占比请求组合,这一优势才可能影响账单。
- DeepSeek V4 Pro 可以作为与更高价 Qwen 档位对比时、以成本优先的推理候选,但模型质量并不可互换。应测试成功任务成本,而不只是 token 数。
- 不要在 Qwen Turbo 上启动新的工作流。阿里云列出的退役日期是2026 年 11 月 30 日,并建议以 Qwen Flash 作为替代。
DeepSeek vs Qwen:按工作流划分的成本结论
| 工作流 | 成本优先默认选择 | 原因 | 上线前验证 |
|---|---|---|---|
| 短对话或抽取 | Qwen Flash | 更低的输入和输出标价 | 区域、确切模型快照、质量底线 |
| 大批量离线评估 | Qwen 批量推理 | 符合条件的模型可享受输入和输出 50% 折扣 | 确切模型和区域是否支持批量 |
| 重复长上下文 | 大多数情况下选 Qwen Flash | 在普通命中率下,Qwen 更低的基础价格会抵消 DeepSeek 的缓存折扣 | 衡量缓存命中率以及缓存创建/存储成本 |
| 极度依赖缓存的输入 | 两者都计算 | DeepSeek 的缓存输入很便宜,但未命中和输出更贵 | token 比例、命中率、输出量 |
| 重推理任务 | 测试 DeepSeek V4 Pro 和相应的 Qwen 档位 | DeepSeek Pro 公开的输出定价低于 Qwen 3.7 Plus | 准确率、重试、工具调用、延迟 |
| 最快的直连提供商接入 | DeepSeek | 一个有文档说明的全球 OpenAI 兼容基础 URL | 数据区域和采购要求 |
| 频繁切换模型 | 共享网关和日志 | 运营切换成本可能会抹平 token 节省 | 路由、余额、可观测性、回滚 |
这是一项成本比较,而不是通用的模型排名。一个需要更多重试、更长提示词或人工纠正的模型,即使 token 价格更低,也可能最终更贵。
当前 DeepSeek API 定价
DeepSeek 的定价页面于 7 月 28 日更新,列出了两个 V4 文本模型。价格按每一百万 token 计算。
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 | 上下文 | 最大输出 |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
DeepSeek 记录了自动上下文缓存,并公开了单独的命中和未命中价格。它还提供了一个与 OpenAI 兼容的端点 https://api.deepseek.com,以及一个与 Anthropic 兼容的端点 https://api.deepseek.com/anthropic。
最引人注目的数字是 V4 Flash 的缓存命中价格:它仅为缓存未命中费率的 2%。但这个折扣不应孤立评估。一次未命中的成本仍然是 Qwen Flash 第一档标准输入费率的六倍多,而且 DeepSeek V4 Flash 的输出成本也更高。
当前的 Qwen API 定价
阿里云 Model Studio 按模型、输入长度、输出模式和部署区域列出 Qwen 价格。对于输入最多 128K tokens 的全球部署,相关的低成本行如下:
| 模型 | 标准输入 | 输出 | 隐式缓存命中 | 显式缓存命中 | 批量折扣 |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
标准输入价格的 20% | 标准输入价格的 10% | 受支持的批处理任务可享受 50% 折扣 |
对于新加坡部署模式,同一页面将 qwen-flash 列为输入 $0.05、输出 $0.40,适用于最多 128K 的提示词。这一区域差异说明,合理的 Qwen 预测必须记录部署模式和端点,而不是照搬某个醒目的单一数字。
Qwen 的缓存同样需要精确建模:
- 隐式缓存命中按标准输入价格的 20% 计费。
- 显式缓存命中按标准输入价格的 10% 计费。
- 显式缓存创建按标准输入价格的 125% 计费,缓存存储则单独计费。
- 批量推理可让符合条件的模型享受输入和输出 50% 的折扣,但不要假设这些折扣会叠加,除非提供商明确文档说明了该模型和区域可同时使用。
阿里云还指出,qwen-flash 是一个滚动别名。当可复现性很重要时,请固定到某个带日期的模型 ID,然后在该快照退役之前安排迁移测试。
三种工作负载计算
以下公式使用公开挂牌价,而不是临时促销或议价合同。它们只比较直接来自提供商的 token 费用,不包括税费、网络费用、缓存存储和工程人力成本。
场景 1:短篇未缓存聊天
假设:
- 10,000 次请求
- 每次请求 1,000 个输入 token
- 每次请求 500 个输出 token
- 无缓存命中
- Qwen 全球
qwen3.5-flash第一档定价
| 路由 | 输入计算 | 输出计算 | 估算总计 |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
对于这种请求形态,按公开标价计算,Qwen 的成本大约低 54%。如果你使用不同的 Qwen 区域、超过第一个输入档位,或者需要足够多的重试来抵消 token 优势,结果可能会发生变化。
场景 2:90% 缓存命中的重复长上下文
假设:
- 10,000 次请求
- 每次请求 10,000 个输入 token
- 每次请求 1,000 个输出 token
- 90% 的输入 token 按缓存命中费率计费
- Qwen 使用隐式缓存
| 路由 | 缓存未命中输入 | 缓存命中输入 | 输出 | 估算总计 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
DeepSeek 的缓存命中费率更低,但在这个 90% 命中的场景中,Qwen 仍然胜出,因为 Qwen 的未命中和输出价格更低。
仅就输入而言,只有当缓存命中占比大约达到 98.7% 或更高 时,DeepSeek V4 Flash 才会比 Qwen 的隐式缓存组合更便宜。一旦计入输出 token,所需命中率还会更高。使用 Qwen 的显式缓存时,其命中价格本身低于 DeepSeek,不过还必须把创建和存储费用算进去。
场景 3:离线批处理
假设:
- 1 亿个输入 token
- 2,000 万个输出 token
- Qwen 模型和区域符合公开的 50% 批处理折扣资格
- 由于 DeepSeek 的定价页面未公布等效的批处理折扣,因此按标准同步标价计算
| 路由 | 计算 | 估算总计 |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash batch | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
对于可容忍延迟的评估、标注、摘要或合成数据任务,是否符合批处理资格可能比细微的缓存差异更重要。在批准预测之前,请确认你的具体模型、部署模式和任务类型都符合资格。
更好的盈亏平衡公式
不要只比较单个 token 价格单元,而要使用下面这个工作表:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
然后计算每个成功任务的成本:
successful_task_cost = monthly_cost / accepted_outputs
第二个数值可以捕捉到令牌表忽略的运营成本。如果更便宜的路径会产生更多无效 JSON、工具调用失败、冗长的推理轨迹或人工复核,那么它的真实成本可能更高。
影响总成本的运营差异
地区与端点设计
DeepSeek 文档说明了一个全球直接端点。Qwen 使用与部署模式和地区绑定的阿里云 Model Studio 端点。区域配置可以改善治理,但也会影响模型可用性、价格行、凭据和故障切换设计。
在每次审批中记录以下字段:
- 提供方和确切的模型 ID
- 部署地区或模式
- 基础 URL
- 输入长度档位
- 思考或非思考输出模式
- 缓存方式
- 批处理资格
- 价格核对日期
模型生命周期
Qwen Turbo 计划于 2026 年 11 月 30 日退役,阿里云建议使用 Qwen Flash 作为替代。新系统不应把 Turbo 熟悉的名称或更低的非思考输出行视为长期节省方案。
滚动别名适合实验,但会引入静默变更风险。在生产中固定到带日期的版本,维护一个小型评估集,并在退役前测试下一个版本。
质量与重试预算
不要把 DeepSeek V4 Flash 和 Qwen Flash 当作会产生相同结果的模型来比较。应基于实际任务评估每条路径:抽取准确率、代码测试通过率、工具调用完成率、结构化输出有效性、延迟和人工接受率。
一个实用的路由门槛是:
- 拒绝低于质量底线的模型。
- 在通过筛选的方案中比较每个被接受输出的成本。
- 加上重试和回退成本。
- 用回滚阈值对更便宜的路径进行金丝雀发布。
- 在生产流量运行第一周后重新计算。
如需可重复的测试框架,请使用 多模型提示测试工作流。如需更广泛的费率背景,请比较当前的 AI 模型定价对比 和 Flatkey 的 定价页面。
何时选择 DeepSeek 更合适
在以下情况下,DeepSeek 值得先测试:
- 你想要一个简单的全球直接端点。
- 你的工作负载具有极高且经测量的缓存复用率。
- DeepSeek V4 Pro 以低于你测试的 Qwen 档位的成功任务成本,满足推理质量底线。
- 你的团队已经可靠地运行 DeepSeek,而迁移工作会超过预期节省。
何时选择 Qwen 更合适
在以下情况下,Qwen 值得先测试:
- 原始令牌成本是主要约束。
- 你运行的是短或中等长度的未缓存提示。
- 你有可容忍延迟、且符合批处理推理条件的作业。
- 你可以有效使用显式或隐式缓存。
- 阿里云的区域化部署模式符合你的合规和运营要求。
FAQ
DeepSeek 在 2026 年会比 Qwen 更便宜吗?
并非全方位如此。在 7 月 28 日的公开标价下,Qwen 3.5 Flash 在本指南中的短期未缓存、90% 缓存命中以及符合条件的批处理示例里都更便宜。DeepSeek 仍可能在成功任务成本、运维简化,或某个特定的高阶对比中胜出。
哪个 API 更适合高频自动化?
如果工作可以使用批量推理,或者对低延迟不敏感,先测试 Qwen Flash。若缓存复用率极高,或其输出质量能减少重试,也一并测试 DeepSeek。选择每个已接受结果成本最低的方案。
DeepSeek 的缓存价格会让它在 RAG 中更便宜吗?
不一定。DeepSeek 的缓存命中输入价格非常低,但其缓存未命中和输出费率高于 Qwen 3.5 Flash 的第一档费率。在决定前,请测量实际命中率、提示词到输出的比例,以及 Qwen 的缓存方式。
我应该在新应用中使用 Qwen Turbo 吗?
不。阿里云已将 Qwen Turbo 的退役日期列为 2026 年 11 月 30 日,并建议迁移到 Qwen Flash。
API 定价应该多久复查一次?
对于活跃的生产路线,按月复查;一旦提供商更改模型 ID、退役日期、缓存规则、批处理支持、区域可用性或公开标价,也应立即复查。
以生产流量为依据选择,而不是看表面费率
对于大多数成本敏感型文本工作流,截至 2026 年 7 月 28 日,Qwen Flash 是更低价的起点。对于那些其端点简洁性、缓存行为或任务质量能降低总运营成本的场景,DeepSeek 仍值得测试。
保存请求形态工作表,固定精确的模型版本,并保持路线可逆。如果你想在不重写客户端代码的情况下,在一个地方测试两个提供商,可以从 Flatkey 集成入门 开始,运行相同的评估集,只有在每次成功成本数据稳定后再将生产流量切过去。



