主な制約が API 利用料金であるなら、DeepSeek API vs Qwen API の判断は、もはや記憶だけで決められるほど近いものではありません。両プロバイダーは低コストモデルのラインアップを変更しており、最安の選択肢は、キャッシュなし入力、キャッシュあり入力、出力量、そしてワークロードでバッチ推論を使えるかどうかの 4 つに左右されます。
このガイドは、2026年7月28日火曜日時点の一次情報の価格表とモデルライフサイクル文書を照合して確認しました。要点は次のとおりです。
- Qwen Flash は、キャッシュなし、キャッシュあり、バッチのテキストワークロードの大半で、表面上のリスト価格が最も低いです。
- DeepSeek V4 Flash は非常に低いキャッシュヒット率と、よりシンプルなグローバル直結エンドポイントを提供しますが、キャッシュミス時と出力時の料金が高いため、その利点が請求額に反映されるには、かなりキャッシュ依存の高いリクエスト構成が必要です。
- DeepSeek V4 Pro は、より高価格帯の Qwen ティアに対して、コスト重視の推論候補になり得ますが、モデル品質は置き換え可能ではありません。トークン数だけでなく、成功タスクあたりのコストをテストしてください。
- 新しいワークフローを Qwen Turbo で開始しないでください。 Alibaba Cloud は 2026年11月30日 の終了日を案内しており、代替として Qwen Flash を推奨しています。
DeepSeek vs Qwen: ワークフロー別のコスト判断
| ワークフロー | コスト重視の既定 | 理由 | 本番前に確認すべき点 |
|---|---|---|---|
| 短いチャットまたは抽出 | Qwen Flash | 入力・出力ともにリスト価格が低い | リージョン、正確なモデルスナップショット、品質の下限 |
| 大規模なオフライン評価 | Qwen のバッチ推論 | 対象モデルは入力と出力の両方が 50% 割引 | 正確なモデルとリージョンがバッチをサポートしているか |
| 長いコンテキストの繰り返し利用 | 多くの場合は Qwen Flash | 通常のヒット率では、Qwen の低い基本価格が DeepSeek のキャッシュ割引を上回る | キャッシュヒット率、キャッシュ作成・保存コストを測定する |
| 極端にキャッシュ依存の入力 | 両方を計算する | DeepSeek のキャッシュあり入力は安いが、ミス時と出力が高い | トークン比率、ヒット率、出力量 |
| 推論負荷の高いタスク | DeepSeek V4 Pro と該当する Qwen ティアをテストする | DeepSeek Pro は Qwen 3.7 Plus より公開出力価格が低い | 精度、再試行、ツール利用、レイテンシ |
| 最も速い直結プロバイダー設定 | DeepSeek | 文書化されたグローバルな OpenAI 互換ベース URL が 1 つある | データリージョンと調達要件 |
| 頻繁なモデル切り替え | 共通ゲートウェイとログ | 運用上の切り替えコストがトークン節約を打ち消す可能性がある | ルーティング、残高、可観測性、ロールバック |
これはコスト比較であり、万能なモデル順位付けではありません。再試行が多い、プロンプトが長い、人手修正が必要といったモデルは、トークン単価が低くても不利になることがあります。
現在の DeepSeek API 価格
7月28日に更新された DeepSeek の価格ページには、2 つの V4 テキストモデルが掲載されています。価格は 100 万トークンあたりです。
| モデル | キャッシュヒット入力 | キャッシュミス入力 | 出力 | コンテキスト | 最大出力 |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
DeepSeek は自動コンテキストキャッシュをドキュメント化しており、ヒット価格とミス価格を別々に公開しています。また、https://api.deepseek.com に OpenAI 互換エンドポイント、https://api.deepseek.com/anthropic に Anthropic 互換エンドポイントも提供しています。
注目すべき数字は V4 Flash のキャッシュヒット価格で、キャッシュミス率のわずか 2% です。ただし、この割引を単独で評価すべきではありません。ミス時でも Qwen Flash の第1価格帯の標準入力料金の 6 倍以上かかり、DeepSeek V4 Flash の出力料金もさらに高くなります。
現在の Qwen API 価格
Alibaba Cloud Model Studio は、モデル、入力長、出力モード、デプロイ地域ごとに Qwen の価格を掲載しています。入力が最大 128K トークンのグローバル展開では、関連する低コストの行は次のとおりです:
| モデル | 標準入力 | 出力 | 暗黙的キャッシュヒット | 明示的キャッシュヒット | バッチ割引 |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
標準入力価格の 20% | 標準入力価格の 10% | 対応バッチジョブは 50% |
シンガポールのデプロイモードでは、同じページに qwen-flash が、128K までのプロンプトに対して入力 $0.05、出力 $0.40 として掲載されています。この地域差があるため、妥当な Qwen の予測では、1つの目立つ数値をそのまま使うのではなく、デプロイモードとエンドポイントを記録する必要があります。
Qwen のキャッシュも正確なモデリングが必要です:
- 暗黙的キャッシュヒットは標準入力価格の 20% で課金されます。
- 明示的キャッシュヒットは標準入力価格の 10% で課金されます。
- 明示的キャッシュ作成は標準入力価格の 125% で課金され、キャッシュ保存は別途課金されます。
- バッチ推論では、対象モデルの入力と出力が 50% 割引になりますが、プロバイダーがその組み合わせをモデルと地域について明記していない限り、割引が重複適用されるとは想定しないでください。
Alibaba Cloud はまた、qwen-flash がローリングエイリアスであることも示しています。再現性が重要な場合は日付付きのモデル ID を固定し、そのスナップショットが終了する前に移行テストをスケジュールしてください。
3 つのワークロード計算
以下の式は、一時的なプロモーションや交渉済み契約ではなく、公表されている一覧価格を使用しています。ここではプロバイダー直課金のトークン料金のみを比較し、税金、ネットワーク料金、キャッシュ保存、エンジニアリング工数は含めていません。
シナリオ 1: 短い非キャッシュチャット
前提:
- 10,000 件のリクエスト
- 1 リクエストあたり 1,000 入力トークン
- 1 リクエストあたり 500 出力トークン
- キャッシュヒットなし
- Qwen グローバル
qwen3.5-flashの第1価格帯
| 経路 | 入力計算 | 出力計算 | 概算合計 |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
このリクエスト形状では、公開されている定価ベースで Qwen のコストは約 54% 安くなります。別の Qwen リージョンを使う場合、最初の入力階層を超える場合、またはトークン優位性を打ち消すのに十分なリトライが必要な場合は、結果が変わることがあります。
シナリオ 2: キャッシュヒット率 90% の反復的な長文コンテキスト
前提:
- 10,000 リクエスト
- リクエストあたり 10,000 入力トークン
- リクエストあたり 1,000 出力トークン
- 入力トークンの 90% はキャッシュヒット料金で課金
- Qwen は暗黙的キャッシングを使用
| 経路 | キャッシュミス入力 | キャッシュヒット入力 | 出力 | 概算合計 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
DeepSeek のキャッシュヒット率は低めですが、Qwen はミス時と出力の価格が低いため、この 90% ヒットのシナリオでも Qwen が有利です。
入力のみで見ると、DeepSeek V4 Flash が Qwen の暗黙的キャッシュ混合より安くなるのは、キャッシュヒット比率が概ね 98.7% 以上 の場合だけです。出力トークンを含めると、必要なヒット率はさらに高くなります。Qwen の明示的キャッシングでは、ヒット時の単価自体は DeepSeek より低いものの、作成・保存コストも含めて考慮する必要があります。
シナリオ 3: オフラインバッチ処理
前提:
- 1 億入力トークン
- 2,000 万出力トークン
- Qwen のモデルとリージョンは、公開されている 50% のバッチ割引の対象
- DeepSeek は、料金ページに同等のバッチ割引が記載されていないため、標準の同期定価で計算
| 経路 | 計算 | 概算合計 |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash batch | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
遅延許容の評価、ラベリング、要約、または合成データのジョブでは、小さなキャッシュ差よりもバッチ適用可否のほうが重要になる場合があります。予測を承認する前に、正確なモデル、デプロイモード、ジョブ種別が対象条件を満たすか確認してください。
より適切な損益分岐点の式
単一のトークン単価セルを比較する代わりに、このワークシートを使ってください:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
次に、成功したタスクあたりのコストを計算します:
successful_task_cost = monthly_cost / accepted_outputs
この2つ目の数値は、トークン表では見えない運用コストを捉えます。より安いルートでも、無効なJSON、ツール呼び出しの失敗、長い推論トレース、手動レビューが増えるなら、実際のコストは高くなる可能性があります。
総コストに影響する運用上の違い
リージョンとエンドポイント設計
DeepSeek は単一のグローバル直接エンドポイントを公開しています。Qwen は、デプロイモードとリージョンに紐づいた Alibaba Cloud Model Studio のエンドポイントを使用します。リージョン設定はガバナンスを改善できますが、同時にモデルの利用可否、価格行、認証情報、フェイルオーバー設計にも影響します。
すべての承認に次の項目を記録してください。
- プロバイダーと正確なモデル ID
- デプロイ先リージョンまたはモード
- ベース URL
- 入力長ティア
- thinking または non-thinking の出力モード
- キャッシュ方式
- バッチ適格性
- 価格確認日
モデルのライフサイクル
Qwen Turbo は 2026年11月30日 に終了予定で、Alibaba Cloud は代替として Qwen Flash を推奨しています。新しいシステムでは、Turbo の馴染みのある名称や、thinking なし出力のより低い価格行を、長期的な節約策として扱うべきではありません。
ロールिंगエイリアスは実験には便利ですが、静かに変更されるリスクをもたらします。本番では日付付きバージョンを固定し、小さな評価セットを維持し、終了前に次のバージョンをテストしてください。
品質とリトライ予算
DeepSeek V4 Flash と Qwen Flash が同じ結果を出すかのように比較してはいけません。抽出精度、コードのテスト合格率、ツール呼び出しの完了率、構造化出力の妥当性、レイテンシ、人による受け入れなど、実際のタスクで各ルートを評価してください。
実践的なルーティングゲートは次のとおりです。
- 品質基準を下回るモデルを除外する。
- 残った候補の中で、受理済み出力あたりのコストを比較する。
- リトライとフォールバックのコストを加える。
- 安いルートをロールバックしきい値付きでカナリアリリースする。
- 本番トラフィックの最初の1週間後に再計算する。
再現可能なテストハーネスには、マルチモデルプロンプトテストワークフローを使用してください。より広い料金の文脈については、現在の AIモデル価格比較 と Flatkey の 価格ページ を比較してください。
DeepSeek がより適した選択となる場合
次のような場合は、DeepSeek を最初に試す価値があります。
- シンプルなグローバル直接エンドポイントが必要な場合。
- ワークロードで、測定可能なキャッシュ再利用率が極めて高い場合。
- DeepSeek V4 Pro が、テストした Qwen のティアより低い successful-task cost で推論品質の基準を満たす場合。
- チームがすでに DeepSeek を安定運用しており、移行作業が見込まれる節約額を上回る場合。
Qwen がより適した選択となる場合
次のような場合は、Qwen を最初に試す価値があります。
- 生のトークンコストが主な制約である場合。
- 短い、または中程度の未キャッシュプロンプトを実行する場合。
- バッチ推論の対象となる、遅延許容のジョブがある場合。
- 明示的または暗黙的なキャッシュを効果的に使える場合。
- Alibaba Cloud のリージョン分散デプロイモデルが、コンプライアンスと運用要件に合致する場合。
FAQ
2026年に DeepSeek は Qwen より安いですか?
全体としてはそうではありません。7月28日時点の公開リスト価格では、このガイドにおける短いキャッシュなし、90%キャッシュ済み、そして対象バッチの例では、Qwen 3.5 Flash のほうが安価です。DeepSeek は、成功タスクあたりのコスト、運用のシンプルさ、または特定の上位ティア比較では依然として有利な場合があります。
大量自動化にはどの API が適していますか?
作業でバッチ推論を使える場合、または低遅延がそれほど重要でない場合は、まず Qwen Flash でテストしてください。キャッシュ再利用率が非常に高い場合、または出力品質によって再試行が減る場合は、DeepSeek も併せてテストしてください。承認するのは、受け入れられた結果 1 件あたりのコストが最も低いルートです。
DeepSeek のキャッシュ価格は RAG をより安くしますか?
自動的には安くなりません。DeepSeek のキャッシュヒット時の入力価格は非常に低いですが、キャッシュミス時と出力時の料金は Qwen 3.5 Flash の第一階層料金より高くなっています。判断する前に、実際のヒット率、プロンプト対出力比、そして Qwen のキャッシュ方式を測定してください。
新しいアプリケーションに Qwen Turbo を使うべきですか?
いいえ。Alibaba Cloud は Qwen Turbo の提供終了を 2026年11月30日と案内しており、Qwen Flash への移行を推奨しています。
API 価格はどのくらいの頻度で見直すべきですか?
稼働中の本番ルートについては毎月見直し、さらにプロバイダーがモデル ID、提供終了日、キャッシュルール、バッチ対応、地域ごとの提供可否、またはリスト価格を変更した場合は直ちに見直してください。
見出し料金ではなく、本番トラフィックで選ぶ
コスト重視のテキストワークフローの多くでは、2026年7月28日時点で Qwen Flash がより低価格な出発点です。DeepSeek は、エンドポイントのシンプルさ、キャッシュ挙動、またはタスク品質によって運用全体のコストが下がる場合に、引き続き試す価値があります。
リクエスト形状のワークシートを保存し、正確なモデルバージョンを固定し、ルートをいつでも戻せるようにしておきましょう。クライアントコードを書き換えずに両方のプロバイダーを 1 か所で試したい場合は、Flatkey integration starter から始め、同じ評価セットを実行し、成功 1 件あたりのコストの数値が安定してから本番トラフィックを振り分けてください。



