AI APIの料金比較は難しいです。なぜなら、最も安い入力トークン単価が、実運用で最も安いワークフローを生むとは限らないからです。出力トークンは入力より何倍も高くなる場合があり、キャッシュされたプロンプトが請求額を変え、コンテキスト長の段階別料金が適用されることもあり、さらに低価格のモデルでも再試行や人手修正が増える可能性があります。
このガイドでは、OpenAI、Anthropic Claude、Google Gemini、Alibaba Qwenの代表的なテキストモデルについて、現在公開されている標準価格を比較します。また、価格を1つの正規化されたワークロードに換算することで、単に100万トークンあたりの価格表を見るだけでなく、実際の予算を見積もれるようにします。
価格確認: 料金は2026年7月29日時点で公式プロバイダーページと照合しています。特に断りがない限り、価格は100万トークンあたりの米ドルです。プロバイダーは、モデル名、プレビュー状態、地域ごとの提供可否、コンテキストしきい値、割引、価格を変更することがあります。本番の購入判断を行う前に、リンク先の公式ページで確認してください。
簡潔な答え: どのAI APIが最も安いですか?
純粋なトークンコストでは、この比較ではQwenの低価格モデルが最も安価です。Geminiも非常に価格競争力が高く、特にFlashおよびFlash-Lite系でその傾向が強いです。OpenAIとClaudeは一般に標準価格が高めですが、特定のワークロードで再試行、ツールエラー、レビュー時間、フォールバックトラフィックを減らせるなら、1つのタスクを成功させるためのコストは最も低くなる可能性があります。
万能の勝者はありません:
- まずはタスク品質で選ぶ: 自分のプロンプト、ツール、スキーマ、言語、エッジケースでテストしてください。
- 入力と出力を分けて考える: 出力の多い生成では、分類や抽出とはまったく異なる順位になることがあります。
- 失敗コストを含める: 再試行、フォールバック呼び出し、人手レビュー、顧客に見えるエラーはすべて実効価格に影響します。
- 割引としきい値を再確認する: キャッシュ、バッチ、コンテキスト長、リージョンエンドポイント、初期価格設定によって、合計額は大きく変わることがあります。
AI API料金比較表
以下の表では、代表的なモデルをフラッグシップ、バランス、予算重視の帯に分類しています。これは購入判断の目安であり、品質や性能が同等であるという意味ではありません。
| 提供元 | モデル | 比較帯 | 入力 / 100万トークン | 出力 / 100万トークン | 重要な価格メモ |
|---|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | フラッグシップ | $5.00 | $30.00 | 標準のテキストトークン単価 |
| Anthropic | Claude Opus 5 | フラッグシップ | $5.00 | $25.00 | 標準のプロンプトおよび完了価格 |
| Gemini 3.1 Pro Preview | フラッグシップ | $2.00 | $12.00 | 200Kトークンまでのプロンプトに対して示された料金。これを超える場合は、より高い長文コンテキスト階層が適用されます | |
| Alibaba Cloud | Qwen3.7-Max | フラッグシップ | $2.50 | $7.50 | グローバル展開、最大256Kトークンのコンテキスト階層 |
| OpenAI | GPT-5.6 Terra | バランス | $2.50 | $15.00 | 標準のテキストトークン単価 |
| Anthropic | Claude Sonnet 5 | バランス | $2.00 | $10.00 | 2026年8月31日までの導入価格。2026年9月1日以降は入力$3.00、出力$15.00 |
| Gemini 3.6 Flash | バランス | $1.50 | $7.50 | 標準の有料階層。Batchは別途掲載 | |
| Alibaba Cloud | Qwen3.7-Plus | バランス | $0.40 | $1.60 | グローバル展開、最大256Kトークンのコンテキスト階層 |
| OpenAI | GPT-5.6 Luna | バジェット | $1.00 | $6.00 | 標準のテキストトークン単価 |
| Anthropic | Claude Haiku 4.5 | バジェット | $1.00 | $5.00 | 標準のプロンプトおよび完了価格 |
| Gemini 3.5 Flash-Lite | バジェット | $0.30 | $2.50 | 標準の有料階層。より低いBatch価格は別途掲載 | |
| Alibaba Cloud | Qwen3.7-Flash | バジェット | $0.03 | $0.13 | 最大32Kトークンのリクエストに対して示されたグローバル展開料金。より高いコンテキスト階層ではさらに高くなります |
公式ソース: OpenAI API pricing、Anthropic Claude pricing、Gemini API pricing、およびAlibaba Cloud Model Studio pricing。
正規化されたワークロードコスト: 1,000件の本番ジョブ
静的なトークン料金は、同じリクエスト形状をすべての候補に適用した後のほうが有用です。次のようなワークロードを想定します:
- 完了済みジョブ 1,000件
- ジョブあたり入力トークン 20,000
- ジョブあたり出力トークン 2,000
- キャッシュ入力割引やバッチ割引なし
- 再試行やフォールバック呼び出しなし
これは入力2,000万トークン、出力200万トークンに相当します。
式は次のとおりです:
workload cost = (input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
フラッグシップ帯の推定
| モデル | 入力コスト | 出力コスト | 1,000ジョブあたりの合計 |
|---|---|---|---|
| GPT-5.6 Sol | $100.00 | $60.00 | $160.00 |
| Claude Opus 5 | $100.00 | $50.00 | $150.00 |
| Gemini 3.1 Pro Preview | $40.00 | $24.00 | $64.00 |
| Qwen3.7-Max | $50.00 | $15.00 | $65.00 |
バランス帯の見積もり
| モデル | 入力コスト | 出力コスト | 1,000ジョブあたりの合計 |
|---|---|---|---|
| GPT-5.6 Terra | $50.00 | $30.00 | $80.00 |
| Claude Sonnet 5, introductory rate | $40.00 | $20.00 | $60.00 |
| Gemini 3.6 Flash | $30.00 | $15.00 | $45.00 |
| Qwen3.7-Plus | $8.00 | $3.20 | $11.20 |
Claude Sonnet 5 の同じワークロードは、2026年9月1日に公表された料金では $90.00 になります。内訳は入力 $60.00 と出力 $30.00 です。
予算帯の見積もり
| モデル | 入力コスト | 出力コスト | 1,000ジョブあたりの合計 |
|---|---|---|---|
| GPT-5.6 Luna | $20.00 | $12.00 | $32.00 |
| Claude Haiku 4.5 | $20.00 | $10.00 | $30.00 |
| Gemini 3.5 Flash-Lite | $6.00 | $5.00 | $11.00 |
| Qwen3.7-Flash | $0.60 | $0.26 | $0.86 |
これらの合計は、性能順位ではなく算術的な比較です。1,000ジョブあたり $11 のモデルでも、結果の70%しか採用されない一方で $30 のモデルが98%の採用率を達成するなら、実際には安いとは言えません。
トークンコストだけでなく、成功タスクあたりのコストを比較する
本番運用でより良い指標は、採用結果あたりのコストです:
採用結果あたりのコスト = モデル総費用 / 採用結果数
2つの候補がそれぞれ1,000ジョブを処理するとします:
| 候補 | モデル費用 | 採用結果数 | 採用結果あたりのコスト |
|---|---|---|---|
| 低いリスト価格のモデル | $20 | 700 | $0.0286 |
| 高いリスト価格のモデル | $30 | 980 | $0.0306 |
この例では低価格モデルがわずかに勝ちますが、リスト価格の差が示すほどその差は大きくありません。300件の却下結果に対するエンジニアリング工数、顧客エスカレーション、または有料のフォールバックを加えると、順位が逆転する可能性があります。
各モデルについて、少なくとも以下を記録します:
- Acceptance rate: 自動および人手による品質ゲートを通過する出力の割合。
- Retry rate: 同じモデルを再度呼び出す必要がある頻度。
- Fallback rate: トラフィックがより高価なモデルへ移行する頻度。
- Average output length: 入力レートが低くても、冗長なモデルは請求額を大きくする可能性があります。
- Latency at the target percentile: 製品SLAを満たせない安価なモデルは、実運用では使えない場合があります。
- Tool and schema reliability: 無効な構造化出力や失敗したツール呼び出しは、見えにくいコストを生みます。
- Human review minutes: 手動修正は、ビジネスワークフローではトークン費用を上回ることがあります。
OpenAI APIの料金体系
OpenAIは、キャッシュされていない入力、キャッシュされた入力、出力の料金を分けており、対応モデル向けにBatchやFlexなどの追加処理オプションも示しています。上記のモデルでは出力料金が入力料金よりかなり高いため、応答長の制御が重要です。
OpenAIは、アプリケーションがすでにそのAPIを中心に構築されており、選択したモデルが評価セットで安定して良好に動作する場合に有力な選択肢です。OpenAI中心のチームであれば、直接統合は運用上シンプルです。一方、継続的に他のプロバイダーをテストするチームでは、個別のクライアント、認証情報、制限、レポートを維持するコストも比較対象の一部になります。
Claude APIの料金体系
Anthropicは標準的なClaudeリクエストを入力トークンと出力トークンで課金し、プロンプトキャッシュ、長文コンテキストのリクエスト、バッチ処理については別ルールを公開しています。Claude Sonnet 5の導入期間は予算策定で特に重要です。2026年8月に始めた試験導入を、調整なしに9月へそのまま外挿すべきではありません。
Claudeの料金は、長文コンテキストの挙動、ツール利用、コード品質、そしてワークフローが必要とするレビュー量とあわせて評価すべきです。コーディングエージェントや複雑な業務タスクでは、モデルが介入なしにより多くのタスクを完了できるなら、トークン単価が高くても経済的な場合があります。
Gemini APIの料金体系
Googleは、無料および有料のGemini API階層、モデルごとの入力・出力料金、対応モデル向けの別個のBatch料金を示しています。一部のGeminiモデルでは、コンテキストがしきい値を超えるとプロンプトの課金が異なるため、平均プロンプトサイズだけでは不十分です。リクエストサイズの分布が必要になります。
GeminiのFlashおよびFlash-Lite系は大量処理に魅力的で、Proモデルはより難しいタスクを対象としています。プレビュー表示も重要です。価格に加えて、運用チームはライフサイクル状態、制限、移行計画を確認すべきです。
Qwen APIの料金体系
Alibaba Cloud Model Studioは、複数のモデルについてコンテキスト長の階層を持つグローバルデプロイ向けQwen価格を掲載しています。Qwen3.7-Flashは公開表では短いリクエストに対して非常に安価ですが、より大きなコンテキストウィンドウでは料金が上がります。そのため、地域、デプロイモード、正確なモデルIDはすべてのベンチマークで記録する必要があります。
Qwen は、コスト重視のルーティング、多言語アプリケーション、そして追加のプロバイダー候補を求めるチームにとって魅力的です。すべてのモデルファミリーと同様に、本番トラフィックをルーティングする前に、品質、安全性、レイテンシー、ツールの挙動、地域ごとの利用可能性をテストしてください。
キャッシュ入力、バッチ、コンテキスト階層が勝者を変えることがある
冒頭の比較では、意図的に標準のキャッシュなし同期レートを使用しています。実際のワークロードでは、次の要因により、支払額が少なくなることもあれば、まれに多くなることもあります。
キャッシュ入力
大きな繰り返しのシステムプロンプト、ツール定義、ポリシー、ドキュメントのプレフィックスは、cached-input 価格の対象になる場合があります。繰り返しトークンがすべて割引を受けると決めつけるのではなく、実際のキャッシュヒット率を測定してください。
バッチ処理
OpenAI、Anthropic、Google は、対応ユースケース向けに割引のある非同期またはバッチオプションを公開しています。バッチは、評価、エンリッチメント、オフライン分類、夜間のドキュメント処理には有用ですが、低レイテンシーの対話型エンドポイントの代替にはなりません。
長文コンテキストの閾値
Gemini と Qwen は一部のモデルでコンテキスト依存の階層を公開しており、Anthropic は長文コンテキストの価格条件を文書化しています。ごく少数の非常に大きなリクエストだけでも、中央値のリクエストが小さい場合であっても、加重平均レートを引き上げる可能性があります。
異なるトークナイザー
あるプロバイダーで 100 万トークンだからといって、別のプロバイダーのトークナイザーでも必ずしも同じ量のソーステキストやコードになるとは限りません。すべてのモデルを 1 つのトークナイザーから推定するのではなく、実際の呼び出しでプロバイダーが報告する使用量を使ってください。
地域とプラットフォームの違い
クラウドマーケットプレイス、地域、データレジデンシー、またはマネージドプラットフォームの価格は、プロバイダーの直接的なグローバル API と異なる場合があります。評価シートでは、各価格の横にエンドポイントと請求主体を必ず記載してください。
実践的な AI API 料金評価ワークフロー
既定モデルを選ぶ前に、次の 7 ステップのプロセスを使ってください。
- 代表的なテストセットを固定する。 日常的なプロンプト、難しいプロンプト、長文コンテキスト、ツール呼び出し、構造化出力、多言語ケース、既知の失敗モードを含めます。
- 正確なモデル ID を固定する。 新しいモデルへ静かに移行される可能性のあるエイリアスをベンチマークしないでください。
- 各候補を同じ合格基準で実行する。 タスク精度、形式の妥当性、安全性、レイテンシー、レビュー担当者の労力を採点します。
- プロバイダー報告の使用量を記録する。 すべての呼び出しについて、入力、キャッシュ入力、出力、再試行、エラーを保存します。
- 正しい価格階層を適用する。 コンテキストの閾値、キャッシュヒット、バッチ、導入期間、地域レートを含めます。
- 合格結果 1 件あたりのコストを計算する。 初回呼び出しの支出だけでなく、フォールバックや再試行の支出も含めます。
- 勝者を本番でカナリアリリースする。 トラフィックを拡大する前に、品質とコストのドリフトを監視します。
マルチモデル製品では、プロバイダーが価格を変更した、新しいモデルをリリースした、プレビューを終了した、またはエイリアスを変更したタイミングごとに、このプロセスを繰り返す必要があります。
統合 AI API ゲートウェイが役立つ場合
直接のプロバイダーアカウントは、1つのベンダーが明確な標準である場合には合理的です。しかし、ある製品で1つのワークフローにOpenAI、別のワークフローにClaude、大量処理の経路にGemini、コスト重視または地域要件のルートにQwenが必要になると、運用負荷は増大します。
統合アクセス層は、1つの認証情報、1つのOpenAI互換エンドポイント、そして対応モデル全体にわたる1つの利用状況ビューを提供することで、統合のオーバーヘッドを削減できます。ただし、プロバイダー固有の機能をテストしたり、最新の料金ルールを確認したりする必要がなくなるわけではありません。
Flatkeyは、このマルチモデルのワークフロー向けに設計されています。現在のモデル料金カタログを確認して候補を比較し、OpenAI互換の統合を使って、プロバイダーごとに個別のクライアントパターンを維持することなくモデルIDを切り替えられます。実装の詳細については、マルチモデルのプロンプトテストワークフローとAI APIコスト追跡ガイドを参照してください。
AI API料金比較チェックリスト
プロバイダーまたはモデルを承認する前に、以下を確認してください。
- [ ] 公式の価格ページと確認日が記録されている。
- [ ] 正確なモデルID、リージョン、エンドポイント、ライフサイクル状態が固定されている。
- [ ] 入力、キャッシュ済み入力、出力の料金が分かれている。
- [ ] コンテキスト長のしきい値が含まれている。
- [ ] 導入時の価格設定に有効期限が見積もりへ反映されている。
- [ ] バッチ前提が製品のレイテンシ要件に一致している。
- [ ] 実際のトークナイザー使用量がテスト呼び出しから取得されている。
- [ ] リトライ、フォールバック、人手レビューのコストが含まれている。
- [ ] 受理された結果あたりのコストが算出されている。
- [ ] 本番カナリアでベンチマーク結果が検証されている。
よくある質問
Gemini APIはOpenAI APIより安いですか?
この2026年7月29日時点の比較における代表的なモデルと標準料金では、Geminiの方が対応するOpenAIの購入帯よりも生のトークン価格が低くなっています。ただし、実運用でより良い価値が得られるかは、タスク品質、出力長、リトライ、レイテンシ、そして受理率によって決まります。
Claude APIはOpenAI APIより高いですか?
選択したモデルによります。このスナップショットでは、Claude Opus 5とGPT-5.6 Solは同じ$5の入力料金ですが、Claude Opus 5の方が出力料金は低くなっています。Claude Sonnet 5の導入時料金はGPT-5.6 Terraを下回りますが、Anthropicは2026年9月1日以降により高いSonnet 5料金を公開しています。
Qwen APIの価格がこれほど安いのはなぜですか?
Alibaba Cloudは、異なるQwenモデルとコンテキスト階層を異なるワークロード向けに位置付けています。最も低いQwen3.7-Flash料金はより短いコンテキストに適用され、より高い階層ほどコストが上がります。低い一覧価格は、品質、レイテンシ、可用性、運用要件と照らして検証する必要があります。
コーディングエージェント向けに最も安いAPIを提供するのはどのプロバイダーですか?
トークン単価だけでは、信頼できる答えはありません。コーディングエージェントは長い会話を生成し、ツールのスキーマを繰り返し、相当量の出力を生成し、場合によっては高額な再試行が発生します。リポジトリの移動、パッチ品質、テスト成功、ツール呼び出しの有効性、人手介入をベンチマークし、そのうえで受け入れられたコーディングタスクあたりのコストを算出してください。
AI APIの価格はどのくらいの頻度で見直すべきですか?
公式価格は少なくとも毎月、そしてベンダーがモデルをリリースしたとき、プレビューを変更したとき、導入期間を発表したとき、またはコンテキストとキャッシュのルールを更新したときに見直してください。大量利用するチームは、価格バージョンのチェックを自動化し、重要な変更があればアラートを出すべきです。
最終推奨
価格表は、最終的なルーティング判断ではなく、候補の絞り込みに使ってください。このスナップショットでは、多くの帯域でQwenとGeminiが生のコスト面で優勢ですが、品質と信頼性によって再試行やレビューが減るワークフローでは、OpenAIとClaudeの高い料金が正当化される場合があります。
持続的に有効な方法はシンプルです。正確なモデルIDでベンチマークを行い、ベンダーが報告するトークン使用量を使い、あらゆる料金ルールを適用し、受け入れられたタスクあたりのコストで最適化します。そのうえで、少なくとも1つ検証済みの代替案を常に用意しておいてください。価格とモデル性能は、多くの本番ロードマップよりも速く変化するからです。



