Sign inContact usStart free
Cost, Billing, and OpsJuly 29, 2026Flatkey Team

Perbandingan Harga API AI: OpenAI vs Claude vs Gemini vs Qwen (2026)

Bandingkan harga API OpenAI, Claude, Gemini, dan Qwen saat ini menggunakan beban kerja produksi yang dinormalisasi serta biaya per hasil yang diterima.

Perbandingan Harga API AI: OpenAI vs Claude vs Gemini vs Qwen (2026)

Harga API AI sulit dibandingkan karena tarif token input termurah hampir tidak pernah menghasilkan alur kerja produksi yang paling murah. Token output bisa berharga beberapa kali lipat lebih mahal daripada input, prompt yang di-cache dapat mengubah tagihan, tier panjang konteks mungkin berlaku, dan model dengan harga lebih rendah bisa memerlukan lebih banyak percobaan ulang atau koreksi manusia.

Panduan ini membandingkan harga daftar publik saat ini untuk model teks representatif dari OpenAI, Anthropic Claude, Google Gemini, dan Alibaba Qwen. Panduan ini juga mengonversi tarif tersebut ke satu beban kerja yang dinormalisasi agar Anda bisa memperkirakan anggaran nyata, bukan sekadar memilih dari tabel harga per satu juta token.

Pemeriksaan harga: Tarif diperiksa terhadap halaman resmi penyedia pada 29 Juli 2026. Harga dinyatakan dalam dolar AS per 1 juta token kecuali dinyatakan lain. Penyedia dapat mengubah nama model, status pratinjau, ketersediaan regional, ambang konteks, diskon, dan harga. Konfirmasikan halaman resmi yang ditautkan sebelum membuat keputusan pembelian untuk produksi.

Jawaban cepat: API AI mana yang paling murah?

Untuk biaya token mentah, model berbiaya lebih rendah dari Qwen adalah opsi yang paling murah dalam perbandingan ini. Gemini juga sangat kompetitif dari sisi harga, terutama dalam keluarga Flash dan Flash-Lite. OpenAI dan Claude umumnya memiliki harga daftar yang lebih tinggi, tetapi model mereka masih bisa memiliki biaya per tugas berhasil paling rendah ketika mengurangi percobaan ulang, kesalahan alat, waktu peninjauan, atau lalu lintas fallback untuk beban kerja tertentu.

Tidak ada pemenang universal:

  • Pilih berdasarkan kualitas tugas terlebih dahulu: Uji prompt, alat, skema, bahasa, dan kasus tepi Anda sendiri.
  • Pisahkan input dan output model: Pembuatan yang berat di output dapat menghasilkan peringkat yang sangat berbeda dari klasifikasi atau ekstraksi.
  • Masukkan biaya kegagalan: Percobaan ulang, panggilan fallback, peninjauan manusia, dan kesalahan yang terlihat oleh pelanggan semuanya memengaruhi harga efektif.
  • Periksa ulang diskon dan ambang batas: Caching, batch, panjang konteks, endpoint regional, dan harga perkenalan dapat secara material mengubah totalnya.

Tabel perbandingan harga API AI

Tabel berikut mengelompokkan model representatif ke dalam band flagship, seimbang, dan hemat. Ini adalah band pembelian, bukan klaim tentang kualitas atau kemampuan yang setara.

Penyedia Model Band perbandingan Input / 1M token Output / 1M token Catatan harga penting
OpenAI GPT-5.6 Sol Flagship $5.00 $30.00 Harga daftar standar untuk token teks
Anthropic Claude Opus 5 Flagship $5.00 $25.00 Harga standar untuk prompt dan completion
Google Gemini 3.1 Pro Preview Flagship $2.00 $12.00 Tarif yang ditampilkan untuk prompt hingga 200K token; tier konteks panjang yang lebih tinggi berlaku di atas ambang tersebut
Alibaba Cloud Qwen3.7-Max Flagship $2.50 $7.50 Deployment global, hingga tier konteks 256K token
OpenAI GPT-5.6 Terra Balanced $2.50 $15.00 Harga daftar standar untuk token teks
Anthropic Claude Sonnet 5 Balanced $2.00 $10.00 Harga perkenalan hingga 31 Agustus 2026; $3.00 untuk input dan $15.00 untuk output mulai 1 September 2026
Google Gemini 3.6 Flash Balanced $1.50 $7.50 Tier berbayar standar; Batch dicantumkan secara terpisah
Alibaba Cloud Qwen3.7-Plus Balanced $0.40 $1.60 Deployment global, hingga tier konteks 256K token
OpenAI GPT-5.6 Luna Budget $1.00 $6.00 Harga daftar standar untuk token teks
Anthropic Claude Haiku 4.5 Budget $1.00 $5.00 Harga standar untuk prompt dan completion
Google Gemini 3.5 Flash-Lite Budget $0.30 $2.50 Tier berbayar standar; harga Batch yang lebih rendah dicantumkan secara terpisah
Alibaba Cloud Qwen3.7-Flash Budget $0.03 $0.13 Tarif deployment global yang ditampilkan untuk permintaan hingga 32K token; tier konteks yang lebih tinggi biayanya lebih mahal

Sumber resmi: harga API OpenAI, harga Claude Anthropic, harga Gemini API, dan harga Alibaba Cloud Model Studio.

Biaya beban kerja ternormalisasi: 1.000 pekerjaan produksi

Tarif token statis menjadi lebih berguna setelah Anda menerapkan bentuk permintaan yang sama ke setiap kandidat. Misalkan sebuah beban kerja memproses:

  • 1.000 pekerjaan selesai
  • 20.000 token input per pekerjaan
  • 2.000 token output per pekerjaan
  • tanpa diskon cached-input atau batch
  • tanpa retry atau panggilan fallback

Itu setara dengan 20 juta token input dan 2 juta token output.

Rumusnya adalah:

biaya beban kerja = (token input / 1.000.000 × tarif input)
                   + (token output / 1.000.000 × tarif output)

Estimasi band flagship

Model Biaya input Biaya output Total untuk 1.000 pekerjaan
GPT-5.6 Sol $100.00 $60.00 $160.00
Claude Opus 5 $100.00 $50.00 $150.00
Gemini 3.1 Pro Preview $40.00 $24.00 $64.00
Qwen3.7-Max $50.00 $15.00 $65.00

Perkiraan rentang seimbang

Model Biaya input Biaya output Total untuk 1.000 pekerjaan
GPT-5.6 Terra $50.00 $30.00 $80.00
Claude Sonnet 5, tarif pengenalan $40.00 $20.00 $60.00
Gemini 3.6 Flash $30.00 $15.00 $45.00
Qwen3.7-Plus $8.00 $3.20 $11.20

Beban kerja yang sama pada Claude Sonnet 5 menjadi $90.00 pada tarif yang dipublikasikan 1 September 2026: $60.00 input ditambah $30.00 output.

Perkiraan rentang anggaran

Model Biaya input Biaya output Total untuk 1.000 pekerjaan
GPT-5.6 Luna $20.00 $12.00 $32.00
Claude Haiku 4.5 $20.00 $10.00 $30.00
Gemini 3.5 Flash-Lite $6.00 $5.00 $11.00
Qwen3.7-Flash $0.60 $0.26 $0.86

Total ini adalah perbandingan aritmetika, bukan peringkat performa. Model yang biayanya $11 per seribu pekerjaan tidak lebih murah dalam praktik jika hanya 70% hasilnya diterima sementara model seharga $30 mencapai tingkat penerimaan 98%.

Bandingkan biaya per tugas yang berhasil, bukan hanya biaya token

Metrik produksi yang lebih baik adalah biaya per hasil yang diterima:

biaya per hasil yang diterima = total pengeluaran model / hasil yang diterima

Misalkan dua kandidat masing-masing memproses 1.000 pekerjaan:

Kandidat Pengeluaran model Hasil yang diterima Biaya per hasil yang diterima
Model harga daftar lebih rendah $20 700 $0.0286
Model harga daftar lebih tinggi $30 980 $0.0306

Model dengan harga lebih rendah masih menang tipis dalam contoh ini, tetapi selisihnya jauh lebih kecil daripada yang disiratkan oleh perbedaan harga daftar. Tambahkan waktu engineering, eskalasi pelanggan, atau fallback berbayar untuk 300 hasil yang ditolak, dan peringkatnya mungkin berbalik.

Untuk setiap model, catat setidaknya:

  1. Tingkat penerimaan: Persentase output yang lolos dari gerbang kualitas otomatis dan manusia Anda.
  2. Tingkat retry: Seberapa sering model yang sama harus dipanggil lagi.
  3. Tingkat fallback: Seberapa sering trafik berpindah ke model yang lebih mahal.
  4. Panjang output rata-rata: Model yang sangat verbose dapat menghasilkan tagihan yang lebih besar bahkan ketika tarif input rendah.
  5. Latensi pada persentil target: Model murah yang gagal memenuhi SLA produk Anda mungkin tidak dapat digunakan.
  6. Keandalan tool dan skema: Output terstruktur yang tidak valid atau panggilan tool yang gagal menciptakan biaya tersembunyi.
  7. Menit tinjauan manusia: Koreksi manual dapat mendominasi pengeluaran token dalam alur kerja bisnis.

Cara kerja harga API OpenAI

OpenAI memisahkan harga input yang tidak di-cache, input yang di-cache, dan output, serta mencantumkan opsi pemrosesan tambahan seperti Batch dan Flex untuk model yang didukung. Tarif output jauh lebih tinggi daripada tarif input pada model-model di atas, sehingga kontrol panjang respons menjadi penting.

OpenAI dapat menjadi pilihan yang kuat ketika aplikasi Anda sudah dibangun di sekitar API-nya dan model yang dipilih berkinerja andal pada set evaluasi Anda. Bagi tim yang berfokus pada OpenAI, integrasi langsung bisa sederhana secara operasional. Bagi tim yang terus menguji penyedia lain, biaya untuk memelihara klien, kredensial, batasan, dan pelaporan terpisah menjadi bagian dari perbandingan.

Cara kerja harga API Claude

Anthropic menetapkan harga permintaan Claude standar berdasarkan token input dan output serta menerbitkan aturan terpisah untuk prompt caching, permintaan long-context, dan pemrosesan batch. Periode pengenalan Claude Sonnet 5 sangat penting untuk perencanaan anggaran: pilot yang diluncurkan pada Agustus 2026 tidak boleh mengekstrapolasi tarif pengenalan ke bulan September tanpa penyesuaian.

Harga Claude harus dievaluasi bersama perilaku long-context, penggunaan tool, kualitas kode, dan jumlah tinjauan yang dibutuhkan suatu alur kerja. Untuk coding agent dan tugas bisnis yang kompleks, tarif token yang lebih tinggi bisa jadi ekonomis jika model menyelesaikan lebih banyak tugas tanpa intervensi.

Cara kerja harga API Gemini

Google mencantumkan tier API Gemini gratis dan berbayar, tarif input dan output khusus model, serta tarif Batch terpisah untuk model yang didukung. Beberapa model Gemini juga menetapkan harga prompt secara berbeda saat konteks melampaui ambang batas, jadi ukuran prompt rata-rata saja tidak cukup—Anda perlu distribusi ukuran permintaan.

Lini Flash dan Flash-Lite Gemini menarik untuk beban kerja bervolume tinggi, sementara model Pro menargetkan tugas yang lebih sulit. Label preview juga penting: tim produksi harus memverifikasi status siklus hidup, batasan, dan rencana migrasi selain harga.

Cara kerja harga API Qwen

Alibaba Cloud Model Studio mencantumkan harga Qwen untuk deployment global dengan tier panjang konteks untuk beberapa model. Qwen3.7-Flash sangat murah untuk permintaan pendek dalam tabel yang dipublikasikan, tetapi tarifnya naik pada jendela konteks yang lebih besar. Karena itu, region, mode deployment, dan model ID yang دقیق harus dicatat dalam setiap benchmark.

Qwen menarik bagi routing yang sensitif terhadap biaya, aplikasi multibahasa, dan tim yang menginginkan kandidat penyedia tambahan. Seperti halnya setiap keluarga model, uji kualitas, keamanan, latensi, perilaku alat, dan ketersediaan regional sebelum merutekan traffic produksi.

Cached input, Batch, dan tingkatan konteks dapat mengubah pemenangnya

Perbandingan utama ini secara sengaja menggunakan tarif sinkron standar tanpa cache. Beban kerja nyata mungkin membayar lebih murah—atau kadang lebih mahal—karena variabel-variabel berikut:

Cached input

System prompt yang besar dan berulang, definisi alat, kebijakan, dan prefiks dokumen dapat memenuhi syarat untuk harga cached-input. Ukur tingkat cache-hit yang sebenarnya alih-alih mengasumsikan setiap token berulang mendapat diskon.

Pemrosesan batch

OpenAI, Anthropic, dan Google mempublikasikan opsi asinkron atau batch dengan diskon untuk use case yang didukung. Batch dapat bermanfaat untuk evaluasi, enrichment, klasifikasi offline, dan pemrosesan dokumen malam hari, tetapi bukan pengganti endpoint interaktif berlatensi rendah.

Ambang konteks panjang

Gemini dan Qwen mempublikasikan tingkatan yang bergantung pada konteks untuk beberapa model, dan Anthropic mendokumentasikan kondisi harga konteks panjang. Beberapa permintaan yang sangat besar dapat menaikkan tarif gabungan meskipun permintaan median kecil.

Tokenizer yang berbeda

Satu juta token dari satu penyedia belum tentu setara dengan jumlah teks sumber atau kode yang sama pada tokenizer penyedia lain. Gunakan penggunaan yang dilaporkan penyedia dari panggilan aktual alih-alih memperkirakan setiap model dari satu tokenizer.

Perbedaan regional dan platform

Harga cloud marketplace, regional, data-residency, atau platform terkelola dapat berbeda dari API global langsung milik penyedia. Cantumkan endpoint dan entitas penagihan di samping setiap harga dalam lembar evaluasi Anda.

Alur kerja evaluasi harga API AI yang praktis

Gunakan proses tujuh langkah ini sebelum memilih model default:

  1. Kunci set pengujian yang representatif. Sertakan prompt rutin, prompt sulit, konteks panjang, panggilan alat, output terstruktur, kasus multibahasa, dan mode kegagalan yang diketahui.
  2. Kunci model ID yang tepat. Jangan benchmark alias yang dapat berpindah diam-diam ke model yang lebih baru.
  3. Jalankan setiap kandidat dengan rubrik penerimaan yang sama. Nilai akurasi tugas, validitas format, keamanan, latensi, dan upaya reviewer.
  4. Catat penggunaan yang dilaporkan penyedia. Simpan input, cached input, output, retry, dan error untuk setiap panggilan.
  5. Terapkan tingkatan harga yang benar. Sertakan ambang konteks, cache hit, batch, periode pengenalan, dan tarif regional.
  6. Hitung biaya per hasil yang diterima. Sertakan biaya fallback dan retry, bukan hanya biaya panggilan pertama.
  7. Lakukan canary pada pemenang di produksi. Pantau kualitas dan pergeseran biaya sebelum memperluas traffic.

Produk multi-model harus mengulangi proses ini setiap kali penyedia mengubah harga, merilis model baru, menghentikan preview, atau memodifikasi alias.

Kapan unified AI API gateway membantu

Akun penyedia langsung masuk akal ketika satu vendor menjadi standar yang jelas. Beban operasional meningkat ketika suatu produk membutuhkan OpenAI untuk satu alur kerja, Claude untuk alur lain, Gemini untuk jalur dengan volume tinggi, dan Qwen untuk rute yang sensitif biaya atau regional.

Lapisan akses terpadu dapat mengurangi overhead integrasi dengan menyediakan satu kredensial, satu endpoint yang kompatibel dengan OpenAI, dan satu tampilan penggunaan di seluruh model yang didukung. Ini tidak menghilangkan kebutuhan untuk menguji kemampuan khusus penyedia atau membaca aturan harga terkini.

Flatkey dirancang untuk alur kerja multi-model ini. Anda dapat meninjau katalog harga model terkini, membandingkan kandidat, dan menggunakan integrasi yang kompatibel dengan OpenAI untuk mengganti ID model tanpa mempertahankan pola klien terpisah untuk setiap penyedia. Untuk detail implementasi, lihat alur kerja pengujian prompt multi-model dan panduan pelacakan biaya API AI.

Daftar periksa perbandingan harga API AI

Sebelum menyetujui penyedia atau model, pastikan:

  • [ ] Halaman harga resmi dan tanggal pengecekan dicatat.
  • [ ] ID model, wilayah, endpoint, dan status siklus hidup yang tepat ditetapkan.
  • [ ] Tarif input, input cache, dan output dipisahkan.
  • [ ] Ambang batas panjang konteks disertakan.
  • [ ] Harga perkenalan memiliki tanggal kedaluwarsa dalam proyeksi.
  • [ ] Asumsi batch sesuai dengan kebutuhan latensi produk.
  • [ ] Penggunaan tokenizer yang sebenarnya berasal dari panggilan uji.
  • [ ] Biaya retry, fallback, dan tinjauan manusia disertakan.
  • [ ] Biaya per hasil yang diterima dihitung.
  • [ ] Canary produksi memverifikasi hasil benchmark.

Pertanyaan yang sering diajukan

Apakah Gemini API lebih murah daripada OpenAI API?

Untuk model representatif dan tarif standar dalam perbandingan 29 Juli 2026 ini, Gemini memiliki harga token mentah yang lebih rendah daripada rentang pembelian OpenAI yang sesuai. Nilai produksi yang lebih baik tetap bergantung pada kualitas tugas, panjang output, retry, latensi, dan tingkat hasil yang diterima.

Apakah Claude API lebih mahal daripada OpenAI API?

Tergantung pada model yang dipilih. Claude Opus 5 dan GPT-5.6 Sol memiliki tarif input $5 yang sama dalam snapshot ini, sementara Claude Opus 5 memiliki tarif output yang lebih rendah. Tarif perkenalan Claude Sonnet 5 berada di bawah GPT-5.6 Terra, tetapi Anthropic menerbitkan tarif Sonnet 5 yang lebih tinggi mulai 1 September 2026.

Mengapa harga Qwen API begitu rendah?

Alibaba Cloud memposisikan berbagai model Qwen dan tingkat konteks untuk beban kerja yang berbeda. Tarif Qwen3.7-Flash terendah berlaku untuk konteks yang lebih pendek, dan tier yang lebih tinggi biayanya lebih mahal. Harga daftar yang rendah harus divalidasi terhadap kualitas, latensi, ketersediaan, dan persyaratan operasional.

Penyedia mana yang menawarkan API termurah untuk coding agents?

Tidak ada jawaban yang andal hanya dari tarif token. Agen coding menghasilkan percakapan yang panjang, mengulang skema alat, menghasilkan output yang besar, dan dapat menimbulkan retry yang mahal. Ukur navigasi repositori, kualitas patch, keberhasilan pengujian, validitas panggilan alat, dan intervensi manusia, lalu hitung biaya per tugas coding yang diterima.

Seberapa sering harga API AI harus ditinjau?

Tinjau harga resmi setidaknya setiap bulan dan setiap kali penyedia meluncurkan model, mengubah pratinjau, mengumumkan periode pengenalan, atau memperbarui aturan konteks dan caching. Tim dengan volume tinggi sebaiknya mengotomatiskan pemeriksaan versi harga dan memberi peringatan saat terjadi perubahan material.

Rekomendasi akhir

Gunakan tabel harga untuk membuat daftar pendek, bukan keputusan routing akhir. Qwen dan Gemini memimpin pada biaya mentah di banyak band dalam snapshot ini, sementara OpenAI dan Claude mungkin layak dengan tarif lebih tinggi pada alur kerja di mana kualitas dan keandalan mengurangi retry atau peninjauan.

Metode yang tahan lama itu sederhana: benchmark ID model yang tepat, gunakan penggunaan token yang dilaporkan penyedia, terapkan setiap aturan harga, dan optimalkan untuk biaya per tugas yang diterima. Lalu siapkan setidaknya satu alternatif yang sudah tervalidasi, karena harga dan performa model berubah lebih cepat daripada kebanyakan roadmap produksi.