Jika Anda membandingkan harga Gemini API di tahun 2026, bagian tersulit bukanlah menemukan daftar tarif. Yang lebih sulit adalah menentukan daftar tarif mana yang berlaku untuk beban kerja Anda.
Hasil pencarian kerap mencampur empat produk berbeda: Gemini Developer API, pengalaman pengujian Google AI Studio, Vertex AI atau layanan Google Cloud lainnya, dan langganan Gemini untuk konsumen. Panduan ini berfokus pada Gemini Developer API dan menggunakan halaman harga serta penagihan resmi Google yang dicek pada 27 Juli 2026.
Jawaban singkatnya adalah bahwa biaya Gemini API bergantung pada lima variabel:
- keluarga model yang Anda pilih
- volume token input dan output
- apakah prompt individual melampaui ambang batas konteks panjang
- apakah beban kerja dapat menggunakan harga Batch
- add-on seperti context caching, grounding, audio, gambar, atau video
Artinya, harga token terendah di judul tidak selalu menghasilkan biaya produksi terendah. Perbandingan yang berguna adalah tabel biaya beban kerja dengan asumsi yang sama diterapkan pada setiap model kandidat.
Harga Gemini API sekilas
Tabel di bawah merangkum baris utama Gemini Developer API yang mampu menangani teks dan paling mungkin dibandingkan oleh tim. Harga ditampilkan dalam dolar AS per 1 juta token, berdasarkan halaman resmi harga Gemini Developer API milik Google.
| Model | Status | Input standar | Output standar | Input Batch | Output Batch | Penulisan cache konteks | Penyimpanan cache per jam |
|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | Preview | $0.40 | $2.40 | $0.20 | $1.20 | $0.04 | $1.00 |
| Gemini 3.5 Flash | Preview | $1.50 | $9.00 | $0.75 | $4.50 | $0.15 | $1.00 |
| Gemini 3.5 Flash-Lite | Preview | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 3.1 Flash-Lite | Preview | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 2.5 Pro | Stable | $1.25 hingga 200k; $2.50 di atas 200k | $10.00 hingga 200k; $15.00 di atas 200k | $0.625 hingga 200k; $1.25 di atas 200k | $5.00 hingga 200k; $7.50 di atas 200k | $0.125 hingga 200k; $0.25 di atas 200k | $4.50 |
| Gemini 2.5 Flash | Stable | $0.30 | $2.50 | $0.15 | $1.25 | $0.03 | $1.00 |
| Gemini 2.5 Flash-Lite | Stable | $0.10 | $0.40 | $0.05 | $0.20 | $0.01 | $1.00 |
Untuk Gemini 3.6 Flash, Gemini 3.5 Flash, model pratinjau Flash-Lite, dan keluarga Gemini 2.5 Flash, input audio memiliki tarif lebih tinggi dibanding teks, gambar, atau video. Tabel ini menggunakan tarif input teks, gambar, dan video agar baris model tetap dapat dibandingkan.
Model pratinjau dapat berubah sebelum rilis stabil. Jika kebijakan produksi Anda memerlukan perilaku yang tetap, jendela deprecasi yang lebih panjang, atau pengenal model yang stabil, bandingkan ekonomi model pratinjau dengan baris Gemini 2.5 yang stabil alih-alih memilih semata-mata berdasarkan harga.
Apa yang berubah dalam penyegaran 27 Juli 2026
Perubahan paling penting sejak versi sebelumnya dari panduan ini adalah daftar model saat ini.
- Gemini 3.6 Flash Preview kini muncul sebagai opsi throughput tinggi dengan harga $0.40 input dan $2.40 output per satu juta token.
- Gemini 3.5 Flash-Lite Preview kini muncul dengan harga $0.25 input dan $1.50 output per satu juta token.
- Baris Gemini 3.1 Flash-Lite yang lebih awal masih terlihat, tetapi pembeli sebaiknya memastikan pengenal model preview mana yang ingin mereka operasikan.
- Model stabil Gemini 2.5 tetap menjadi acuan pembanding yang berguna bagi tim yang menghargai prediktabilitas siklus hidup.
Inilah sebabnya halaman harga Gemini memerlukan pemeliharaan terjadwal. Tabel yang benar dapat menjadi menyesatkan secara strategis bahkan ketika setiap angka lama masih secara teknis присутств somewhere dalam katalog.
Tabel biaya beban kerja API Gemini
Tabel di bawah mengubah tarif menjadi estimasi anggaran. Skenario ini bukan tolok ukur kualitas, dan model-modelnya tidak dapat dipertukarkan. Tabel ini menjawab pertanyaan keuangan yang lebih sempit: berapa tagihan token jika beban kerja yang sama dijalankan pada tiap rute?
Asumsi
| Beban kerja | Volume permintaan | Input per permintaan | Output per permintaan | Total input | Total output |
|---|---|---|---|---|---|
| Klasifikasi dan ekstraksi | 1,000 permintaan | 2,000 token | 300 token | 2M token | 0.3M token |
| Asisten dengan retrieval-augmented | 1,000 permintaan | 20,000 token | 1,000 token | 20M token | 1M token |
| Peninjauan dokumen panjang | 100 permintaan | 150,000 token | 5,000 token | 15M token | 0.5M token |
Skenario dokumen panjang menjaga setiap prompt tetap di bawah ambang 200k milik Gemini 2.5 Pro. Grounding, caching, audio, image generation, dan video generation dikecualikan.
Estimasi biaya token tier Standard
| Model | Klasifikasi | Asisten RAG | Peninjauan dokumen panjang |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.95 | $6.50 | $4.50 |
| Gemini 3.6 Flash | $1.52 | $10.40 | $7.20 |
| Gemini 2.5 Flash-Lite | $0.32 | $2.40 | $1.70 |
| Gemini 2.5 Flash | $1.35 | $8.50 | $5.75 |
| Gemini 3.5 Flash | $5.70 | $39.00 | $27.00 |
| Gemini 2.5 Pro | $5.50 | $35.00 | $23.75 |
Total ini menunjukkan mengapa tabel beban kerja lebih berguna daripada daftar model.
- Untuk ekstraksi sempit, baris stabil Gemini 2.5 Flash-Lite memiliki biaya token terendah dalam perbandingan ini.
- Gemini 3.6 Flash lebih mahal daripada rute Lite, tetapi jauh lebih murah daripada Gemini 3.5 Flash dengan asumsi yang sama.
- Pada contoh dokumen panjang, tagihan token Gemini 2.5 Pro lebih rendah daripada Gemini 3.5 Flash karena prompt tetap berada di bawah ambang Pro. Itu tidak membuktikan bahwa itu model yang lebih baik, tetapi mencegah asumsi menyesatkan bahwa setiap beban kerja Pro harus lebih mahal.
- Aplikasi yang banyak output lebih sensitif terhadap pilihan model karena token output lebih mahal daripada token input teks pada setiap baris yang ditampilkan di sini.
Apa yang dilakukan harga Batch pada beban kerja yang sama
Untuk baris yang mendukung Batch API, tarif token Batch yang tercantum Google umumnya setengah dari tarif Standard. Jika setiap permintaan dalam skenario di atas dapat dijalankan secara asinkron, total token yang diperkirakan menjadi:
| Model | Klasifikasi dengan Batch | Asisten RAG dengan Batch | Peninjauan dokumen panjang dengan Batch |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.475 | $3.25 | $2.25 |
| Gemini 3.6 Flash | $0.76 | $5.20 | $3.60 |
| Gemini 2.5 Flash-Lite | $0.16 | $1.20 | $0.85 |
| Gemini 2.5 Flash | $0.675 | $4.25 | $2.875 |
| Gemini 3.5 Flash | $2.85 | $19.50 | $13.50 |
| Gemini 2.5 Pro | $2.75 | $17.50 | $11.875 |
Batch adalah keputusan penagihan dan arsitektur. Ini sangat cocok untuk enrichment offline, run evaluasi, ringkasan malam, backfill dokumen, dan pekerjaan lain yang tidak memerlukan respons segera. Ini bukan pengganti layanan Standard ketika pengguna menunggu dalam alur produk interaktif.
Rumus di balik biaya Gemini API
Untuk beban kerja teks tanpa add-on, gunakan:
monthly cost =
(input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
Jika aplikasi menggunakan context caching, tambahkan biaya penulisan cache dan penyimpanan. Jika menggunakan grounding, audio, gambar yang dihasilkan, atau video yang dihasilkan, hitung baris-baris tersebut secara terpisah karena mereka tidak berbagi satu tarif token universal.
Untuk tinjauan keuangan, simpan asumsi di samping hasilnya:
| Asumsi yang perlu dicatat | Mengapa ini penting |
|---|---|
| Permintaan per bulan | Mengubah perilaku per permintaan menjadi anggaran |
| Token input rata-rata dan p95 | Prompt panjang dapat memicu harga Pro yang lebih tinggi |
| Token output rata-rata dan p95 | Output sering kali menjadi sisi yang lebih mahal |
| Pembagian Standard versus Batch | Pekerjaan asinkron dapat secara material mengurangi pengeluaran token |
| Volume penulisan cache dan waktu retensi | Penggunaan ulang dapat menghemat biaya input, tetapi penyimpanan tidak gratis |
| Permintaan yang di-grounding | Google Search dan Maps memiliki kuota dan biaya terpisah |
| Unit audio, gambar, dan video | Harga berdasarkan modality dapat mendominasi tagihan token teks |
Tier gratis versus tier berbayar Gemini API
Google menampilkan tier gratis untuk beberapa model Gemini Developer API saat ini. Itu membuatnya berguna untuk eksperimen, prototipe, dan validasi dengan volume rendah. Namun, hal itu tidak menghilangkan pertanyaan tentang biaya produksi.
Dokumentasi penagihan Gemini API memisahkan penggunaan gratis dan berbayar serta menjelaskan bagaimana proyek berpindah ke tier berbayar. Tim sebaiknya mengonfirmasi kelayakan saat ini, batas rate, ketentuan penggunaan data, dan ketersediaan model sebelum menganggap prototipe tier gratis yang berhasil sebagai bukti produksi.
Pembedaan praktisnya adalah:
- Gunakan tingkat gratis untuk menguji prompt, perilaku SDK, dan kecocokan produk.
- Gunakan tarif tingkat berbayar dan telemetry token nyata untuk menyetujui anggaran produksi.
- Jangan berasumsi bahwa model pratinjau, kuota gratis, atau batas laju akan tetap tidak berubah hingga peluncuran.
Harga Gemini Pro dan titik batas 200k token
Gemini 2.5 Pro memiliki salah satu ambang harga terpenting di tabel saat ini. Prompt hingga 200k token menggunakan tarif input dan output yang lebih rendah. Prompt di atas 200k menggunakan tarif yang lebih tinggi.
Ambang tersebut berlaku untuk ukuran prompt dari permintaan individual, bukan total bulanan. Tim yang mengirim 20 juta token dalam banyak prompt kecil dapat tetap berada pada tarif lebih rendah, sementara aplikasi konteks panjang dengan volume lebih rendah dapat melewati titik batas ini berulang kali.
Lacak setidaknya dua metrik berikut:
- persentase permintaan di atas 200k token input
- kontribusi biaya dari permintaan tersebut
Jika sebagian kecil prompt berukuran besar mendorong sebagian besar pengeluaran, pertimbangkan chunking, retrieval, ringkasan, penggunaan ulang cache, atau kebijakan routing yang menyisihkan model konteks panjang hanya untuk permintaan yang benar-benar membutuhkannya.
Biaya context caching, grounding, dan modality
Tarif token hanyalah lapisan dasar dari harga Gemini API.
Cache konteks
Tabel resmi mencantumkan harga write cache dan harga penyimpanan per jam. Caching dapat meningkatkan efisiensi biaya ketika konteks besar yang sama digunakan kembali cukup sering, tetapi titik impas bergantung pada volume penulisan, waktu retensi, dan seberapa banyak input berulang yang digantikan oleh cache.
Google Search dan Maps grounding
Grounding mencakup alokasi gratis spesifik model yang diikuti oleh biaya per kueri atau per prompt. Jangan memperkirakan aplikasi yang di-ground hanya dari tarif token. Catat jumlah permintaan yang di-ground dan rekonsiliasikan sebagai item terpisah.
Audio live
Audio Live API menggunakan tarif input dan output yang berbeda dari panggilan teks biasa. Tim agen suara harus menganggarkan token audio secara terpisah dan memasukkan durasi sesi, perilaku interupsi, dan tingkat verbose respons dalam uji beban.
Generasi gambar dan video
Gambar dan video yang dihasilkan dihargai menggunakan unit dan baris model yang spesifik untuk modality. Perlakukan ini sebagai anggaran produksi yang terpisah, bukan sebagai perluasan dari estimasi model teks.
Gemini Developer API versus Vertex AI dan paket konsumen
Frasa "harga Gemini" dapat merujuk pada beberapa jalur pembelian.
| Produk | Pertanyaan umum pembeli | Mengapa ini tidak boleh dicampur ke dalam tabel ini |
|---|---|---|
| Gemini Developer API | Berapa biaya panggilan aplikasi? | Ini adalah daftar tarif yang dirangkum dalam panduan ini |
| Google AI Studio | Apakah saya bisa membuat prototipe dan mendapatkan kunci API? | Ini adalah permukaan pengembangan, bukan daftar tarif produksi universal yang terpisah |
| Vertex AI | Bagaimana saya menjalankan Gemini di dalam Google Cloud? | Ketentuan komersial, kontrol, dan opsi layanan dapat berbeda |
| Paket Gemini konsumen | Apa saja yang termasuk dalam langganan individu? | Harga langganan bukan harga token API |
| Gemini Enterprise atau Agent Platform | Berapa biaya produk enterprise yang lebih luas? | Ini adalah cakupan produk yang berbeda dari panggilan Developer API |
Saat membandingkan vendor atau gateway, gunakan jalur pembelian yang sama di kedua sisi. Membandingkan langganan konsumen dengan token API, atau layanan cloud terkelola dengan API pengembang, menghasilkan kesimpulan yang tampak rapi tetapi tidak dapat digunakan.
Kapan akses langsung ke Google sudah cukup
Akses Gemini langsung sering kali menjadi pilihan paling sederhana ketika:
- Gemini adalah satu-satunya keluarga model yang digunakan di produksi.
- Tim nyaman dengan penagihan Google dan struktur akun.
- Engineering tidak memerlukan failover lintas penyedia atau abstraksi rute.
- Bagian keuangan dapat meninjau penggunaan tanpa mengonsolidasikan vendor AI lain.
Gateway API AI menjadi lebih berguna ketika masalah operasional meluas melampaui satu penyedia:
- produk menggunakan Gemini, GPT, Claude, atau keluarga model lainnya
- engineering menginginkan satu permukaan kredensial dan perutean model terpusat
- bagian keuangan menginginkan saldo, faktur, atau tinjauan penggunaan yang terkonsolidasi
- operasi membutuhkan metering tingkat model dan kontrol kebijakan bersama
- tim ingin mengubah rute tanpa membangun ulang setiap integrasi
Gateway tidak menghilangkan kebutuhan untuk memahami harga model yang mendasarinya. Gateway mengubah cara akses, perutean, pengadaan, dan pelaporan dikelola di sekitar harga tersebut.
Flatkey menyediakan satu lapisan akses API untuk beberapa keluarga model. Tinjau halaman harga Flatkey terkini untuk model komersialnya, lalu bandingkan lanskap model yang lebih luas di perbandingan harga model AI.
Daftar periksa pembaruan harga Gemini yang berulang
Halaman harga harus memiliki penanggung jawab peninjauan sumber yang ditetapkan dan slot pembaruan berkala. Untuk kueri dengan permintaan tinggi seperti harga Gemini API, peninjauan bulanan adalah default yang masuk akal, dengan peninjauan segera setelah pengumuman model besar dari Google.
Gunakan daftar periksa ini:
- Bandingkan urutan model dan label siklus hidup di halaman harga resmi Google.
- Catat pengenal model baru yang berstatus preview, stabil, deprecated, dan dihapus.
- Verifikasi tarif Standard, Batch, cache-write, dan cache-storage secara terpisah.
- Periksa kembali ambang batas panjang prompt dan apakah itu memengaruhi input, output, atau keduanya.
- Verifikasi ketersediaan free-tier dan bahasa tier penagihan.
- Hitung ulang setiap contoh beban kerja berdasarkan asumsi yang dipublikasikan.
- Periksa bagian grounding, Live API, gambar, dan video untuk perubahan harga yang terpisah.
- Pastikan tautan internal, klaim produk, dan CTA harga publik tetap akurat.
- Perbarui tanggal "diperiksa pada" yang terlihat hanya setelah peninjauan sumber selesai.
Tujuannya bukan untuk menjanjikan bahwa artikel harga tidak akan pernah menjadi usang. Tujuannya adalah membuat setiap angka dapat dilacak, setiap skenario dapat direproduksi, dan setiap pembaruan cukup cepat untuk menjaga halaman tetap berguna.
Keputusan pembelian
Mulailah dengan bentuk beban kerja, bukan nama model.
- Pilih rute berbiaya terendah yang memenuhi kebutuhan kualitas dan latensi tugas.
- Gunakan Batch untuk pekerjaan asinkron yang memenuhi syarat.
- Perhatikan token output dan titik patah konteks panjang.
- Anggarkan caching, grounding, audio, gambar, dan video secara terpisah.
- Tinjau kembali arsitektur akses ketika Gemini bukan lagi satu-satunya penyedia di stack.
Proses itu mengubah harga Gemini API dari tabel statis menjadi keputusan operasional yang dapat diulang.



