Jika kendala utama Anda adalah pengeluaran API, keputusan DeepSeek API vs Qwen API sudah tidak lagi cukup dekat untuk ditentukan hanya dari ingatan. Kedua penyedia telah mengubah lini model berbiaya rendah mereka, dan jalur termurah bergantung pada empat hal: input tanpa cache, input dengan cache, volume output, dan apakah beban kerja Anda dapat menggunakan batch inference.
Panduan ini telah diperiksa terhadap harga dari pihak pertama dan dokumentasi siklus hidup model pada Selasa, 28 Juli 2026. Jawaban singkatnya adalah:
- Qwen Flash memiliki harga daftar mentah yang lebih rendah untuk sebagian besar beban kerja teks tanpa cache, dengan cache, dan batch.
- DeepSeek V4 Flash menawarkan tingkat cache-hit yang sangat rendah dan endpoint langsung global yang lebih sederhana, tetapi tingkat cache-miss dan outputnya yang lebih tinggi berarti Anda memerlukan campuran permintaan yang sangat berat pada cache sebelum keunggulan itu mengubah tagihan.
- DeepSeek V4 Pro dapat menjadi kandidat reasoning yang berfokus pada biaya dibandingkan tier Qwen yang harganya lebih tinggi, tetapi kualitas model tidak dapat dipertukarkan. Uji biaya per tugas yang berhasil, bukan token saja.
- Jangan memulai workflow baru di Qwen Turbo. Alibaba Cloud mencantumkan tanggal penghentian pada 30 November 2026 dan merekomendasikan Qwen Flash sebagai penggantinya.
DeepSeek vs Qwen: keputusan biaya berdasarkan workflow
| Workflow | Default berfokus biaya | Alasannya | Verifikasi sebelum produksi |
|---|---|---|---|
| Chat singkat atau ekstraksi | Qwen Flash | Harga daftar input dan output lebih rendah | Region, snapshot model yang tepat, batas kualitas |
| Evaluasi offline volume tinggi | Batch inference Qwen | Model yang memenuhi syarat mendapat diskon 50% untuk input dan output | Model dan region yang tepat mendukung batch |
| Context panjang yang berulang | Qwen Flash dalam sebagian besar kasus | Harga dasar Qwen yang lebih rendah mengimbangi diskon cache DeepSeek pada tingkat hit yang umum | Ukur tingkat cache-hit dan pembuatan/penyimpanan cache |
| Input yang sangat berat pada cache | Hitung keduanya | Input cached DeepSeek murah, tetapi miss dan output-nya lebih mahal | Rasio token, tingkat hit, volume output |
| Tugas berat reasoning | Uji DeepSeek V4 Pro dan tier Qwen yang relevan | DeepSeek Pro memiliki harga output yang dipublikasikan lebih rendah daripada Qwen 3.7 Plus | Akurasi, retry, penggunaan alat, latensi |
| Setup direct-provider tercepat | DeepSeek | Satu base URL global kompatibel OpenAI yang terdokumentasi | Persyaratan data-region dan procurement |
| Sering berganti model | Gateway dan log bersama | Biaya perpindahan operasional dapat menghapus penghematan token | Routing, saldo, observability, rollback |
Ini adalah perbandingan biaya, bukan pemeringkatan model universal. Model yang membutuhkan retry lebih banyak, prompt lebih panjang, atau koreksi manusia dapat kalah meskipun harga tokennya lebih rendah.
Harga API DeepSeek saat ini
Halaman harga DeepSeek, diperbarui 28 Juli, mencantumkan dua model teks V4. Harga dihitung per satu juta token.
| Model | Input cache-hit | Input cache-miss | Output | Kontext | Output maks. |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
DeepSeek mendokumentasikan caching konteks otomatis dan menampilkan harga terpisah untuk hit dan miss. DeepSeek juga menyediakan endpoint yang kompatibel dengan OpenAI di https://api.deepseek.com dan endpoint yang kompatibel dengan Anthropic di https://api.deepseek.com/anthropic.
Angka yang paling mencolok adalah harga cache-hit V4 Flash: hanya 2% dari tarif cache-miss. Namun diskon itu tidak boleh dievaluasi secara terpisah. Sebuah miss tetap berbiaya lebih dari enam kali tarif input standar tingkat pertama Qwen Flash, dan output DeepSeek V4 Flash juga lebih mahal.
Harga API Qwen saat ini
Alibaba Cloud Model Studio mencantumkan harga Qwen berdasarkan model, panjang input, mode output, dan region deployment. Untuk deployment global dengan input hingga 128K token, baris berbiaya rendah yang relevan adalah:
| Model | Input standar | Output | Cache hit implisit | Cache hit eksplisit | Diskon batch |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
20% dari harga input standar | 10% dari harga input standar | 50% untuk job batch yang didukung |
Untuk mode deployment Singapura, halaman yang sama mencantumkan qwen-flash dengan $0.05 untuk input dan $0.40 untuk output untuk prompt hingga 128K. Perbedaan regional ini adalah alasan mengapa proyeksi Qwen yang valid harus mencatat mode deployment dan endpoint, bukan menyalin satu angka utama saja.
Caching Qwen juga memerlukan pemodelan yang presisi:
- Cache hit implisit ditagihkan sebesar 20% dari harga input standar.
- Cache hit eksplisit ditagihkan sebesar 10% dari harga input standar.
- Pembuatan cache eksplisit ditagihkan sebesar 125% dari harga input standar dan penyimpanan cache ditagihkan terpisah.
- Inferensi batch memberi model yang memenuhi syarat diskon 50% untuk input dan output, tetapi jangan berasumsi diskonnya dapat ditumpuk kecuali penyedia mendokumentasikan kombinasi itu untuk model dan region Anda.
Alibaba Cloud juga menyebutkan bahwa qwen-flash adalah alias bergulir. Kunci model ID bertanggal saat reproduktibilitas penting, lalu jadwalkan pengujian migrasi sebelum snapshot tersebut dipensiunkan.
Tiga perhitungan workload
Rumus di bawah menggunakan harga daftar publik, bukan promosi sementara atau kontrak yang dinegosiasikan. Rumus ini hanya membandingkan biaya token dari penyedia langsung dan tidak mencakup pajak, biaya jaringan, penyimpanan cache, maupun tenaga rekayasa.
Skenario 1: chat singkat tanpa cache
Asumsi:
- 10.000 permintaan
- 1.000 token input per permintaan
- 500 token output per permintaan
- Tidak ada cache hit
- Tingkat harga pertama global Qwen
qwen3.5-flash
| Rute | Perhitungan input | Perhitungan output | Perkiraan total |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
Untuk bentuk permintaan ini, biaya Qwen sekitar 54% lebih rendah pada harga daftar yang dipublikasikan. Hasilnya bisa berubah jika Anda menggunakan region Qwen yang berbeda, melampaui tier input pertama, atau memerlukan cukup banyak retry untuk menghapus keunggulan token.
Scenario 2: repeated long context with 90% cache hits
Asumsi:
- 10.000 permintaan
- 10.000 token input per permintaan
- 1.000 token output per permintaan
- 90% token input ditagihkan pada tarif cache-hit
- Qwen menggunakan caching implisit
| Rute | Input cache-miss | Input cache-hit | Output | Perkiraan total |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
DeepSeek memiliki tingkat cache-hit yang lebih rendah, tetapi Qwen tetap unggul dalam skenario 90%-hit ini karena harga miss dan output Qwen lebih rendah.
Untuk input saja, DeepSeek V4 Flash menjadi lebih murah daripada campuran cache implisit Qwen hanya ketika porsi cache-hit kira-kira 98,7% atau lebih tinggi. Setelah token output disertakan, tingkat hit yang diperlukan bahkan lebih tinggi. Dengan caching eksplisit Qwen, harga hit itu sendiri lebih rendah daripada DeepSeek, meskipun biaya pembuatan dan penyimpanan harus disertakan.
Scenario 3: offline batch processing
Asumsi:
- 100 juta token input
- 20 juta token output
- Model dan region Qwen memenuhi syarat untuk diskon batch 50% yang dipublikasikan
- DeepSeek dihitung pada harga daftar sinkron standar karena halaman harganya tidak mempublikasikan diskon batch setara
| Rute | Perhitungan | Perkiraan total |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash batch | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
Untuk evaluasi, labeling, peringkasan, atau pekerjaan data sintetis yang toleran terhadap keterlambatan, kelayakan batch bisa lebih penting daripada perbedaan cache yang kecil. Pastikan model, mode deployment, dan jenis pekerjaan Anda yang tepat memenuhi syarat sebelum menyetujui proyeksi.
A better break-even formula
Gunakan lembar kerja ini alih-alih membandingkan satu sel harga token:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
Lalu hitung biaya per tugas yang berhasil:
successful_task_cost = monthly_cost / accepted_outputs
Angka kedua ini menangkap biaya operasional yang tidak terlihat di tabel token. Jika rute yang lebih murah menghasilkan lebih banyak JSON tidak valid, kegagalan tool-call, jejak penalaran yang panjang, atau peninjauan manual, biaya riilnya bisa lebih tinggi.
Perbedaan operasional yang memengaruhi total biaya
Desain region dan endpoint
DeepSeek mendokumentasikan satu endpoint langsung global. Qwen menggunakan endpoint Alibaba Cloud Model Studio yang terkait dengan mode deployment dan region. Konfigurasi regional dapat meningkatkan governance, tetapi juga memengaruhi ketersediaan model, baris harga, kredensial, dan desain failover.
Catat field berikut di setiap persetujuan:
- Provider dan ID model yang tepat
- Region atau mode deployment
- Base URL
- Tier panjang input
- Mode output thinking atau non-thinking
- Metode cache
- Kelayakan batch
- Tanggal pengecekan harga
Siklus hidup model
Qwen Turbo dijadwalkan pensiun pada 30 November 2026, dan Alibaba Cloud merekomendasikan Qwen Flash sebagai penggantinya. Sistem baru tidak boleh menganggap nama Turbo yang familier atau baris output non-thinking yang lebih rendah sebagai rencana penghematan yang berkelanjutan.
Alias yang bergulir berguna untuk eksperimen, tetapi menimbulkan risiko perubahan diam-diam. Sematkan versi bertanggal di production, pertahankan set evaluasi kecil, dan uji versi berikutnya sebelum pensiun.
Kualitas dan anggaran retry
Jangan membandingkan DeepSeek V4 Flash dan Qwen Flash seolah-olah hasilnya identik. Evaluasi setiap rute pada tugas sebenarnya: akurasi ekstraksi, tingkat lolos pengujian kode, penyelesaian tool-call, validitas structured output, latensi, dan penerimaan manusia.
Gate routing yang praktis adalah:
- Tolak model di bawah batas kualitas minimum.
- Bandingkan biaya per output yang diterima di antara model yang lolos.
- Tambahkan biaya retry dan fallback.
- Canary rute yang lebih murah dengan ambang rollback.
- Hitung ulang setelah minggu pertama traffic production.
Untuk harness pengujian yang dapat diulang, gunakan workflow pengujian prompt multi-model. Untuk konteks tarif yang lebih luas, bandingkan perbandingan harga model AI terbaru dan halaman harga Flatkey.
Kapan DeepSeek menjadi pilihan yang lebih baik
DeepSeek layak menjadi tes pertama ketika:
- Anda menginginkan satu endpoint langsung global yang sederhana.
- Workload Anda memiliki reuse cache yang sangat tinggi dan terukur.
- DeepSeek V4 Pro memenuhi batas kualitas reasoning dengan biaya successful-task yang lebih rendah daripada tier Qwen yang Anda uji.
- Tim Anda sudah mengoperasikan DeepSeek dengan andal dan upaya migrasi akan melebihi penghematan yang diproyeksikan.
Kapan Qwen menjadi pilihan yang lebih baik
Qwen layak menjadi tes pertama ketika:
- Biaya token mentah adalah kendala utama.
- Anda menjalankan prompt uncached yang pendek atau sedang.
- Anda memiliki job yang toleran terhadap penundaan dan memenuhi syarat untuk batch inference.
- Anda dapat menggunakan caching eksplisit atau implisit secara efektif.
- Model deployment regional Alibaba Cloud sesuai dengan kebutuhan compliance dan operasi Anda.
FAQ
Apakah DeepSeek lebih murah daripada Qwen pada 2026?
Tidak secara keseluruhan. Pada harga daftar publik 28 Juli, Qwen 3.5 Flash lebih murah dalam contoh short uncached, 90%-cached, dan eligible batch di panduan ini. DeepSeek mungkin masih unggul dalam biaya per tugas yang berhasil, kesederhanaan operasional, atau perbandingan tingkat yang lebih tinggi tertentu.
API mana yang lebih baik untuk otomasi volume tinggi?
Mulailah dengan menguji Qwen Flash jika pekerjaan dapat menggunakan batch inference atau tidak terlalu sensitif terhadap latensi. Uji DeepSeek berdampingan jika reuse cache sangat tinggi atau kualitas output-nya mengurangi pengulangan. Setujui rute dengan biaya terendah per hasil yang diterima.
Apakah harga cache DeepSeek membuatnya lebih murah untuk RAG?
Tidak secara otomatis. Harga input cache-hit DeepSeek sangat rendah, tetapi tarif cache-miss dan output-nya lebih tinggi daripada tarif tier pertama Qwen 3.5 Flash. Ukur rasio hit aktual, rasio prompt-ke-output, dan metode cache Qwen sebelum memutuskan.
Haruskah saya menggunakan Qwen Turbo untuk aplikasi baru?
Tidak. Alibaba Cloud mencantumkan penghentian Qwen Turbo pada 30 November 2026 dan merekomendasikan migrasi ke Qwen Flash.
Seberapa sering harga API harus ditinjau?
Tinjau setiap bulan untuk rute produksi yang aktif dan segera ketika penyedia mengubah model ID, tanggal penghentian, aturan cache, dukungan batch, ketersediaan regional, atau harga daftar.
Pilih dengan traffic produksi, bukan tarif utama
Untuk sebagian besar workflow teks yang sensitif biaya, Qwen Flash adalah titik awal dengan harga lebih rendah pada 28 Juli 2026. DeepSeek tetap layak diuji ketika kesederhanaan endpoint, perilaku cache, atau kualitas tugasnya menurunkan biaya operasional total.
Simpan worksheet bentuk permintaan, pin versi model yang tepat, dan pastikan rutenya dapat dibalik. Jika Anda menginginkan satu tempat untuk menguji kedua penyedia tanpa menulis ulang kode client, mulai dengan Flatkey integration starter, jalankan set evaluasi yang sama, dan arahkan traffic produksi hanya setelah angka biaya-per-keberhasilan stabil.



