Kimi K3 sudah live untuk tim API yang membutuhkan model dengan konteks panjang untuk coding, kerja berbasis pengetahuan, penalaran visual, dan workflow agen. Versi singkatnya: ID model resmi adalah kimi-k3, Kimi mencantumkan window konteks 1.048.576 token, harga langsung Kimi dipublikasikan per 1 juta token, dan Flatkey saat ini mengekspos route kimi-k3 melalui endpoint yang kompatibel dengan OpenAI.
Panduan ini ditujukan untuk tim produk yang sedang memutuskan apakah Kimi K3 sebaiknya masuk ke rencana routing produksi hari ini. Ini mencakup harga API, batas window konteks, catatan kompatibilitas, pengecekan route, dan pertanyaan operasional yang perlu dijawab sebelum mengirim traffic nyata. Baca Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing sebagai checklist peluncuran, bukan sekadar pengumuman model.
Jawaban Singkat
Untuk tim yang mencari Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing, fakta penting pada hari peluncuran adalah:
| Item | Detail terkini berbasis sumber |
|---|---|
| ID model resmi | kimi-k3 |
| Pola endpoint langsung Kimi | Chat Completions yang kompatibel dengan OpenAI di https://api.moonshot.ai/v1 |
| Window konteks | 1.048.576 token |
| Harga input langsung | $3.00 per 1 juta token |
| Harga input cache langsung | $0.30 per 1 juta token |
| Harga penulisan cache langsung | $3.00 per 1 juta token untuk TTL 5 menit; $6.00 per 1 juta token untuk TTL 1 jam |
| Harga output langsung | $15.00 per 1 juta token |
| Mode berpikir | Selalu aktif; kontrol effort dengan nilai reasoning_effort low, high, atau max |
| Route Flatkey | kimi-k3 tersedia dalam data route Flatkey di grup China LLM |
Rilis ini bukan hanya window konteks yang lebih besar. Daftar model milik Kimi sendiri menggambarkan K3 sebagai model paling mampu sejauh ini, dengan 2,8T parameter, pemahaman visual native, dan window konteks 1 juta token untuk rekayasa perangkat lunak, kerja berbasis pengetahuan, dan penalaran mendalam.
Apa yang Berubah Dengan Kimi K3
Kimi K3 menggantikan route Kimi yang lebih lama sebagai model yang sebaiknya dievaluasi oleh tim untuk dukungan Kimi berkelanjutan. Dokumentasi model Kimi menandai kimi-k2.5 dan seri moonshot-v1 sebagai dihentikan pada 31 Agustus 2026, dan mengarahkan pengguna ke kimi-k3 untuk dukungan berkelanjutan.
Hal itu penting untuk routing. Jika aplikasi Anda masih menyimpan alias moonshot-v1-*, kimi-latest, atau alias kimi-k2-* yang lebih lama di konfigurasi, langkah aman bukanlah search-and-replace secara buta. Perlakukan ini sebagai migrasi route:
- Temukan setiap ID model Kimi di kode, prompt, konfigurasi evaluasi, dan pengaturan workspace pelanggan.
- Pindahkan satu workload staging ke
kimi-k3. - Jalankan smoke test konteks, pemanggilan tool, JSON, vision, dan streaming.
- Bandingkan biaya output yang diterima, bukan hanya harga token.
- Tambahkan route fallback sebelum rollout produksi.
Tim Flatkey dapat menggunakan proses evaluasi hari peluncuran yang sama dalam checklist evaluasi model baru sebelum memindahkan Kimi K3 ke route utama.
Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing Untuk Tim
Harga API Kimi langsung untuk K3 dipublikasikan sebagai harga token per 1 juta token. Untuk Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing, baris harga langsung saat ini adalah:
| Item penagihan | Harga langsung Kimi | Catatan untuk tim produk |
|---|---|---|
| Penulisan cache, TTL 5 menit | $3.00 / 1M tokens | TTL default jika tidak ada TTL yang ditentukan |
| Penulisan cache, TTL 1 jam | $6.00 / 1M tokens | Berguna hanya ketika jendela reuse yang lebih panjang sepadan dengan biaya penulisan |
| Input cache | $0.30 / 1M tokens | Berlaku ketika prefix yang diulang masuk ke cache konteks |
| Input | $3.00 / 1M tokens | Berlaku untuk token prompt yang tidak di-cache |
| Output | $15.00 / 1M tokens | Sering menjadi pendorong terbesar untuk loop agen dan penalaran yang verbose |
Ini adalah bagian dari Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing yang sebaiknya diubah oleh tim menjadi perhitungan beban kerja. Route berkonteks panjang bisa terlihat murah pada harga input dan tetap menjadi mahal jika setiap permintaan membuat penulisan cache yang besar, menghasilkan output penalaran yang panjang, atau mengulang konteks bernilai rendah.
Gunakan formula perencanaan ini:
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
dibagi accepted results
Untuk keputusan produksi, jalankan formula itu pada sampel nyata. Sertakan generasi yang gagal, percobaan ulang, loop panggilan alat, dan output yang ditolak oleh quality gate produk Anda.
Catatan Window Konteks Dan Caching
Kimi mencantumkan window konteks 1.048.576 token untuk Kimi K3. Itu membuatnya relevan untuk tugas coding lintas repositori, review dokumen besar, analisis produk multi-file, dan sesi agen yang berjalan lama.
Namun window 1M token tidak menghilangkan kebutuhan akan disiplin konteks:
- Pertahankan prefix yang stabil agar caching otomatis dapat bekerja.
- Hindari memasukkan setiap dokumen ke setiap permintaan ketika retrieval bisa lebih murah.
- Batasi panjang output untuk tugas yang tidak membutuhkan penalaran panjang.
- Simpan model cadangan yang lebih kecil untuk permintaan singkat yang tidak mendapatkan manfaat dari konteks 1M.
- Ukur latensi secara terpisah dari harga karena prompt yang panjang mengubah pengalaman pengguna meskipun muat.
Dokumentasi Kimi menyebutkan caching otomatis berlaku untuk permintaan model reguler, tanpa perlu cache ID, TTL, atau parameter tambahan. Mereka juga mencatat bahwa permintaan baru hanya dapat memanfaatkan prefix cache ketika prompt sebelumnya melebihi 256 token. Tim produk harus memverifikasi perilaku cache di log mereka sendiri sebelum menjanjikan penghematan biaya dari Kimi K3.
Kompatibilitas API Dan Bentuk Permintaan
Quickstart Kimi menggunakan OpenAI Python SDK dengan base_url="https://api.moonshot.ai/v1" dan model="kimi-k3". Itu menjadikan Kimi K3 kandidat praktis bagi tim yang sudah menggunakan klien Chat Completions yang kompatibel dengan OpenAI.
Detail kompatibilitasnya tetap perlu diuji cepat pada hari rilis:
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "Ringkas risiko routing untuk rilis ini."}
],
)
print(completion.choices[0].message.content)
Untuk Flatkey, pertahankan ID model sebagai kimi-k3, arahkan panggilan yang kompatibel melalui router Flatkey, dan verifikasi rute dalam alur panduan katalog model AI sebelum produksi. Halaman model adalah tempat yang tepat untuk mengonfirmasi ketersediaan saat ini, dukungan endpoint, dan harga rute yang efektif.
Catatan Routing Untuk Tim Flatkey
API harga Flatkey saat ini menunjukkan kimi-k3 tersedia dan dirutekan melalui grup China LLM dengan dukungan endpoint OpenAI. Halaman model publik Flatkey juga menampilkan rute model Kimi K3 dan menyatakan bahwa ini adalah model chat/completions dengan konteks 1M token.
Sebelum menambahkan Kimi K3 ke router produksi, catat rekam review rute ini. Ini adalah artefak serah terima untuk Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing ketika tim platform, produk, dan keuangan membutuhkan sumber kebenaran yang sama:
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- long-context coding
- knowledge-work agent sessions
- visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
Ini mengubah Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing dari pengumuman rilis menjadi daftar periksa operasional.
Daftar Periksa Produksi
Gunakan daftar periksa Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing ini sebelum memindahkan traffic:
| Pemeriksaan | Apa yang perlu diverifikasi |
|---|---|
| ID model | kimi-k3 berfungsi di staging dan tidak disembunyikan di balik tier akun yang tidak dimiliki kunci produksi Anda |
| Top-up/akses | Kimi mengatakan K3 terbuka setelah top-up berhasil, dengan tier akun memengaruhi batas laju |
| Konteks | Prompt terbesar Anda muat di bawah 1.048.576 token dengan ruang untuk output |
| Anggaran output | max_completion_tokens dikendalikan untuk setiap workload |
| Upaya penalaran | low, high, dan max diuji terhadap latensi, biaya, dan kualitas |
| Caching | Workload dengan prefix berulang benar-benar mengenai cache di log |
| Vision | URL gambar publik tidak diasumsikan; dokumentasi Kimi menyebut input base64 atau ms://<file-id> |
| Alat | Loop panggilan alat mengembalikan pesan asisten lengkap, bukan hanya content |
| Fallback | Rute yang lebih murah atau lebih stabil siap sebelum traffic produksi berpindah |
| Penagihan | Log provider langsung dan log penggunaan Flatkey direkonsiliasi untuk workload sampel yang sama |
Kapan Mengarahkan ke Kimi K3
Kimi K3 layak diuji terlebih dahulu ketika workload memiliki satu atau lebih karakteristik berikut:
- Konteks basis kode besar, thread perencanaan panjang, atau analisis multi-dokumen.
- Tugas di mana kualitas penalaran lebih penting daripada latensi mentah.
- Alur kerja yang dapat memanfaatkan caching prefix berulang.
- Peninjauan multimodal di mana input teks dan visual berada dalam satu proses penalaran.
- Tugas agenik di mana window konteks yang lebih besar mengurangi stitching retrieval yang rapuh.
Ini kurang mungkin menjadi rute default untuk setiap permintaan. Tugas klasifikasi singkat, ekstraksi, dan pesan dukungan mungkin berkinerja lebih baik pada model latensi rendah yang lebih murah. Pola routing praktisnya adalah menyimpan Kimi K3 untuk workload di mana konteks 1M, upaya penalaran, atau pemahaman visual mengubah tingkat output yang diterima.
Pertanyaan umum
Apakah Kimi K3 sudah live melalui API?
Ya. Dokumentasi API Kimi mencakup quickstart Kimi K3, daftar model, halaman harga, dan banner peluncuran. Data rute Flatkey juga menunjukkan kimi-k3 tersedia untuk routing gaya OpenAI per 22 September 2026.
Apa window konteks Kimi K3?
Kimi mencantumkan window konteks Kimi K3 sebagai 1.048.576 token. Anggap itu sebagai kapasitas, bukan rekomendasi untuk mengirim setiap dokumen yang tersedia pada setiap panggilan.
Apa harga API Kimi K3?
Harga langsung Kimi mencantumkan K3 sebesar $3,00 per 1 juta token input yang tidak di-cache, $0,30 per 1 juta token input yang di-cache, $3,00 atau $6,00 per 1 juta token cache-write tergantung TTL, dan $15,00 per 1 juta token output. Periksa halaman model Flatkey untuk harga rute Flatkey efektif saat ini sebelum peluncuran.
Apakah Kimi K3 mendukung kontrol penalaran?
Ya. Kimi mengatakan K3 selalu mengaktifkan mode berpikir dan mendukung field tingkat atas reasoning_effort dengan low, high, dan max, dengan max sebagai default.
Bagaimana tim harus menggunakan halaman Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing ini?
Gunakan ini sebagai halaman triase hari rilis: konfirmasi harga resmi dan fakta konteks, jalankan checklist routing, hitung biaya output yang diterima, dan baru setelah itu tentukan apakah Kimi K3 menjadi rute utama, rute cadangan, atau rute eksperimen.
Inti
Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing berguna karena rilis ini memengaruhi kapabilitas model sekaligus operasi produksi. Sorotan utamanya adalah konteks 1M dan rute andalan baru kimi-k3. Keputusan tetap harus didasarkan pada biaya output yang diterima yang terukur, latensi, perilaku cache, keandalan panggilan alat, dan kesiapan fallback.
Flatkey membantu tim menjaga evaluasi itu tetap praktis: satu kunci, satu saldo, dan routing model melalui lapisan API bersama, dengan katalog model dan log penggunaan tersedia untuk pemeriksaan rute sebelum dan sesudah peluncuran.



