Model and Modality Playbooks22 September 2026Flatkey Team

Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing

Kimi K3 sudah live. Cek harga API langsung, konteks 1M, kontrol reasoning, catatan cache, dan pemeriksaan routing Flatkey sebelum rollout ke produksi.

Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing

Kimi K3 sudah live untuk tim API yang membutuhkan model dengan konteks panjang untuk coding, kerja berbasis pengetahuan, penalaran visual, dan workflow agen. Versi singkatnya: ID model resmi adalah kimi-k3, Kimi mencantumkan window konteks 1.048.576 token, harga langsung Kimi dipublikasikan per 1 juta token, dan Flatkey saat ini mengekspos route kimi-k3 melalui endpoint yang kompatibel dengan OpenAI.

Panduan ini ditujukan untuk tim produk yang sedang memutuskan apakah Kimi K3 sebaiknya masuk ke rencana routing produksi hari ini. Ini mencakup harga API, batas window konteks, catatan kompatibilitas, pengecekan route, dan pertanyaan operasional yang perlu dijawab sebelum mengirim traffic nyata. Baca Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing sebagai checklist peluncuran, bukan sekadar pengumuman model.

Jawaban Singkat

Untuk tim yang mencari Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing, fakta penting pada hari peluncuran adalah:

ItemDetail terkini berbasis sumber
ID model resmikimi-k3
Pola endpoint langsung KimiChat Completions yang kompatibel dengan OpenAI di https://api.moonshot.ai/v1
Window konteks1.048.576 token
Harga input langsung$3.00 per 1 juta token
Harga input cache langsung$0.30 per 1 juta token
Harga penulisan cache langsung$3.00 per 1 juta token untuk TTL 5 menit; $6.00 per 1 juta token untuk TTL 1 jam
Harga output langsung$15.00 per 1 juta token
Mode berpikirSelalu aktif; kontrol effort dengan nilai reasoning_effort low, high, atau max
Route Flatkeykimi-k3 tersedia dalam data route Flatkey di grup China LLM

Rilis ini bukan hanya window konteks yang lebih besar. Daftar model milik Kimi sendiri menggambarkan K3 sebagai model paling mampu sejauh ini, dengan 2,8T parameter, pemahaman visual native, dan window konteks 1 juta token untuk rekayasa perangkat lunak, kerja berbasis pengetahuan, dan penalaran mendalam.

Apa yang Berubah Dengan Kimi K3

Kimi K3 menggantikan route Kimi yang lebih lama sebagai model yang sebaiknya dievaluasi oleh tim untuk dukungan Kimi berkelanjutan. Dokumentasi model Kimi menandai kimi-k2.5 dan seri moonshot-v1 sebagai dihentikan pada 31 Agustus 2026, dan mengarahkan pengguna ke kimi-k3 untuk dukungan berkelanjutan.

Hal itu penting untuk routing. Jika aplikasi Anda masih menyimpan alias moonshot-v1-*, kimi-latest, atau alias kimi-k2-* yang lebih lama di konfigurasi, langkah aman bukanlah search-and-replace secara buta. Perlakukan ini sebagai migrasi route:

  1. Temukan setiap ID model Kimi di kode, prompt, konfigurasi evaluasi, dan pengaturan workspace pelanggan.
  2. Pindahkan satu workload staging ke kimi-k3.
  3. Jalankan smoke test konteks, pemanggilan tool, JSON, vision, dan streaming.
  4. Bandingkan biaya output yang diterima, bukan hanya harga token.
  5. Tambahkan route fallback sebelum rollout produksi.

Tim Flatkey dapat menggunakan proses evaluasi hari peluncuran yang sama dalam checklist evaluasi model baru sebelum memindahkan Kimi K3 ke route utama.

Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing Untuk Tim

Harga API Kimi langsung untuk K3 dipublikasikan sebagai harga token per 1 juta token. Untuk Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing, baris harga langsung saat ini adalah:

Item penagihanHarga langsung KimiCatatan untuk tim produk
Penulisan cache, TTL 5 menit$3.00 / 1M tokensTTL default jika tidak ada TTL yang ditentukan
Penulisan cache, TTL 1 jam$6.00 / 1M tokensBerguna hanya ketika jendela reuse yang lebih panjang sepadan dengan biaya penulisan
Input cache$0.30 / 1M tokensBerlaku ketika prefix yang diulang masuk ke cache konteks
Input$3.00 / 1M tokensBerlaku untuk token prompt yang tidak di-cache
Output$15.00 / 1M tokensSering menjadi pendorong terbesar untuk loop agen dan penalaran yang verbose

Ini adalah bagian dari Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing yang sebaiknya diubah oleh tim menjadi perhitungan beban kerja. Route berkonteks panjang bisa terlihat murah pada harga input dan tetap menjadi mahal jika setiap permintaan membuat penulisan cache yang besar, menghasilkan output penalaran yang panjang, atau mengulang konteks bernilai rendah.

Gunakan formula perencanaan ini:

accepted_output_cost =
  (cache_write_tokens * cache_write_rate)
  + (cached_input_tokens * cached_input_rate)
  + (uncached_input_tokens * input_rate)
  + (output_tokens * output_rate)
  dibagi accepted results

Untuk keputusan produksi, jalankan formula itu pada sampel nyata. Sertakan generasi yang gagal, percobaan ulang, loop panggilan alat, dan output yang ditolak oleh quality gate produk Anda.

Catatan Window Konteks Dan Caching

Kimi mencantumkan window konteks 1.048.576 token untuk Kimi K3. Itu membuatnya relevan untuk tugas coding lintas repositori, review dokumen besar, analisis produk multi-file, dan sesi agen yang berjalan lama.

Namun window 1M token tidak menghilangkan kebutuhan akan disiplin konteks:

  • Pertahankan prefix yang stabil agar caching otomatis dapat bekerja.
  • Hindari memasukkan setiap dokumen ke setiap permintaan ketika retrieval bisa lebih murah.
  • Batasi panjang output untuk tugas yang tidak membutuhkan penalaran panjang.
  • Simpan model cadangan yang lebih kecil untuk permintaan singkat yang tidak mendapatkan manfaat dari konteks 1M.
  • Ukur latensi secara terpisah dari harga karena prompt yang panjang mengubah pengalaman pengguna meskipun muat.

Dokumentasi Kimi menyebutkan caching otomatis berlaku untuk permintaan model reguler, tanpa perlu cache ID, TTL, atau parameter tambahan. Mereka juga mencatat bahwa permintaan baru hanya dapat memanfaatkan prefix cache ketika prompt sebelumnya melebihi 256 token. Tim produk harus memverifikasi perilaku cache di log mereka sendiri sebelum menjanjikan penghematan biaya dari Kimi K3.

Kompatibilitas API Dan Bentuk Permintaan

Quickstart Kimi menggunakan OpenAI Python SDK dengan base_url="https://api.moonshot.ai/v1" dan model="kimi-k3". Itu menjadikan Kimi K3 kandidat praktis bagi tim yang sudah menggunakan klien Chat Completions yang kompatibel dengan OpenAI.

Detail kompatibilitasnya tetap perlu diuji cepat pada hari rilis:

from openai import OpenAI

client = OpenAI(
    api_key="MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "user", "content": "Ringkas risiko routing untuk rilis ini."}
    ],
)

print(completion.choices[0].message.content)

Untuk Flatkey, pertahankan ID model sebagai kimi-k3, arahkan panggilan yang kompatibel melalui router Flatkey, dan verifikasi rute dalam alur panduan katalog model AI sebelum produksi. Halaman model adalah tempat yang tepat untuk mengonfirmasi ketersediaan saat ini, dukungan endpoint, dan harga rute yang efektif.

Catatan Routing Untuk Tim Flatkey

API harga Flatkey saat ini menunjukkan kimi-k3 tersedia dan dirutekan melalui grup China LLM dengan dukungan endpoint OpenAI. Halaman model publik Flatkey juga menampilkan rute model Kimi K3 dan menyatakan bahwa ini adalah model chat/completions dengan konteks 1M token.

Sebelum menambahkan Kimi K3 ke router produksi, catat rekam review rute ini. Ini adalah artefak serah terima untuk Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing ketika tim platform, produk, dan keuangan membutuhkan sumber kebenaran yang sama:

model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
  - long-context coding
  - knowledge-work agent sessions
  - visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
  chat_completions: required
  streaming: test_required
  structured_output: test_required
  tool_calls: test_required
  vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
  - short_context_default
  - cheaper_coding_route
rollback_condition:
  - error_rate_above_threshold
  - accepted_output_cost_above_budget
  - latency_p95_above_slo

Ini mengubah Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing dari pengumuman rilis menjadi daftar periksa operasional.

Daftar Periksa Produksi

Gunakan daftar periksa Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing ini sebelum memindahkan traffic:

PemeriksaanApa yang perlu diverifikasi
ID modelkimi-k3 berfungsi di staging dan tidak disembunyikan di balik tier akun yang tidak dimiliki kunci produksi Anda
Top-up/aksesKimi mengatakan K3 terbuka setelah top-up berhasil, dengan tier akun memengaruhi batas laju
KonteksPrompt terbesar Anda muat di bawah 1.048.576 token dengan ruang untuk output
Anggaran outputmax_completion_tokens dikendalikan untuk setiap workload
Upaya penalaranlow, high, dan max diuji terhadap latensi, biaya, dan kualitas
CachingWorkload dengan prefix berulang benar-benar mengenai cache di log
VisionURL gambar publik tidak diasumsikan; dokumentasi Kimi menyebut input base64 atau ms://<file-id>
AlatLoop panggilan alat mengembalikan pesan asisten lengkap, bukan hanya content
FallbackRute yang lebih murah atau lebih stabil siap sebelum traffic produksi berpindah
PenagihanLog provider langsung dan log penggunaan Flatkey direkonsiliasi untuk workload sampel yang sama

Kapan Mengarahkan ke Kimi K3

Kimi K3 layak diuji terlebih dahulu ketika workload memiliki satu atau lebih karakteristik berikut:

  • Konteks basis kode besar, thread perencanaan panjang, atau analisis multi-dokumen.
  • Tugas di mana kualitas penalaran lebih penting daripada latensi mentah.
  • Alur kerja yang dapat memanfaatkan caching prefix berulang.
  • Peninjauan multimodal di mana input teks dan visual berada dalam satu proses penalaran.
  • Tugas agenik di mana window konteks yang lebih besar mengurangi stitching retrieval yang rapuh.

Ini kurang mungkin menjadi rute default untuk setiap permintaan. Tugas klasifikasi singkat, ekstraksi, dan pesan dukungan mungkin berkinerja lebih baik pada model latensi rendah yang lebih murah. Pola routing praktisnya adalah menyimpan Kimi K3 untuk workload di mana konteks 1M, upaya penalaran, atau pemahaman visual mengubah tingkat output yang diterima.

Pertanyaan umum

Apakah Kimi K3 sudah live melalui API?

Ya. Dokumentasi API Kimi mencakup quickstart Kimi K3, daftar model, halaman harga, dan banner peluncuran. Data rute Flatkey juga menunjukkan kimi-k3 tersedia untuk routing gaya OpenAI per 22 September 2026.

Apa window konteks Kimi K3?

Kimi mencantumkan window konteks Kimi K3 sebagai 1.048.576 token. Anggap itu sebagai kapasitas, bukan rekomendasi untuk mengirim setiap dokumen yang tersedia pada setiap panggilan.

Apa harga API Kimi K3?

Harga langsung Kimi mencantumkan K3 sebesar $3,00 per 1 juta token input yang tidak di-cache, $0,30 per 1 juta token input yang di-cache, $3,00 atau $6,00 per 1 juta token cache-write tergantung TTL, dan $15,00 per 1 juta token output. Periksa halaman model Flatkey untuk harga rute Flatkey efektif saat ini sebelum peluncuran.

Apakah Kimi K3 mendukung kontrol penalaran?

Ya. Kimi mengatakan K3 selalu mengaktifkan mode berpikir dan mendukung field tingkat atas reasoning_effort dengan low, high, dan max, dengan max sebagai default.

Bagaimana tim harus menggunakan halaman Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing ini?

Gunakan ini sebagai halaman triase hari rilis: konfirmasi harga resmi dan fakta konteks, jalankan checklist routing, hitung biaya output yang diterima, dan baru setelah itu tentukan apakah Kimi K3 menjadi rute utama, rute cadangan, atau rute eksperimen.

Inti

Kimi K3 Sudah Live: Harga API, Window Konteks, dan Catatan Routing berguna karena rilis ini memengaruhi kapabilitas model sekaligus operasi produksi. Sorotan utamanya adalah konteks 1M dan rute andalan baru kimi-k3. Keputusan tetap harus didasarkan pada biaya output yang diterima yang terukur, latensi, perilaku cache, keandalan panggilan alat, dan kesiapan fallback.

Flatkey membantu tim menjaga evaluasi itu tetap praktis: satu kunci, satu saldo, dan routing model melalui lapisan API bersama, dengan katalog model dan log penggunaan tersedia untuk pemeriksaan rute sebelum dan sesudah peluncuran.