Kimi K3 は、コーディング、ナレッジワーク、視覚推論、エージェントワークフロー向けに長文コンテキストのモデルルートを必要とする API チーム向けに公開されています。要点だけ言うと、公式のモデル ID は kimi-k3 で、Kimi は 1,048,576 トークンのコンテキストウィンドウを提示しており、Kimi の直接料金は 1M トークンあたりで公開され、Flatkey は現在 OpenAI 互換エンドポイント経由で kimi-k3 ルートを提供しています。
このガイドは、Kimi K3 を今日から本番のルーティング計画に入れるべきかを判断しているプロダクトチーム向けです。API 料金、コンテキストウィンドウの上限、互換性の注意点、ルート確認、そして実際のトラフィックを流す前に答えるべき運用上の প্রশ্নを扱います。Kimi K3 Is Live: API Pricing, Context Window, and Routing Notes は、単なるモデル発表ではなく、公開時のチェックリストとしてお読みください。
要点
Kimi K3 Is Live: API Pricing, Context Window, and Routing Notes を探しているチームにとって、公開初日に重要な事実は次のとおりです:
| Item | Current source-backed detail |
|---|---|
| Official model ID | kimi-k3 |
| Direct Kimi endpoint pattern | OpenAI-compatible Chat Completions at https://api.moonshot.ai/v1 |
| Context window | 1,048,576 tokens |
| Direct input price | $3.00 per 1M tokens |
| Direct cached input price | $0.30 per 1M tokens |
| Direct cache write price | $3.00 per 1M tokens for 5-minute TTL; $6.00 per 1M tokens for 1-hour TTL |
| Direct output price | $15.00 per 1M tokens |
| Thinking mode | Always enabled; control effort with reasoning_effort values low, high, or max |
| Flatkey route | kimi-k3 is available in Flatkey route data under the China LLM group |
今回の公開は、単にコンテキストウィンドウが大きくなっただけではありません。Kimi のモデル一覧では、K3 はこれまでで最も高性能なモデルであり、2.8T パラメータ、ネイティブな視覚理解、そしてソフトウェアエンジニアリング、ナレッジワーク、深い推論向けの 100 万トークンのコンテキストウィンドウを備えていると説明されています。
Kimi K3で変わったこと
Kimi K3 は、継続的な Kimi サポートを評価すべきモデルとして、古い Kimi ルートに代わるものです。Kimi のモデルドキュメントでは、kimi-k2.5 と moonshot-v1 系列は 2026 年 8 月 31 日に廃止予定とされており、継続サポートには kimi-k3 を使うよう案内されています。
これはルーティング上重要です。アプリがまだ設定内に moonshot-v1-*、kimi-latest、または旧 kimi-k2-* のエイリアスを保存している場合、安全な対応は無差別な検索置換ではありません。これはルート移行として扱ってください:
- コード、プロンプト、評価設定、顧客ワークスペース設定内のすべての Kimi モデル ID を見つける。
- 1 つのステージングワークロードを
kimi-k3に移す。 - コンテキスト、ツール呼び出し、JSON、ビジョン、ストリーミングのスモークテストを実行する。
- トークン単価だけでなく、受理済み出力のコストを比較する。
- 本番展開の前にフォールバックルートを追加する。
Flatkey のチームは、Kimi K3 を主要ルートに移す前に、new model evaluation checklist の公開時評価プロセスを同じように使えます。
Kimi K3が公開:API料金、コンテキストウィンドウ、ルーティングの注意点
K3 の Kimi API 直接料金は、1Mトークンあたりのトークン料金として公開されています。Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点に関して、現在の直接料金は次のとおりです。
| 課金項目 | Kimi 直接料金 | 製品チーム向けの注意点 |
|---|---|---|
| キャッシュ書き込み、5分TTL | $3.00 / 1M tokens | TTL が指定されていない場合のデフォルトTTL |
| キャッシュ書き込み、1時間TTL | $6.00 / 1M tokens | より長い再利用期間が書き込みコストに見合う場合にのみ有用 |
| キャッシュ済み入力 | $0.30 / 1M tokens | 繰り返しのプレフィックスがコンテキストキャッシュにヒットした場合に適用 |
| 入力 | $3.00 / 1M tokens | キャッシュされていないプロンプトトークンに適用 |
| 出力 | $15.00 / 1M tokens | エージェントループや冗長な推論で、しばしば最大のコスト要因になる |
これは、Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点の中でも、チームがワークロードの計算に落とし込むべき部分です。長文コンテキストのルートは入力価格だけ見ると手頃に見えても、各リクエストで大きなキャッシュ書き込みが発生したり、長い推論出力を生成したり、低価値なコンテキストを繰り返したりすると、結局高くつく可能性があります。
次の計画式を使ってください。
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
divided by accepted results
本番導入の判断では、この式を実データのサンプルに当ててください。失敗した生成、リトライ、ツール呼び出しループ、そして製品の品質ゲートで却下された出力も含めます。
コンテキストウィンドウとキャッシュに関する注意点
Kimi は Kimi K3 に 1,048,576 トークンのコンテキストウィンドウを設定しています。これにより、リポジトリ全体のコーディングタスク、大規模文書レビュー、複数ファイルにまたがる製品分析、長時間稼働するエージェントセッションに適しています。
ただし、100万トークンのウィンドウがあっても、コンテキスト管理の重要性はなくなりません。
- 自動キャッシュが機能するように、安定したプレフィックスは安定したままに保つ。
- 検索で十分安価に済む場合は、毎回のリクエストにすべての文書を入れない。
- 長文推論を必要としないタスクでは、出力長を制限する。
- 100万コンテキストの利点がない短いリクエスト向けに、より小さなフォールバックモデルを用意する。
- 長いプロンプトは収まる場合でもユーザー体験を変えるため、価格とは別にレイテンシを測定する。
Kimi のドキュメントでは、通常のモデルリクエストに自動キャッシュが適用され、キャッシュID、TTL、追加パラメータは不要とされています。また、新しいリクエストがプレフィックスキャッシュにヒットするのは、直前のプロンプトが 256 トークンを超える場合のみだとも説明しています。製品チームは、Kimi K3 によるコスト削減を約束する前に、自社のログでキャッシュ動作を確認するべきです。
API互換性とリクエスト形式
Kimi のクイックスタートでは、base_url="https://api.moonshot.ai/v1" と model="kimi-k3" を使う OpenAI Python SDK が案内されています。これにより、Kimi K3 は OpenAI 互換の Chat Completions クライアントをすでに使っているチームにとって実用的な候補になります。
互換性の詳細については、リリース当日のスモークテストがまだ必要です。
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "このリリースのルーティングリスクを要約してください。"}
],
)
print(completion.choices[0].message.content)
Flatkey では、モデル ID を kimi-k3 のままにし、互換性のある呼び出しは Flatkey ルーター経由で行い、本番前に AI model catalog guide のワークフローでルートを確認してください。モデルページは、現在の利用可能状況、エンドポイント対応、実効ルート料金を確認するのに最適な場所です。
Flatkey チーム向けのルーティングメモ
Flatkey の現在の料金 API では、kimi-k3 は利用可能で、China LLM グループ経由でルーティングされ、OpenAI エンドポイントに対応していると表示されています。公開されている Flatkey のモデルページにも Kimi K3 のモデルルートがあり、1M トークンのコンテキストを持つ chat/completions モデルであると記載されています。
Kimi K3 を本番ルーターに追加する前に、このルートレビュー記録を残してください。プラットフォーム、プロダクト、ファイナンスの各チームが同じ真実の情報源を必要とする際の、Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点 の引き継ぎ成果物です:
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- long-context coding
- knowledge-work agent sessions
- visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
これにより、Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点 はリリース告知から運用チェックリストへと変わります。
本番導入チェックリスト
トラフィックを切り替える前に、この Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点 チェックリストを使用してください:
| 確認項目 | 確認すべき内容 |
|---|---|
| モデルID | kimi-k3 はステージングで動作し、本番キーにないアカウント階層の背後に隠れていない |
| チャージ/アクセス | Kimi によると、K3 は入金が成功すると解除され、アカウント階層がレート制限に影響する |
| コンテキスト | 最大のプロンプトが、出力分の余裕を残して 1,048,576 トークン未満に収まる |
| 出力予算 | max_completion_tokens が各ワークロードごとに制御されている |
| 推論の強度 | low、high、max をレイテンシ、コスト、品質に対して検証している |
| キャッシュ | 繰り返しプレフィックスのワークロードが、実際にログ上でキャッシュにヒットしている |
| ビジョン | 公開画像URLは前提にしていない。Kimi のドキュメントでは base64 または ms://<file-id> 入力が示されている |
| ツール | ツール呼び出しループは、content だけでなく完全な assistant メッセージを返す |
| フォールバック | 本番トラフィックが移る前に、より安価またはより安定したルートが準備できている |
| 請求 | 同じサンプルワークロードについて、直接プロバイダのログと Flatkey の使用量ログが一致する |
Kimi K3 をルーティングするタイミング
以下のいずれかの特性があるワークロードでは、まず Kimi K3 を試す価値があります:
- 大規模なコードベースのコンテキスト、長い計画スレッド、または複数ドキュメントの分析。
- 生のレイテンシよりも推論品質が重要なタスク。
- 繰り返しプレフィックスのキャッシュの恩恵を受けられるワークフロー。
- テキスト入力と視覚入力を 1 回の推論パスにまとめるマルチモーダルレビュー。
- より大きいコンテキストウィンドウによって脆弱な検索のつなぎ合わせを減らせるエージェントタスク。
すべてのリクエストのデフォルトルートにする可能性は低いです。短い分類、抽出、サポートメッセージのタスクでは、より安価で低レイテンシなモデルのほうが良い性能を出す場合があります。実用的なルーティングパターンは、1M コンテキスト、推論の強度、または視覚理解が受け入れ可能な出力率を変えるワークロードのために Kimi K3 を確保することです。
よくある質問
Kimi K3 は API 経由で公開されていますか?
はい。Kimi の API ドキュメントには、Kimi K3 のクイックスタート、モデル一覧、料金ページ、ローンチバナーが含まれています。Flatkey のルートデータでも、2026 年 9 月 22 日時点で kimi-k3 が OpenAI スタイルのルーティングで利用可能であることが示されています。
Kimi K3 のコンテキストウィンドウはどれくらいですか?
Kimi は Kimi K3 のコンテキストウィンドウを 1,048,576 トークンと示しています。これは容量として扱うべきであり、毎回利用可能なすべてのドキュメントを送るべきという推奨ではありません。
Kimi K3 の API 料金はいくらですか?
直接の Kimi 料金では、K3 は未キャッシュの入力トークン 100 万あたり $3.00、キャッシュ済み入力トークン 100 万あたり $0.30、TTL に応じてキャッシュ書き込みトークン 100 万あたり $3.00 または $6.00、出力トークン 100 万あたり $15.00 とされています。公開前に、現在の実効的な Flatkey のルート価格は Flatkey のモデルページで確認してください。
Kimi K3 は推論制御をサポートしていますか?
はい。Kimi によると、K3 は常に思考モードが有効で、low、high、max を持つトップレベルの reasoning_effort フィールドをサポートし、max がデフォルトです。
チームはこの「Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点」ページをどのように使うべきですか?
リリース当日のトリアージページとして使ってください。公式の料金とコンテキストの事実を確認し、ルーティングのチェックリストを実行し、accepted-output コストを算出してから、Kimi K3 を主要ルート、フォールバックルート、または実験的ルートのどれにするかを決めます。
結論
Kimi K3 が公開: API料金、コンテキストウィンドウ、ルーティングの注意点 は、このリリースがモデルの能力と本番運用の両方に影響するため有用です。見出しは 1M コンテキストと新しいフラッグシップの kimi-k3 ルートです。それでも判断は、測定した accepted-output コスト、レイテンシ、キャッシュの挙動、ツール呼び出しの信頼性、そしてフォールバックの準備状況に基づくべきです。
Flatkey は、チームがこの評価を実用的に進められるよう支援します。1つのキー、1つの残高、共有 API レイヤーを通じたモデルルーティング、そしてリリース前後のルート確認に使えるモデルカタログと使用ログを備えています。



