Kimi K3 est disponible en ligne pour les équipes API qui ont besoin d’un modèle à long contexte pour le codage, le travail de connaissance, le raisonnement visuel et les flux de travail d’agents. En bref : l’identifiant officiel du modèle est kimi-k3, Kimi annonce une fenêtre de contexte de 1 048 576 tokens, la tarification directe de Kimi est publiée par tranche de 1M tokens, et Flatkey expose actuellement une route kimi-k3 via un point de terminaison compatible OpenAI.
Ce guide s’adresse aux équipes produit qui déterminent si Kimi K3 doit entrer dès aujourd’hui dans un plan de routage de production. Il couvre la tarification API, les limites de fenêtre de contexte, les notes de compatibilité, les vérifications de route et les प्रश्नions opérationnelles à résoudre avant d’envoyer du trafic réel. Lisez Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage comme une liste de contrôle de lancement, et pas seulement comme une annonce de modèle.
Réponse rapide
Pour les équipes qui recherchent Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage, les faits importants du jour de lancement sont :
| Élément | Détail actuel fondé sur les sources |
|---|---|
| Identifiant officiel du modèle | kimi-k3 |
| Schéma du point de terminaison direct Kimi | Chat Completions compatible OpenAI à https://api.moonshot.ai/v1 |
| Fenêtre de contexte | 1 048 576 tokens |
| Prix direct des entrées | 3,00 $ par 1M tokens |
| Prix direct des entrées mises en cache | 0,30 $ par 1M tokens |
| Prix d’écriture du cache direct | 3,00 $ par 1M tokens pour une TTL de 5 minutes ; 6,00 $ par 1M tokens pour une TTL d’1 heure |
| Prix direct des sorties | 15,00 $ par 1M tokens |
| Mode de réflexion | Toujours activé ; contrôlez l’effort avec les valeurs reasoning_effort low, high ou max |
| Route Flatkey | kimi-k3 est disponible dans les données de routes Flatkey sous le groupe China LLM |
Cette sortie n’est pas qu’une simple fenêtre de contexte plus grande. La propre liste de modèles de Kimi décrit K3 comme son modèle le plus performant à ce jour, avec 2,8T paramètres, une compréhension visuelle native et une fenêtre de contexte de 1M tokens pour l’ingénierie logicielle, le travail de connaissance et le raisonnement approfondi.
Ce qui a changé avec Kimi K3
Kimi K3 remplace les anciennes routes Kimi comme modèle que les équipes doivent évaluer pour poursuivre la prise en charge de Kimi. La documentation du modèle Kimi indique que kimi-k2.5 et la série moonshot-v1 sont arrêtées le 31 août 2026, et renvoie les utilisateurs vers kimi-k3 pour continuer la prise en charge.
Cela compte pour le routage. Si votre application stocke encore des alias moonshot-v1-*, kimi-latest ou d’anciens kimi-k2-* dans sa configuration, la bonne approche n’est pas un simple remplacement global à l’aveugle. Traitez cela comme une migration de route :
- Trouvez chaque identifiant de modèle Kimi dans le code, les prompts, les configurations d’évaluation et les paramètres des espaces clients.
- Déplacez une charge de travail de staging vers
kimi-k3. - Exécutez un test de fumée pour le contexte, les appels d’outils, le JSON, la vision et le streaming.
- Comparez le coût du résultat accepté, pas seulement le prix des tokens.
- Ajoutez une route de repli avant le déploiement en production.
Les équipes Flatkey peuvent utiliser le même processus d’évaluation du jour de lancement dans la liste de contrôle d’évaluation des nouveaux modèles avant d’intégrer Kimi K3 dans une route principale.
Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage pour les équipes
La tarification directe de l’API Kimi pour K3 est publiée sous forme de prix par token, pour 1M de tokens. Pour Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage, les lignes de tarification directe actuelles sont les suivantes :
| Élément de facturation | Prix direct Kimi | Notes pour les équipes produit |
|---|---|---|
| Écriture en cache, TTL de 5 minutes | $3.00 / 1M tokens | TTL par défaut si aucun TTL n’est spécifié |
| Écriture en cache, TTL de 1 heure | $6.00 / 1M tokens | Utile uniquement lorsque la fenêtre de réutilisation plus longue vaut le coût d’écriture |
| Entrée mise en cache | $0.30 / 1M tokens | S’applique lorsque des préfixes répétés atteignent le cache de contexte |
| Entrée | $3.00 / 1M tokens | S’applique aux tokens de prompt non mis en cache |
| Sortie | $15.00 / 1M tokens | Souvent le principal facteur de coût pour les boucles d’agent et le raisonnement verbeux |
C’est la partie de Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage que les équipes devraient transformer en calculs de charge de travail. Un routage à long contexte peut sembler abordable en prix d’entrée et devenir malgré tout coûteux si chaque requête crée une grosse écriture en cache, produit une sortie de raisonnement longue ou répète du contexte de faible valeur.
Utilisez cette formule de planification :
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
divided by accepted results
Pour une décision de production, exécutez cette formule sur un échantillon réel. Incluez les générations échouées, les tentatives répétées, les boucles d’appels d’outils et les sorties rejetées par votre garde-fou de qualité produit.
Fenêtre de contexte et notes sur la mise en cache
Kimi indique une fenêtre de contexte de 1 048 576 tokens pour Kimi K3. Cela le rend pertinent pour les tâches de codage à l’échelle d’un dépôt, la revue de documents volumineux, l’analyse de produit sur plusieurs fichiers et les sessions d’agent de longue durée.
Mais une fenêtre de 1M tokens ne supprime pas la nécessité d’une discipline du contexte :
- Conservez stables les préfixes stables afin que la mise en cache automatique puisse fonctionner.
- Évitez de mettre chaque document dans chaque requête lorsque la récupération serait moins coûteuse.
- Limitez la longueur des sorties pour les tâches qui n’ont pas besoin d’un raisonnement long.
- Conservez un modèle de repli plus petit pour les requêtes courtes qui ne bénéficient pas d’un contexte de 1M.
- Mesurez la latence séparément du prix, car les prompts longs modifient l’expérience utilisateur même lorsqu’ils tiennent dans la fenêtre.
La documentation de Kimi indique que la mise en cache automatique s’applique aux requêtes de modèle standard, sans qu’un ID de cache, un TTL ou un paramètre supplémentaire soient requis. Elle précise également qu’une nouvelle requête ne peut atteindre le cache de préfixe que lorsque le prompt précédent dépasse 256 tokens. Les équipes produit devraient vérifier le comportement du cache dans leurs propres journaux avant de promettre des réductions de coûts grâce à Kimi K3.
Compatibilité API et forme des requêtes
Le guide de démarrage rapide de Kimi utilise le SDK Python d’OpenAI avec base_url="https://api.moonshot.ai/v1" et model="kimi-k3". Cela fait de Kimi K3 un candidat pratique pour les équipes qui utilisent déjà des clients Chat Completions compatibles avec OpenAI.
Les détails de compatibilité nécessitent tout de même un test de fumée le jour du lancement :
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "Résumez les risques de routage pour cette version."}
],
)
print(completion.choices[0].message.content)
Pour Flatkey, conservez l'ID du modèle en tant que kimi-k3, faites passer les appels compatibles via le routeur Flatkey et vérifiez l'itinéraire dans le flux du guide du catalogue de modèles d'IA avant la production. La page du modèle est l'endroit approprié pour confirmer la disponibilité actuelle, la prise en charge des points de terminaison et la tarification effective de l'itinéraire.
Notes de routage pour les équipes Flatkey
L'API de tarification actuelle de Flatkey montre kimi-k3 comme disponible et acheminé via le groupe China LLM avec prise en charge du point de terminaison OpenAI. La page publique du modèle Flatkey expose également un itinéraire de modèle Kimi K3 et indique qu'il s'agit d'un modèle chat/completions avec un contexte de 1M jetons.
Avant d'ajouter Kimi K3 à un routeur de production, consignez cet enregistrement de revue de routage. C'est l'artefact de passation pour Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage lorsque les équipes plateforme, produit et finance ont besoin de la même source de vérité :
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- long-context coding
- knowledge-work agent sessions
- visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
Cela transforme Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage d'une annonce de lancement en une liste de contrôle opérationnelle.
Liste de contrôle de production
Utilisez cette liste de contrôle Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage avant de transférer le trafic :
| Vérification | Ce qu’il faut vérifier |
|---|---|
| ID du modèle | kimi-k3 fonctionne en environnement de test et n’est pas masqué derrière un niveau de compte dont votre clé de production ne bénéficie pas |
| Recharge/accès | Kimi indique que K3 est débloqué après une recharge réussie, le niveau de compte influençant les limites de débit |
| Contexte | Votre plus grande requête tient sous 1 048 576 tokens avec de la marge pour la sortie |
| Budget de sortie | max_completion_tokens est contrôlé pour chaque charge de travail |
| Effort de raisonnement | low, high et max sont testés en fonction de la latence, du coût et de la qualité |
| Cache | Les charges de travail à préfixe répété atteignent réellement le cache dans les journaux |
| Vision | Les URL d’images publiques ne sont pas supposées ; la documentation Kimi mentionne une entrée base64 ou ms://<file-id> |
| Outils | Les boucles d’appel d’outils renvoient le message complet de l’assistant, pas seulement content |
| Repli | Une route moins chère ou plus stable est prête avant le passage du trafic de production |
| Facturation | Les journaux directs du fournisseur et les journaux d’utilisation Flatkey concordent pour la même charge de travail d’échantillon |
Quand orienter vers Kimi K3
Kimi K3 vaut la peine d’être testé en premier lorsque la charge de travail présente une ou plusieurs de ces caractéristiques :
- Contexte de grande base de code, longues discussions de planification ou analyse multi-documents.
- Tâches où la qualité du raisonnement compte davantage que la latence brute.
- Flux de travail pouvant bénéficier d’un cache à préfixe répété.
- Revue multimodale où le texte et les entrées visuelles appartiennent à un même passage de raisonnement.
- Tâches d’agent où une fenêtre de contexte plus large réduit les assemblages de récupération fragiles.
Il est moins probable qu’il s’agisse de la route par défaut pour chaque requête. Les tâches courtes de classification, d’extraction et de messages de support peuvent mieux fonctionner sur un modèle moins coûteux et à faible latence. Le schéma pratique de routage consiste à réserver Kimi K3 aux charges de travail pour lesquelles un contexte de 1 M, l’effort de raisonnement ou la compréhension visuelle modifient le taux de sortie acceptée.
Questions fréquentes
Kimi K3 est-il accessible via l’API ?
Oui. La documentation API de Kimi inclut un guide de démarrage rapide Kimi K3, une liste de modèles, une page de tarification et une bannière de lancement. Les données de routage Flatkey montrent également kimi-k3 disponible pour le routage de type OpenAI au 22 septembre 2026.
Quelle est la fenêtre de contexte de Kimi K3 ?
Kimi indique une fenêtre de contexte Kimi K3 de 1 048 576 tokens. Considérez cela comme une capacité, et non comme une recommandation d’envoyer chaque document disponible à chaque appel.
Quel est le prix de l’API Kimi K3 ?
La tarification directe de Kimi indique K3 à 3,00 $ par 1 M de tokens d’entrée non mis en cache, 0,30 $ par 1 M de tokens d’entrée mis en cache, 3,00 $ ou 6,00 $ par 1 M de tokens d’écriture de cache selon le TTL, et 15,00 $ par 1 M de tokens de sortie. Consultez la page du modèle Flatkey pour connaître le prix effectif actuel du routage Flatkey avant le lancement.
Kimi K3 prend-il en charge des contrôles de raisonnement ?
Oui. Kimi indique que K3 a toujours le mode de réflexion activé et prend en charge un champ de niveau supérieur reasoning_effort avec low, high et max, où max est la valeur par défaut.
Comment les équipes doivent-elles utiliser cette page Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage ?
Utilisez-la comme une page de triage le jour du lancement : confirmez les informations officielles sur la tarification et le contexte, exécutez la liste de contrôle du routage, calculez le coût de la sortie acceptée, puis seulement ensuite déterminez si Kimi K3 devient une route principale, une route de secours ou une route expérimentale.
En résumé
Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage est utile car cette version affecte à la fois les capacités du modèle et les opérations de production. L’information principale est un contexte de 1M et une nouvelle route phare kimi-k3. La décision devrait toujours reposer sur le coût mesuré de la sortie acceptée, la latence, le comportement du cache, la fiabilité des appels d’outils et la disponibilité du plan de secours.
Flatkey aide les équipes à garder cette évaluation pratique : une clé, un solde unique, et un routage des modèles via une couche API partagée, avec le catalogue des modèles et les journaux d’utilisation disponibles pour vérifier les routes avant et après le lancement.



