Model and Modality Playbooks22 septembre 2026Flatkey Team

Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage

Kimi K3 est en ligne. Vérifiez la tarification directe de l’API, le contexte de 1M, les contrôles de raisonnement, les notes sur le cache et les vérifications de routage Flatkey avant le déploiement en production.

Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage

Kimi K3 est disponible en ligne pour les équipes API qui ont besoin d’un modèle à long contexte pour le codage, le travail de connaissance, le raisonnement visuel et les flux de travail d’agents. En bref : l’identifiant officiel du modèle est kimi-k3, Kimi annonce une fenêtre de contexte de 1 048 576 tokens, la tarification directe de Kimi est publiée par tranche de 1M tokens, et Flatkey expose actuellement une route kimi-k3 via un point de terminaison compatible OpenAI.

Ce guide s’adresse aux équipes produit qui déterminent si Kimi K3 doit entrer dès aujourd’hui dans un plan de routage de production. Il couvre la tarification API, les limites de fenêtre de contexte, les notes de compatibilité, les vérifications de route et les प्रश्नions opérationnelles à résoudre avant d’envoyer du trafic réel. Lisez Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage comme une liste de contrôle de lancement, et pas seulement comme une annonce de modèle.

Réponse rapide

Pour les équipes qui recherchent Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage, les faits importants du jour de lancement sont :

ÉlémentDétail actuel fondé sur les sources
Identifiant officiel du modèlekimi-k3
Schéma du point de terminaison direct KimiChat Completions compatible OpenAI à https://api.moonshot.ai/v1
Fenêtre de contexte1 048 576 tokens
Prix direct des entrées3,00 $ par 1M tokens
Prix direct des entrées mises en cache0,30 $ par 1M tokens
Prix d’écriture du cache direct3,00 $ par 1M tokens pour une TTL de 5 minutes ; 6,00 $ par 1M tokens pour une TTL d’1 heure
Prix direct des sorties15,00 $ par 1M tokens
Mode de réflexionToujours activé ; contrôlez l’effort avec les valeurs reasoning_effort low, high ou max
Route Flatkeykimi-k3 est disponible dans les données de routes Flatkey sous le groupe China LLM

Cette sortie n’est pas qu’une simple fenêtre de contexte plus grande. La propre liste de modèles de Kimi décrit K3 comme son modèle le plus performant à ce jour, avec 2,8T paramètres, une compréhension visuelle native et une fenêtre de contexte de 1M tokens pour l’ingénierie logicielle, le travail de connaissance et le raisonnement approfondi.

Ce qui a changé avec Kimi K3

Kimi K3 remplace les anciennes routes Kimi comme modèle que les équipes doivent évaluer pour poursuivre la prise en charge de Kimi. La documentation du modèle Kimi indique que kimi-k2.5 et la série moonshot-v1 sont arrêtées le 31 août 2026, et renvoie les utilisateurs vers kimi-k3 pour continuer la prise en charge.

Cela compte pour le routage. Si votre application stocke encore des alias moonshot-v1-*, kimi-latest ou d’anciens kimi-k2-* dans sa configuration, la bonne approche n’est pas un simple remplacement global à l’aveugle. Traitez cela comme une migration de route :

  1. Trouvez chaque identifiant de modèle Kimi dans le code, les prompts, les configurations d’évaluation et les paramètres des espaces clients.
  2. Déplacez une charge de travail de staging vers kimi-k3.
  3. Exécutez un test de fumée pour le contexte, les appels d’outils, le JSON, la vision et le streaming.
  4. Comparez le coût du résultat accepté, pas seulement le prix des tokens.
  5. Ajoutez une route de repli avant le déploiement en production.

Les équipes Flatkey peuvent utiliser le même processus d’évaluation du jour de lancement dans la liste de contrôle d’évaluation des nouveaux modèles avant d’intégrer Kimi K3 dans une route principale.

Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage pour les équipes

La tarification directe de l’API Kimi pour K3 est publiée sous forme de prix par token, pour 1M de tokens. Pour Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage, les lignes de tarification directe actuelles sont les suivantes :

Élément de facturationPrix direct KimiNotes pour les équipes produit
Écriture en cache, TTL de 5 minutes$3.00 / 1M tokensTTL par défaut si aucun TTL n’est spécifié
Écriture en cache, TTL de 1 heure$6.00 / 1M tokensUtile uniquement lorsque la fenêtre de réutilisation plus longue vaut le coût d’écriture
Entrée mise en cache$0.30 / 1M tokensS’applique lorsque des préfixes répétés atteignent le cache de contexte
Entrée$3.00 / 1M tokensS’applique aux tokens de prompt non mis en cache
Sortie$15.00 / 1M tokensSouvent le principal facteur de coût pour les boucles d’agent et le raisonnement verbeux

C’est la partie de Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage que les équipes devraient transformer en calculs de charge de travail. Un routage à long contexte peut sembler abordable en prix d’entrée et devenir malgré tout coûteux si chaque requête crée une grosse écriture en cache, produit une sortie de raisonnement longue ou répète du contexte de faible valeur.

Utilisez cette formule de planification :

accepted_output_cost =
  (cache_write_tokens * cache_write_rate)
  + (cached_input_tokens * cached_input_rate)
  + (uncached_input_tokens * input_rate)
  + (output_tokens * output_rate)
  divided by accepted results

Pour une décision de production, exécutez cette formule sur un échantillon réel. Incluez les générations échouées, les tentatives répétées, les boucles d’appels d’outils et les sorties rejetées par votre garde-fou de qualité produit.

Fenêtre de contexte et notes sur la mise en cache

Kimi indique une fenêtre de contexte de 1 048 576 tokens pour Kimi K3. Cela le rend pertinent pour les tâches de codage à l’échelle d’un dépôt, la revue de documents volumineux, l’analyse de produit sur plusieurs fichiers et les sessions d’agent de longue durée.

Mais une fenêtre de 1M tokens ne supprime pas la nécessité d’une discipline du contexte :

  • Conservez stables les préfixes stables afin que la mise en cache automatique puisse fonctionner.
  • Évitez de mettre chaque document dans chaque requête lorsque la récupération serait moins coûteuse.
  • Limitez la longueur des sorties pour les tâches qui n’ont pas besoin d’un raisonnement long.
  • Conservez un modèle de repli plus petit pour les requêtes courtes qui ne bénéficient pas d’un contexte de 1M.
  • Mesurez la latence séparément du prix, car les prompts longs modifient l’expérience utilisateur même lorsqu’ils tiennent dans la fenêtre.

La documentation de Kimi indique que la mise en cache automatique s’applique aux requêtes de modèle standard, sans qu’un ID de cache, un TTL ou un paramètre supplémentaire soient requis. Elle précise également qu’une nouvelle requête ne peut atteindre le cache de préfixe que lorsque le prompt précédent dépasse 256 tokens. Les équipes produit devraient vérifier le comportement du cache dans leurs propres journaux avant de promettre des réductions de coûts grâce à Kimi K3.

Compatibilité API et forme des requêtes

Le guide de démarrage rapide de Kimi utilise le SDK Python d’OpenAI avec base_url="https://api.moonshot.ai/v1" et model="kimi-k3". Cela fait de Kimi K3 un candidat pratique pour les équipes qui utilisent déjà des clients Chat Completions compatibles avec OpenAI.

Les détails de compatibilité nécessitent tout de même un test de fumée le jour du lancement :

from openai import OpenAI

client = OpenAI(
    api_key="MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "user", "content": "Résumez les risques de routage pour cette version."}
    ],
)

print(completion.choices[0].message.content)

Pour Flatkey, conservez l'ID du modèle en tant que kimi-k3, faites passer les appels compatibles via le routeur Flatkey et vérifiez l'itinéraire dans le flux du guide du catalogue de modèles d'IA avant la production. La page du modèle est l'endroit approprié pour confirmer la disponibilité actuelle, la prise en charge des points de terminaison et la tarification effective de l'itinéraire.

Notes de routage pour les équipes Flatkey

L'API de tarification actuelle de Flatkey montre kimi-k3 comme disponible et acheminé via le groupe China LLM avec prise en charge du point de terminaison OpenAI. La page publique du modèle Flatkey expose également un itinéraire de modèle Kimi K3 et indique qu'il s'agit d'un modèle chat/completions avec un contexte de 1M jetons.

Avant d'ajouter Kimi K3 à un routeur de production, consignez cet enregistrement de revue de routage. C'est l'artefact de passation pour Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage lorsque les équipes plateforme, produit et finance ont besoin de la même source de vérité :

model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
  - long-context coding
  - knowledge-work agent sessions
  - visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
  chat_completions: required
  streaming: test_required
  structured_output: test_required
  tool_calls: test_required
  vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
  - short_context_default
  - cheaper_coding_route
rollback_condition:
  - error_rate_above_threshold
  - accepted_output_cost_above_budget
  - latency_p95_above_slo

Cela transforme Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage d'une annonce de lancement en une liste de contrôle opérationnelle.

Liste de contrôle de production

Utilisez cette liste de contrôle Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage avant de transférer le trafic :

VérificationCe qu’il faut vérifier
ID du modèlekimi-k3 fonctionne en environnement de test et n’est pas masqué derrière un niveau de compte dont votre clé de production ne bénéficie pas
Recharge/accèsKimi indique que K3 est débloqué après une recharge réussie, le niveau de compte influençant les limites de débit
ContexteVotre plus grande requête tient sous 1 048 576 tokens avec de la marge pour la sortie
Budget de sortiemax_completion_tokens est contrôlé pour chaque charge de travail
Effort de raisonnementlow, high et max sont testés en fonction de la latence, du coût et de la qualité
CacheLes charges de travail à préfixe répété atteignent réellement le cache dans les journaux
VisionLes URL d’images publiques ne sont pas supposées ; la documentation Kimi mentionne une entrée base64 ou ms://<file-id>
OutilsLes boucles d’appel d’outils renvoient le message complet de l’assistant, pas seulement content
RepliUne route moins chère ou plus stable est prête avant le passage du trafic de production
FacturationLes journaux directs du fournisseur et les journaux d’utilisation Flatkey concordent pour la même charge de travail d’échantillon

Quand orienter vers Kimi K3

Kimi K3 vaut la peine d’être testé en premier lorsque la charge de travail présente une ou plusieurs de ces caractéristiques :

  • Contexte de grande base de code, longues discussions de planification ou analyse multi-documents.
  • Tâches où la qualité du raisonnement compte davantage que la latence brute.
  • Flux de travail pouvant bénéficier d’un cache à préfixe répété.
  • Revue multimodale où le texte et les entrées visuelles appartiennent à un même passage de raisonnement.
  • Tâches d’agent où une fenêtre de contexte plus large réduit les assemblages de récupération fragiles.

Il est moins probable qu’il s’agisse de la route par défaut pour chaque requête. Les tâches courtes de classification, d’extraction et de messages de support peuvent mieux fonctionner sur un modèle moins coûteux et à faible latence. Le schéma pratique de routage consiste à réserver Kimi K3 aux charges de travail pour lesquelles un contexte de 1 M, l’effort de raisonnement ou la compréhension visuelle modifient le taux de sortie acceptée.

Questions fréquentes

Kimi K3 est-il accessible via l’API ?

Oui. La documentation API de Kimi inclut un guide de démarrage rapide Kimi K3, une liste de modèles, une page de tarification et une bannière de lancement. Les données de routage Flatkey montrent également kimi-k3 disponible pour le routage de type OpenAI au 22 septembre 2026.

Quelle est la fenêtre de contexte de Kimi K3 ?

Kimi indique une fenêtre de contexte Kimi K3 de 1 048 576 tokens. Considérez cela comme une capacité, et non comme une recommandation d’envoyer chaque document disponible à chaque appel.

Quel est le prix de l’API Kimi K3 ?

La tarification directe de Kimi indique K3 à 3,00 $ par 1 M de tokens d’entrée non mis en cache, 0,30 $ par 1 M de tokens d’entrée mis en cache, 3,00 $ ou 6,00 $ par 1 M de tokens d’écriture de cache selon le TTL, et 15,00 $ par 1 M de tokens de sortie. Consultez la page du modèle Flatkey pour connaître le prix effectif actuel du routage Flatkey avant le lancement.

Kimi K3 prend-il en charge des contrôles de raisonnement ?

Oui. Kimi indique que K3 a toujours le mode de réflexion activé et prend en charge un champ de niveau supérieur reasoning_effort avec low, high et max, où max est la valeur par défaut.

Comment les équipes doivent-elles utiliser cette page Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage ?

Utilisez-la comme une page de triage le jour du lancement : confirmez les informations officielles sur la tarification et le contexte, exécutez la liste de contrôle du routage, calculez le coût de la sortie acceptée, puis seulement ensuite déterminez si Kimi K3 devient une route principale, une route de secours ou une route expérimentale.

En résumé

Kimi K3 est en ligne : tarification API, fenêtre de contexte et notes de routage est utile car cette version affecte à la fois les capacités du modèle et les opérations de production. L’information principale est un contexte de 1M et une nouvelle route phare kimi-k3. La décision devrait toujours reposer sur le coût mesuré de la sortie acceptée, la latence, le comportement du cache, la fiabilité des appels d’outils et la disponibilité du plan de secours.

Flatkey aide les équipes à garder cette évaluation pratique : une clé, un solde unique, et un routage des modèles via une couche API partagée, avec le catalogue des modèles et les journaux d’utilisation disponibles pour vérifier les routes avant et après le lancement.