Kimi K3 ist live für API-Teams, die eine Long-Context-Model-Route für Coding, Wissensarbeit, visuelles Reasoning und Agent-Workflows benötigen. Kurz gesagt: Die offizielle Model-ID ist kimi-k3, Kimi nennt ein Kontextfenster von 1.048.576 Tokens, die direkte Kimi-Preisgestaltung wird pro 1 Mio. Tokens veröffentlicht, und Flatkey stellt derzeit eine kimi-k3-Route über einen OpenAI-kompatiblen Endpunkt bereit.
Dieser Leitfaden richtet sich an Produktteams, die entscheiden, ob Kimi K3 heute in einen produktiven Routing-Plan aufgenommen werden sollte. Er behandelt API-Preise, Kontextfenster-Grenzen, Kompatibilitätshinweise, Routenprüfungen und die betrieblichen Fragen, die vor dem Senden echter Anfragen zu beantworten sind. Lesen Sie Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise als Launch-Checkliste und nicht nur als Modellankündigung.
Kurze Antwort
Für Teams, die nach Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise suchen, sind die wichtigsten Fakten zum Veröffentlichungstag:
| Element | Aktueller quellengestützter Detailwert |
|---|---|
| Offizielle Modell-ID | kimi-k3 |
| Direktes Kimi-Endpunktmuster | OpenAI-kompatible Chat Completions unter https://api.moonshot.ai/v1 |
| Kontextfenster | 1.048.576 Tokens |
| Direkter Eingabepreis | 3,00 $ pro 1 Mio. Tokens |
| Direkter Preis für gecachte Eingaben | 0,30 $ pro 1 Mio. Tokens |
| Direkter Preis für Cache-Schreibvorgänge | 3,00 $ pro 1 Mio. Tokens für eine TTL von 5 Minuten; 6,00 $ pro 1 Mio. Tokens für eine TTL von 1 Stunde |
| Direkter Ausgabepreis | 15,00 $ pro 1 Mio. Tokens |
| Thinking-Modus | Immer aktiviert; der Aufwand kann mit den reasoning_effort-Werten low, high oder max gesteuert werden |
| Flatkey-Route | kimi-k3 ist in den Flatkey-Routendaten unter der China-LLM-Gruppe verfügbar |
Die Veröffentlichung ist nicht nur ein größeres Kontextfenster. Kimis eigene Modellliste beschreibt K3 als das bisher leistungsfähigste Modell mit 2,8T Parametern, nativer visueller Verständniserfassung und einem 1M-Token-Kontextfenster für Softwareentwicklung, Wissensarbeit und tiefes Reasoning.
Was sich mit Kimi K3 geändert hat
Kimi K3 ersetzt ältere Kimi-Routen als das Modell, das Teams für die fortgesetzte Kimi-Unterstützung evaluieren sollten. Kimis Modelldokumentation kennzeichnet kimi-k2.5 und die moonshot-v1-Serie ab dem 31. August 2026 als eingestellt und verweist Nutzer für die fortgesetzte Unterstützung auf kimi-k3.
Das ist für das Routing wichtig. Wenn Ihre App in der Konfiguration noch moonshot-v1-*, kimi-latest oder ältere kimi-k2-*-Aliase speichert, ist die sichere Vorgehensweise kein blindes Suchen-und-Ersetzen. Behandeln Sie dies als Routenmigration:
- Finden Sie jede Kimi-Model-ID in Code, Prompts, Eval-Konfigurationen und Kundenspace-Einstellungen.
- Verschieben Sie eine Staging-Workload auf
kimi-k3. - Führen Sie einen Smoke-Test für Kontext, Tool-Calls, JSON, Vision und Streaming aus.
- Vergleichen Sie die Kosten für akzeptierte Ausgaben, nicht nur den Token-Preis.
- Fügen Sie vor dem Produktions-Rollout eine Fallback-Route hinzu.
Flatkey-Teams können vor der Aufnahme von Kimi K3 in eine primäre Route denselben Evaluierungsprozess für den Veröffentlichungstag in der Checkliste zur Bewertung neuer Modelle verwenden.
Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise für Teams
Die direkte Kimi-API-Preisgestaltung für K3 wird als Token-Preis pro 1 Mio. Tokens veröffentlicht. Für Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise lauten die aktuellen direkten Preiszeilen:
| Abrechnungsposition | Direkter Kimi-Preis | Hinweise für Produktteams |
|---|---|---|
| Cache-Schreiben, 5-Minuten-TTL | $3.00 / 1M tokens | Standard-TTL, wenn keine TTL angegeben ist |
| Cache-Schreiben, 1-Stunden-TTL | $6.00 / 1M tokens | Nur sinnvoll, wenn das längere Wiederverwendungsfenster die Schreibkosten rechtfertigt |
| Gecachter Input | $0.30 / 1M tokens | Gilt, wenn wiederholte Präfixe den Kontext-Cache treffen |
| Input | $3.00 / 1M tokens | Gilt für nicht gecachte Prompt-Tokens |
| Output | $15.00 / 1M tokens | Oft der größte Treiber für Agenten-Schleifen und ausführliches Reasoning |
Das ist der Teil von Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise, den Teams in Workload-Mathematik übersetzen sollten. Ein Langkontext-Route kann bei Input-Preisen günstig wirken und dennoch teuer werden, wenn jede Anfrage einen großen Cache-Schreibvorgang erzeugt, lange Reasoning-Ausgaben produziert oder Kontext mit geringem Wert wiederholt.
Verwenden Sie diese Planungsformel:
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
divided by accepted results
Für eine Produktionsentscheidung führen Sie diese Formel mit einer realen Stichprobe aus. Beziehen Sie fehlgeschlagene Generierungen, Retries, Tool-Call-Schleifen und Ausgaben ein, die von Ihrem Produkt-Qualitätstor abgelehnt werden.
Hinweise zu Kontextfenster und Caching
Kimi gibt für Kimi K3 ein Kontextfenster von 1.048.576 Tokens an. Das macht das Modell relevant für Coding-Aufgaben über ganze Repositories, die Prüfung großer Dokumente, die Analyse mehrerer Dateien für Produktanalysen und lang laufende Agenten-Sitzungen.
Ein 1M-Token-Fenster nimmt jedoch nicht die Notwendigkeit von Kontextdisziplin:
- Halten Sie stabile Präfixe stabil, damit automatisches Caching funktionieren kann.
- Vermeiden Sie es, jedes Dokument in jede Anfrage zu packen, wenn Retrieval günstiger wäre.
- Begrenzen Sie die Ausgabelänge für Aufgaben, die kein ausführliches Reasoning benötigen.
- Behalten Sie ein kleineres Fallback-Modell für kurze Anfragen, die nicht von 1M Kontext profitieren.
- Messen Sie Latenz getrennt vom Preis, weil lange Prompts die Nutzererfahrung verändern, selbst wenn sie hineinpassen.
In Kimis Dokumentation steht, dass automatisches Caching für reguläre Modellanfragen gilt, ohne dass eine Cache-ID, TTL oder ein zusätzlicher Parameter erforderlich ist. Außerdem wird darauf hingewiesen, dass eine neue Anfrage das Präfix-Cache nur treffen kann, wenn der vorherige Prompt mehr als 256 Tokens umfasst. Produktteams sollten das Cache-Verhalten in ihren eigenen Logs verifizieren, bevor sie Kostensenkungen durch Kimi K3 versprechen.
API-Kompatibilität und Anforderungsform
Kimis Schnellstart verwendet das OpenAI-Python-SDK mit base_url="https://api.moonshot.ai/v1" und model="kimi-k3". Das macht Kimi K3 zu einem praktischen Kandidaten für Teams, die bereits OpenAI-kompatible Chat-Completions-Clients verwenden.
Die Kompatibilitätsdetails brauchen dennoch einen Smoke-Test am Veröffentlichungstag:
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "Fasse die Routing-Risiken für diese Veröffentlichung zusammen."}
],
)
print(completion.choices[0].message.content)
Für Flatkey behalten Sie die Modell-ID als kimi-k3 bei, leiten Sie kompatible Aufrufe über den Flatkey-Router und überprüfen Sie die Route im Workflow des Leitfadens zum KI-Modellkatalog, bevor Sie in die Produktion gehen. Die Modellseite ist der richtige Ort, um die aktuelle Verfügbarkeit, die Endpunktunterstützung und die effektive Routenpreisgestaltung zu bestätigen.
Routing-Hinweise für Flatkey-Teams
Die aktuelle Preis-API von Flatkey zeigt kimi-k3 als verfügbar und über die Gruppe China LLM mit OpenAI-Endpunktunterstützung geroutet an. Die öffentliche Flatkey-Modellseite weist außerdem eine Kimi-K3-Modellroute aus und gibt an, dass es sich um ein Chat/Completions-Modell mit 1M-Token-Kontext handelt.
Bevor Sie Kimi K3 zu einem Produktionsrouter hinzufügen, erfassen Sie diesen Routing-Prüfdatensatz. Er ist das Übergabe-Artefakt für Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise, wenn Plattform-, Produkt- und Finanzteams dieselbe verlässliche Datenbasis benötigen:
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- long-context coding
- knowledge-work agent sessions
- visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
So wird aus Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise eine Betriebs-Checkliste statt nur einer Ankündigung der Veröffentlichung.
Produktions-Checkliste
Verwenden Sie diese Checkliste zu Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise, bevor Sie Traffic umschalten:
| Prüfung | Was zu verifizieren ist |
|---|---|
| Modell-ID | kimi-k3 funktioniert in Staging und ist nicht hinter einer Konto-Stufe verborgen, die Ihrem Produktionsschlüssel fehlt |
| Aufladung/Zugriff | Kimi sagt, dass K3 nach einer erfolgreichen Aufladung freigeschaltet wird, wobei die Konto-Stufe die Rate-Limits beeinflusst |
| Kontext | Ihr größter Prompt passt unter 1.048.576 Tokens, mit Platz für die Ausgabe |
| Ausgabebudget | max_completion_tokens wird für jede Arbeitslast gesteuert |
| Reasoning-Aufwand | low, high und max werden anhand von Latenz, Kosten und Qualität getestet |
| Caching | Arbeitslasten mit wiederholtem Präfix treffen in den Logs tatsächlich auf den Cache |
| Vision | Es wird nicht vorausgesetzt, dass öffentliche Bild-URLs verwendet werden; die Kimi-Dokumentation verweist auf Base64- oder ms://<file-id>-Eingaben |
| Tools | Tool-Call-Loops geben die vollständige Assistant-Nachricht zurück, nicht nur content |
| Fallback | Eine günstigere oder stabilere Route ist bereit, bevor der Produktionsverkehr umgestellt wird |
| Abrechnung | Direkte Provider-Logs und Flatkey-Nutzungslogs stimmen für dieselbe Stichproben-Arbeitslast überein |
Wann Kimi K3 geroutet werden sollte
Kimi K3 ist einen ersten Test wert, wenn die Arbeitslast eine oder mehrere dieser Eigenschaften hat:
- Großer Codebase-Kontext, lange Planungs-Threads oder Analyse über mehrere Dokumente hinweg.
- Aufgaben, bei denen die Qualität des Reasonings wichtiger ist als rohe Latenz.
- Workflows, die von Caching mit wiederholtem Präfix profitieren können.
- Multimodale Prüfungen, bei denen Text- und visuelle Eingaben in einen einzigen Reasoning-Durchlauf gehören.
- Agentenaufgaben, bei denen ein größeres Kontextfenster fragiles Stitching von Retrieval-Ergebnissen reduziert.
Es ist weniger wahrscheinlich, dass es für jede Anfrage die Standardroute ist. Kurze Klassifizierungs-, Extraktions- und Support-Nachrichten-Aufgaben können mit einem günstigeren Modell mit niedriger Latenz besser abschneiden. Das praktische Routing-Muster besteht darin, Kimi K3 für Arbeitslasten zu reservieren, bei denen 1M Kontext, Reasoning-Aufwand oder visuelles Verständnis die akzeptierte Ausgabequote verändert.
Häufig gestellte Fragen
Ist Kimi K3 über die API live?
Ja. Die API-Dokumentation von Kimi enthält ein Kimi-K3-Quickstart, eine Modellliste, eine Preisseite und ein Launch-Banner. Die Flatkey-Routedaten zeigen außerdem, dass kimi-k3 ab dem 22. September 2026 für das OpenAI-ähnliche Routing verfügbar ist.
Wie groß ist das Kontextfenster von Kimi K3?
Kimi gibt das Kontextfenster von Kimi K3 mit 1.048.576 Tokens an. Betrachten Sie das als Kapazität, nicht als Empfehlung, bei jedem Aufruf jedes verfügbare Dokument zu senden.
Wie ist die API-Preisgestaltung von Kimi K3?
Die direkten Kimi-Preise nennen K3 mit 3,00 $ pro 1 Mio. uncached Input-Tokens, 0,30 $ pro 1 Mio. gecachte Input-Tokens, 3,00 $ oder 6,00 $ pro 1 Mio. Cache-Write-Tokens je nach TTL und 15,00 $ pro 1 Mio. Output-Tokens. Prüfen Sie vor dem Start die aktuelle effektive Flatkey-Route-Preisgestaltung auf der Flatkey-Modellseite.
Unterstützt Kimi K3 Reasoning-Steuerungen?
Ja. Kimi sagt, dass K3 den Thinking-Modus immer aktiviert hat und ein Top-Level-Feld reasoning_effort mit low, high und max unterstützt, wobei max der Standard ist.
Wie sollten Teams diese Seite „Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise“ verwenden?
Verwenden Sie dies als Triage-Seite zum Veröffentlichungstag: Bestätigen Sie die offiziellen Preis- und Kontextdaten, führen Sie die Routing-Checkliste aus, berechnen Sie die Kosten für akzeptierte Ausgaben und entscheiden Sie erst dann, ob Kimi K3 zur primären Route, Fallback-Route oder experimentellen Route wird.
Fazit
Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise ist nützlich, weil diese Veröffentlichung sowohl die Modellfähigkeiten als auch den Produktionsbetrieb beeinflusst. Die Schlagzeile lautet 1M Kontext und eine neue Flaggschiff-Route kimi-k3. Die Entscheidung sollte weiterhin auf den gemessenen Kosten pro akzeptierter Ausgabe, der Latenz, dem Cache-Verhalten, der Zuverlässigkeit von Tool-Aufrufen und der Bereitschaft für Fallbacks beruhen.
Flatkey hilft Teams, diese Bewertung praxisnah zu halten: ein Schlüssel, ein Guthaben und Model-Routing über eine gemeinsame API-Ebene, mit dem Modellkatalog und den Nutzungsprotokollen, die für Routings-Checks vor und nach dem Start verfügbar sind.



