Wenn Sie nach der Kimi 3 API suchen, lautet der offizielle Modellname, den Sie im Code verwenden sollten, Kimi K3. Dieser Unterschied ist wichtig, weil Modell-Dokumentationen, SDK-Beispiele, Preistabellen und die API-Modellkennung alle kimi-k3 verwenden, nicht kimi-3.
Stand: 11. September 2026 führt Kimi in seinem eigenen Kimi K3-Leitfaden Kimi K3 als sein Flaggschiffmodell für langes Coding, durchgängige Wissensarbeit, tiefes Reasoning, visuelles Verständnis, Videoverständnis und 1M-Token-Workflows mit großem Kontext an. Die Kimi API Platform stellt es über OpenAI-kompatible Chat Completions, OpenAI-kompatible Responses und Anthropic-kompatible Messages-Protokolle bereit, sodass Entwickler Kimi K3 evaluieren können, ohne jeden Request-Wrapper von Grund auf neu zu bauen.
Dieser Leitfaden erklärt, was es aktuell bei der Suchanfrage zur Kimi 3 API gibt, wie man Kimi K3 direkt aufruft, was sich seit der ersten Berichterstattung zum K3-Launch geändert hat und wie ein Indie Hacker Kimi K3 über einen direkten Provider-Pfad oder ein Multi-Model-Gateway wie Flatkey testen kann.
Kimi 3 API vs Kimi K3 API
Kimi K3 ist der offizielle Name. Kimi 3 API ist eine nützliche Suchphrase, weil viele Entwickler bei der Einführung einer neuen Modellgeneration eine versionsähnliche Sprache verwenden.
Verwenden Sie die Begriffe so:
- In Artikeltiteln und erklärenden Texten hilft „Kimi 3 API (Kimi K3)“ den Lesern, die Suchphrase dem offiziellen Modell zuzuordnen.
- In API-Anfragen verwenden Sie
kimi-k3immodel-Feld. - In Engineering-Tickets und Dokumentationen sollten Sie nach der ersten Klarstellung „Kimi K3“ bevorzugen.
Das vermeidet einen einfachen, aber kostspieligen Fehler: eine populäre Suchphrase in Code zu kopieren und dann einen „Model not found“-Fehler zu debuggen, der nichts mit dem Kontozugang zu tun hat.
Aktuelle Kimi-K3-API-Fakten
Die aktuellen Kimi-API-Dokumentationen beschreiben Kimi K3 als ein Modell mit 2,8 Billionen Parametern, nativem visuellem Verständnis und einem Kontextfenster von 1.048.576 Token. Kimi sagt, dass die vollständigen Modellgewichte veröffentlicht wurden; damit ersetzt dies die Formulierung aus der Launch-Woche, wonach die Gewichte bis zum 27. Juli 2026 veröffentlicht werden sollten.
| Feld | Aktueller Entwicklerhinweis |
|---|---|
| Offizieller Modellname | Kimi K3 |
| API-Modell-ID | kimi-k3 |
| Direkte OpenAI-kompatible Base-URL | https://api.moonshot.ai/v1 |
| Chat-Endpunkt | /chat/completions |
| Responses-Endpunkt | /responses |
| Anthropic-kompatible Base-URL | https://api.moonshot.ai/anthropic |
| Kontextfenster | 1.048.576 Token |
| Modalitäten | Text-, Bild- und Videoeingaben sind dokumentiert |
| Reasoning | Für K3 immer aktiviert; verwenden Sie reasoning_effort |
| Reasoning-Effort-Werte | low, high, max; Standard ist max |
| Zugriffsvoraussetzung | Mindestens 1 $ erfolgreiches Aufladen schaltet die API-Nutzung frei |
| Direkte Kimi-Preise | 0,30 $ Input bei Cache-Hit, 3,00 $ Input bei Cache-Miss, 15,00 $ Output pro 1 Mio. Token, exklusive anwendbarer Steuern |
Preise, Verfügbarkeit von Routen und Rate Limits können sich ändern. Behandeln Sie feste Zahlen daher eher als Prüfpunkte vor dem Deployment und nicht als dauerhaften Vertrag. Kimi’s eigene Dokumentation zu Preisen und Rate-Limits sollte vor der Budgetierung eines Produktionsrollouts geprüft werden.
Was hat sich seit der Startwoche geändert?
Wenn Sie einen älteren Kimi-K3-Artikel lesen, überprüfen Sie diese Punkte noch einmal, bevor Sie dessen Ratschläge übernehmen:
- In Kimi’s K3-Dokumentation steht jetzt, dass die vollständigen Modellgewichte veröffentlicht wurden.
- Die Modellliste von Kimi positioniert
kimi-k3jetzt als Migrationsziel für mehrere eingestellte Modell-IDs. - Die Reihen
kimi-k2.5undmoonshot-v1wurden am 31. August 2026 eingestellt, und Aufrufe an diese Modelle liefern laut Kimi’s Modellliste und Plattform-Änderungsprotokoll jetzt Fehler vom Typ model-not-found. - Die API-Übersicht dokumentiert jetzt drei Kompatibilitätsschnittstellen: OpenAI Chat Completions, OpenAI Responses und Anthropic Messages.
- K3-spezifisches Anfrageverhalten ist weiterhin wichtig: K3 denkt immer, mehrere Sampling-Parameter sind fest vorgegeben, und öffentliche Bild-URLs werden für Vision-Input nicht unterstützt.
Für einen Indie-Hacker oder ein kleines KI-Produktteam ist die praktische Schlussfolgerung einfach: Wenn ein altes Prototyp-Modell-ID von Moonshot v1 oder K2.x verwendet hat, tauschen Sie nicht einfach nur die Basis-URL aus und hoffen, dass der Rest funktioniert. Aktualisieren Sie die Modell-ID, entfernen Sie nicht unterstützte Thinking-Parameter, führen Sie Smoke Tests aus und validieren Sie Kosten und Limits erneut.
Wie Sie Kimi K3 direkt mit dem OpenAI SDK aufrufen
Kimis OpenAI-kompatibles Setup verwendet das OpenAI SDK mit dem Moonshot-API-Schlüssel und der Kimi-Basis-URL.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{
"role": "user",
"content": "Review this launch checklist and list the three riskiest gaps.",
}
],
)
print(response.choices[0].message.content)
Das reicht für einen einfachen Textaufruf aus. Für eine Produktionsmigration reicht das nicht. Kimi K3 unterscheidet sich in Punkten von generischen OpenAI-kompatiblen Modellen, die Ihre App ausdrücklich testen sollte.
Kimi-K3-Parameter, die Sie nicht überspringen sollten
Der wichtigste K3-Parameter ist reasoning_effort.
Kimi K3 hat Thinking immer aktiviert. Sie können es nicht ausschalten, aber Sie können die Stufe des Reasoning-Aufwands wählen:
lowfür Prüfungen mit geringer Latenz, Entwürfe, Klassifizierung oder günstigere Exploration.highfür schwierigere Reasoning-Aufgaben, bei denen Latenz akzeptabel ist.maxfür den tiefsten K3-Reasoning-Modus und den aktuellen Standardwert.
In Kimis Parameter-Referenz steht außerdem, dass temperature, top_p, n, presence_penalty und frequency_penalty für K3 fest vorgegeben sind. Das Übergeben inkompatibler Werte kann Fehler zurückgeben, lassen Sie diese Parameter also weg, sofern die aktuellen Dokumente nichts anderes sagen.
Für Multi-Turn-Konversationen und Tool-Aufrufe sagt Kimi, dass du die vollständige von der API zurückgegebene Assistant-Nachricht zurückgeben sollst, einschließlich der Felder für Reasoning und Tool-Calls. Wenn deine bestehende App nur message.content speichert, behebe das, bevor du K3 an Agent-Workflows misst.
Vision- und Video-Eingabe: Verwende die unterstützten Formate
Kimi K3 unterstützt visuelles Verständnis, aber die Eingabeform ist spezifisch.
Für Bildnachrichten muss message.content ein Array von Teilen sein, kein JSON-String. Kimis Vision-Dokumentation unterstützt Base64-Bildinhalte und Verweise auf Datei-IDs. Derzeit werden keine öffentlich per URL formatierten Bilder als Vision-Eingabe unterstützt.
Für Video lädst du die Datei zuerst hoch und referenzierst sie mit dem Format ms://<file-id> in einem video_url-Teil. Kimi empfiehlt, die Videoauflösung bei FHD oder darunter zu halten und vor teuren multimodalen Jobs die Token-Schätzungs-API zu verwenden.
Das ist für Produktteams wichtig, weil ein Anbieter für Chat zwar "OpenAI-kompatibel" sein kann, aber dennoch anbieterspezifische Regeln für Bilder, Video, Datei-Uploads, Limits und Abrechnung haben kann.
Direkte Kimi API oder Flatkey-Route?
Beide Ansätze sind valide. Die richtige Wahl hängt davon ab, was du lernen möchtest.
Wähle die direkte Kimi API, wenn:
- du den kürzesten Weg zu Moonshot-spezifischen K3-Funktionen suchst;
- deine App primär Kimi K3 bewertet, statt viele Modelle zu vergleichen;
- du es gewohnt bist, ein weiteres Anbieter-Konto, Guthaben, einen Schlüssel, ein Rate-Limit-Profil und eine Rechnung zu verwalten;
- du Kimi-spezifische Parameterbehandlung im Anwendungscode behalten kannst.
Wähle ein Multi-Model-Gateway wie Flatkey, wenn:
- du eine einzige OpenAI-kompatible Base-URL möchtest, während du Kimi K3 mit GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Seedance und anderen unterstützten Modellen vergleichst;
- deine App Fallback-Routing, Model-Allowlists, Nutzungsprotokolle, Kontingentsteuerung oder gemeinsame Abrechnung benötigt;
- du anbieterspezifische Zugangsdaten und Routing-Richtlinien aus dem Funktionscode heraus verlagern möchtest;
- du mit Coding-Agents oder Automatisierungsaufträgen arbeitest, die große Token-Volumina über mehrere Anbieter hinweg verbrauchen können.
Flatkeys öffentlicher Modellkatalog führt derzeit kimi-k3 als über den OpenAI-kompatiblen Endpunkttyp verfügbar auf. Flatkeys aktuelle Router-Base-URL für OpenAI-kompatible Anfragen lautet:
https://router.flatkey.ai/v1
Das entsprechende SDK-Setup lautet:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FLATKEY_API_KEY"],
base_url="https://router.flatkey.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Vergleiche diese drei Onboarding-Flows und wähle den Launch-Pfad mit dem geringsten Risiko.",
}
],
)
print(response.choices[0].message.content)
Vor dem produktiven Einsatz solltest du bestätigen, ob die Route jedes Kimi-spezifische Request-Feld unterstützt, das dein Workload benötigt. Kompatibilität ist eine Integrationsabkürzung, kein Ersatz für Testabdeckung.
Ein praktischer Evaluierungs-Workflow für Kimi K3
Nutze diese Reihenfolge, bevor du echte Nutzer auf die Kimi 3 API-Route umstellst:
- Modell-ID und Zugriff bestätigen. Prüfen Sie, ob
kimi-k3in der aktuellen Modellliste des Providers oder Gateways erscheint, und bestätigen Sie, dass Ihr Konto über das erforderliche Guthaben oder die nötige Routenberechtigung verfügt. - Einen einfachen Plain-Text-Smoke-Test ausführen. Beginnen Sie mit einer kurzen nicht-streamenden Eingabeaufforderung, bevor Sie Tools, JSON-Modus, Streaming, langen Kontext oder Vision hinzufügen.
- Die exakte Arbeitslast testen. Verwenden Sie reale Prompts aus Ihrem Produkt: Aufgaben für Coding-Agents, Dokumentenanalyse, Support-Automatisierung, Recherche, strukturierte Extraktion oder multimodale Prüfungen.
- Die Akzeptanz der Ausgabe messen. Verlassen Sie sich nicht nur auf Benchmark-Aussagen. Verfolgen Sie, ob Nutzer, Prüfer oder nachgelagerte Parser die Antwort akzeptieren.
- Latenz und Token-Nutzung messen. Der lange Kontext und das Reasoning von K3 können nützlich sein, sie können aber auch die Wall-Clock-Zeit und die Ausgabelänge verändern.
- Das Parameterverhalten testen. Entfernen Sie feste Sampling-Parameter, setzen Sie
reasoning_effortbewusst und bewahren Sie in Multi-Turn-Sitzungen vollständige Assistant-Nachrichten auf. - Multimodale Einschränkungen prüfen. Verwenden Sie Base64 oder Datei-Uploads für Bilder und Videos und schätzen Sie die Token-Kosten vor großen Medienaufträgen.
- Fallback definieren. Wählen Sie Fallback-Modelle mit denselben Anforderungen an Modalität und Antwortform. Legen Sie fest, wann erneut versucht, sichtbar fehlgeschlagen oder auf einen anderen Pfad umgeleitet werden soll.
- Nutzungsprotokolle prüfen. Bestätigen Sie, dass Sie Modell, Status, Token, gecachte Token, Kosten, Latenz, Eigentümer und Umgebung sehen können.
- Eine Arbeitslast schrittweise einführen. Starten Sie mit einer begrenzten Arbeitslast und erweitern Sie sie erst, nachdem die Route Qualität, Zuverlässigkeit und Kosten bewiesen hat.
Kimi-K3-Migrations-Checkliste für ältere Kimi-Apps
Wenn Ihr Code bereits ältere Kimi- oder Moonshot-Modell-IDs verwendet, prüfen Sie Folgendes:
- Ersetzen Sie abgekündigte Modell-IDs wie
kimi-k2.5odermoonshot-v1-*durchkimi-k3oder ein anderes unterstütztes aktuelles Modell. - Entfernen Sie die K2.x-
thinking-Konfiguration beim Wechsel zu K3; verwenden Sie stattdessenreasoning_effortauf Top-Level. - Übergeben Sie keine nicht unterstützten Sampling-Parameter mehr.
- Bewahren Sie vollständige Assistant-Nachrichten in Multi-Turn- und Tool-Call-Flows auf.
- Testen Sie die Ausgabe nach JSON-Schema, das Tool-Choice-Verhalten, das Verhalten des Streaming-Parsers und die Fehlerbehandlung erneut.
- Berechnen Sie die Wirtschaftlichkeit von Cache-Hit und Cache-Miss anhand der aktuellen Preistabelle neu.
- Prüfen Sie die Rate Limits für Ihre aktuelle Aufladestufe erneut.
- Aktualisieren Sie Dashboards, Alarme und Runbooks, damit
kimi-k3als eigener Modellpfad sichtbar ist.
Häufige Fehler mit der Kimi 3 API
Den falschen Modellnamen verwenden
Verwenden Sie kimi-k3, nicht kimi-3. Behalten Sie die Formulierung „Kimi 3 API“ für die Suche und die Erklärung gegenüber Nutzern bei.
OpenAI-kompatibel mit identisch verwechseln
OpenAI-kompatibel bedeutet, dass Sie eine vertraute Request-Oberfläche wiederverwenden können. Das garantiert nicht identische Modellparameter, Multimodal-Behandlung, Rate Limits, Nutzungsfelder oder Ausgabeverhalten.
Cache-Misses ignorieren
Die Preisgestaltung von Kimi K3 trennt Cache-Hit und Cache-Miss-Eingaben. Bei Long-Context-Apps kann ein kleiner Unterschied in der Stabilität des Präfixes die effektiven Kosten deutlich verändern.
Nur Benchmark-Screenshots bewerten
Die Einführungsunterlagen von Kimi enthalten Benchmark- und Architekturbehauptungen, aber Ihre Produktionsentscheidung sollte auf Ihrem eigenen Akzeptanzset, Ihrem Latenzbudget, der Parser-Kompatibilität und dem Fallback-Verhalten basieren.
Wechsel eines lang laufenden Agents mitten in einer Sitzung
Kimis technischer Blog warnt davor, dass K3 empfindlich auf die Denkgeschichte reagieren kann. Vermeiden Sie bei Agent-Workflows den Wechsel einer laufenden Sitzung von einem anderen Modell zu K3, ohne den Gesprächszustand zurückzusetzen und zu validieren.
FAQ
Ist Kimi 3 dasselbe wie Kimi K3?
„Kimi 3“ ist ein gängiger Suchbegriff. Kimi K3 ist der offizielle Modellname, und kimi-k3 ist die API-Modell-ID, die Entwickler verwenden sollten.
Ist die Kimi K3 API jetzt verfügbar?
Ja. Die aktuelle Modellauswahl von Kimi enthält kimi-k3, und der Kimi-K3-Leitfaden dokumentiert den direkten API-Zugriff über die Kimi API Platform.
Wie groß ist das Kontextfenster von Kimi K3?
Die aktuellen Kimi-Dokumente nennen ein Kontextfenster von 1.048.576 Token für Kimi K3.
Was kostet die Kimi K3 API?
Die aktuelle Inferenz-Preisseite von Kimi führt Kimi K3 mit 0,30 $ pro 1 Mio. Cache-Hit-Input-Token, 3,00 $ pro 1 Mio. Cache-Miss-Input-Token und 15,00 $ pro 1 Mio. Output-Token auf, zuzüglich der jeweils anfallenden Steuern. Prüfen Sie die Preisseite vor der Budgetplanung erneut, da sich Modellpreise ändern können.
Kann ich das Reasoning von Kimi K3 deaktivieren?
Nein. Kimi K3 reasoning ist immer aktiv. Sie können reasoning_effort auf low, high oder max setzen.
Unterstützt Kimi K3 Bild-URLs?
Kimi K3 unterstützt Vision-Eingaben, aber die aktuellen Vision-Dokumente von Kimi besagen, dass Bilder im öffentlichen URL-Format nicht unterstützt werden. Verwenden Sie stattdessen Base64-Bildinhalte oder Datei-Uploads.
Kann ich Kimi K3 über Flatkey aufrufen?
Der öffentliche Katalog von Flatkey führt kimi-k3 derzeit als über einen OpenAI-kompatiblen Endpunkt-Typ verfügbar auf. Verwenden Sie Flatkey, wenn Sie einen Schlüssel, eine Router-Base-URL, gemeinsame Abrechnung, Nutzungstransparenz und Routing-Steuerung über mehrere unterstützte Modelle hinweg möchten.
Für den nächsten Modellwechsel entwickeln
Der Suchtrend zur Kimi 3 API dreht sich im Grunde um ein breiteres Entwicklerproblem: Der Modellzugang verändert sich schneller als die Anwendungsarchitektur.
Kimi K3 ist eine Evaluation wert für Coding mit langem Kontext, Wissensarbeit, tiefes Reasoning und multimodale Aufgaben. Die nachhaltige technische Entscheidung besteht jedoch darin, die Provider-Auswahl konfigurierbar zu halten, modellspezifisches Verhalten explizit zu testen und Routing, Nutzung, Fallback und Abrechnung zu zentralisieren, bevor sich Modellexperimente über Ihren Codebestand ausbreiten.
Flatkey unterstützt dieses Betriebsmodell, indem es Teams einen OpenAI-kompatiblen Router, einen API-Schlüssel, ein Guthaben und ein Dashboard für unterstützte offizielle Modelle und Tools bereitstellt. Starten Sie mit dem Flatkey API Quickstart, und vergleichen Sie dann kimi-k3 mit den Workloads, bei denen K3s langer Kontext und sein Reasoning Ihre Produktmetriken tatsächlich verbessern können.



