Model and Modality Playbooks22. September 2026Flatkey Team

Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise

Kimi K3 ist live. Prüfen Sie die direkten API-Preise, den 1M-Kontext, Reasoning-Steuerungen, Cache-Hinweise und Flatkey-Routing-Checks vor dem Produktions-Rollout.

Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise

Kimi K3 ist live für API-Teams, die eine Long-Context-Model-Route für Coding, Wissensarbeit, visuelles Reasoning und Agent-Workflows benötigen. Kurz gesagt: Die offizielle Model-ID ist kimi-k3, Kimi nennt ein Kontextfenster von 1.048.576 Tokens, die direkte Kimi-Preisgestaltung wird pro 1 Mio. Tokens veröffentlicht, und Flatkey stellt derzeit eine kimi-k3-Route über einen OpenAI-kompatiblen Endpunkt bereit.

Dieser Leitfaden richtet sich an Produktteams, die entscheiden, ob Kimi K3 heute in einen produktiven Routing-Plan aufgenommen werden sollte. Er behandelt API-Preise, Kontextfenster-Grenzen, Kompatibilitätshinweise, Routenprüfungen und die betrieblichen Fragen, die vor dem Senden echter Anfragen zu beantworten sind. Lesen Sie Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise als Launch-Checkliste und nicht nur als Modellankündigung.

Kurze Antwort

Für Teams, die nach Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise suchen, sind die wichtigsten Fakten zum Veröffentlichungstag:

ElementAktueller quellengestützter Detailwert
Offizielle Modell-IDkimi-k3
Direktes Kimi-EndpunktmusterOpenAI-kompatible Chat Completions unter https://api.moonshot.ai/v1
Kontextfenster1.048.576 Tokens
Direkter Eingabepreis3,00 $ pro 1 Mio. Tokens
Direkter Preis für gecachte Eingaben0,30 $ pro 1 Mio. Tokens
Direkter Preis für Cache-Schreibvorgänge3,00 $ pro 1 Mio. Tokens für eine TTL von 5 Minuten; 6,00 $ pro 1 Mio. Tokens für eine TTL von 1 Stunde
Direkter Ausgabepreis15,00 $ pro 1 Mio. Tokens
Thinking-ModusImmer aktiviert; der Aufwand kann mit den reasoning_effort-Werten low, high oder max gesteuert werden
Flatkey-Routekimi-k3 ist in den Flatkey-Routendaten unter der China-LLM-Gruppe verfügbar

Die Veröffentlichung ist nicht nur ein größeres Kontextfenster. Kimis eigene Modellliste beschreibt K3 als das bisher leistungsfähigste Modell mit 2,8T Parametern, nativer visueller Verständniserfassung und einem 1M-Token-Kontextfenster für Softwareentwicklung, Wissensarbeit und tiefes Reasoning.

Was sich mit Kimi K3 geändert hat

Kimi K3 ersetzt ältere Kimi-Routen als das Modell, das Teams für die fortgesetzte Kimi-Unterstützung evaluieren sollten. Kimis Modelldokumentation kennzeichnet kimi-k2.5 und die moonshot-v1-Serie ab dem 31. August 2026 als eingestellt und verweist Nutzer für die fortgesetzte Unterstützung auf kimi-k3.

Das ist für das Routing wichtig. Wenn Ihre App in der Konfiguration noch moonshot-v1-*, kimi-latest oder ältere kimi-k2-*-Aliase speichert, ist die sichere Vorgehensweise kein blindes Suchen-und-Ersetzen. Behandeln Sie dies als Routenmigration:

  1. Finden Sie jede Kimi-Model-ID in Code, Prompts, Eval-Konfigurationen und Kundenspace-Einstellungen.
  2. Verschieben Sie eine Staging-Workload auf kimi-k3.
  3. Führen Sie einen Smoke-Test für Kontext, Tool-Calls, JSON, Vision und Streaming aus.
  4. Vergleichen Sie die Kosten für akzeptierte Ausgaben, nicht nur den Token-Preis.
  5. Fügen Sie vor dem Produktions-Rollout eine Fallback-Route hinzu.

Flatkey-Teams können vor der Aufnahme von Kimi K3 in eine primäre Route denselben Evaluierungsprozess für den Veröffentlichungstag in der Checkliste zur Bewertung neuer Modelle verwenden.

Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise für Teams

Die direkte Kimi-API-Preisgestaltung für K3 wird als Token-Preis pro 1 Mio. Tokens veröffentlicht. Für Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise lauten die aktuellen direkten Preiszeilen:

AbrechnungspositionDirekter Kimi-PreisHinweise für Produktteams
Cache-Schreiben, 5-Minuten-TTL$3.00 / 1M tokensStandard-TTL, wenn keine TTL angegeben ist
Cache-Schreiben, 1-Stunden-TTL$6.00 / 1M tokensNur sinnvoll, wenn das längere Wiederverwendungsfenster die Schreibkosten rechtfertigt
Gecachter Input$0.30 / 1M tokensGilt, wenn wiederholte Präfixe den Kontext-Cache treffen
Input$3.00 / 1M tokensGilt für nicht gecachte Prompt-Tokens
Output$15.00 / 1M tokensOft der größte Treiber für Agenten-Schleifen und ausführliches Reasoning

Das ist der Teil von Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise, den Teams in Workload-Mathematik übersetzen sollten. Ein Langkontext-Route kann bei Input-Preisen günstig wirken und dennoch teuer werden, wenn jede Anfrage einen großen Cache-Schreibvorgang erzeugt, lange Reasoning-Ausgaben produziert oder Kontext mit geringem Wert wiederholt.

Verwenden Sie diese Planungsformel:

accepted_output_cost =
  (cache_write_tokens * cache_write_rate)
  + (cached_input_tokens * cached_input_rate)
  + (uncached_input_tokens * input_rate)
  + (output_tokens * output_rate)
  divided by accepted results

Für eine Produktionsentscheidung führen Sie diese Formel mit einer realen Stichprobe aus. Beziehen Sie fehlgeschlagene Generierungen, Retries, Tool-Call-Schleifen und Ausgaben ein, die von Ihrem Produkt-Qualitätstor abgelehnt werden.

Hinweise zu Kontextfenster und Caching

Kimi gibt für Kimi K3 ein Kontextfenster von 1.048.576 Tokens an. Das macht das Modell relevant für Coding-Aufgaben über ganze Repositories, die Prüfung großer Dokumente, die Analyse mehrerer Dateien für Produktanalysen und lang laufende Agenten-Sitzungen.

Ein 1M-Token-Fenster nimmt jedoch nicht die Notwendigkeit von Kontextdisziplin:

  • Halten Sie stabile Präfixe stabil, damit automatisches Caching funktionieren kann.
  • Vermeiden Sie es, jedes Dokument in jede Anfrage zu packen, wenn Retrieval günstiger wäre.
  • Begrenzen Sie die Ausgabelänge für Aufgaben, die kein ausführliches Reasoning benötigen.
  • Behalten Sie ein kleineres Fallback-Modell für kurze Anfragen, die nicht von 1M Kontext profitieren.
  • Messen Sie Latenz getrennt vom Preis, weil lange Prompts die Nutzererfahrung verändern, selbst wenn sie hineinpassen.

In Kimis Dokumentation steht, dass automatisches Caching für reguläre Modellanfragen gilt, ohne dass eine Cache-ID, TTL oder ein zusätzlicher Parameter erforderlich ist. Außerdem wird darauf hingewiesen, dass eine neue Anfrage das Präfix-Cache nur treffen kann, wenn der vorherige Prompt mehr als 256 Tokens umfasst. Produktteams sollten das Cache-Verhalten in ihren eigenen Logs verifizieren, bevor sie Kostensenkungen durch Kimi K3 versprechen.

API-Kompatibilität und Anforderungsform

Kimis Schnellstart verwendet das OpenAI-Python-SDK mit base_url="https://api.moonshot.ai/v1" und model="kimi-k3". Das macht Kimi K3 zu einem praktischen Kandidaten für Teams, die bereits OpenAI-kompatible Chat-Completions-Clients verwenden.

Die Kompatibilitätsdetails brauchen dennoch einen Smoke-Test am Veröffentlichungstag:

from openai import OpenAI

client = OpenAI(
    api_key="MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "user", "content": "Fasse die Routing-Risiken für diese Veröffentlichung zusammen."}
    ],
)

print(completion.choices[0].message.content)

Für Flatkey behalten Sie die Modell-ID als kimi-k3 bei, leiten Sie kompatible Aufrufe über den Flatkey-Router und überprüfen Sie die Route im Workflow des Leitfadens zum KI-Modellkatalog, bevor Sie in die Produktion gehen. Die Modellseite ist der richtige Ort, um die aktuelle Verfügbarkeit, die Endpunktunterstützung und die effektive Routenpreisgestaltung zu bestätigen.

Routing-Hinweise für Flatkey-Teams

Die aktuelle Preis-API von Flatkey zeigt kimi-k3 als verfügbar und über die Gruppe China LLM mit OpenAI-Endpunktunterstützung geroutet an. Die öffentliche Flatkey-Modellseite weist außerdem eine Kimi-K3-Modellroute aus und gibt an, dass es sich um ein Chat/Completions-Modell mit 1M-Token-Kontext handelt.

Bevor Sie Kimi K3 zu einem Produktionsrouter hinzufügen, erfassen Sie diesen Routing-Prüfdatensatz. Er ist das Übergabe-Artefakt für Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise, wenn Plattform-, Produkt- und Finanzteams dieselbe verlässliche Datenbasis benötigen:

model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
  - long-context coding
  - knowledge-work agent sessions
  - visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
  chat_completions: required
  streaming: test_required
  structured_output: test_required
  tool_calls: test_required
  vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
  - short_context_default
  - cheaper_coding_route
rollback_condition:
  - error_rate_above_threshold
  - accepted_output_cost_above_budget
  - latency_p95_above_slo

So wird aus Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise eine Betriebs-Checkliste statt nur einer Ankündigung der Veröffentlichung.

Produktions-Checkliste

Verwenden Sie diese Checkliste zu Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise, bevor Sie Traffic umschalten:

PrüfungWas zu verifizieren ist
Modell-IDkimi-k3 funktioniert in Staging und ist nicht hinter einer Konto-Stufe verborgen, die Ihrem Produktionsschlüssel fehlt
Aufladung/ZugriffKimi sagt, dass K3 nach einer erfolgreichen Aufladung freigeschaltet wird, wobei die Konto-Stufe die Rate-Limits beeinflusst
KontextIhr größter Prompt passt unter 1.048.576 Tokens, mit Platz für die Ausgabe
Ausgabebudgetmax_completion_tokens wird für jede Arbeitslast gesteuert
Reasoning-Aufwandlow, high und max werden anhand von Latenz, Kosten und Qualität getestet
CachingArbeitslasten mit wiederholtem Präfix treffen in den Logs tatsächlich auf den Cache
VisionEs wird nicht vorausgesetzt, dass öffentliche Bild-URLs verwendet werden; die Kimi-Dokumentation verweist auf Base64- oder ms://<file-id>-Eingaben
ToolsTool-Call-Loops geben die vollständige Assistant-Nachricht zurück, nicht nur content
FallbackEine günstigere oder stabilere Route ist bereit, bevor der Produktionsverkehr umgestellt wird
AbrechnungDirekte Provider-Logs und Flatkey-Nutzungslogs stimmen für dieselbe Stichproben-Arbeitslast überein

Wann Kimi K3 geroutet werden sollte

Kimi K3 ist einen ersten Test wert, wenn die Arbeitslast eine oder mehrere dieser Eigenschaften hat:

  • Großer Codebase-Kontext, lange Planungs-Threads oder Analyse über mehrere Dokumente hinweg.
  • Aufgaben, bei denen die Qualität des Reasonings wichtiger ist als rohe Latenz.
  • Workflows, die von Caching mit wiederholtem Präfix profitieren können.
  • Multimodale Prüfungen, bei denen Text- und visuelle Eingaben in einen einzigen Reasoning-Durchlauf gehören.
  • Agentenaufgaben, bei denen ein größeres Kontextfenster fragiles Stitching von Retrieval-Ergebnissen reduziert.

Es ist weniger wahrscheinlich, dass es für jede Anfrage die Standardroute ist. Kurze Klassifizierungs-, Extraktions- und Support-Nachrichten-Aufgaben können mit einem günstigeren Modell mit niedriger Latenz besser abschneiden. Das praktische Routing-Muster besteht darin, Kimi K3 für Arbeitslasten zu reservieren, bei denen 1M Kontext, Reasoning-Aufwand oder visuelles Verständnis die akzeptierte Ausgabequote verändert.

Häufig gestellte Fragen

Ist Kimi K3 über die API live?

Ja. Die API-Dokumentation von Kimi enthält ein Kimi-K3-Quickstart, eine Modellliste, eine Preisseite und ein Launch-Banner. Die Flatkey-Routedaten zeigen außerdem, dass kimi-k3 ab dem 22. September 2026 für das OpenAI-ähnliche Routing verfügbar ist.

Wie groß ist das Kontextfenster von Kimi K3?

Kimi gibt das Kontextfenster von Kimi K3 mit 1.048.576 Tokens an. Betrachten Sie das als Kapazität, nicht als Empfehlung, bei jedem Aufruf jedes verfügbare Dokument zu senden.

Wie ist die API-Preisgestaltung von Kimi K3?

Die direkten Kimi-Preise nennen K3 mit 3,00 $ pro 1 Mio. uncached Input-Tokens, 0,30 $ pro 1 Mio. gecachte Input-Tokens, 3,00 $ oder 6,00 $ pro 1 Mio. Cache-Write-Tokens je nach TTL und 15,00 $ pro 1 Mio. Output-Tokens. Prüfen Sie vor dem Start die aktuelle effektive Flatkey-Route-Preisgestaltung auf der Flatkey-Modellseite.

Unterstützt Kimi K3 Reasoning-Steuerungen?

Ja. Kimi sagt, dass K3 den Thinking-Modus immer aktiviert hat und ein Top-Level-Feld reasoning_effort mit low, high und max unterstützt, wobei max der Standard ist.

Wie sollten Teams diese Seite „Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise“ verwenden?

Verwenden Sie dies als Triage-Seite zum Veröffentlichungstag: Bestätigen Sie die offiziellen Preis- und Kontextdaten, führen Sie die Routing-Checkliste aus, berechnen Sie die Kosten für akzeptierte Ausgaben und entscheiden Sie erst dann, ob Kimi K3 zur primären Route, Fallback-Route oder experimentellen Route wird.

Fazit

Kimi K3 ist live: API-Preise, Kontextfenster und Routing-Hinweise ist nützlich, weil diese Veröffentlichung sowohl die Modellfähigkeiten als auch den Produktionsbetrieb beeinflusst. Die Schlagzeile lautet 1M Kontext und eine neue Flaggschiff-Route kimi-k3. Die Entscheidung sollte weiterhin auf den gemessenen Kosten pro akzeptierter Ausgabe, der Latenz, dem Cache-Verhalten, der Zuverlässigkeit von Tool-Aufrufen und der Bereitschaft für Fallbacks beruhen.

Flatkey hilft Teams, diese Bewertung praxisnah zu halten: ein Schlüssel, ein Guthaben und Model-Routing über eine gemeinsame API-Ebene, mit dem Modellkatalog und den Nutzungsprotokollen, die für Routings-Checks vor und nach dem Start verfügbar sind.