Kimi K3 já está disponível para equipes de API que precisam de um modelo de longo contexto para programação, trabalho de conhecimento, raciocínio visual e fluxos de trabalho de agentes. A versão curta: o ID oficial do modelo é kimi-k3, a Kimi lista uma janela de contexto de 1.048.576 tokens, o preço direto da Kimi é publicado por 1M de tokens, e a Flatkey atualmente expõe uma rota kimi-k3 por meio de um endpoint compatível com OpenAI.
Este guia é para equipes de produto que estão decidindo se a Kimi K3 deve entrar hoje em um plano de roteamento de produção. Ele cobre preços da API, limites de janela de contexto, notas de compatibilidade, verificações de rota e as questões operacionais a responder antes de enviar tráfego real. Leia Kimi K3 Is Live: API Pricing, Context Window, and Routing Notes como uma lista de verificação de lançamento, não apenas como um anúncio de modelo.
Resposta Rápida
Para equipes que procuram Kimi K3 Is Live: API Pricing, Context Window, and Routing Notes, os fatos importantes do dia do lançamento são:
| Item | Detalhe atual respaldado por fonte |
|---|---|
| ID oficial do modelo | kimi-k3 |
| Padrão do endpoint direto da Kimi | Chat Completions compatível com OpenAI em https://api.moonshot.ai/v1 |
| Janela de contexto | 1.048.576 tokens |
| Preço direto de entrada | $3.00 por 1M tokens |
| Preço direto de entrada em cache | $0.30 por 1M tokens |
| Preço direto de gravação em cache | $3.00 por 1M tokens para TTL de 5 minutos; $6.00 por 1M tokens para TTL de 1 hora |
| Preço direto de saída | $15.00 por 1M tokens |
| Modo de raciocínio | Sempre ativado; controle o esforço com valores reasoning_effort low, high ou max |
| Rota da Flatkey | kimi-k3 está disponível nos dados de rota da Flatkey sob o grupo China LLM |
O lançamento não é apenas uma janela de contexto maior. A própria lista de modelos da Kimi descreve a K3 como o modelo mais capaz até agora, com 2,8T de parâmetros, compreensão visual nativa e uma janela de contexto de 1M de tokens para engenharia de software, trabalho de conhecimento e raciocínio profundo.
O que Mudou com a Kimi K3
A Kimi K3 substitui rotas Kimi mais antigas como o modelo que as equipes devem avaliar para suporte contínuo da Kimi. A documentação de modelos da Kimi marca kimi-k2.5 e a série moonshot-v1 como descontinuadas em 31 de agosto de 2026, e direciona os usuários para kimi-k3 para suporte contínuo.
Isso importa para o roteamento. Se seu app ainda armazena aliases moonshot-v1-*, kimi-latest ou kimi-k2-* mais antigos na configuração, a escolha segura não é uma substituição cega de localizar e substituir. Trate isso como uma migração de rota:
- Encontre todos os IDs de modelo Kimi no código, prompts, configs de avaliação e configurações do workspace do cliente.
- Mova uma carga de trabalho de staging para
kimi-k3. - Execute um teste rápido de contexto, chamada de ferramenta, JSON, visão e streaming.
- Compare o custo do output aceito, não apenas o preço por token.
- Adicione uma rota de fallback antes da implantação em produção.
As equipes da Flatkey podem usar o mesmo processo de avaliação do dia do lançamento na lista de verificação de avaliação de novos modelos antes de mover a Kimi K3 para uma rota principal.
Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento Para Equipes
Os preços diretos da API Kimi para o K3 são publicados como preços por token por 1M tokens. Para Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento, as linhas atuais de preços diretos são:
| Item de cobrança | Preço direto da Kimi | Observações para equipes de produto |
|---|---|---|
| Gravação em cache, TTL de 5 minutos | $3.00 / 1M tokens | TTL padrão se nenhum TTL for especificado |
| Gravação em cache, TTL de 1 hora | $6.00 / 1M tokens | Útil apenas quando a janela mais longa de reutilização compensa o custo de gravação |
| Entrada em cache | $0.30 / 1M tokens | Aplica-se quando prefixos repetidos atingem o cache de contexto |
| Entrada | $3.00 / 1M tokens | Aplica-se a tokens de prompt não armazenados em cache |
| Saída | $15.00 / 1M tokens | Muitas vezes o maior fator em loops de agentes e raciocínio verboso |
Esta é a parte de Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento que as equipes devem transformar em cálculos de carga de trabalho. Um caminho de contexto longo pode parecer acessível no preço de entrada e ainda assim se tornar caro se cada solicitação criar uma grande gravação em cache, produzir saída de raciocínio longa ou repetir contexto de baixo valor.
Use esta fórmula de planejamento:
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
divided by accepted results
Para uma decisão de produção, aplique essa fórmula a uma amostra real. Inclua gerações com falha, novas tentativas, loops de chamadas de ferramentas e saídas rejeitadas pela sua etapa de qualidade do produto.
Notas Sobre Janela de Contexto E Cache
A Kimi lista uma janela de contexto de 1.048.576 tokens para o Kimi K3. Isso o torna relevante para tarefas de programação em nível de repositório, revisão de documentos grandes, análise de produtos em múltiplos arquivos e sessões de agentes de longa duração.
Mas uma janela de 1M tokens não elimina a necessidade de disciplina de contexto:
- Mantenha prefixos estáveis para que o cache automático possa funcionar.
- Evite colocar todos os documentos em cada solicitação quando a recuperação seria mais barata.
- Limite o tamanho da saída para tarefas que não precisam de raciocínio em formato longo.
- Mantenha um modelo de fallback menor para solicitações curtas que não se beneficiam de 1M de contexto.
- Meça a latência separadamente do preço, porque prompts longos alteram a experiência do usuário mesmo quando cabem.
A documentação da Kimi diz que o cache automático se aplica a solicitações regulares do modelo, sem necessidade de ID de cache, TTL ou parâmetro extra. Eles também observam que uma nova solicitação só pode atingir o cache de prefixo quando o prompt anterior excede 256 tokens. As equipes de produto devem verificar o comportamento do cache em seus próprios logs antes de prometer reduções de custo com o Kimi K3.
Compatibilidade Da API E Forma Da Solicitação
O guia de início rápido da Kimi usa o OpenAI Python SDK com base_url="https://api.moonshot.ai/v1" e model="kimi-k3". Isso torna o Kimi K3 um candidato prático para equipes que já usam clientes de Chat Completions compatíveis com a OpenAI.
Os detalhes de compatibilidade ainda precisam de um teste rápido no dia do lançamento:
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "Resuma os riscos de roteamento para esta versão."}
],
)
print(completion.choices[0].message.content)
Para a Flatkey, mantenha o ID do modelo como kimi-k3, direcione as chamadas compatíveis pelo roteador da Flatkey e verifique a rota no fluxo do guia de catálogo de modelos de IA antes da produção. A página do modelo é o lugar certo para confirmar a disponibilidade atual, o suporte ao endpoint e o preço efetivo da rota.
Notas de Roteamento para Equipes da Flatkey
A API de preços atual da Flatkey mostra kimi-k3 como disponível e roteado pelo grupo China LLM, com suporte ao endpoint OpenAI. A página pública do modelo da Flatkey também expõe uma rota de modelo Kimi K3 e informa que ele é um modelo de chat/completions com contexto de 1M tokens.
Antes de adicionar o Kimi K3 a um roteador de produção, registre este documento de revisão de rota. Ele é o artefato de handoff para Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento quando as equipes de plataforma, produto e finanças precisarem da mesma fonte de verdade:
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- long-context coding
- knowledge-work agent sessions
- visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
Isso transforma Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento de um anúncio de lançamento em uma lista operacional de verificação.
Lista de Verificação de Produção
Use esta lista de verificação de Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento antes de transferir o tráfego:
| Verificação | O que verificar |
|---|---|
| ID do modelo | kimi-k3 funciona em staging e não está oculto por trás de um nível de conta que sua chave de produção não tenha |
| Recarga/acesso | A Kimi diz que o K3 é desbloqueado após uma recarga bem-sucedida, com o nível da conta afetando os limites de taxa |
| Contexto | Seu prompt maior cabe abaixo de 1.048.576 tokens com espaço para a saída |
| Orçamento de saída | max_completion_tokens é नियंत्रado para cada carga de trabalho |
| Esforço de raciocínio | low, high e max são testados em relação a latência, custo e qualidade |
| Cache | Cargas de trabalho com prefixo repetido realmente atingem o cache nos logs |
| Visão | Não se presume o uso de URLs públicas de imagens; a documentação da Kimi menciona entrada em base64 ou ms://<file-id> |
| Ferramentas | Os loops de chamadas de ferramenta retornam a mensagem completa do assistente, não apenas content |
| Fallback | Uma rota mais barata ou mais estável está pronta antes que o tráfego de produção seja movido |
| Faturamento | Os logs diretos do provedor e os logs de uso da Flatkey são conciliados para a mesma carga de trabalho de exemplo |
Quando Roteirizar o Kimi K3
Vale testar o Kimi K3 primeiro quando a carga de trabalho tiver uma ou mais destas características:
- Contexto de base de código grande, longos threads de planejamento ou análise de múltiplos documentos.
- Tarefas em que a qualidade do raciocínio importa mais do que a latência bruta.
- Fluxos de trabalho que podem se beneficiar de cache com prefixo repetido.
- Revisão multimodal em que entradas de texto e visuais pertencem a uma única passagem de raciocínio.
- Tarefas de agente em que uma janela de contexto maior reduz a fragilidade do encadeamento de recuperação.
É menos provável que seja a rota padrão para todas as solicitações. Tarefas curtas de classificação, extração e mensagens de suporte podem ter melhor desempenho em um modelo mais barato e de baixa latência. O padrão prático de roteamento é reservar o Kimi K3 para cargas de trabalho em que o contexto de 1M, o esforço de raciocínio ou a compreensão visual alterem a taxa de saída aceita.
Perguntas frequentes
O Kimi K3 está disponível pela API?
Sim. A documentação da API da Kimi inclui um guia rápido do Kimi K3, lista de modelos, página de preços e banner de lançamento. Os dados de rotas da Flatkey também mostram kimi-k3 disponível para roteamento no estilo OpenAI em 22 de setembro de 2026.
Qual é a janela de contexto do Kimi K3?
A Kimi lista a janela de contexto do Kimi K3 como 1.048.576 tokens. Trate isso como capacidade, não como uma recomendação para enviar todos os documentos disponíveis em cada chamada.
Qual é o preço da API do Kimi K3?
Os preços diretos da Kimi listam o K3 a US$ 3,00 por 1M de tokens de entrada sem cache, US$ 0,30 por 1M de tokens de entrada em cache, US$ 3,00 ou US$ 6,00 por 1M de tokens de gravação de cache, dependendo do TTL, e US$ 15,00 por 1M de tokens de saída. Verifique a página do modelo na Flatkey para o preço efetivo atual da rota Flatkey antes do lançamento.
O Kimi K3 suporta controles de raciocínio?
Sim. A Kimi diz que o K3 sempre tem o modo de pensamento ativado e oferece suporte a um campo de nível superior reasoning_effort com low, high e max, sendo max o padrão.
Como as equipes devem usar esta página Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento?
Use-o como uma página de triagem no dia do lançamento: confirme os preços oficiais e os fatos sobre a janela de contexto, execute a checklist de roteamento, calcule o custo do output aceito e, só então, decida se o Kimi K3 se torna uma rota primária, uma rota de fallback ou uma rota experimental.
Conclusão Principal
Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento é útil porque este lançamento afeta tanto a capacidade do modelo quanto as operações em produção. O destaque é 1M de contexto e uma nova rota principal kimi-k3. A decisão ainda deve se basear no custo medido do output aceito, na latência, no comportamento de cache, na confiabilidade das chamadas de ferramenta e na prontidão do fallback.
A Flatkey ajuda as equipes a manter essa avaliação prática: uma chave, um saldo e roteamento de modelos por meio de uma camada de API compartilhada, com o catálogo de modelos e os logs de uso disponíveis para verificações de rotas antes e depois do lançamento.



