Model and Modality Playbooks22 de setembro de 2026Flatkey Team

Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento

Kimi K3 está disponível. Confira os preços diretos da API, 1M de contexto, controles de raciocínio, notas de cache e verificações de roteamento do Flatkey antes da implantação em produção.

Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento

Kimi K3 já está disponível para equipes de API que precisam de um modelo de longo contexto para programação, trabalho de conhecimento, raciocínio visual e fluxos de trabalho de agentes. A versão curta: o ID oficial do modelo é kimi-k3, a Kimi lista uma janela de contexto de 1.048.576 tokens, o preço direto da Kimi é publicado por 1M de tokens, e a Flatkey atualmente expõe uma rota kimi-k3 por meio de um endpoint compatível com OpenAI.

Este guia é para equipes de produto que estão decidindo se a Kimi K3 deve entrar hoje em um plano de roteamento de produção. Ele cobre preços da API, limites de janela de contexto, notas de compatibilidade, verificações de rota e as questões operacionais a responder antes de enviar tráfego real. Leia Kimi K3 Is Live: API Pricing, Context Window, and Routing Notes como uma lista de verificação de lançamento, não apenas como um anúncio de modelo.

Resposta Rápida

Para equipes que procuram Kimi K3 Is Live: API Pricing, Context Window, and Routing Notes, os fatos importantes do dia do lançamento são:

ItemDetalhe atual respaldado por fonte
ID oficial do modelokimi-k3
Padrão do endpoint direto da KimiChat Completions compatível com OpenAI em https://api.moonshot.ai/v1
Janela de contexto1.048.576 tokens
Preço direto de entrada$3.00 por 1M tokens
Preço direto de entrada em cache$0.30 por 1M tokens
Preço direto de gravação em cache$3.00 por 1M tokens para TTL de 5 minutos; $6.00 por 1M tokens para TTL de 1 hora
Preço direto de saída$15.00 por 1M tokens
Modo de raciocínioSempre ativado; controle o esforço com valores reasoning_effort low, high ou max
Rota da Flatkeykimi-k3 está disponível nos dados de rota da Flatkey sob o grupo China LLM

O lançamento não é apenas uma janela de contexto maior. A própria lista de modelos da Kimi descreve a K3 como o modelo mais capaz até agora, com 2,8T de parâmetros, compreensão visual nativa e uma janela de contexto de 1M de tokens para engenharia de software, trabalho de conhecimento e raciocínio profundo.

O que Mudou com a Kimi K3

A Kimi K3 substitui rotas Kimi mais antigas como o modelo que as equipes devem avaliar para suporte contínuo da Kimi. A documentação de modelos da Kimi marca kimi-k2.5 e a série moonshot-v1 como descontinuadas em 31 de agosto de 2026, e direciona os usuários para kimi-k3 para suporte contínuo.

Isso importa para o roteamento. Se seu app ainda armazena aliases moonshot-v1-*, kimi-latest ou kimi-k2-* mais antigos na configuração, a escolha segura não é uma substituição cega de localizar e substituir. Trate isso como uma migração de rota:

  1. Encontre todos os IDs de modelo Kimi no código, prompts, configs de avaliação e configurações do workspace do cliente.
  2. Mova uma carga de trabalho de staging para kimi-k3.
  3. Execute um teste rápido de contexto, chamada de ferramenta, JSON, visão e streaming.
  4. Compare o custo do output aceito, não apenas o preço por token.
  5. Adicione uma rota de fallback antes da implantação em produção.

As equipes da Flatkey podem usar o mesmo processo de avaliação do dia do lançamento na lista de verificação de avaliação de novos modelos antes de mover a Kimi K3 para uma rota principal.

Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento Para Equipes

Os preços diretos da API Kimi para o K3 são publicados como preços por token por 1M tokens. Para Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento, as linhas atuais de preços diretos são:

Item de cobrançaPreço direto da KimiObservações para equipes de produto
Gravação em cache, TTL de 5 minutos$3.00 / 1M tokensTTL padrão se nenhum TTL for especificado
Gravação em cache, TTL de 1 hora$6.00 / 1M tokensÚtil apenas quando a janela mais longa de reutilização compensa o custo de gravação
Entrada em cache$0.30 / 1M tokensAplica-se quando prefixos repetidos atingem o cache de contexto
Entrada$3.00 / 1M tokensAplica-se a tokens de prompt não armazenados em cache
Saída$15.00 / 1M tokensMuitas vezes o maior fator em loops de agentes e raciocínio verboso

Esta é a parte de Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento que as equipes devem transformar em cálculos de carga de trabalho. Um caminho de contexto longo pode parecer acessível no preço de entrada e ainda assim se tornar caro se cada solicitação criar uma grande gravação em cache, produzir saída de raciocínio longa ou repetir contexto de baixo valor.

Use esta fórmula de planejamento:

accepted_output_cost =
  (cache_write_tokens * cache_write_rate)
  + (cached_input_tokens * cached_input_rate)
  + (uncached_input_tokens * input_rate)
  + (output_tokens * output_rate)
  divided by accepted results

Para uma decisão de produção, aplique essa fórmula a uma amostra real. Inclua gerações com falha, novas tentativas, loops de chamadas de ferramentas e saídas rejeitadas pela sua etapa de qualidade do produto.

Notas Sobre Janela de Contexto E Cache

A Kimi lista uma janela de contexto de 1.048.576 tokens para o Kimi K3. Isso o torna relevante para tarefas de programação em nível de repositório, revisão de documentos grandes, análise de produtos em múltiplos arquivos e sessões de agentes de longa duração.

Mas uma janela de 1M tokens não elimina a necessidade de disciplina de contexto:

  • Mantenha prefixos estáveis para que o cache automático possa funcionar.
  • Evite colocar todos os documentos em cada solicitação quando a recuperação seria mais barata.
  • Limite o tamanho da saída para tarefas que não precisam de raciocínio em formato longo.
  • Mantenha um modelo de fallback menor para solicitações curtas que não se beneficiam de 1M de contexto.
  • Meça a latência separadamente do preço, porque prompts longos alteram a experiência do usuário mesmo quando cabem.

A documentação da Kimi diz que o cache automático se aplica a solicitações regulares do modelo, sem necessidade de ID de cache, TTL ou parâmetro extra. Eles também observam que uma nova solicitação só pode atingir o cache de prefixo quando o prompt anterior excede 256 tokens. As equipes de produto devem verificar o comportamento do cache em seus próprios logs antes de prometer reduções de custo com o Kimi K3.

Compatibilidade Da API E Forma Da Solicitação

O guia de início rápido da Kimi usa o OpenAI Python SDK com base_url="https://api.moonshot.ai/v1" e model="kimi-k3". Isso torna o Kimi K3 um candidato prático para equipes que já usam clientes de Chat Completions compatíveis com a OpenAI.

Os detalhes de compatibilidade ainda precisam de um teste rápido no dia do lançamento:

from openai import OpenAI

client = OpenAI(
    api_key="MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "user", "content": "Resuma os riscos de roteamento para esta versão."}
    ],
)

print(completion.choices[0].message.content)

Para a Flatkey, mantenha o ID do modelo como kimi-k3, direcione as chamadas compatíveis pelo roteador da Flatkey e verifique a rota no fluxo do guia de catálogo de modelos de IA antes da produção. A página do modelo é o lugar certo para confirmar a disponibilidade atual, o suporte ao endpoint e o preço efetivo da rota.

Notas de Roteamento para Equipes da Flatkey

A API de preços atual da Flatkey mostra kimi-k3 como disponível e roteado pelo grupo China LLM, com suporte ao endpoint OpenAI. A página pública do modelo da Flatkey também expõe uma rota de modelo Kimi K3 e informa que ele é um modelo de chat/completions com contexto de 1M tokens.

Antes de adicionar o Kimi K3 a um roteador de produção, registre este documento de revisão de rota. Ele é o artefato de handoff para Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento quando as equipes de plataforma, produto e finanças precisarem da mesma fonte de verdade:

model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
  - long-context coding
  - knowledge-work agent sessions
  - visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
  chat_completions: required
  streaming: test_required
  structured_output: test_required
  tool_calls: test_required
  vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
  - short_context_default
  - cheaper_coding_route
rollback_condition:
  - error_rate_above_threshold
  - accepted_output_cost_above_budget
  - latency_p95_above_slo

Isso transforma Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento de um anúncio de lançamento em uma lista operacional de verificação.

Lista de Verificação de Produção

Use esta lista de verificação de Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento antes de transferir o tráfego:

VerificaçãoO que verificar
ID do modelokimi-k3 funciona em staging e não está oculto por trás de um nível de conta que sua chave de produção não tenha
Recarga/acessoA Kimi diz que o K3 é desbloqueado após uma recarga bem-sucedida, com o nível da conta afetando os limites de taxa
ContextoSeu prompt maior cabe abaixo de 1.048.576 tokens com espaço para a saída
Orçamento de saídamax_completion_tokens é नियंत्रado para cada carga de trabalho
Esforço de raciocíniolow, high e max são testados em relação a latência, custo e qualidade
CacheCargas de trabalho com prefixo repetido realmente atingem o cache nos logs
VisãoNão se presume o uso de URLs públicas de imagens; a documentação da Kimi menciona entrada em base64 ou ms://<file-id>
FerramentasOs loops de chamadas de ferramenta retornam a mensagem completa do assistente, não apenas content
FallbackUma rota mais barata ou mais estável está pronta antes que o tráfego de produção seja movido
FaturamentoOs logs diretos do provedor e os logs de uso da Flatkey são conciliados para a mesma carga de trabalho de exemplo

Quando Roteirizar o Kimi K3

Vale testar o Kimi K3 primeiro quando a carga de trabalho tiver uma ou mais destas características:

  • Contexto de base de código grande, longos threads de planejamento ou análise de múltiplos documentos.
  • Tarefas em que a qualidade do raciocínio importa mais do que a latência bruta.
  • Fluxos de trabalho que podem se beneficiar de cache com prefixo repetido.
  • Revisão multimodal em que entradas de texto e visuais pertencem a uma única passagem de raciocínio.
  • Tarefas de agente em que uma janela de contexto maior reduz a fragilidade do encadeamento de recuperação.

É menos provável que seja a rota padrão para todas as solicitações. Tarefas curtas de classificação, extração e mensagens de suporte podem ter melhor desempenho em um modelo mais barato e de baixa latência. O padrão prático de roteamento é reservar o Kimi K3 para cargas de trabalho em que o contexto de 1M, o esforço de raciocínio ou a compreensão visual alterem a taxa de saída aceita.

Perguntas frequentes

O Kimi K3 está disponível pela API?

Sim. A documentação da API da Kimi inclui um guia rápido do Kimi K3, lista de modelos, página de preços e banner de lançamento. Os dados de rotas da Flatkey também mostram kimi-k3 disponível para roteamento no estilo OpenAI em 22 de setembro de 2026.

Qual é a janela de contexto do Kimi K3?

A Kimi lista a janela de contexto do Kimi K3 como 1.048.576 tokens. Trate isso como capacidade, não como uma recomendação para enviar todos os documentos disponíveis em cada chamada.

Qual é o preço da API do Kimi K3?

Os preços diretos da Kimi listam o K3 a US$ 3,00 por 1M de tokens de entrada sem cache, US$ 0,30 por 1M de tokens de entrada em cache, US$ 3,00 ou US$ 6,00 por 1M de tokens de gravação de cache, dependendo do TTL, e US$ 15,00 por 1M de tokens de saída. Verifique a página do modelo na Flatkey para o preço efetivo atual da rota Flatkey antes do lançamento.

O Kimi K3 suporta controles de raciocínio?

Sim. A Kimi diz que o K3 sempre tem o modo de pensamento ativado e oferece suporte a um campo de nível superior reasoning_effort com low, high e max, sendo max o padrão.

Como as equipes devem usar esta página Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento?

Use-o como uma página de triagem no dia do lançamento: confirme os preços oficiais e os fatos sobre a janela de contexto, execute a checklist de roteamento, calcule o custo do output aceito e, só então, decida se o Kimi K3 se torna uma rota primária, uma rota de fallback ou uma rota experimental.

Conclusão Principal

Kimi K3 Está Disponível: Preços da API, Janela de Contexto e Notas de Roteamento é útil porque este lançamento afeta tanto a capacidade do modelo quanto as operações em produção. O destaque é 1M de contexto e uma nova rota principal kimi-k3. A decisão ainda deve se basear no custo medido do output aceito, na latência, no comportamento de cache, na confiabilidade das chamadas de ferramenta e na prontidão do fallback.

A Flatkey ajuda as equipes a manter essa avaliação prática: uma chave, um saldo e roteamento de modelos por meio de uma camada de API compartilhada, com o catálogo de modelos e os logs de uso disponíveis para verificações de rotas antes e depois do lançamento.