Se você está procurando pela Kimi 3 API, o nome oficial do modelo a ser usado no código é Kimi K3. A distinção importa porque a documentação do modelo, os exemplos de SDK, as tabelas de preços e o identificador do modelo na API usam todos kimi-k3, e não kimi-3.
Em 11 de setembro de 2026, o próprio guia Kimi K3 da Kimi lista o Kimi K3 como seu modelo principal para codificação de longo horizonte, trabalho de conhecimento ponta a ponta, raciocínio profundo, compreensão visual, compreensão de vídeo e fluxos de trabalho com contexto de 1M tokens. A Kimi API Platform o expõe por meio dos protocolos Chat Completions compatíveis com OpenAI, Responses compatível com OpenAI e Messages compatível com Anthropic, então os desenvolvedores podem avaliar o Kimi K3 sem reconstruir do zero todos os wrappers de requisição.
Este guia explica o que há de atual na pesquisa por Kimi 3 API, como chamar o Kimi K3 diretamente, o que mudou desde a primeira cobertura de lançamento do K3 e como um indie hacker pode testar o Kimi K3 por meio de uma rota direta do provedor ou de um gateway multi-modelo como o Flatkey.
Kimi 3 API vs Kimi K3 API
Kimi K3 é o nome oficial. Kimi 3 API é uma frase de busca útil porque muitos desenvolvedores usam linguagem baseada em versão quando uma nova geração importante de modelo é lançada.
Use os termos desta forma:
- Em títulos de artigos e textos educativos, "Kimi 3 API (Kimi K3)" ajuda os leitores a associar a frase de busca ao modelo oficial.
- Em requisições de API, use
kimi-k3no campomodel. - Em tickets de engenharia e documentação, prefira "Kimi K3" após a primeira clarificação.
Isso evita um erro simples, mas caro: copiar uma frase de busca popular para o código e depurar um erro de modelo não encontrado que não tem nada a ver com acesso à conta.
Fatos atuais sobre a API Kimi K3
A documentação atual da API Kimi descreve o Kimi K3 como um modelo com 2,8 trilhões de parâmetros, compreensão visual nativa e uma janela de contexto de 1.048.576 tokens. A Kimi informa que os pesos completos do modelo já foram liberados, o que substitui a redação da semana de lançamento de que os pesos estavam programados para ser liberados até 27 de julho de 2026.
| Campo | Observação atual para desenvolvedores |
|---|---|
| Nome oficial do modelo | Kimi K3 |
| ID do modelo na API | kimi-k3 |
| URL base direta compatível com OpenAI | https://api.moonshot.ai/v1 |
| Endpoint de chat | /chat/completions |
| Endpoint de Responses | /responses |
| URL base compatível com Anthropic | https://api.moonshot.ai/anthropic |
| Janela de contexto | 1.048.576 tokens |
| Modalidades | Entrada de texto, imagem e vídeo estão documentadas |
| Raciocínio | Sempre habilitado para K3; use reasoning_effort |
| Valores de effort de raciocínio | low, high, max; o padrão é max |
| Requisito de acesso | Uma recarga bem-sucedida mínima de $1 desbloqueia o uso da API |
| Preço direto do Kimi | $0.30 de entrada com cache hit, $3.00 de entrada com cache miss, $15.00 de saída por 1M tokens, excluindo impostos aplicáveis |
Os preços, a disponibilidade de rotas e os limites de taxa podem mudar, então trate números fixos como um item de verificação pré-implantação, e não como um contrato permanente. A própria documentação da Kimi sobre preços e limites de taxa deve ser consultada antes de você orçar um rollout em produção.
O que mudou desde a semana de lançamento?
Se você leu um artigo mais antigo sobre o Kimi K3, revise estes pontos antes de copiar as recomendações:
- A documentação do K3 da Kimi agora diz que os pesos completos do modelo foram liberados.
- A lista de modelos da Kimi agora posiciona
kimi-k3como o destino de migração para vários IDs de modelo aposentados. - As séries
kimi-k2.5emoonshot-v1foram aposentadas em 31 de agosto de 2026, e as chamadas para esses modelos agora retornam erros de modelo não encontrado, de acordo com a lista de modelos e o changelog da plataforma da Kimi. - A visão geral da API agora documenta três superfícies de compatibilidade: OpenAI Chat Completions, OpenAI Responses e Anthropic Messages.
- O comportamento específico de requisição do K3 ainda importa: o K3 sempre raciocina, vários parâmetros de amostragem são fixos e URLs públicas de imagens não são compatíveis como entrada de visão.
Para um indie hacker ou uma pequena equipe de produto de IA, a conclusão prática é simples: se um protótipo antigo usava um ID de modelo Moonshot v1 ou K2.x, não basta trocar a URL base e esperar que o resto funcione. Atualize o ID do modelo, remova os parâmetros de raciocínio sem suporte, execute testes rápidos e valide novamente os custos e limites.
Como chamar o Kimi K3 diretamente com o SDK da OpenAI
A configuração compatível com OpenAI da Kimi usa o SDK da OpenAI com a chave da API Moonshot e a URL base da Kimi.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{
"role": "user",
"content": "Revise esta lista de verificação de lançamento e liste as três lacunas mais arriscadas.",
}
],
)
print(response.choices[0].message.content)
Isso é suficiente para uma chamada básica de texto. Não é suficiente para uma migração para produção. O Kimi K3 difere de modelos genéricos compatíveis com OpenAI de maneiras que seu app deve testar explicitamente.
Parâmetros do Kimi K3 que você não deve ignorar
O parâmetro mais importante do K3 é reasoning_effort.
O Kimi K3 sempre tem o raciocínio habilitado. Você não pode desativá-lo, mas pode escolher o nível de esforço de raciocínio:
lowpara verificações de menor latência, rascunhos, classificação ou exploração mais barata.highpara tarefas de raciocínio mais difíceis em que a latência é aceitável.maxpara o modo de raciocínio mais profundo do K3 e o valor padrão atual.
A referência de parâmetros da Kimi também diz que temperature, top_p, n, presence_penalty e frequency_penalty são fixos para o K3. Passar valores incompatíveis pode retornar erros, então omita esses parâmetros, a menos que a documentação atual diga o contrário.
Para conversas com várias interações e chamadas de ferramentas, a Kimi diz para reenviar a mensagem completa do assistente retornada pela API, incluindo os campos de raciocínio e de chamada de ferramenta. Se o seu app existente armazena apenas message.content, corrija isso antes de julgar o K3 em fluxos de trabalho de agentes.
Entrada de visão e vídeo: use os formatos suportados
O Kimi K3 suporta entendimento visual, mas a forma de entrada é específica.
Para mensagens com imagem, message.content deve ser um array de partes, não uma string JSON. A documentação de visão da Kimi suporta conteúdo de imagem em base64 e referências de file-ID. Atualmente, ela não suporta imagens formatadas como URL pública para entrada de visão.
Para vídeo, faça o upload do arquivo primeiro e referencie-o com o formato ms://<file-id> em uma parte video_url. A Kimi recomenda manter a resolução do vídeo em FHD ou abaixo e usar a API de estimativa de tokens antes de trabalhos multimodais caros.
Isso importa para equipes de produto porque um provedor pode ser "compatível com OpenAI" para chat e ainda assim ter regras específicas do provedor para imagens, vídeo, uploads de arquivos, limites e cobrança.
API direta da Kimi ou rota da Flatkey?
Ambas as abordagens são válidas. A escolha certa depende do que você está tentando aprender.
Escolha a API direta da Kimi quando:
- você quer o caminho mais próximo dos recursos específicos do K3 da Moonshot;
- seu app está avaliando principalmente o Kimi K3, em vez de comparar muitos modelos;
- você se sente confortável em gerenciar outra conta de provedor, saldo, chave, perfil de limite de taxa e fatura;
- você consegue manter o tratamento de parâmetros específicos da Kimi no código da sua aplicação.
Escolha um gateway multmodelo como a Flatkey quando:
- você quer uma única base URL compatível com OpenAI enquanto compara Kimi K3 com GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Seedance e outros modelos suportados;
- sua aplicação precisa de roteamento de fallback, allowlists de modelos, logs de uso, controles de quota ou cobrança compartilhada;
- você quer mover credenciais específicas do provedor e a política de roteamento para fora do código de funcionalidades;
- você está construindo com agentes de código ou tarefas de automação que podem consumir grandes volumes de tokens em vários provedores.
O catálogo público de modelos da Flatkey atualmente lista kimi-k3 como disponível por meio do tipo de endpoint compatível com OpenAI. A base URL atual do roteador da Flatkey para solicitações compatíveis com OpenAI é:
https://router.flatkey.ai/v1
A configuração correspondente do SDK é:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FLATKEY_API_KEY"],
base_url="https://router.flatkey.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Compare estes três fluxos de onboarding e escolha o caminho de lançamento de menor risco.",
}
],
)
print(response.choices[0].message.content)
Antes do uso em produção, confirme se a rota suporta todos os campos de solicitação específicos da Kimi de que sua carga de trabalho precisa. Compatibilidade é um atalho de integração, não um substituto para cobertura de testes.
Um fluxo prático de avaliação do Kimi K3
Use esta sequência antes de levar usuários reais para a rota da API Kimi 3:
- Confirme o ID do modelo e o acesso. Verifique se
kimi-k3aparece na lista atual de modelos do provedor ou gateway e confirme se sua conta tem o saldo necessário ou a permissão de rota. - Execute um teste rápido de texto simples. Comece com um prompt curto sem streaming antes de adicionar ferramentas, modo JSON, streaming, contexto longo ou visão.
- Teste a carga de trabalho exata. Use prompts reais do seu produto: tarefas de agente de codificação, análise de documentos, automação de suporte, pesquisa, extração estruturada ou revisão multimodal.
- Meça a aceitação da saída. Não confie apenas em alegações de benchmark. Acompanhe se usuários, revisores ou parsers downstream aceitam a პასუხa.
- Meça a latência e o uso de tokens. O contexto longo e o raciocínio do K3 podem ser úteis, mas também podem alterar o tempo de execução e o comprimento da saída.
- Teste o comportamento dos parâmetros. Remova parâmetros fixos de amostragem, defina
reasoning_effortde forma intencional e preserve mensagens completas do assistente em sessões com várias interações. - Verifique as restrições multimodais. Use base64 ou uploads de arquivo para imagens e vídeos, e estime o custo em tokens antes de grandes trabalhos com mídia.
- Defina um fallback. Escolha modelos de fallback com os mesmos requisitos de modalidade e formato de resposta. Decida quando tentar novamente, falhar de forma visível ou rotear para outro lugar.
- Revise os logs de uso. Confirme se você consegue ver modelo, status, tokens, tokens em cache, custo, latência, proprietário e ambiente.
- Faça a implantação em uma carga de trabalho por vez. Comece com uma carga de trabalho limitada e, depois, expanda após a rota comprovar qualidade, confiabilidade e custo.
Checklist de migração do Kimi K3 para apps Kimi mais antigos
Se o seu código já usa IDs de modelo Kimi ou Moonshot mais antigos, verifique o seguinte:
- Substitua IDs de modelo descontinuados, como
kimi-k2.5oumoonshot-v1-*, porkimi-k3ou outro modelo atual suportado. - Remova a configuração
thinkingdo K2.x ao migrar para o K3; usereasoning_effortno nível superior em vez disso. - Pare de passar parâmetros de amostragem não suportados.
- Preserve mensagens completas do assistente em fluxos com várias interações e chamadas de ferramenta.
- Teste novamente a saída de schema JSON, o comportamento de escolha de ferramenta, o comportamento do parser de streaming e o tratamento de erros.
- Recalcule a economia de cache-hit e cache-miss com base na tabela de preços atual.
- Verifique novamente os limites de taxa para o seu nível atual de recarga.
- Atualize painéis, alertas e runbooks para que
kimi-k3fique visível como sua própria rota de modelo.
Erros comuns com a API Kimi 3
Usar o nome de modelo errado
Use kimi-k3, não kimi-3. Mantenha a expressão "Kimi 3 API" para busca e explicação voltada ao usuário.
Tratar OpenAI-compatible como idêntico
OpenAI-compatible significa que você pode reutilizar uma superfície de solicitação familiar. Isso não garante parâmetros de modelo idênticos, tratamento multimodal, limites de taxa, campos de uso ou comportamento de saída.
Ignorar cache misses
O preço do Kimi K3 separa input com cache-hit e cache-miss. Para apps de contexto longo, uma pequena diferença na estabilidade do prefixo pode alterar materialmente o custo efetivo.
Avaliar apenas capturas de tela de benchmark
Os materiais de lançamento do Kimi incluem afirmações sobre benchmarks e arquitetura, mas sua decisão de produção deve vir do seu próprio conjunto de aceitação, do orçamento de latência, da compatibilidade do parser e do comportamento de fallback.
Trocando um agente de longa execução no meio da sessão
O blog técnico do Kimi alerta que o K3 pode ser sensível ao histórico de pensamento. Para fluxos de trabalho com agentes, evite trocar uma sessão ativa de outro modelo para o K3 sem redefinir e validar o estado da conversa.
FAQ
O Kimi 3 é o mesmo que Kimi K3?
"Kimi 3" é uma frase de busca comum. Kimi K3 é o nome oficial do modelo, e kimi-k3 é o ID do modelo de API que os desenvolvedores devem usar.
A API do Kimi K3 já está disponível?
Sim. A lista atual de modelos do Kimi inclui kimi-k3, e o guia do Kimi K3 documenta acesso direto à API por meio da Kimi API Platform.
Qual é a janela de contexto do Kimi K3?
A documentação atual do Kimi lista uma janela de contexto de 1.048.576 tokens para o Kimi K3.
Quanto custa a API do Kimi K3?
A página atual de preços de inferência do Kimi lista o Kimi K3 em US$ 0,30 por 1M de tokens de entrada com cache hit, US$ 3,00 por 1M de tokens de entrada com cache miss e US$ 15,00 por 1M de tokens de saída, excluindo os impostos aplicáveis. Verifique novamente a página de preços antes de orçar, porque os preços do modelo podem mudar.
Posso desativar o raciocínio do Kimi K3?
Não. O Kimi K3 sempre raciocina. Você pode definir reasoning_effort como low, high ou max.
O Kimi K3 suporta URLs de imagem?
O Kimi K3 suporta entrada visual, mas a documentação atual de visão do Kimi diz que imagens formatadas como URL públicas não são suportadas. Use conteúdo de imagem em base64 ou envios de arquivos.
Posso chamar o Kimi K3 por meio do Flatkey?
O catálogo público do Flatkey atualmente lista kimi-k3 como disponível por meio de um tipo de endpoint compatível com OpenAI. Use o Flatkey quando quiser uma chave, uma URL base de roteador, faturamento compartilhado, visibilidade de uso e controles de roteamento entre vários modelos compatíveis.
Construa para a próxima mudança de modelo
A tendência de busca por API do Kimi 3 realmente trata de um problema mais amplo para desenvolvedores: o acesso aos modelos muda mais rápido do que a arquitetura da aplicação.
Vale a pena avaliar o Kimi K3 para codificação em contexto longo, trabalho com conhecimento, raciocínio profundo e tarefas multimodais. Mas a decisão de engenharia duradoura é manter a escolha do provedor configurável, testar explicitamente o comportamento específico do modelo e centralizar roteamento, uso, fallback e faturamento antes que os experimentos com modelos se espalhem pela sua base de código.
O Flatkey ajuda com esse modelo operacional ao oferecer às equipes um roteador compatível com OpenAI, uma chave de API, um saldo e um painel em todos os modelos oficiais e ferramentas suportados. Comece com o guia de início rápido da API do Flatkey e, em seguida, compare kimi-k3 com as cargas de trabalho em que o contexto longo e o raciocínio do K3 podem realmente melhorar as métricas do seu produto.



