Las búsquedas de Kimi 3 API están aumentando, pero el nombre oficial del modelo es Kimi K3. Ese detalle de nomenclatura importa cuando buscas documentación, configuras un SDK o eliges un identificador de modelo: el ID del modelo en la API es kimi-k3, no kimi-3.
A fecha de 23 de julio de 2026, Moonshot AI ha puesto Kimi K3 a disposición a través de la plataforma Kimi API. La documentación oficial describe un modelo insignia de 2,8 billones de parámetros con comprensión visual nativa y una ventana de contexto de 1.048.576 tokens. Se puede invocar mediante una interfaz compatible con OpenAI, y Moonshot afirma que los pesos completos del modelo se publicarán el 27 de julio de 2026.
Esta guía separa lo que está confirmado de lo que todavía requiere seguimiento, muestra la configuración básica de la API de Kimi K3 y explica cómo preparar una aplicación para Kimi K3 y el próximo lanzamiento de un modelo de rápida evolución sin tener que reconstruir su integración cada vez.
Kimi 3 o Kimi K3: ¿cuál es el nombre correcto?
Kimi K3 es el nombre oficial. “Kimi 3” es una frase de búsqueda natural, pero la página de lanzamiento, la plataforma de API, la documentación y el ID del modelo de Moonshot AI usan Kimi K3.
Usa estos términos en los lugares apropiados:
- Búsqueda y contenido educativo: “Kimi 3 API (Kimi K3)” puede ayudar a los lectores a relacionar la consulta popular con el nombre oficial del producto.
- Solicitudes de API: usa
kimi-k3en el campomodel. - Documentación técnica: prefiere “Kimi K3” después de aclarar una vez la diferencia de nomenclatura.
Esto evita un problema común de la semana de lanzamiento: copiar un nombre de modelo no oficial en el código y asumir que el error resultante significa que la API no está disponible.
¿Qué está confirmado sobre la API de Kimi K3?
Los siguientes detalles fueron confirmados en los materiales oficiales de Moonshot AI el 23 de julio de 2026:
| Elemento | Información confirmada |
|---|---|
| Nombre oficial del modelo | Kimi K3 |
| ID del modelo de la API | kimi-k3 |
| URL base oficial de la API | https://api.moonshot.ai/v1 |
| Formato de la API | Compatible con el formato de la API de OpenAI |
| Endpoint de chat | /chat/completions |
| Ventana de contexto | 1.048.576 tokens |
| Modalidades | Se documenta la entrada de texto, imagen y video |
| Razonamiento | Siempre habilitado; reasoning_effort admite low, high y max |
| Acceso directo a la API | Se requiere una recarga exitosa de al menos $1 para desbloquear K3 |
| Pesos completos del modelo | Programados para publicarse antes del 27 de julio de 2026 |
La página oficial de precios de Kimi K3 de Moonshot indica actualmente, por cada un millón de tokens, $0.30 para entrada con acierto de caché, $3.00 para entrada sin acierto de caché y $15.00 para salida, sin incluir los impuestos aplicables. Toma estas cifras como datos sensibles al tiempo y consulta de nuevo la página oficial de precios antes de presupuestar o publicar una comparación fija.
Los materiales oficiales de lanzamiento también incluyen afirmaciones sobre benchmarks y arquitectura. Son puntos de partida útiles para la evaluación, pero los equipos deberían reproducir las pruebas con sus propios prompts, herramientas, requisitos de latencia y estándares de revisión de resultados, en lugar de tratar una gráfica de lanzamiento como una decisión de producción.
Cómo acceder directamente a la API de Kimi K3
Moonshot documenta una configuración compatible con OpenAI, por lo que los desarrolladores que ya usan el SDK de OpenAI pueden inicializar un cliente con una clave de API y una URL base diferentes.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Summarize the main risks in this migration plan.",
}
],
reasoning_effort="low",
)
print(response.choices[0].message.content)
Que sea compatible con OpenAI no significa que todos los modelos se comporten de forma idéntica. Kimi K3 tiene reglas específicas del modelo. Su modo de pensamiento está siempre activado, varios parámetros de muestreo están fijos y, según la documentación actual, no se admiten URL públicas de imágenes como entrada de visión. Revise los límites de parámetros de K3 antes de trasladar una carga de trabajo de producción existente sin cambios.
Por qué una API compatible con OpenAI es útil, pero no lo es todo
Una API compatible con OpenAI reduce el trabajo mecánico de integración. Su aplicación a menudo puede conservar la misma biblioteca cliente y la misma estructura de solicitudes mientras cambia la URL base, la clave de API y el nombre del modelo.
Pero la compatibilidad en la capa de transporte no elimina las diferencias operativas entre modelos:
- los parámetros de solicitud compatibles pueden diferir;
- el comportamiento de la salida estructurada necesita pruebas de regresión;
- los esquemas de llamadas a herramientas y las reglas de elección de herramientas pueden variar;
- el razonamiento puede cambiar la latencia y el consumo de tokens;
- los límites de contexto no garantizan el mismo rendimiento con documentos largos;
- los límites de velocidad y la disponibilidad pueden cambiar según el nivel de cuenta;
- los requisitos de entrada multimodal pueden ser específicos del proveedor.
El enfoque sostenible es separar el código de su producto del acceso específico del proveedor. Su aplicación debería llamar a una capa estable de acceso al modelo, mientras que la política de enrutamiento, las credenciales del proveedor, los planes de respaldo, las cuotas y los informes de uso permanezcan configurables fuera de la función principal.
Preparar su app para Kimi K3 y el próximo lanzamiento de modelo
Los lanzamientos rápidos de modelos crean dos tareas distintas: evaluación y migración. Combinar ambas en un solo cambio de código de emergencia dificulta las dos.
1. Mantenga estable la superficie de la API
Utilice un único límite de cliente compatible con OpenAI en su aplicación en lugar de dispersar la inicialización del SDK del proveedor por toda la base de código. Una URL base estable facilita agregar o reemplazar modelos compatibles sin reescribir cada función.
Flatkey proporciona una clave API y la URL base compatible con OpenAI https://router.flatkey.ai/v1 para los modelos compatibles. Su catálogo público en vivo mostraba kimi-k3 como disponible al verificarse el 23 de julio de 2026.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FLATKEY_API_KEY"],
base_url="https://router.flatkey.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Revisa este plan de implementación."}
],
)
Confirme siempre el catálogo actual de modelos y la compatibilidad de parámetros antes de implementar. La disponibilidad, la configuración de rutas y los precios pueden cambiar después de un lanzamiento.
2. Encamine por carga de trabajo, no por el entusiasmo del modelo
No envíe todo el tráfico a un modelo recién lanzado el primer día. Defina clases de evaluación como:
- codificación a escala de repositorio;
- análisis de documentos;
- agentes que usan herramientas;
- extracción de datos estructurados;
- comprensión de imágenes o video;
- chat con clientes de baja latencia.
Luego pruebe la calidad, la latencia, el consumo de tokens y el comportamiento ante fallos para cada clase. Un modelo puede ser excelente para codificación de largo recorrido y, al mismo tiempo, ser innecesario para llamadas breves de clasificación.
3. Defina una alternativa de modelo antes del tráfico de producción
Una política de respaldo de modelo debe responder a algo más que “¿qué se ejecuta si Kimi K3 está caído?”. Debe definir:
- qué modelos de respaldo admiten la misma modalidad de entrada;
- qué parámetros de la solicitud deben eliminarse o traducirse;
- si el respaldo conserva la salida estructurada y las llamadas a herramientas;
- el coste y la latencia máximos aceptables;
- cuándo fallar de forma visible en lugar de devolver una respuesta con menor confianza.
Las capacidades de enrutamiento y conmutación automática de Flatkey permiten a los equipos gestionar las rutas ascendentes compatibles detrás de una sola integración. La aplicación mantiene una frontera de API estable mientras la política de enrutamiento puede evolucionar a medida que cambia la disponibilidad de los modelos.
4. Haga un seguimiento del uso y aplique cuotas de forma centralizada
Un modelo nuevo puede cambiar tanto el consumo promedio de tokens como la longitud de salida. El seguimiento centralizado del uso ayuda a ingeniería y finanzas a ver si un experimento está mejorando el producto o simplemente aumentando el gasto.
Flatkey combina visibilidad del uso, facturación unificada, gestión de claves API y controles de cuota en un solo panel. Esto es especialmente útil cuando varios equipos están probando Kimi K3 junto con GPT, Claude, Gemini, DeepSeek, Qwen u otros modelos compatibles.
¿API directa de Kimi o una puerta de enlace de IA multimodelo?
Ambos enfoques pueden ser válidos.
Elija la API directa de Kimi AI cuando quiera el camino más corto hacia las capacidades específicas de Moonshot, se sienta cómodo gestionando otra cuenta de proveedor y planee optimizar de cerca en torno al comportamiento actual de la API de Kimi.
Elija una puerta de enlace de IA multimodelo cuando su aplicación necesite comparar modelos, cambiar rutas sin amplios cambios de código, configurar respaldo, consolidar informes de uso o controlar cuotas de equipos entre proveedores.
La elección no tiene por qué ser permanente. Una frontera limpia compatible con OpenAI permite a los equipos probar rutas directas y de pasarela, manteniendo relativamente estable la capa de aplicación.
Para conocer los detalles de implementación, lee la lista de verificación de migración de pasarela de API compatible con OpenAI de Flatkey y luego revisa la guía de arquitectura de pasarela de API de IA más amplia.
Lista de verificación de evaluación de Kimi K3
Antes de enrutar tráfico de producción a Kimi K3, verifica:
- que el ID exacto del modelo y la ruta estén disponibles;
- los precios actuales de entrada, salida y caché;
- los límites de tasa y la concurrencia del nivel de cuenta;
- el comportamiento requerido de
reasoning_effort; - la compatibilidad con llamadas a herramientas y salida estructurada;
- las restricciones de archivos y URL multimodales;
- la latencia con tamaños de contexto realistas;
- el comportamiento de respaldo bajo límites de tasa o errores del proveedor;
- la visibilidad de uso, facturación y cuota;
- la calidad de salida en tu propio conjunto de aceptación.
Una ventana de contexto de un millón de tokens es una capacidad importante, pero no sustituye las pruebas específicas de la carga de trabajo, la observabilidad ni los controles de costos.
Preguntas frecuentes
¿Kimi 3 es lo mismo que Kimi K3?
“Kimi 3” es una frase de búsqueda común, mientras que Kimi K3 es el nombre oficial del modelo. Usa kimi-k3 como el ID del modelo en la API.
¿La API de Kimi K3 está disponible ahora?
Sí. A fecha del 23 de julio de 2026, Kimi K3 está documentado y disponible a través de la plataforma oficial Kimi API Platform. El catálogo público en vivo de modelos de Flatkey también mostraba kimi-k3 como disponible en esa fecha.
¿La API de Kimi K3 es compatible con OpenAI?
Moonshot indica que la API de Kimi utiliza un formato compatible con OpenAI. Los desarrolladores pueden usar el SDK de OpenAI con la URL base de Moonshot y la clave de API, teniendo en cuenta las reglas de parámetros específicas de K3.
¿Cuál es la ventana de contexto de Kimi K3?
La documentación oficial indica una ventana de contexto de 1.048.576 tokens, que comúnmente se describe como un millón de tokens.
¿Puedo desactivar el razonamiento en Kimi K3?
No. La documentación actual indica que Kimi K3 siempre tiene el pensamiento activado. Puedes ajustar reasoning_effort a low, high o max.
¿Por qué usar una pasarela de API de IA para Kimi K3?
Una pasarela de API de IA puede mantener una sola frontera de API orientada a la aplicación mientras centraliza el acceso a modelos compatibles, el enrutamiento, el fallback, el seguimiento de uso, la facturación y los controles de cuota. Esto reduce el trabajo operativo cuando los modelos y la disponibilidad cambian rápidamente.
Construye para el cambio de modelos, no solo para un modelo
Kimi K3 es una nueva opción importante para los desarrolladores que evalúan cargas de trabajo de contexto largo, multimodales, de programación y de trabajo con conocimiento. La lección arquitectónica más importante es que el acceso a los modelos seguirá cambiando.
Flatkey ayuda a los equipos a acceder a los modelos compatibles a través de una sola clave de API, una única URL base compatible con OpenAI y un solo panel para el enrutamiento, el uso, la facturación y las cuotas. Revisa el catálogo actual de modelos y los precios antes de tu próxima evaluación de modelos.



