Kimi K3 ya está disponible para equipos de API que necesitan una ruta de modelo de contexto largo para programación, trabajo del conocimiento, razonamiento visual y flujos de trabajo con agentes. La versión breve: el ID oficial del modelo es kimi-k3, Kimi indica una ventana de contexto de 1,048,576 tokens, el precio directo de Kimi se publica por cada 1M de tokens y Flatkey actualmente expone una ruta kimi-k3 a través de un endpoint compatible con OpenAI.
Esta guía está dirigida a equipos de producto que están decidiendo si Kimi K3 debería entrar hoy en un plan de enrutamiento de producción. Cubre precios de API, límites de la ventana de contexto, notas de compatibilidad, comprobaciones de rutas y las preguntas operativas que hay que responder antes de enviar tráfico real. Lea Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento como una lista de verificación de lanzamiento, no solo como un anuncio del modelo.
Respuesta rápida
Para los equipos que buscan Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento, los datos importantes del día de lanzamiento son:
| Elemento | Detalle actual respaldado por la fuente |
|---|---|
| ID oficial del modelo | kimi-k3 |
| Patrón de endpoint directo de Kimi | Chat Completions compatible con OpenAI en https://api.moonshot.ai/v1 |
| Ventana de contexto | 1,048,576 tokens |
| Precio directo de entrada | $3.00 por 1M tokens |
| Precio directo de entrada en caché | $0.30 por 1M tokens |
| Precio directo de escritura en caché | $3.00 por 1M tokens para TTL de 5 minutos; $6.00 por 1M tokens para TTL de 1 hora |
| Precio directo de salida | $15.00 por 1M tokens |
| Modo de pensamiento | Siempre habilitado; controle el esfuerzo con valores de reasoning_effort low, high o max |
| Ruta de Flatkey | kimi-k3 está disponible en los datos de rutas de Flatkey dentro del grupo China LLM |
El lanzamiento no es solo una ventana de contexto más grande. La propia lista de modelos de Kimi describe K3 como su modelo más capaz hasta la fecha, con 2.8T parámetros, comprensión visual nativa y una ventana de contexto de 1M tokens para ingeniería de software, trabajo del conocimiento y razonamiento profundo.
Qué cambió con Kimi K3
Kimi K3 reemplaza las rutas anteriores de Kimi como el modelo que los equipos deberían evaluar para continuar con el soporte de Kimi. La documentación del modelo de Kimi marca kimi-k2.5 y la serie moonshot-v1 como discontinuadas el 31 de agosto de 2026, y dirige a los usuarios a kimi-k3 para continuar con el soporte.
Eso importa para el enrutamiento. Si su aplicación todavía guarda alias moonshot-v1-*, kimi-latest o kimi-k2-* anteriores en la configuración, la opción segura no es hacer un buscar y reemplazar a ciegas. Trátelo como una migración de ruta:
- Encuentre cada ID de modelo Kimi en el código, los prompts, las configuraciones de evaluación y los ajustes del espacio de trabajo del cliente.
- Mueva una carga de trabajo de staging a
kimi-k3. - Ejecute una prueba rápida de contexto, llamada a herramientas, JSON, visión y streaming.
- Compare el coste de salida aceptada, no solo el precio por token.
- Añada una ruta de respaldo antes del despliegue en producción.
Los equipos de Flatkey pueden usar el mismo proceso de evaluación del día de lanzamiento en la lista de verificación de evaluación de nuevos modelos antes de mover Kimi K3 a una ruta principal.
Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento para equipos
Los precios directos de la API de Kimi para K3 se publican como precio por tokens, por cada 1 millón de tokens. Para Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento, las filas de precios directos actuales son:
| Elemento de facturación | Precio directo de Kimi | Notas para los equipos de producto |
|---|---|---|
| Escritura en caché, TTL de 5 minutos | $3.00 / 1M tokens | TTL predeterminado si no se especifica un TTL |
| Escritura en caché, TTL de 1 hora | $6.00 / 1M tokens | Útil solo cuando la ventana de reutilización más larga compensa el coste de escritura |
| Entrada en caché | $0.30 / 1M tokens | Se aplica cuando los prefijos repetidos aciertan en la caché de contexto |
| Entrada | $3.00 / 1M tokens | Se aplica a los tokens del prompt no almacenados en caché |
| Salida | $15.00 / 1M tokens | A menudo es el principal factor de coste para bucles de agentes y razonamiento extenso |
Esta es la parte de Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento que los equipos deberían convertir en cálculo de carga de trabajo. Una ruta de contexto largo puede parecer asequible en el precio de entrada y aun así volverse cara si cada solicitud crea una gran escritura en caché, produce una salida de razonamiento larga o repite contexto de poco valor.
Usa esta fórmula de planificación:
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
divided by accepted results
Para una decisión de producción, ejecuta esa fórmula sobre una muestra real. Incluye las generaciones fallidas, los reintentos, los bucles de llamadas a herramientas y las salidas rechazadas por tu control de calidad del producto.
Notas sobre la ventana de contexto y la caché
Kimi indica una ventana de contexto de 1.048.576 tokens para Kimi K3. Eso la hace relevante para tareas de programación en todo el repositorio, revisión de documentos grandes, análisis de productos en varios archivos y sesiones de agentes de larga duración.
Pero una ventana de 1M tokens no elimina la necesidad de disciplina de contexto:
- Mantén estables los prefijos estables para que la caché automática pueda funcionar.
- Evita poner todos los documentos en todas las solicitudes cuando la recuperación sea más barata.
- Limita la longitud de salida para tareas que no necesitan razonamiento de formato largo.
- Mantén un modelo de respaldo más pequeño para solicitudes breves que no se beneficien del contexto de 1M.
- Mide la latencia por separado del precio porque los prompts largos cambian la experiencia del usuario incluso cuando caben.
La documentación de Kimi indica que la caché automática se aplica a las solicitudes normales del modelo, sin necesidad de ID de caché, TTL ni parámetros adicionales. También señalan que una nueva solicitud solo puede usar la caché de prefijo cuando el prompt anterior supera los 256 tokens. Los equipos de producto deberían verificar el comportamiento de la caché en sus propios registros antes de prometer reducciones de coste con Kimi K3.
Compatibilidad de la API y forma de la solicitud
La guía de inicio rápido de Kimi usa el SDK de Python de OpenAI con base_url="https://api.moonshot.ai/v1" y model="kimi-k3". Eso convierte a Kimi K3 en un candidato práctico para equipos que ya usan clientes de Chat Completions compatibles con OpenAI.
Los detalles de compatibilidad todavía necesitan una prueba rápida el día del lanzamiento:
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "Resume los riesgos de enrutamiento para este lanzamiento."}
],
)
print(completion.choices[0].message.content)
Para Flatkey, mantén el ID del modelo como kimi-k3, dirige las llamadas compatibles a través del enrutador de Flatkey y verifica la ruta en el flujo de trabajo de la guía del catálogo de modelos de IA antes de pasar a producción. La página del modelo es el lugar adecuado para confirmar la disponibilidad actual, la compatibilidad con endpoints y el precio efectivo de la ruta.
Notas de enrutamiento para equipos de Flatkey
La API de precios actual de Flatkey muestra kimi-k3 como disponible y enrutado a través del grupo China LLM con compatibilidad con el endpoint de OpenAI. La página pública del modelo de Flatkey también muestra una ruta de modelo Kimi K3 y establece que es un modelo de chat/completions con contexto de 1M tokens.
Antes de añadir Kimi K3 a un enrutador de producción, captura este registro de revisión de ruta. Es el artefacto de entrega para Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento cuando los equipos de plataforma, producto y finanzas necesitan la misma fuente de verdad:
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- codificación de contexto largo
- sesiones de agentes para trabajo del conocimiento
- revisión de razonamiento visual
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
Esto convierte Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento de un anuncio de lanzamiento en una lista de verificación operativa.
Lista de verificación de producción
Usa esta lista de verificación de Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento antes de desviar tráfico:
| Comprobación | Qué verificar |
|---|---|
| ID del modelo | kimi-k3 funciona en staging y no está oculto detrás de un nivel de cuenta que tu clave de producción no tenga |
| Recarga/acceso | Kimi dice que K3 se desbloquea después de una recarga exitosa, y que el nivel de la cuenta afecta los límites de velocidad |
| Contexto | Tu prompt más grande cabe por debajo de 1.048.576 tokens con espacio para la salida |
| Presupuesto de salida | max_completion_tokens se controla para cada carga de trabajo |
| Esfuerzo de razonamiento | low, high y max se prueban frente a latencia, costo y calidad |
| Caché | Las cargas de trabajo con prefijo repetido realmente alcanzan la caché en los registros |
| Visión | No se asumen URL públicas de imágenes; la documentación de Kimi indica entrada en base64 o ms://<file-id> |
| Herramientas | Los bucles de llamadas a herramientas devuelven el mensaje completo del asistente, no solo content |
| Fallback | Una ruta más barata o más estable está lista antes de que el tráfico de producción se mueva |
| Facturación | Los registros directos del proveedor y los registros de uso de Flatkey se concilian para la misma carga de trabajo de muestra |
Cuándo enrutar Kimi K3
Kimi K3 merece probarse primero cuando la carga de trabajo tiene una o más de estas características:
- Contexto de bases de código grandes, hilos de planificación largos o análisis de varios documentos.
- Tareas en las que la calidad del razonamiento importa más que la latencia bruta.
- Flujos de trabajo que pueden beneficiarse de la caché de prefijo repetido.
- Revisión multimodal donde el texto y las entradas visuales pertenecen a un solo paso de razonamiento.
- Tareas de agente en las que una ventana de contexto más grande reduce la fragilidad del ensamblaje de recuperación.
Es menos probable que sea la ruta predeterminada para todas las solicitudes. Las tareas cortas de clasificación, extracción y mensajes de soporte pueden rendir mejor en un modelo más barato y de baja latencia. El patrón práctico de enrutamiento es reservar Kimi K3 para cargas de trabajo en las que el contexto de 1M, el esfuerzo de razonamiento o la comprensión visual cambian la tasa de salida aceptada.
Preguntas frecuentes
¿Kimi K3 ya está disponible a través de la API?
Sí. La documentación de la API de Kimi incluye una guía rápida de Kimi K3, una lista de modelos, una página de precios y un banner de lanzamiento. Los datos de rutas de Flatkey también muestran kimi-k3 disponible para enrutamiento estilo OpenAI a partir del 22 de septiembre de 2026.
¿Cuál es la ventana de contexto de Kimi K3?
Kimi indica la ventana de contexto de Kimi K3 como 1.048.576 tokens. Tómalo como capacidad, no como una recomendación para enviar todos los documentos disponibles en cada llamada.
¿Cuál es el precio de la API de Kimi K3?
Los precios directos de Kimi sitúan K3 en $3.00 por 1M de tokens de entrada no cacheados, $0.30 por 1M de tokens de entrada cacheados, $3.00 o $6.00 por 1M de tokens de escritura de caché según el TTL, y $15.00 por 1M de tokens de salida. Consulta la página del modelo en Flatkey para conocer el precio efectivo actual de la ruta de Flatkey antes del lanzamiento.
¿Kimi K3 admite controles de razonamiento?
Sí. Kimi dice que K3 siempre tiene activado el modo de pensamiento y admite un campo de nivel superior reasoning_effort con low, high y max, donde max es el valor predeterminado.
¿Cómo deberían usar los equipos esta página Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento?
Úsalo como una página de triaje para el día del lanzamiento: confirma los datos oficiales de precios y contexto, ejecuta la lista de verificación de enrutamiento, calcula el coste del output aceptado y solo entonces decide si Kimi K3 pasa a ser una ruta principal, una ruta de respaldo o una ruta experimental.
Conclusión principal
Kimi K3 ya está disponible: precios de API, ventana de contexto y notas de enrutamiento es útil porque este lanzamiento afecta tanto la capacidad del modelo como las operaciones en producción. El titular es 1M de contexto y una nueva ruta insignia kimi-k3. Aun así, la decisión debería basarse en el coste medido del output aceptado, la latencia, el comportamiento de la caché, la fiabilidad de las llamadas a herramientas y la preparación del plan de respaldo.
Flatkey ayuda a los equipos a mantener esa evaluación de forma práctica: una clave, un saldo y el enrutamiento de modelos a través de una capa de API compartida, con el catálogo de modelos y los registros de uso disponibles para comprobar las rutas antes y después del lanzamiento.



