Model and Modality Playbooks11 de septiembre de 2026Flatkey Team

Kimi 3 API (Kimi K3): Lo que los desarrolladores necesitan saber

Una guía actual y basada en fuentes sobre el acceso a la API de Kimi K3, precios, ajustes de razonamiento, límites multimodales, comprobaciones de migración y enrutamiento con Flatkey.

Kimi 3 API (Kimi K3): Lo que los desarrolladores necesitan saber

Si está buscando la Kimi 3 API, el nombre oficial del modelo que debe usar en el código es Kimi K3. La distinción importa porque la documentación del modelo, los ejemplos del SDK, las tablas de precios y el identificador del modelo de la API utilizan todos kimi-k3, no kimi-3.

A fecha de 11 de septiembre de 2026, la propia guía de Kimi K3 de Kimi enumera Kimi K3 como su modelo insignia para programación de largo alcance, trabajo de conocimiento de extremo a extremo, razonamiento profundo, comprensión visual, comprensión de video y flujos de trabajo de contexto de 1M tokens. La plataforma API de Kimi lo expone mediante los protocolos Chat Completions compatibles con OpenAI, Responses compatibles con OpenAI y Messages compatibles con Anthropic, por lo que los desarrolladores pueden evaluar Kimi K3 sin reconstruir desde cero todos los envoltorios de solicitudes.

Esta guía explica qué hay de actual en la búsqueda para Kimi 3 API, cómo llamar directamente a Kimi K3, qué cambió desde la primera cobertura del lanzamiento de K3 y cómo un indie hacker puede probar Kimi K3 a través de una ruta directa del proveedor o de una puerta de enlace multmodelo como Flatkey.

Kimi 3 API vs Kimi K3 API

Kimi K3 es el nombre oficial. Kimi 3 API es una frase de búsqueda útil porque muchos desarrolladores usan un lenguaje parecido al de una versión cuando se lanza una nueva generación importante de modelos.

Use los términos de esta manera:

  • En los títulos de artículos y en textos educativos, "Kimi 3 API (Kimi K3)" ayuda a los lectores a relacionar la frase de búsqueda con el modelo oficial.
  • En las solicitudes de API, use kimi-k3 en el campo model.
  • En tickets de ingeniería y documentación, prefiera "Kimi K3" después de la primera aclaración.

Esto evita un error simple pero costoso: copiar una frase de búsqueda popular al código y depurar un error de modelo no encontrado que no tiene nada que ver con el acceso a la cuenta.

Datos actuales de la API de Kimi K3

La documentación actual de la API de Kimi describe Kimi K3 como un modelo de 2.8 billones de parámetros con comprensión visual nativa y una ventana de contexto de 1,048,576 tokens. Kimi indica que se han publicado los pesos completos del modelo, lo que sustituye la redacción de la semana de lanzamiento según la cual los pesos estaban programados para publicarse antes del 27 de julio de 2026.

Campo Nota actual para desarrolladores
Nombre oficial del modelo Kimi K3
ID del modelo de la API kimi-k3
URL base directa compatible con OpenAI https://api.moonshot.ai/v1
Endpoint de chat /chat/completions
Endpoint de Responses /responses
URL base compatible con Anthropic https://api.moonshot.ai/anthropic
Ventana de contexto 1,048,576 tokens
Modalidades Se documentan entradas de texto, imagen y video
Razonamiento Siempre habilitado para K3; use reasoning_effort
Valores de esfuerzo de razonamiento low, high, max; el valor predeterminado es max
Requisito de acceso Un recargo exitoso mínimo de $1 desbloquea el uso de la API
Precio directo de Kimi $0.30 de entrada con acierto en caché, $3.00 de entrada sin acierto en caché, $15.00 de salida por 1M tokens, excluidos los impuestos aplicables

Los precios, la disponibilidad de rutas y los límites de tasa pueden cambiar, así que trate los números fijos como un elemento de verificación previo al despliegue, no como un contrato permanente. Antes de presupuestar un lanzamiento en producción, consulte la documentación de precios y límites de tasa de Kimi.

¿Qué cambió desde la semana de lanzamiento?

Si leyó un artículo anterior sobre Kimi K3, vuelva a revisar estos puntos antes de copiar su consejo:

  • La documentación de K3 de Kimi ahora indica que se han publicado los pesos completos del modelo.
  • La lista de modelos de Kimi ahora posiciona kimi-k3 como el destino de migración para varios ID de modelo retirados.
  • Las series kimi-k2.5 y moonshot-v1 fueron retiradas el 31 de agosto de 2026, y las llamadas a esos modelos ahora devuelven errores de modelo no encontrado, según la lista de modelos y el registro de cambios de la plataforma de Kimi.
  • La descripción general de la API ahora documenta tres superficies de compatibilidad: OpenAI Chat Completions, OpenAI Responses y Anthropic Messages.
  • El comportamiento de las solicitudes específico de K3 sigue siendo importante: K3 siempre razona, varios parámetros de muestreo están fijos y las URL públicas de imágenes no son compatibles como entrada de visión.

Para un desarrollador independiente o un pequeño equipo de producto de IA, la conclusión práctica es simple: si un prototipo antiguo usaba un ID de modelo Moonshot v1 o K2.x, no se limite a cambiar la URL base y esperar que el resto funcione. Actualice el ID del modelo, elimine los parámetros de pensamiento no compatibles, ejecute pruebas rápidas de verificación y valide de nuevo los costes y los límites.

Cómo llamar directamente a Kimi K3 con el SDK de OpenAI

La configuración compatible con OpenAI de Kimi usa el SDK de OpenAI con la clave de API de Moonshot y la URL base de Kimi.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {
            "role": "user",
            "content": "Revise esta lista de verificación de lanzamiento y enumere las tres brechas más riesgosas.",
        }
    ],
)

print(response.choices[0].message.content)

Eso es suficiente para una llamada de texto básica. No es suficiente para una migración de producción. Kimi K3 difiere de los modelos genéricos compatibles con OpenAI en aspectos que su aplicación debería probar explícitamente.

Parámetros de Kimi K3 que no debe omitir

El parámetro más importante de K3 es reasoning_effort.

Kimi K3 siempre tiene el pensamiento habilitado. No puede desactivarlo, pero sí puede elegir el nivel de esfuerzo de razonamiento:

  • low para comprobaciones de menor latencia, borradores, clasificación o exploración más económica.
  • high para tareas de razonamiento más difíciles en las que la latencia es aceptable.
  • max para el modo de razonamiento más profundo de K3 y el valor predeterminado actual.

La referencia de parámetros de Kimi también indica que temperature, top_p, n, presence_penalty y frequency_penalty están fijos para K3. Pasar valores incompatibles puede devolver errores, así que omita esos parámetros salvo que la documentación actual indique lo contrario.

Para conversaciones de varios turnos y llamadas a herramientas, Kimi indica que debes devolver el mensaje completo del asistente devuelto por la API, incluidos los campos de razonamiento y de llamada a herramientas. Si tu aplicación existente solo almacena message.content, corrígelo antes de juzgar K3 en flujos de trabajo de agentes.

Entrada de visión y video: usa los formatos compatibles

Kimi K3 admite comprensión visual, pero la forma de entrada es específica.

Para mensajes de imagen, message.content debe ser un array de partes, no una cadena JSON. La documentación de visión de Kimi admite contenido de imagen en base64 y referencias de ID de archivo. Actualmente no admite imágenes con formato de URL pública como entrada de visión.

Para video, sube primero el archivo y refiérelo con el formato ms://<file-id> en una parte video_url. Kimi recomienda mantener la resolución del video en FHD o por debajo y usar la API de estimación de tokens antes de trabajos multimodales costosos.

Esto importa para los equipos de producto porque un proveedor puede ser "compatible con OpenAI" para chat y, aun así, tener reglas específicas del proveedor para imágenes, video, cargas de archivos, límites y facturación.

¿API directa de Kimi o ruta Flatkey?

Ambos enfoques son válidos. La elección correcta depende de lo que quieras aprender.

Elige la API directa de Kimi cuando:

  • quieres la ruta más cercana a las funciones específicas de K3 de Moonshot;
  • tu aplicación está evaluando principalmente Kimi K3 en lugar de comparar muchos modelos;
  • te sientes cómodo gestionando otra cuenta de proveedor, saldo, clave, perfil de límite de tasa y factura;
  • puedes mantener el manejo de parámetros específicos de Kimi en el código de tu aplicación.

Elige una puerta de enlace multimodelo como Flatkey cuando:

  • quieres una sola URL base compatible con OpenAI mientras comparas Kimi K3 con GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Seedance y otros modelos compatibles;
  • tu aplicación necesita enrutamiento de respaldo, listas de अनुमति de modelos, registros de uso, controles de cuota o facturación compartida;
  • quieres mover las credenciales específicas del proveedor y la política de rutas fuera del código de funcionalidad;
  • estás construyendo con agentes de programación o trabajos de automatización que pueden consumir grandes volúmenes de tokens en varios proveedores.

El catálogo público de modelos de Flatkey actualmente enumera kimi-k3 como disponible a través del tipo de endpoint compatible con OpenAI. La URL base actual del router de Flatkey para solicitudes compatibles con OpenAI es:

https://router.flatkey.ai/v1

La configuración correspondiente del SDK es:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["FLATKEY_API_KEY"],
    base_url="https://router.flatkey.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": "Compara estos tres flujos de incorporación y elige la ruta de lanzamiento de menor riesgo.",
        }
    ],
)

print(response.choices[0].message.content)

Antes de usarlo en producción, confirma si la ruta admite todos los campos de solicitud específicos de Kimi que tu carga de trabajo necesita. La compatibilidad es una atajo de integración, no un sustituto de la cobertura de pruebas.

Un flujo práctico de evaluación de Kimi K3

Usa esta secuencia antes de mover usuarios reales a la ruta de la API de Kimi 3:

  1. Confirme el ID del modelo y el acceso. Verifique que kimi-k3 aparezca en la lista actual de modelos del proveedor o gateway, y confirme que su cuenta tenga el saldo requerido o permiso de ruta.
  2. Ejecute una prueba de humo en texto plano. Comience con un prompt breve sin streaming antes de añadir herramientas, modo JSON, streaming, contexto largo o visión.
  3. Pruebe la carga de trabajo exacta. Use prompts reales de su producto: tareas de agentes de programación, análisis de documentos, automatización de soporte, investigación, extracción estructurada o revisión multimodal.
  4. Mida la aceptación de la salida. No confíe solo en las afirmaciones de los benchmarks. Haga seguimiento de si los usuarios, revisores o analizadores posteriores aceptan la respuesta.
  5. Mida la latencia y el uso de tokens. El contexto largo y el razonamiento de K3 pueden ser útiles, pero también pueden cambiar el tiempo real de ejecución y la longitud de la salida.
  6. Pruebe el comportamiento de los parámetros. Elimine los parámetros fijos de muestreo, establezca reasoning_effort de forma deliberada y conserve los mensajes completos del asistente en sesiones de varios turnos.
  7. Verifique las restricciones multimodales. Use base64 o cargas de archivos para imágenes y videos, y estime el costo en tokens antes de trabajos con grandes medios.
  8. Defina un respaldo. Elija modelos de respaldo con los mismos requisitos de modalidad y forma de respuesta. Decida cuándo reintentar, fallar de forma visible o enrutar en otro lugar.
  9. Revise los registros de uso. Confirme que puede ver el modelo, estado, tokens, tokens en caché, costo, latencia, propietario y entorno.
  10. Despliegue una carga de trabajo. Comience con una carga de trabajo acotada y luego amplíela después de que la ruta demuestre calidad, fiabilidad y costo.

Lista de verificación de migración a Kimi K3 para aplicaciones antiguas de Kimi

Si su código ya usa IDs de modelos antiguos de Kimi o Moonshot, revise lo siguiente:

  • Reemplace IDs de modelos retirados como kimi-k2.5 o moonshot-v1-* por kimi-k3 u otro modelo actual compatible.
  • Elimine la configuración thinking de K2.x al migrar a K3; en su lugar, use reasoning_effort en el nivel superior.
  • Deje de pasar parámetros de muestreo no admitidos.
  • Conserve los mensajes completos del asistente en flujos de varios turnos y llamadas a herramientas.
  • Vuelva a probar la salida con esquema JSON, el comportamiento de selección de herramientas, el comportamiento del analizador de streaming y el manejo de errores.
  • Recalcule la economía de aciertos y fallos de caché a partir de la tabla de precios actual.
  • Vuelva a comprobar los límites de tasa para su nivel de recarga actual.
  • Actualice paneles, alertas y runbooks para que kimi-k3 sea visible como su propia ruta de modelo.

Errores comunes con la API de Kimi 3

Usar el nombre de modelo incorrecto

Use kimi-k3, no kimi-3. Mantenga la frase "Kimi 3 API" para búsquedas y explicaciones dirigidas al usuario.

Tratar OpenAI-compatible como idéntico

OpenAI-compatible significa que puede reutilizar una superficie de solicitud familiar. No garantiza parámetros de modelo idénticos, manejo multimodal, límites de tasa, campos de uso o comportamiento de salida.

Ignorar los fallos de caché

El precio de Kimi K3 separa la entrada con acierto en caché y la entrada sin acierto en caché. Para aplicaciones de contexto largo, una pequeña diferencia en la estabilidad del prefijo puede cambiar de forma material el costo efectivo.

Evaluar solo capturas de pantalla de benchmarks

Los materiales de lanzamiento de Kimi incluyen afirmaciones sobre benchmarks y arquitectura, pero tu decisión de producción debe basarse en tu propio conjunto de aceptación, presupuesto de latencia, compatibilidad del parser y comportamiento de fallback.

Cambiar un agente de larga duración a mitad de sesión

El blog técnico de Kimi advierte que K3 puede ser sensible al historial de pensamiento. Para flujos de trabajo de agentes, evita cambiar una sesión activa desde otro modelo a K3 sin restablecer y validar el estado de la conversación.

Preguntas frecuentes

¿Kimi 3 es lo mismo que Kimi K3?

"Kimi 3" es una frase de búsqueda común. Kimi K3 es el nombre oficial del modelo, y kimi-k3 es el ID del modelo de API que los desarrolladores deben usar.

¿La API de Kimi K3 está disponible ahora?

Sí. La lista actual de modelos de Kimi incluye kimi-k3, y la guía de Kimi K3 documenta el acceso directo a la API a través de la Kimi API Platform.

¿Cuál es la ventana de contexto de Kimi K3?

La documentación actual de Kimi indica una ventana de contexto de 1,048,576 tokens para Kimi K3.

¿Cuánto cuesta la API de Kimi K3?

La página actual de precios de inferencia de Kimi indica Kimi K3 a $0.30 por 1M de tokens de entrada con acierto de caché, $3.00 por 1M de tokens de entrada sin acierto de caché y $15.00 por 1M de tokens de salida, excluyendo los impuestos aplicables. Revisa de nuevo la página de precios antes de presupuestar porque los precios del modelo pueden cambiar.

¿Puedo desactivar el razonamiento de Kimi K3?

No. Kimi K3 siempre razona. Puedes establecer reasoning_effort en low, high o max.

¿Kimi K3 admite URLs de imágenes?

Kimi K3 admite entrada visual, pero la documentación actual de visión de Kimi indica que no se admiten imágenes con formato de URL pública. Usa contenido de imagen en base64 o cargas de archivos en su lugar.

¿Puedo llamar a Kimi K3 a través de Flatkey?

El catálogo público de Flatkey actualmente enumera kimi-k3 como disponible a través de un tipo de endpoint compatible con OpenAI. Usa Flatkey cuando quieras una clave, una URL base de router, facturación compartida, visibilidad de uso y controles de enrutamiento entre varios modelos compatibles.

Construye para el próximo cambio de modelo

La tendencia de búsqueda de la API de Kimi 3 en realidad trata de un problema más amplio para los desarrolladores: el acceso a los modelos cambia más rápido que la arquitectura de las aplicaciones.

Kimi K3 merece evaluarse para programación de contexto largo, trabajo de conocimiento, razonamiento profundo y tareas multimodales. Pero la decisión de ingeniería duradera es mantener configurable la elección del proveedor, probar explícitamente el comportamiento específico de cada modelo y centralizar el enrutamiento, el uso, el fallback y la facturación antes de que los experimentos con modelos se extiendan por toda tu base de código.

Flatkey ayuda con ese modelo operativo al ofrecer a los equipos un router compatible con OpenAI, una clave de API, un saldo y un panel únicos en modelos y herramientas oficiales compatibles. Empieza con la guía de inicio rápido de la API de Flatkey, y luego compara kimi-k3 con las cargas de trabajo donde el contexto largo y el razonamiento de K3 realmente pueden mover las métricas de tu producto.