Si está comparando los precios de la API de Gemini en 2026, la parte más difícil no es encontrar una tarifa. Es decidir qué tarifa se aplica a su carga de trabajo.
Los resultados de búsqueda suelen mezclar cuatro productos diferentes: la API para desarrolladores de Gemini, la experiencia de prueba de Google AI Studio, Vertex AI u otros servicios de Google Cloud, y las suscripciones de Gemini para consumidores. Esta guía se centra en la API para desarrolladores de Gemini y utiliza las páginas oficiales de precios y facturación de Google revisadas el 27 de julio de 2026.
La respuesta corta es que el costo de la API de Gemini depende de cinco variables:
- la familia de modelos que seleccione
- el volumen de tokens de entrada y salida
- si las solicitudes individuales superan un umbral de contexto largo
- si la carga de trabajo puede usar precios por lotes
- complementos como almacenamiento en caché de contexto, grounding, audio, imágenes o video
Eso significa que el precio mínimo destacado de los tokens no siempre es el costo de producción más bajo. La comparación útil es una tabla de costos de carga de trabajo con los mismos supuestos aplicados a cada modelo candidato.
Precios de la API de Gemini de un vistazo
La tabla a continuación resume las principales filas de la API para desarrolladores de Gemini con capacidad de texto que los equipos tienen más probabilidades de comparar. Los precios están en dólares estadounidenses por 1 millón de tokens, según la página oficial de precios de la API para desarrolladores de Gemini de Google.
| Modelo | Estado | Entrada estándar | Salida estándar | Entrada por lotes | Salida por lotes | Escritura de caché de contexto | Almacenamiento de caché por hora |
|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | Vista previa | $0.40 | $2.40 | $0.20 | $1.20 | $0.04 | $1.00 |
| Gemini 3.5 Flash | Vista previa | $1.50 | $9.00 | $0.75 | $4.50 | $0.15 | $1.00 |
| Gemini 3.5 Flash-Lite | Vista previa | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 3.1 Flash-Lite | Vista previa | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 2.5 Pro | Estable | $1.25 hasta 200k; $2.50 por encima de 200k | $10.00 hasta 200k; $15.00 por encima de 200k | $0.625 hasta 200k; $1.25 por encima de 200k | $5.00 hasta 200k; $7.50 por encima de 200k | $0.125 hasta 200k; $0.25 por encima de 200k | $4.50 |
| Gemini 2.5 Flash | Estable | $0.30 | $2.50 | $0.15 | $1.25 | $0.03 | $1.00 |
| Gemini 2.5 Flash-Lite | Estable | $0.10 | $0.40 | $0.05 | $0.20 | $0.01 | $1.00 |
Para Gemini 3.6 Flash, Gemini 3.5 Flash, los modelos Flash-Lite de vista previa y las familias Gemini 2.5 Flash, la entrada de audio tiene una tarifa más alta que la entrada de texto, imagen o video. La tabla usa la tarifa de entrada de texto, imagen y video para que las filas de modelos sigan siendo comparables.
Los modelos de vista previa pueden cambiar antes del lanzamiento estable. Si su política de producción requiere comportamiento fijo, ventanas de desuso más largas o un identificador de modelo estable, compare la economía de la vista previa con las filas estables de Gemini 2.5 en lugar de seleccionar solo por precio.
Qué cambió en la actualización del 27 de julio de 2026
El cambio más importante desde la versión anterior de esta guía es la línea de modelos actual.
- Gemini 3.6 Flash Preview ahora aparece como una opción de alto rendimiento a $0.40 de entrada y $2.40 de salida por millón de tokens.
- Gemini 3.5 Flash-Lite Preview ahora aparece a $0.25 de entrada y $1.50 de salida por millón de tokens.
- La fila anterior de Gemini 3.1 Flash-Lite sigue visible, pero los compradores deben confirmar qué identificador de modelo preview tienen intención de usar.
- Los modelos estables de Gemini 2.5 siguen siendo puntos de referencia útiles para los equipos que valoran la previsibilidad del ciclo de vida.
Por eso una página de precios de Gemini necesita mantenimiento programado. Una tabla correcta puede volverse estratégicamente engañosa incluso cuando cada número antiguo sigue estando técnicamente presente en algún lugar del catálogo.
Tabla de costos de carga de trabajo de la API de Gemini
La tabla siguiente convierte las tarifas en estimaciones de presupuesto. Estos escenarios no son referencias de calidad, y los modelos no son intercambiables. Responden a una pregunta financiera más concreta: ¿cuál sería la factura de tokens si la misma carga de trabajo se ejecutara en cada ruta?
Suposiciones
| Carga de trabajo | Volumen de solicitudes | Entrada por solicitud | Salida por solicitud | Entrada total | Salida total |
|---|---|---|---|---|---|
| Clasificación y extracción | 1,000 solicitudes | 2,000 tokens | 300 tokens | 2M tokens | 0.3M tokens |
| Asistente con recuperación aumentada | 1,000 solicitudes | 20,000 tokens | 1,000 tokens | 20M tokens | 1M tokens |
| Revisión de documentos largos | 100 solicitudes | 150,000 tokens | 5,000 tokens | 15M tokens | 0.5M tokens |
El escenario de documentos largos mantiene cada prompt por debajo del umbral de 200k de Gemini 2.5 Pro. Se excluyen grounding, caché, audio, generación de imágenes y generación de video.
Coste estimado de tokens del nivel Standard
| Modelo | Clasificación | Asistente RAG | Revisión de documentos largos |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.95 | $6.50 | $4.50 |
| Gemini 3.6 Flash | $1.52 | $10.40 | $7.20 |
| Gemini 2.5 Flash-Lite | $0.32 | $2.40 | $1.70 |
| Gemini 2.5 Flash | $1.35 | $8.50 | $5.75 |
| Gemini 3.5 Flash | $5.70 | $39.00 | $27.00 |
| Gemini 2.5 Pro | $5.50 | $35.00 | $23.75 |
Estos totales muestran por qué una tabla de cargas de trabajo es más útil que una lista de modelos.
- Para la extracción de alcance limitado, la fila estable de Gemini 2.5 Flash-Lite tiene el coste de tokens más bajo en esta comparación.
- Gemini 3.6 Flash cuesta más que las rutas Lite, pero sustancialmente menos que Gemini 3.5 Flash bajo las mismas suposiciones.
- En el ejemplo de documentos largos, la factura de tokens de Gemini 2.5 Pro es menor que la de Gemini 3.5 Flash porque el prompt se mantiene por debajo del umbral de Pro. Eso no demuestra que sea el mejor modelo, pero evita la suposición engañosa de que toda carga de trabajo Pro debe costar más.
- Las aplicaciones con salida intensiva son más sensibles a la elección del modelo porque los tokens de salida cuestan más que los tokens de entrada de texto en cada fila mostrada aquí.
Qué hace la fijación de precios Batch con las mismas cargas de trabajo
Para las filas que admiten la API Batch, las tarifas por token Batch que Google publica suelen ser la mitad de las tarifas Standard. Si todas las solicitudes de los escenarios anteriores pueden ejecutarse de forma asíncrona, los totales estimados de tokens se convierten en:
| Modelo | Clasificación con Batch | Asistente RAG con Batch | Revisión de documentos largos con Batch |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.475 | $3.25 | $2.25 |
| Gemini 3.6 Flash | $0.76 | $5.20 | $3.60 |
| Gemini 2.5 Flash-Lite | $0.16 | $1.20 | $0.85 |
| Gemini 2.5 Flash | $0.675 | $4.25 | $2.875 |
| Gemini 3.5 Flash | $2.85 | $19.50 | $13.50 |
| Gemini 2.5 Pro | $2.75 | $17.50 | $11.875 |
Batch es una decisión de facturación y de arquitectura. Encaja muy bien para enriquecimiento sin conexión, ejecuciones de evaluación, resúmenes nocturnos, cargas retrospectivas de documentos y otros trabajos que no requieren una respuesta inmediata. No sustituye al servicio Standard cuando un usuario está esperando en un flujo de producto interactivo.
La fórmula detrás del costo de la API de Gemini
Para una carga de trabajo de texto sin complementos, use:
monthly cost =
(input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
Si la aplicación usa caché de contexto, agregue los costos de escritura en caché y almacenamiento. Si usa grounding, audio, imágenes generadas o video generado, calcule esas líneas por separado porque no comparten una tarifa universal por token.
Para las revisiones financieras, mantenga las suposiciones junto al resultado:
| Suposición a registrar | Por qué importa |
|---|---|
| Solicitudes por mes | Convierte el comportamiento por solicitud en un presupuesto |
| Tokens de entrada promedio y p95 | Los prompts largos pueden activar precios Pro más altos |
| Tokens de salida promedio y p95 | La salida suele ser la parte más cara |
| Proporción Standard frente a Batch | El trabajo asíncrono puede reducir de forma material el gasto en tokens |
| Volumen de escritura en caché y tiempo de retención | La reutilización puede ahorrar costo de entrada, pero el almacenamiento no es gratuito |
| Solicitudes con grounding | Google Search y Maps tienen asignaciones y tarifas independientes |
| Unidades de audio, imagen y video | La fijación de precios por modalidad puede dominar la factura de tokens de texto |
Nivel gratuito frente a nivel de pago de la API de Gemini
Google muestra un nivel gratuito para varios modelos actuales de la API de Gemini Developer. Eso lo hace útil para experimentos, prototipos y validación de bajo volumen. No hace desaparecer la cuestión del costo de producción.
La documentación de facturación de la API de Gemini separa el uso gratuito y de pago, y explica cómo los proyectos pasan a niveles de pago. Los equipos deben confirmar la elegibilidad actual, los límites de velocidad, los términos de uso de datos y la disponibilidad del modelo antes de tomar un prototipo exitoso del nivel gratuito como evidencia de producción.
La distinción práctica es:
- Usa el nivel gratuito para probar prompts, el comportamiento del SDK y la adecuación del producto.
- Usa las tarifas del nivel de pago y la telemetría real de tokens para aprobar un presupuesto de producción.
- No asumas que un modelo de vista previa, una cuota gratuita o un límite de tasa permanecerán sin cambios hasta el lanzamiento.
Precios de Gemini Pro y el umbral de 200k tokens
Gemini 2.5 Pro tiene uno de los umbrales de precio más importantes de la tabla actual. Los prompts de hasta 200k tokens usan las tarifas más bajas de entrada y salida. Los prompts por encima de 200k usan las tarifas más altas.
Ese umbral se aplica al tamaño del prompt de una solicitud individual, no al total mensual. Un equipo que envía 20 millones de tokens en muchos prompts pequeños puede permanecer en la tarifa más baja, mientras que una aplicación de contexto largo de menor volumen puede cruzar repetidamente el umbral.
Haz seguimiento al menos de estas dos métricas:
- porcentaje de solicitudes por encima de 200k tokens de entrada
- contribución al costo de esas solicitudes
Si una pequeña proporción de prompts sobredimensionados impulsa una gran parte del gasto, considera fragmentación, recuperación, resumen, reutilización de caché o una política de enrutamiento que reserve el modelo de contexto largo para las solicitudes que realmente lo necesitan.
Costos de caché de contexto, grounding y modalidad
Las tarifas por token son solo la capa base de los precios de la API de Gemini.
Caché de contexto
La tabla oficial enumera un precio de escritura en caché y un precio de almacenamiento por hora. La caché puede mejorar la economía cuando el mismo contexto grande se reutiliza suficientes veces, pero el punto de equilibrio depende del volumen de escritura, el tiempo de retención y cuánto input repetido reemplaza la caché.
Grounding con Google Search y Maps
El grounding incluye asignaciones gratuitas específicas del modelo seguidas de cargos por consulta o por prompt. No estimes una aplicación con grounding solo a partir de las tarifas por token. Registra el número de solicitudes con grounding y concílialas como una línea separada.
Audio en vivo
El audio de Live API usa tarifas de entrada y salida diferentes de las llamadas de texto habituales. Los equipos de agentes de voz deben presupuestar los tokens de audio por separado e incluir la duración de la sesión, el comportamiento de interrupción y la verbosidad de la respuesta en las pruebas de carga.
Generación de imágenes y video
Las imágenes y el video generados se tarifican usando unidades y filas de modelo específicas de la modalidad. Trátalos como presupuestos de producción separados en lugar de extensiones de una estimación del modelo de texto.
Gemini Developer API frente a Vertex AI y los planes de consumo
La frase "precios de Gemini" puede referirse a varias vías de compra.
| Producto | Pregunta típica del comprador | Por qué no debe mezclarse en esta tabla |
|---|---|---|
| Gemini Developer API | ¿Cuánto costarán las llamadas de la aplicación? | Esta es la tarjeta de tarifas resumida en esta guía |
| Google AI Studio | ¿Puedo crear un prototipo y obtener una clave de API? | Es una superficie de desarrollo, no una tarjeta de tarifas de producción universal separada |
| Vertex AI | ¿Cómo opero Gemini dentro de Google Cloud? | Los términos comerciales, los controles y las opciones de servicio pueden diferir |
| Planes de consumo de Gemini | ¿Qué incluye una suscripción individual? | El precio de suscripción no es el precio de tokens de la API |
| Gemini Enterprise o Agent Platform | ¿Cuánto cuesta un producto empresarial más amplio? | Es un alcance de producto diferente al de las llamadas de la Developer API |
Al comparar proveedores o pasarelas, mantenga el mismo recorrido de compra en ambos lados. Comparar una suscripción de consumidor con tokens de API, o un servicio gestionado en la nube con una API para desarrolladores, produce una conclusión de aspecto limpio pero inutilizable.
Cuando el acceso directo de Google es suficiente
El acceso directo a Gemini suele ser la opción más sencilla cuando:
- Gemini es la única familia de modelos en producción.
- El equipo se siente cómodo con la facturación y la estructura de cuentas de Google.
- La ingeniería no necesita conmutación por error entre proveedores ni abstracción de rutas.
- Finanzas puede revisar el uso sin consolidar a otros proveedores de IA.
Una pasarela de API de IA se vuelve más útil cuando el problema operativo se amplía más allá de un solo proveedor:
- el producto usa Gemini, GPT, Claude u otras familias de modelos
- ingeniería quiere una sola superficie de credenciales y enrutamiento centralizado de modelos
- finanzas quiere saldos, facturas o revisión de uso consolidados
- operaciones necesita medición a nivel de modelo y controles de políticas compartidos
- los equipos quieren cambiar rutas sin reconstruir cada integración
La pasarela no elimina la necesidad de entender los precios subyacentes de los modelos. Cambia cómo se gestionan el acceso, el enrutamiento, las adquisiciones y la generación de informes en torno a esos precios.
Flatkey proporciona una capa única de acceso API para múltiples familias de modelos. Revise la página de precios de Flatkey actual para conocer el modelo comercial y luego compare el panorama más amplio de modelos en la comparación de precios de modelos de IA.
Una lista de verificación recurrente para actualizar los precios de Gemini
Las páginas de precios deben tener un responsable designado de revisión de fuentes y un espacio recurrente para actualizaciones. Para una consulta de alta demanda como precios de la API de Gemini, una revisión mensual es una opción predeterminada razonable, con una revisión inmediata después de los principales anuncios de modelos de Google.
Use esta lista de verificación:
- Compare el orden de los modelos y las etiquetas de ciclo de vida en la página oficial de precios de Google.
- Registre nuevos identificadores de modelo de vista previa, estable, obsoleto y eliminado.
- Verifique por separado las tarifas de Standard, Batch, escritura en caché y almacenamiento en caché.
- Vuelva a comprobar los umbrales de longitud del prompt y si afectan a la entrada, la salida o a ambas.
- Verifique la disponibilidad del nivel gratuito y la redacción del nivel de facturación.
- Recalcule cada ejemplo de carga de trabajo a partir de sus supuestos publicados.
- Revise las secciones de grounding, Live API, imagen y vídeo para detectar cambios de precio separados.
- Confirme que los enlaces internos, las afirmaciones del producto y la CTA pública de precios sigan siendo correctos.
- Actualice la fecha visible de "verificado el" solo después de completar la revisión de la fuente.
El objetivo no es prometer que un artículo de precios nunca quedará obsoleto. El objetivo es hacer que cada cifra sea trazable, cada escenario reproducible y cada actualización lo suficientemente rápida como para que la página siga siendo útil.
La decisión de compra
Empiece por la forma de la carga de trabajo, no por el nombre del modelo.
- Elija la ruta de menor costo que cumpla con los requisitos de calidad y latencia de la tarea.
- Use Batch para el trabajo asincrónico elegible.
- Vigile los tokens de salida y los puntos de inflexión de contexto largo.
- Presupueste por separado el almacenamiento en caché, grounding, audio, imagen y vídeo.
- Reconsidere la arquitectura de acceso cuando Gemini ya no sea el único proveedor en la pila.
Ese proceso convierte los precios de la API de Gemini de una tabla estática en una decisión operativa repetible.



