Precios de la API de Claude explicados: tarifas por token, escrituras de caché y el modelo de coste real
Si está comparando los precios de la API de Claude el lunes 20 de julio de 2026, lo más importante que debe entender es que no existe un único precio de Claude. Los precios oficiales de Anthropic dependen del nivel del modelo, de si los tokens son de entrada o de salida, de si el almacenamiento en caché de prompts está activo, de si la carga de trabajo puede usar la API Batch y de si añade enrutamiento regional o controles de residencia de datos.
Ahí es donde la mayoría de los resúmenes de precios se quedan cortos. Copian la tabla, pero no explican qué es lo que realmente mueve la factura. Esta guía comienza con la tarifa oficial de Anthropic y luego la convierte en cálculos prácticos de costes para equipos de producto. También cubre el punto en el que los precios de la API de Claude dejan de ser solo una cuestión de Anthropic y pasan a ser una cuestión del modelo operativo sobre facturación compartida, enrutamiento y acceso a más de una familia de modelos.
Precios de la API de Claude de un vistazo
La página oficial de precios de Anthropic fija el uso de la API de Claude por millón de tokens. A 20 de julio de 2026, estas son las filas actuales más útiles para la mayoría de los equipos que evalúan tráfico de producción:
| Modelo | Entrada base | Escritura de caché de 5 minutos | Escritura de caché de 1 hora | Hit de caché | Salida |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | $1 / MTok | $1.25 / MTok | $2 / MTok | $0.10 / MTok | $5 / MTok |
| Claude Sonnet 4.6 | $3 / MTok | $3.75 / MTok | $6 / MTok | $0.30 / MTok | $15 / MTok |
| Claude Sonnet 5 | $2 / MTok hasta el 31 de agosto de 2026; $3 / MTok a partir del 1 de septiembre de 2026 | $2.50 / MTok introductorio; $3.75 / MTok estándar | $4 / MTok introductorio; $6 / MTok estándar | $0.20 / MTok introductorio; $0.30 / MTok estándar | $10 / MTok introductorio; $15 / MTok estándar |
| Claude Opus 4.8 | $5 / MTok | $6.25 / MTok | $10 / MTok | $0.50 / MTok | $25 / MTok |
La tabla anterior es el centro de la conversación actual sobre los precios de la API de Claude, pero sigue siendo solo el punto de partida.
Lo que la mayoría de los equipos pasan por alto sobre los precios de la API de Claude
Tres detalles importan más que otro resumen genérico del nivel del modelo.
1. El almacenamiento en caché de prompts cambia rápidamente la factura real
Anthropic establece que el almacenamiento en caché de prompts utiliza estos multiplicadores en relación con el precio base de entrada:
| Operación de caché | Multiplicador | Significado |
|---|---|---|
| Escritura de caché de 5 minutos | 1.25x | Usted paga una pequeña prima por almacenar el prompt para reutilizarlo |
| Escritura de caché de 1 hora | 2x | Usted paga más por adelantado a cambio de una duración de caché más larga |
| Lectura de caché | 0.1x | Un acierto de caché cuesta el 10% del precio normal de entrada |
Por eso los prompts de sistema repetidos, las instrucciones largas reutilizables, los paquetes de conocimiento estables y el contexto de revisión de documentos pueden tener un coste efectivo mucho menor de lo que sugiere la tabla en bruto. Anthropic señala explícitamente que una escritura en caché de 5 minutos se amortiza después de una lectura de caché, mientras que una escritura en caché de 1 hora se amortiza después de dos lecturas.
2. Los precios de Batch API reducen a la mitad las cargas de trabajo asíncronas
La documentación de Anthropic indica que la Batch API ofrece un 50% de descuento tanto en tokens de entrada como de salida. Eso importa para backfills, análisis offline, trabajos de evaluación nocturnos o grandes colas de revisión de documentos que no necesitan respuestas instantáneas.
Para muchos equipos, la forma más rápida de ahorrar costes no es dejar de usar Claude. Es mover la carga de trabajo adecuada de Claude al modo batch.
3. Los cambios en el tokenizer pueden distorsionar comparaciones ingenuas de precios
Anthropic también señala que Claude Opus 4.7 y los modelos Opus posteriores, además de Claude Sonnet 5 y las familias relacionadas más nuevas, usan un tokenizer más reciente que puede generar aproximadamente un 30% más de tokens para el mismo texto. Eso no significa que los modelos sean demasiado caros. Significa que tus verdaderos precios de la API de Claude dependen de la forma de tus prompts y del estilo de tus salidas, no solo del precio de lista.
Precios de la API de Claude por carga de trabajo
La forma más sencilla de elegir el nivel adecuado es partir de la forma de la carga de trabajo, no de la familiaridad con la marca.
| Carga de trabajo | Nivel predeterminado recomendado | Por qué | Principal aspecto a vigilar |
|---|---|---|---|
| Clasificación, extracción, tareas breves de enrutamiento | Claude Haiku 4.5 | Precio de entrada actual más bajo para trabajo de alto volumen | Los prompts con mucho peso en la salida pueden anular el ahorro aparente |
| Chat general de producto, resumidos, flujos de asistente | Claude Sonnet 4.6 o Sonnet 5 | Mejor equilibrio entre coste y calidad para la mayoría de los equipos en producción | El precio introductorio de Sonnet 5 termina el 1 de septiembre de 2026 |
| Programación más compleja, razonamiento profundo, agentes difíciles de varios pasos | Claude Opus 4.8 | Nivel premium de razonamiento con el mayor techo de capacidad | Los tokens de salida son caros, así que la disciplina en el prompt importa |
| Backfills, análisis masivo, procesamiento nocturno | El mismo modelo, pero a través de Batch API | La misma calidad del modelo con menor coste unitario | No es مناسب para flujos interactivos orientados al usuario |
Esta es la parte que la mayoría de los resultados de búsqueda omiten. Los equipos no compran un nombre de modelo. Compran un perfil de carga de trabajo.
Tres ejemplos rápidos de coste
Estos ejemplos usan los precios oficiales de lista de Anthropic al 20 de julio de 2026.
Clasificador ligero de soporte en Haiku 4.5
Supongamos 20M tokens de entrada y 4M tokens de salida en un mes.
| Concepto | Cálculo del coste | Total |
|---|---|---|
| Entrada | 20 x $1 |
$20 |
| Salida | 4 x $5 |
$20 |
| Total | $40 |
Para tareas acotadas, los precios de la API de Claude son, en su mayor parte, un problema de volumen de entrada.
Copiloto de producto en Sonnet 4.6 con aciertos de caché
Supongamos 30M tokens de entrada sin caché, 50M tokens con acierto de caché y 8M tokens de salida.
| Concepto | Cálculo del coste | Total |
|---|---|---|
| Entrada sin caché | 30 x $3 |
$90 |
| Aciertos de caché | 50 x $0.30 |
$15 |
| Salida | 8 x $15 |
$120 |
| Total | $225 |
Aquí es donde los precios de la API de Claude dejan de parecer una simple tarifa. El contexto reutilizado puede cambiar de forma material la economía de Sonnet.
Revisión asíncrona de documentos en Opus 4.8 mediante Batch API
Supongamos 12M tokens de entrada y 3M tokens de salida.
| Concepto | Estándar | Batch |
|---|---|---|
| Entrada | 12 x $5 = $60 |
12 x $2.50 = $30 |
| Salida | 3 x $25 = $75 |
3 x $12.50 = $37.50 |
| Total | $135 | $67.50 |
Para trabajo offline, la idea más útil sobre los precios de la API de Claude a menudo no es «Opus es caro». Es «la calidad premium aún puede ser económica si el trabajo puede ejecutarse de forma asíncrona».
Notas sobre contexto largo y precios regionales
La documentación actual de precios de Anthropic también deja claros dos detalles:
- Claude Opus 4.6, Claude Opus 4.7, Claude Opus 4.8, Claude Sonnet 4.6 y las familias actuales listadas más adelante incluyen la ventana de contexto completa de 1M tokens al precio estándar.
- Para los modelos de la era de Claude 4.5 y posteriores, las opciones de endpoint regional o multirregional pueden introducir una prima del 10% sobre el enrutamiento global, y los ajustes de inferencia solo en EE. UU. pueden aplicar un multiplicador de 1.1x en las categorías de precios donde se admita.
Eso significa que el factor de coste oculto no suele ser un recargo especial por contexto largo. Son prompts sobredimensionados, caché infrautilizada o un requisito de residencia que cambia el multiplicador.
Cuándo el acceso directo a Anthropic es suficiente
El acceso directo a Anthropic sigue siendo una opción limpia cuando todo lo siguiente es cierto:
- Claude es la única familia de modelos que necesitas en producción.
- La facturación puede mantenerse dentro de una sola relación con un proveedor.
- El equipo de ingeniería se siente cómodo gestionando el acceso al modelo y el gasto directamente en un sistema.
- Finanzas y operaciones no necesitan una superficie compartida de enrutamiento y facturación entre proveedores.
Si ese es tu entorno, un gateway puede ser prematuro.
Cuando los precios de la API de Claude se convierten en un problema del modelo operativo
La decisión de compra cambia una vez que el equipo ya no se limita a Claude.
Eso suele ocurrir cuando:
- necesitas Claude junto con GPT, Gemini, DeepSeek u otras familias bajo una sola capa de integración
- finanzas quiere un solo saldo o una sola factura en lugar de la facturación dispersa de varios proveedores
- ingeniería quiere una sola URL base y un solo patrón de gestión de claves entre proveedores
- operaciones quiere registros de solicitudes a nivel de modelo, cuotas compartidas o una vía de revisión más clara para el gasto
Esta es la brecha que la mayoría de los artículos sobre precios de la API de Claude no cubren. Una vez que un equipo se vuelve multimodelo, el verdadero problema no es solo el coste por token. Es el coste de coordinación.
Dónde encaja Flatkey
Las superficies públicas de Flatkey, revisadas el lunes 20 de julio de 2026, respaldan una propuesta de valor específica y cautelosa:
- La página de inicio posiciona Flatkey en torno a cada modelo oficial, una sola clave, incluido el acceso oficial a GPT, Claude, Gemini, DeepSeek, Qwen, GLM y Seedance.
- La misma página afirma que Flatkey enruta las solicitudes a puntos finales oficiales, admite más de 160 modelos punteros detrás de una sola clave y verifica esas rutas cada hora.
- La página de precios afirma que un solo saldo puede enrutar entre GPT, Claude, Gemini, DeepSeek, imagen, audio y vídeo a través de una única pasarela compatible con OpenAI.
- Esa misma página de precios también afirma que el uso se mide por modelo, tipo de token y registros de solicitudes, y que los planes empresariales son la opción adecuada para mayor uso mensual, facturación, compras, descuentos de enrutamiento personalizados o controles a nivel de equipo.
La conclusión segura no es que Flatkey garantice una fila pública específica de Claude con un porcentaje fijo por debajo del precio de lista de Anthropic en todos los casos. La conclusión segura es que los equipos que evalúan precios de la API de Claude también pueden querer una capa de control más simple cuando Claude solo es una parte de la pila.
Si ese es tu caso, revisa la actual página de precios de Flatkey, y luego compárala con tu flujo de trabajo más amplio de enrutamiento de modelos en Arquitectura de pasarela de API de IA: una sola clave, enrutamiento de modelos y el fin de la proliferación de cuentas de proveedores y Alternativa a OpenRouter para el acceso a la API de Claude: Flatkey vs OpenRouter para equipos.
Preguntas frecuentes
¿Cuál es ahora mismo el precio de la API de Claude?
A fecha de 20 de julio de 2026, la página oficial de precios de Anthropic enumera las familias actuales de Claude con precios por millón de tokens, además de columnas separadas de almacenamiento en caché de prompts, precios por lotes y notas de precios regionales. Para muchos equipos, las filas más relevantes son Haiku 4.5, Sonnet 4.6, el precio introductorio de Sonnet 5 y Opus 4.8.
¿El precio de la API de Claude solo depende de los tokens de entrada y salida?
No. El precio de la API de Claude real también depende de la caché de prompts, el procesamiento por lotes, el comportamiento de tokenización, la forma de los prompts largos y cualquier modificador de residencia o de precios regionales que se aplique a la ruta de implementación elegida.
¿La caché de prompts realmente reduce el coste de la API de Claude?
Sí. La documentación de precios de Anthropic indica que las lecturas de caché cuestan el 10% del precio normal de entrada. Para contexto de prompt repetido, eso puede reducir de forma material el coste efectivo de la carga de trabajo después de la escritura inicial en caché.
¿Cuándo importa la API de Batch?
Importa siempre que una carga de trabajo de Claude sea asíncrona. Anthropic indica que el precio de la API de Batch conlleva un descuento del 50% tanto en los tokens de entrada como en los de salida, lo que puede cambiar la economía de grandes trabajos offline.
¿Cuándo debería un equipo mirar más allá de la tarifa directa de Anthropic?
Un equipo debería mirar más allá de la tarifa directa cuando Claude deja de ser el único proveedor en uso. En ese punto, el coste operativo de la facturación fragmentada, el enrutamiento y el acceso puede importar casi tanto como el gasto bruto en tokens.
Conclusión
La mejor manera de evaluar los precios de la API de Claude es dejar de pedir una sola cifra y empezar a hacer cuatro preguntas:
- ¿Qué nivel de Claude se ajusta a la carga de trabajo?
- ¿Puede la carga de trabajo beneficiarse del almacenamiento en caché de prompts?
- ¿Puede alguna parte pasar a la tarificación de la API de Batch?
- ¿Sigue siendo Claude la única familia de modelos que el equipo necesita operar?
La documentación actual de Anthropic responde a las tres primeras. Si la cuarta pregunta empieza a importar, entonces el siguiente paso no es solo comparar precios. Es comparar la capa de control.
Revisa la documentación actual de precios de Anthropic y luego compara tus requisitos más amplios de acceso a modelos y facturación en precios de Flatkey.



