Si tu principal limitación es el gasto en API, la decisión entre DeepSeek API vs Qwen API ya no está lo bastante reñida como para tomarla de memoria. Ambos proveedores han cambiado sus líneas de modelos de bajo coste, y la ruta más barata depende de cuatro cosas: entrada sin caché, entrada en caché, volumen de salida y si tu carga de trabajo puede usar inferencia por lotes.
Esta guía se revisó con la documentación de precios y del ciclo de vida de modelos de primera mano el martes, 28 de julio de 2026. La respuesta breve es:
- Qwen Flash tiene el precio de lista bruto más bajo para la mayoría de las cargas de trabajo de texto sin caché, en caché y por lotes.
- DeepSeek V4 Flash ofrece una tasa de acierto de caché muy baja y un endpoint directo global más sencillo, pero sus tarifas más altas para fallos de caché y salida hacen que necesites una mezcla de solicitudes inusualmente intensiva en caché antes de que esa ventaja cambie la factura.
- DeepSeek V4 Pro puede ser un candidato orientado al coste frente a niveles Qwen de precio más alto, pero la calidad del modelo no es intercambiable. Prueba el coste por tarea exitosa, no solo los tokens.
- No empieces un nuevo flujo de trabajo en Qwen Turbo. Alibaba Cloud indica una fecha de retirada del 30 de noviembre de 2026 y recomienda Qwen Flash como sustituto.
DeepSeek vs Qwen: veredicto de coste por flujo de trabajo
| Flujo de trabajo | Opción predeterminada orientada al coste | Por qué | Verificar antes de producción |
|---|---|---|---|
| Chat breve o extracción | Qwen Flash | Precios de lista más bajos de entrada y salida | Región, instantánea exacta del modelo, umbral mínimo de calidad |
| Evaluación offline de gran volumen | Inferencia por lotes de Qwen | Los modelos elegibles reciben un 50% de descuento en entrada y salida | El modelo exacto y la compatibilidad de la región con lotes |
| Contexto largo repetido | Qwen Flash en la mayoría de los casos | El precio base más bajo de Qwen supera el descuento de caché de DeepSeek a tasas de acierto normales | Medir la tasa de acierto de caché y la creación/almacenamiento de caché |
| Entrada extremadamente dependiente de caché | Calcular ambos | La entrada en caché de DeepSeek es barata, pero sus fallos y su salida cuestan más | Relación de tokens, tasa de acierto, volumen de salida |
| Tareas con mucho razonamiento | Probar DeepSeek V4 Pro y el nivel de Qwen correspondiente | Pro de DeepSeek tiene un precio de salida publicado más bajo que Qwen 3.7 Plus | Precisión, reintentos, uso de herramientas, latencia |
| Configuración directa con proveedor más rápida | DeepSeek | Una única URL base global compatible con OpenAI documentada | Requisitos de región de datos y aprovisionamiento |
| Cambio frecuente de modelo | Pasarela compartida y registros | El coste operativo del cambio puede borrar el ahorro de tokens | Enrutado, saldos, observabilidad, reversión |
Esta es una comparación de costes, no una clasificación universal de modelos. Un modelo que necesite más reintentos, prompts más largos o corrección humana puede perder pese a tener un precio por token más bajo.
Precios actuales de la API de DeepSeek
La página de precios de DeepSeek, actualizada el 28 de julio, enumera dos modelos de texto V4. Los precios son por un millón de tokens.
| Modelo | Entrada con acierto de caché | Entrada con fallo de caché | Salida | Contexto | Salida máxima |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
DeepSeek documenta el almacenamiento en caché automático del contexto y expone precios separados para aciertos y fallos. También proporciona un endpoint compatible con OpenAI en https://api.deepseek.com y un endpoint compatible con Anthropic en https://api.deepseek.com/anthropic.
La cifra más llamativa es el precio de acierto de caché de V4 Flash: es solo el 2% de la tarifa de fallo de caché. Pero ese descuento no debe evaluarse de forma aislada. Un fallo sigue costando más de seis veces la tarifa de entrada estándar de primer nivel de Qwen Flash, y la salida de DeepSeek V4 Flash también cuesta más.
Precios actuales de la API de Qwen
Alibaba Cloud Model Studio enumera los precios de Qwen por modelo, longitud de entrada, modo de salida y región de despliegue. Para un despliegue global con entrada de hasta 128K tokens, la fila de bajo coste relevante es:
| Modelo | Entrada estándar | Salida | Acierto de caché implícito | Acierto de caché explícito | Descuento por lotes |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
20% del precio de entrada estándar | 10% del precio de entrada estándar | 50% para trabajos por lotes compatibles |
Para el modo de despliegue de Singapur, la misma página enumera qwen-flash a $0.05 de entrada y $0.40 de salida para prompts de hasta 128K. Esta diferencia regional es la razón por la que una previsión válida de Qwen debe registrar el modo de despliegue y el endpoint en lugar de copiar una sola cifra destacada.
El caché de Qwen también necesita un modelado preciso:
- Los aciertos de caché implícitos se facturan al 20% del precio estándar de entrada.
- Los aciertos de caché explícitos se facturan al 10% del precio estándar de entrada.
- La creación explícita de caché se factura al 125% del precio estándar de entrada y el almacenamiento de caché se factura por separado.
- La inferencia por lotes ofrece a los modelos elegibles un descuento del 50% en entrada y salida, pero no asumas que los descuentos se acumulan a menos que el proveedor documente esa combinación para tu modelo y región.
Alibaba Cloud también señala que qwen-flash es un alias en rotación. Fija un ID de modelo con fecha cuando la reproducibilidad sea importante, y luego programa pruebas de migración antes de que esa instantánea se retire.
Tres cálculos de carga de trabajo
Las fórmulas siguientes usan precios públicos de lista, no promociones temporales ni contratos negociados. Comparan solo los cargos por tokens del proveedor directo y excluyen impuestos, cargos de red, almacenamiento de caché y trabajo de ingeniería.
Escenario 1: chat breve sin caché
Suposiciones:
- 10,000 solicitudes
- 1,000 tokens de entrada por solicitud
- 500 tokens de salida por solicitud
- Sin aciertos de caché
- Primer nivel de precios global de
qwen3.5-flashde Qwen
| Ruta | Cálculo de entrada | Cálculo de salida | Total estimado |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
Para esta forma de solicitud, Qwen cuesta aproximadamente un 54% menos a los precios públicos de lista. El resultado puede cambiar si usas una región diferente de Qwen, superas el primer nivel de entrada o necesitas suficientes reintentos como para anular la ventaja de tokens.
Escenario 2: contexto largo repetido con 90% de aciertos de caché
Suposiciones:
- 10,000 solicitudes
- 10,000 tokens de entrada por solicitud
- 1,000 tokens de salida por solicitud
- 90% de los tokens de entrada facturados a la tarifa de acierto de caché
- Qwen usa caché implícita
| Ruta | Entrada con fallo de caché | Entrada con acierto de caché | Salida | Total estimado |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
DeepSeek tiene la tarifa de acierto de caché más baja, pero Qwen aun así gana este escenario con 90% de aciertos porque los precios de fallo y de salida de Qwen son más bajos.
Solo para la entrada, DeepSeek V4 Flash se vuelve más barato que la mezcla de caché implícita de Qwen solo cuando la proporción de aciertos de caché es aproximadamente 98.7% o superior. Una vez que se incluyen los tokens de salida, la tasa de acierto requerida es aún mayor. Con la caché explícita de Qwen, el propio precio de acierto es más bajo que el de DeepSeek, aunque deben incluirse los cargos de creación y almacenamiento.
Escenario 3: procesamiento por lotes offline
Suposiciones:
- 100 millones de tokens de entrada
- 20 millones de tokens de salida
- El modelo y la región de Qwen son elegibles para el descuento por lotes publicado del 50%
- DeepSeek se calcula al precio estándar sincrónico de lista porque su página de precios no publica un descuento por lotes equivalente
| Ruta | Cálculo | Total estimado |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash batch | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
Para evaluación tolerante a la latencia, etiquetado, resumen o trabajos de datos sintéticos, la elegibilidad para lotes puede importar más que pequeñas diferencias de caché. Confirma que tu modelo exacto, modo de despliegue y tipo de trabajo califican antes de aprobar la previsión.
Una mejor fórmula de punto de equilibrio
Usa esta hoja de cálculo en lugar de comparar una sola celda de precio por token:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
Luego calcula el coste por tarea exitosa:
successful_task_cost = monthly_cost / accepted_outputs
Este segundo número detecta los costes operativos que las tablas de tokens pasan por alto. Si una ruta más barata produce más JSON inválido, fallos en llamadas a herramientas, largas trazas de razonamiento o revisión manual, su coste real puede ser mayor.
Diferencias operativas que afectan al coste total
Diseño de región y endpoint
DeepSeek documenta un único endpoint directo global. Qwen utiliza endpoints de Alibaba Cloud Model Studio vinculados al modo de despliegue y a la región. La configuración regional puede mejorar la gobernanza, pero también afecta a la disponibilidad del modelo, las filas de precios, las credenciales y el diseño de failover.
Registra estos campos en cada aprobación:
- Proveedor e ID exacto del modelo
- Región o modo de despliegue
- URL base
- Nivel de longitud de entrada
- Modo de salida con thinking o sin thinking
- Método de caché
- Elegibilidad para batch
- Fecha de comprobación de precios
Ciclo de vida del modelo
Está previsto que Qwen Turbo se retire el 30 de noviembre de 2026, y Alibaba Cloud recomienda Qwen Flash como sustituto. Los nuevos sistemas no deberían tratar el nombre conocido de Turbo ni su fila de salida sin thinking más baja como un plan de ahorro duradero.
Los alias dinámicos son cómodos para la experimentación, pero introducen riesgo de cambios silenciosos. Fija versiones fechadas en producción, mantén un pequeño conjunto de evaluación y prueba la siguiente versión antes de la retirada.
Calidad y presupuesto de reintentos
No compares DeepSeek V4 Flash y Qwen Flash como si produjeran resultados idénticos. Evalúa cada ruta en la tarea real: precisión de extracción, tasa de aprobación de pruebas de código, finalización de llamadas a herramientas, validez de la salida estructurada, latencia y aceptación humana.
Una puerta de enrutamiento práctica es:
- Rechaza los modelos por debajo del umbral mínimo de calidad.
- Compara el coste por salida aceptada entre los supervivientes.
- Añade el coste de reintentos y fallback.
- Haz un canary de la ruta más barata con un umbral de rollback.
- Recalcula después de la primera semana de tráfico de producción.
Para un framework de pruebas repetible, usa el flujo de trabajo de pruebas de prompts multi-modelo. Para un contexto más amplio de tarifas, compara la actual comparación de precios de modelos de IA y la página de precios de Flatkey.
Cuándo DeepSeek es la mejor opción
DeepSeek merece la primera prueba cuando:
- Quieres un endpoint directo global sencillo.
- Tu carga de trabajo tiene una reutilización de caché extremadamente alta y medida.
- DeepSeek V4 Pro cumple el umbral de calidad de razonamiento a un coste por tarea exitosa inferior al nivel de Qwen que probaste.
- Tu equipo ya opera DeepSeek de forma fiable y el trabajo de migración superaría el ahorro proyectado.
Cuándo Qwen es la mejor opción
Qwen merece la primera prueba cuando:
- El coste bruto por token es la restricción principal.
- Ejecutas prompts cortos o medianos sin caché.
- Tienes trabajos tolerantes a la latencia que califican para inferencia por lotes.
- Puedes usar la caché explícita o implícita de forma eficaz.
- El modelo de despliegue regional de Alibaba Cloud encaja con tus requisitos de cumplimiento y operaciones.
FAQ
¿Es DeepSeek más barato que Qwen en 2026?
No en todos los casos. Según los precios públicos de lista del 28 de julio, Qwen 3.5 Flash es más barato en los ejemplos de corto plazo sin caché, con caché al 90% y por lotes elegibles de esta guía. DeepSeek aún puede ganar en coste por tarea completada, simplicidad operativa o en una comparación específica de un nivel superior.
Which API is better for high-volume automation?
Empiece probando Qwen Flash si el trabajo puede usar inferencia por lotes o tiene baja sensibilidad a la latencia. Pruébelo junto con DeepSeek si la reutilización de caché es excepcionalmente alta o si la calidad de su salida reduce los reintentos. Apruebe la ruta con el menor coste por resultado aceptado.
Does DeepSeek's cache price make it cheaper for RAG?
No automáticamente. El precio de entrada con acierto de caché de DeepSeek es muy bajo, pero sus tarifas de fallo de caché y de salida son más altas que las tarifas de primer nivel de Qwen 3.5 Flash. Mida la proporción real de aciertos, la relación entre prompt y salida, y el método de caché de Qwen antes de decidir.
Should I use Qwen Turbo for a new application?
No. Alibaba Cloud indica la retirada de Qwen Turbo el 30 de noviembre de 2026 y recomienda migrar a Qwen Flash.
How often should API pricing be reviewed?
Revíselo mensualmente para rutas de producción activas e inmediatamente cuando un proveedor cambie los ID de modelo, las fechas de retirada, las reglas de caché, la compatibilidad con lotes, la disponibilidad regional o los precios de lista.
Elija con tráfico de producción, no con una tarifa destacada
Para la mayoría de los flujos de trabajo de texto sensibles al coste, Qwen Flash es el punto de partida más económico el 28 de julio de 2026. DeepSeek sigue mereciendo pruebas allí donde la simplicidad del endpoint, el comportamiento de la caché o la calidad de la tarea reduzcan el coste total de operación.
Guarde la hoja de cálculo de la forma de la solicitud, fije las versiones exactas del modelo y mantenga la ruta reversible. Si quiere un solo lugar para probar ambos proveedores sin reescribir el código del cliente, empiece con el Flatkey integration starter, ejecute el mismo conjunto de evaluación y dirija el tráfico de producción solo después de que las cifras de coste por éxito se estabilicen.



