Se sua principal restrição é o gasto com API, a decisão entre DeepSeek API vs Qwen API já não está próxima o suficiente para ser tomada de memória. Ambos os provedores mudaram suas linhas de modelos de baixo custo, e o caminho mais barato depende de quatro fatores: entrada não cacheada, entrada cacheada, volume de saída e se sua carga de trabalho pode usar inferência em lote.
Este guia foi verificado com base em preços e documentação de ciclo de vida de modelos de primeira mão em terça-feira, 28 de julho de 2026. A resposta curta é:
- Qwen Flash tem o menor preço bruto de tabela para a maioria das cargas de trabalho de texto não cacheadas, cacheadas e em lote.
- DeepSeek V4 Flash oferece uma taxa de acerto de cache muito baixa e um endpoint global direto mais simples, mas suas taxas mais altas de cache miss e saída significam que você precisa de uma proporção de solicitações incomumente pesada em cache antes que essa vantagem mude a fatura.
- DeepSeek V4 Pro pode ser um candidato de custo primeiro para raciocínio em comparação com camadas Qwen de preço mais alto, mas a qualidade do modelo não é intercambiável. Teste o custo por tarefa bem-sucedida, não apenas os tokens.
- Não inicie um novo fluxo de trabalho no Qwen Turbo. A Alibaba Cloud lista uma data de desativação de 30 de novembro de 2026 e recomenda o Qwen Flash como substituto.
DeepSeek vs Qwen: veredicto de custo por fluxo de trabalho
| Fluxo de trabalho | Padrão de menor custo | Por quê | Verificar antes da produção |
|---|---|---|---|
| Chat curto ou extração | Qwen Flash | Preços de tabela de entrada e saída mais baixos | Região, snapshot exato do modelo, piso de qualidade |
| Avaliação offline de alto volume | Inferência em lote do Qwen | Modelos elegíveis recebem 50% de desconto em entrada e saída | Modelo exato e suporte de região para lote |
| Contexto longo repetido | Qwen Flash na maioria dos casos | O preço base mais baixo do Qwen supera o desconto de cache do DeepSeek em taxas normais de acerto | Meça a taxa de acerto de cache e a criação/armazenamento de cache |
| Entrada extremamente dependente de cache | Calcule ambos | A entrada em cache do DeepSeek é barata, mas suas falhas e saída custam mais | Proporção de tokens, taxa de acerto, volume de saída |
| Tarefas pesadas em raciocínio | Teste o DeepSeek V4 Pro e a camada Qwen relevante | O DeepSeek Pro tem preço de saída publicado mais baixo do que o Qwen 3.7 Plus | Precisão, novas tentativas, uso de ferramentas, latência |
| Configuração direta mais rápida com o provedor | DeepSeek | Uma única URL base global compatível com OpenAI documentada | Requisitos de região de dados e compras |
| Troca frequente de modelos | Gateway compartilhado e logs | O custo operacional de alternar pode apagar a economia de tokens | Roteamento, saldos, observabilidade, reversão |
Esta é uma comparação de custo, não uma classificação universal de modelos. Um modelo que exige mais tentativas, prompts mais longos ou correção humana pode perder apesar de um preço por token mais baixo.
Preços atuais da API DeepSeek
A página de preços da DeepSeek, atualizada em 28 de julho, lista dois modelos de texto V4. Os preços são por um milhão de tokens.
| Modelo | Entrada com cache hit | Entrada com cache miss | Saída | Contexto | Saída máxima |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
A DeepSeek documenta cache de contexto automático e expõe preços separados para hit e miss. Também oferece um endpoint compatível com OpenAI em https://api.deepseek.com e um endpoint compatível com Anthropic em https://api.deepseek.com/anthropic.
O número que chama a atenção é o preço de cache-hit do V4 Flash: ele é apenas 2% da taxa de cache-miss. Mas esse desconto não deve ser avaliado isoladamente. Um miss ainda custa mais de seis vezes a taxa de entrada padrão do primeiro nível do Qwen Flash, e a saída do DeepSeek V4 Flash também custa mais.
Preços atuais da API Qwen
O Alibaba Cloud Model Studio lista os preços do Qwen por modelo, comprimento de entrada, modo de saída e região de implantação. Para uma implantação global com entrada de até 128K tokens, a linha relevante de baixo custo é:
| Modelo | Entrada padrão | Saída | Cache hit implícito | Cache hit explícito | Desconto em lote |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
20% do preço de entrada padrão | 10% do preço de entrada padrão | 50% para jobs em lote compatíveis |
Para o modo de implantação em Singapura, a mesma página lista qwen-flash a $0.05 de entrada e $0.40 de saída para prompts de até 128K. Essa diferença regional é o motivo pelo qual uma previsão válida do Qwen precisa registrar o modo de implantação e o endpoint, em vez de copiar um único número de destaque.
O cache do Qwen também precisa de modelagem precisa:
- Os cache hits implícitos são cobrados a 20% do preço padrão de entrada.
- Os cache hits explícitos são cobrados a 10% do preço padrão de entrada.
- A criação explícita de cache é cobrada a 125% do preço padrão de entrada, e o armazenamento de cache é cobrado separadamente.
- A inferência em lote oferece aos modelos elegíveis um desconto de 50% na entrada e na saída, mas não presuma que os descontos se acumulam, a menos que o provedor documente essa combinação para o seu modelo e região.
A Alibaba Cloud também observa que qwen-flash é um alias em rotação. Fixe um ID de modelo com data quando a reprodutibilidade for importante e, então, agende testes de migração antes que esse snapshot seja descontinuado.
Três cálculos de carga de trabalho
As fórmulas abaixo usam preços públicos de tabela, não promoções temporárias nem contratos negociados. Elas comparam apenas as cobranças de token do provedor direto e excluem impostos, cobranças de rede, armazenamento de cache e trabalho de engenharia.
Cenário 1: chat curto sem cache
Premissas:
- 10.000 solicitações
- 1.000 tokens de entrada por solicitação
- 500 tokens de saída por solicitação
- Sem cache hits
- Primeira faixa de preços do
qwen3.5-flashglobal da Qwen
| Rota | Cálculo de entrada | Cálculo de saída | Total estimado |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
Para este formato de solicitação, o Qwen custa cerca de 54% menos aos preços de tabela publicados. O resultado pode mudar se você usar uma região diferente do Qwen, exceder o primeiro nível de entrada ou precisar de retrials suficientes para apagar a vantagem de tokens.
Cenário 2: contexto longo repetido com 90% de cache hits
Suposições:
- 10.000 solicitações
- 10.000 tokens de entrada por solicitação
- 1.000 tokens de saída por solicitação
- 90% dos tokens de entrada cobrados pela taxa de cache hit
- Qwen usa caching implícito
| Rota | Entrada sem cache | Entrada com cache | Saída | Total estimado |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
O DeepSeek tem a menor taxa de cache hit, mas o Qwen ainda vence neste cenário de 90% de hits porque os preços de falha e de saída do Qwen são mais baixos.
Somente para entrada, o DeepSeek V4 Flash fica mais barato do que a combinação de cache implícito do Qwen apenas quando a participação de cache hits é de aproximadamente 98,7% ou mais. Assim que os tokens de saída são incluídos, a taxa de hits necessária é ainda maior. Com o cache explícito do Qwen, o próprio preço de hit é menor do que o do DeepSeek, embora as cobranças de criação e armazenamento precisem ser incluídas.
Cenário 3: processamento em lote offline
Suposições:
- 100 milhões de tokens de entrada
- 20 milhões de tokens de saída
- O modelo e a região do Qwen são elegíveis para o desconto de 50% em lote publicado
- O DeepSeek é calculado ao preço padrão síncrono de tabela porque sua página de preços não publica um desconto de lote equivalente
| Rota | Cálculo | Total estimado |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash em lote | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
Para avaliação, rotulagem, sumarização ou jobs de dados sintéticos tolerantes a atraso, a elegibilidade para lote pode importar mais do que pequenas diferenças de cache. Confirme se o seu modelo exato, modo de implantação e tipo de job se qualificam antes de aprovar a previsão.
Uma fórmula de ponto de equilíbrio melhor
Use esta planilha em vez de comparar uma única célula de preço por token:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
Depois, calcule o custo por tarefa bem-sucedida:
successful_task_cost = monthly_cost / accepted_outputs
Esse segundo número captura os custos operacionais que as tabelas de tokens não mostram. Se uma rota mais barata produzir mais JSON inválido, falhas em chamadas de ferramentas, longas trilhas de raciocínio ou revisão manual, seu custo real pode ser maior.
Diferenças operacionais que afetam o custo total
Design de região e endpoint
A DeepSeek documenta um único endpoint direto global. A Qwen usa endpoints do Alibaba Cloud Model Studio vinculados ao modo de implantação e à região. A configuração regional pode melhorar a governança, mas também afeta a disponibilidade do modelo, as linhas de preço, as credenciais e o design de failover.
Registre estes campos em cada aprovação:
- Provedor e ID exato do modelo
- Região ou modo de implantação
- Base URL
- Nível de comprimento de entrada
- Modo de saída com thinking ou sem thinking
- Método de cache
- Elegibilidade para batch
- Data da verificação de preços
Ciclo de vida do modelo
O Qwen Turbo está programado para ser descontinuado em 30 de novembro de 2026, e o Alibaba Cloud recomenda o Qwen Flash como substituto. Novos sistemas não devem tratar o nome familiar do Turbo ou a linha de saída sem thinking mais barata como um plano de economia duradouro.
Aliases rotativos são convenientes para experimentação, mas introduzem risco de mudanças silenciosas. Fixe versões datadas em produção, mantenha um pequeno conjunto de avaliação e teste a próxima versão antes da descontinuação.
Qualidade e orçamento de retries
Não compare o DeepSeek V4 Flash e o Qwen Flash como se produzissem resultados idênticos. Avalie cada rota na tarefa real: precisão de extração, taxa de sucesso em testes de código, conclusão de chamadas de ferramentas, validade da saída estruturada, latência e aceitação humana.
Um gate de roteamento prático é:
- Rejeite modelos abaixo do piso de qualidade.
- Compare o custo por saída aceita entre os sobreviventes.
- Adicione custo de retries e fallback.
- Faça canary da rota mais barata com um limite de rollback.
- Recalcule após a primeira semana de tráfego em produção.
Para um harness de teste repetível, use o fluxo de trabalho de teste de prompts com múltiplos modelos. Para um contexto mais amplo de tarifas, compare a atual comparação de preços de modelos de IA e a página de preços da Flatkey.
Quando a DeepSeek é a melhor escolha
A DeepSeek merece o primeiro teste quando:
- Você quer um endpoint direto global simples.
- Sua carga de trabalho tem reutilização de cache excepcionalmente alta e mensurada.
- O DeepSeek V4 Pro atende ao piso de qualidade de raciocínio a um custo por tarefa aceita menor do que o nível da Qwen que você testou.
- Sua equipe já opera a DeepSeek de forma confiável e o trabalho de migração excederia a economia projetada.
Quando a Qwen é a melhor escolha
A Qwen merece o primeiro teste quando:
- O custo bruto de tokens é a principal restrição.
- Você executa prompts curtos ou médios sem cache.
- Você tem jobs tolerantes a atraso que se qualificam para inferência em batch.
- Você pode usar cache explícito ou implícito de forma eficaz.
- O modelo de implantação regional do Alibaba Cloud corresponde aos seus requisitos de conformidade e operações.
FAQ
DeepSeek é mais barata do que Qwen em 2026?
Não em todos os casos. Nos preços públicos listados em 28 de julho, o Qwen 3.5 Flash é mais barato nos exemplos deste guia de curto prazo sem cache, com 90% em cache e em lote elegível. O DeepSeek ainda pode vencer em custo por tarefa bem-sucedida, simplicidade operacional ou em uma comparação específica de nível superior.
Qual API é melhor para automação de alto volume?
Comece testando o Qwen Flash se o trabalho puder usar inferência em lote ou tiver baixa sensibilidade à latência. Teste o DeepSeek em paralelo se a reutilização de cache for excepcionalmente alta ou se a qualidade de saída dele reduzir as novas tentativas. Aprove o caminho com o menor custo por resultado aceito.
O preço de cache do DeepSeek o torna mais barato para RAG?
Não automaticamente. O preço de entrada com acerto de cache do DeepSeek é muito baixo, mas as taxas de cache miss e de saída são mais altas do que as taxas de primeiro nível do Qwen 3.5 Flash. Meça a taxa real de acerto, a relação prompt/saída e o método de cache do Qwen antes de decidir.
Devo usar o Qwen Turbo para uma nova aplicação?
Não. A Alibaba Cloud lista a descontinuação do Qwen Turbo em 30 de novembro de 2026 e recomenda a migração para o Qwen Flash.
Com que frequência os preços da API devem ser revisados?
Revise mensalmente para rotas de produção ativas e imediatamente quando um provedor alterar IDs de modelo, datas de descontinuação, regras de cache, suporte a lote, disponibilidade regional ou preços listados.
Escolha com tráfego de produção, não com uma taxa de destaque
Para a maioria dos fluxos de trabalho de texto sensíveis a custo, o Qwen Flash é o ponto de partida de menor preço em 28 de julho de 2026. O DeepSeek continua valendo o teste quando a simplicidade do endpoint, o comportamento de cache ou a qualidade da tarefa reduzem o custo total de operação.
Salve a planilha de formato da solicitação, fixe as versões exatas do modelo e mantenha a rota reversível. Se você quiser um único lugar para testar ambos os provedores sem reescrever o código do cliente, comece com o Flatkey integration starter, execute o mesmo conjunto de avaliação e direcione o tráfego de produção somente depois que os números de custo por sucesso estiverem estáveis.



