Cost, Billing, and Ops27 de julho de 2026Big Y

Preços da Gemini API em 2026: custos atuais dos modelos e calculadora de carga de trabalho

Compare os preços atuais da Gemini API com tabelas reproduzíveis de custo por carga de trabalho para Gemini 3.6 Flash, 3.5 Flash-Lite, modelos Gemini 2.5, jobs em Batch, cache e cargas de trabalho de contexto longo.

Preços da Gemini API em 2026: custos atuais dos modelos e calculadora de carga de trabalho

Se você está comparando preços da Gemini API em 2026, a parte mais difícil não é encontrar uma tabela de preços. É decidir qual tabela de preços se aplica à sua carga de trabalho.

Os resultados de busca costumam misturar quatro produtos diferentes: a Gemini Developer API, a experiência de teste do Google AI Studio, o Vertex AI ou outros serviços do Google Cloud e as assinaturas consumer do Gemini. Este guia se concentra na Gemini Developer API e usa as páginas oficiais de preços e faturamento do Google verificadas em 27 de julho de 2026.

A resposta curta é que o custo da Gemini API depende de cinco variáveis:

  1. a família de modelo que você selecionar
  2. o volume de tokens de entrada e de saída
  3. se prompts individuais ultrapassam um limite de contexto longo
  4. se a carga de trabalho pode usar preços em lote
  5. adicionais como cache de contexto, grounding, áudio, imagens ou vídeo

Isso significa que o menor preço de token divulgado nem sempre é o menor custo em produção. A comparação útil é uma tabela de custo da carga de trabalho com as mesmas premissas aplicadas a cada modelo candidato.

Preços da Gemini API em resumo

A tabela abaixo resume as principais linhas da Gemini Developer API capazes de lidar com texto que as equipes têm maior probabilidade de comparar. Os preços estão em dólares americanos por 1 milhão de tokens, com base na página oficial de preços da Gemini Developer API do Google.

Modelo Status Entrada padrão Saída padrão Entrada em lote Saída em lote Gravação no cache de contexto Armazenamento de cache por hora
Gemini 3.6 Flash Prévia $0.40 $2.40 $0.20 $1.20 $0.04 $1.00
Gemini 3.5 Flash Prévia $1.50 $9.00 $0.75 $4.50 $0.15 $1.00
Gemini 3.5 Flash-Lite Prévia $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 3.1 Flash-Lite Prévia $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 2.5 Pro Estável $1.25 até 200 mil; $2.50 acima de 200 mil $10.00 até 200 mil; $15.00 acima de 200 mil $0.625 até 200 mil; $1.25 acima de 200 mil $5.00 até 200 mil; $7.50 acima de 200 mil $0.125 até 200 mil; $0.25 acima de 200 mil $4.50
Gemini 2.5 Flash Estável $0.30 $2.50 $0.15 $1.25 $0.03 $1.00
Gemini 2.5 Flash-Lite Estável $0.10 $0.40 $0.05 $0.20 $0.01 $1.00

Para o Gemini 3.6 Flash, o Gemini 3.5 Flash, os modelos de prévia Flash-Lite e as famílias Gemini 2.5 Flash, a entrada de áudio tem uma taxa mais alta do que a entrada de texto, imagem ou vídeo. A tabela usa a taxa de entrada de texto, imagem e vídeo para que as linhas dos modelos permaneçam comparáveis.

Modelos de prévia podem mudar antes do lançamento estável. Se a sua política de produção exigir comportamento fixo, janelas de descontinuação mais longas ou um identificador de modelo estável, compare a economia dos modelos de prévia com as linhas estáveis do Gemini 2.5 em vez de selecionar apenas com base no preço.

O que mudou na atualização de 27 de julho de 2026

A mudança mais importante desde a versão anterior deste guia é a linha atual de modelos.

  • Gemini 3.6 Flash Preview agora aparece como uma opção de alta taxa de transferência a $0.40 de entrada e $2.40 de saída por milhão de tokens.
  • Gemini 3.5 Flash-Lite Preview agora aparece a $0.25 de entrada e $1.50 de saída por milhão de tokens.
  • A linha anterior do Gemini 3.1 Flash-Lite continua visível, mas os compradores devem confirmar qual identificador de modelo de preview pretendem operar.
  • Os modelos estáveis Gemini 2.5 continuam sendo referências úteis de comparação para equipes que valorizam a previsibilidade do ciclo de vida.

É por isso que uma página de preços do Gemini precisa de manutenção programada. Uma tabela correta pode se tornar estrategicamente enganosa mesmo quando cada número antigo ainda está tecnicamente presente em algum lugar no catálogo.

Tabela de custos de carga de trabalho da API Gemini

A tabela abaixo converte taxas em estimativas de orçamento. Esses cenários não são benchmarks de qualidade, e os modelos não são intercambiáveis. Eles respondem a uma questão financeira mais restrita: qual seria a conta de tokens se a mesma carga de trabalho fosse executada em cada rota?

Suposições

Workload Request volume Input per request Output per request Total input Total output
Classification and extraction 1,000 requests 2,000 tokens 300 tokens 2M tokens 0.3M tokens
Retrieval-augmented assistant 1,000 requests 20,000 tokens 1,000 tokens 20M tokens 1M tokens
Long-document review 100 requests 150,000 tokens 5,000 tokens 15M tokens 0.5M tokens

O cenário de documento longo mantém cada prompt abaixo do limite de 200k do Gemini 2.5 Pro. Grounding, caching, áudio, geração de imagens e geração de vídeo estão excluídos.

Custo estimado do token de nível Standard

Model Classification RAG assistant Long-document review
Gemini 3.5 Flash-Lite $0.95 $6.50 $4.50
Gemini 3.6 Flash $1.52 $10.40 $7.20
Gemini 2.5 Flash-Lite $0.32 $2.40 $1.70
Gemini 2.5 Flash $1.35 $8.50 $5.75
Gemini 3.5 Flash $5.70 $39.00 $27.00
Gemini 2.5 Pro $5.50 $35.00 $23.75

Esses totais mostram por que uma tabela de carga de trabalho é mais útil do que uma lista de modelos.

  • Para extração limitada, a linha estável do Gemini 2.5 Flash-Lite tem o menor custo de tokens nesta comparação.
  • O Gemini 3.6 Flash custa mais do que as rotas Lite, mas substancialmente menos do que o Gemini 3.5 Flash sob as mesmas premissas.
  • No exemplo de documento longo, a conta de tokens do Gemini 2.5 Pro é menor do que a do Gemini 3.5 Flash porque o prompt fica abaixo do limite do Pro. Isso não prova que ele seja o melhor modelo, mas evita a suposição enganosa de que toda carga de trabalho Pro precisa custar mais.
  • Aplicações com saída intensa são mais sensíveis à escolha do modelo porque os tokens de saída custam mais do que os tokens de entrada de texto em todas as linhas mostradas aqui.

O que a precificação Batch faz com as mesmas cargas de trabalho

Para linhas que suportam a Batch API, as taxas de token Batch listadas pelo Google são geralmente metade das taxas Standard. Se cada solicitação nos cenários acima puder ser executada de forma assíncrona, os totais estimados de tokens passam a ser:

Modelo Classificação com Batch Assistente RAG com Batch Revisão de documentos longos com Batch
Gemini 3.5 Flash-Lite $0.475 $3.25 $2.25
Gemini 3.6 Flash $0.76 $5.20 $3.60
Gemini 2.5 Flash-Lite $0.16 $1.20 $0.85
Gemini 2.5 Flash $0.675 $4.25 $2.875
Gemini 3.5 Flash $2.85 $19.50 $13.50
Gemini 2.5 Pro $2.75 $17.50 $11.875

Batch é uma decisão de faturamento e arquitetura. É uma excelente opção para enriquecimento offline, execuções de avaliação, resumos noturnos, backfills de documentos e outros jobs que não exigem uma resposta imediata. Não é um substituto para o serviço Standard quando um usuário está esperando em um fluxo interativo do produto.

A fórmula por trás do custo da Gemini API

Para uma carga de trabalho de texto sem complementos, use:

custo mensal =
  (tokens de entrada / 1.000.000 × taxa de entrada)
  + (tokens de saída / 1.000.000 × taxa de saída)

Se a aplicação usar cache de contexto, adicione os custos de gravação e armazenamento do cache. Se usar grounding, áudio, imagens geradas ou vídeo gerado, calcule essas linhas separadamente, porque elas não compartilham uma única taxa universal de tokens.

Para revisões financeiras, mantenha as premissas ao lado do resultado:

Premissa a registrar Por que isso importa
Solicitações por mês Converte o comportamento por solicitação em um orçamento
Tokens médios e p95 de entrada Prompts longos podem acionar preços Pro mais altos
Tokens médios e p95 de saída A saída costuma ser a parte mais cara
Proporção entre Standard e Batch O trabalho assíncrono pode reduzir significativamente o gasto com tokens
Volume de gravação no cache e tempo de retenção O reuso pode economizar custo de entrada, mas o armazenamento não é gratuito
Solicitações com grounding Google Search e Maps têm cotas e taxas separadas
Unidades de áudio, imagem e vídeo A precificação por modalidade pode dominar a conta de tokens de texto

Camada gratuita da Gemini API versus camada paga

O Google mostra uma camada gratuita para vários modelos atuais da Gemini Developer API. Isso a torna útil para experimentos, protótipos e validação de baixo volume. Mas isso não elimina a questão do custo de produção.

A documentação de faturamento da Gemini API separa o uso gratuito do pago e explica como os projetos passam para as camadas pagas. As equipes devem confirmar a elegibilidade atual, os limites de taxa, os termos de uso de dados e a disponibilidade dos modelos antes de tratar um protótipo bem-sucedido na camada gratuita como evidência de produção.

A distinção prática é:

  • Use a camada gratuita para testar prompts, o comportamento do SDK e o ajuste ao produto.
  • Use as tarifas da camada paga e a telemetria real de tokens para aprovar um orçamento de produção.
  • Não assuma que um modelo em prévia, uma cota gratuita ou um limite de taxa permanecerão inalterados até o lançamento.

Preços do Gemini Pro e o ponto de inflexão de 200k tokens

O Gemini 2.5 Pro tem um dos limites de preço mais importantes na tabela atual. Prompts de até 200k tokens usam as taxas mais baixas de entrada e saída. Prompts acima de 200k usam as taxas mais altas.

Esse limite se aplica ao tamanho do prompt de uma solicitação individual, não ao total mensal. Uma equipe que envia 20 milhões de tokens em muitos prompts pequenos pode permanecer na taxa mais baixa, enquanto uma aplicação de contexto longo com menor volume pode cruzar o ponto de inflexão repetidamente.

Acompanhe pelo menos estas duas métricas:

  1. percentual de solicitações acima de 200k tokens de entrada
  2. contribuição de custo dessas solicitações

Se uma pequena parcela de prompts excessivamente grandes estiver gerando uma grande parte do gasto, considere fragmentação, recuperação, resumo, reutilização de cache ou uma política de roteamento que reserve o modelo de contexto longo para solicitações que realmente precisem dele.

Cache de contexto, grounding e custos de modalidade

As taxas por token são apenas a camada base dos preços da Gemini API.

Cache de contexto

A tabela oficial lista um preço de gravação em cache e um preço de armazenamento por hora. O cache pode melhorar a economia quando o mesmo contexto grande é reutilizado vezes suficientes, mas o ponto de equilíbrio depende do volume de gravação, do tempo de retenção e de quanto da entrada repetida o cache substitui.

Grounding com Google Search e Maps

O grounding inclui franquias gratuitas específicas do modelo, seguidas por cobranças por consulta ou por prompt. Não estime uma aplicação com grounding apenas com base nas taxas por token. Registre o número de solicitações com grounding e reconcilie-as como um item separado.

Áudio em tempo real

O áudio da Live API usa taxas diferentes de entrada e saída em relação às chamadas de texto comuns. Equipes de agentes de voz devem orçar tokens de áudio separadamente e incluir duração da sessão, comportamento de interrupção e verbosidade da resposta nos testes de carga.

Geração de imagens e vídeo

Imagens e vídeos gerados são precificados usando unidades específicas de modalidade e linhas de modelo. Trate-os como orçamentos de produção separados, e não como extensões de uma estimativa de modelo de texto.

Gemini Developer API versus Vertex AI e planos para consumidores

A expressão "preços do Gemini" pode se referir a vários caminhos de compra.

Produto Pergunta típica do comprador Por que não deve ser misturado nesta tabela
Gemini Developer API Quanto custarão as chamadas do aplicativo? Esta é a tabela de tarifas resumida neste guia
Google AI Studio Posso criar um protótipo e obter uma chave de API? É uma superfície de desenvolvimento, não uma tabela universal separada de preços de produção
Vertex AI Como opero o Gemini dentro do Google Cloud? Termos comerciais, controles e opções de serviço podem ser diferentes
Planos consumer do Gemini O que inclui uma assinatura individual? Preço de assinatura não é preço por token da API
Gemini Enterprise ou Agent Platform Quanto custa um produto empresarial mais amplo? É um escopo de produto diferente das chamadas da Developer API

Ao comparar fornecedores ou gateways, mantenha o mesmo caminho de compra em ambos os lados. Comparar uma assinatura para consumidores com tokens de API, ou um serviço gerenciado em nuvem com uma API para desenvolvedores, produz uma conclusão aparentemente limpa, mas inútil.

Quando o acesso direto do Google é suficiente

O acesso direto ao Gemini costuma ser a escolha mais simples quando:

  • Gemini é a única família de modelos em produção.
  • A equipe está confortável com o faturamento e a estrutura de contas do Google.
  • A engenharia não precisa de failover entre provedores nem de abstração de rotas.
  • O financeiro consegue revisar o uso sem consolidar outros fornecedores de IA.

Um gateway de API de IA se torna mais útil quando o problema operacional vai além de um único provedor:

  • o produto usa Gemini, GPT, Claude ou outras famílias de modelos
  • a engenharia quer uma única superfície de credenciais e roteamento centralizado de modelos
  • o financeiro quer saldos, faturas ou revisão de uso consolidados
  • as operações precisam de medição em nível de modelo e controles de políticas compartilhadas
  • as equipes querem alterar rotas sem reconstruir cada integração

O gateway não elimina a necessidade de entender os preços subjacentes dos modelos. Ele muda como acesso, roteamento, aquisição e relatórios são gerenciados em torno desses preços.

Flatkey fornece uma camada única de acesso via API para várias famílias de modelos. Consulte a página de preços da Flatkey para entender o modelo comercial e, em seguida, compare o panorama mais amplo de modelos na comparação de preços de modelos de IA.

Uma lista recorrente de verificação para atualização de preços do Gemini

As páginas de preços devem ter um responsável nomeado pela revisão das fontes e um intervalo recorrente de atualização. Para uma consulta de alta demanda como Gemini API pricing, a revisão mensal é um padrão razoável, com uma revisão imediata após grandes anúncios de modelos do Google.

Use esta lista de verificação:

  1. Compare a ordem dos modelos e os rótulos de ciclo de vida na página oficial de preços do Google.
  2. Registre novos identificadores de modelos em preview, estáveis, descontinuados e removidos.
  3. Verifique de forma independente as tarifas de Standard, Batch, cache-write e cache-storage.
  4. Confira novamente os limites de comprimento do prompt e se eles afetam a entrada, a saída ou ambas.
  5. Verifique a disponibilidade da camada gratuita e a linguagem da camada de faturamento.
  6. Recalcule todos os exemplos de carga de trabalho a partir de suas premissas publicadas.
  7. Verifique se as seções de grounding, Live API, imagem e vídeo têm mudanças de preço separadas.
  8. Confirme que os links internos, as alegações de produto e o CTA público de preços permanecem corretos.
  9. Atualize a data visível de "verificado em" somente depois de concluir a revisão da fonte.

O objetivo não é prometer que um artigo de preços nunca ficará desatualizado. O objetivo é tornar cada número rastreável, cada cenário reproduzível e cada atualização rápida o suficiente para manter a página útil.

A decisão de compra

Comece pela forma da carga de trabalho, não pelo nome do modelo.

  • Escolha a rota de menor custo que atenda aos requisitos de qualidade e latência da tarefa.
  • Use Batch para trabalhos assíncronos elegíveis.
  • Acompanhe os tokens de saída e os pontos de ruptura de contexto longo.
  • Orce separadamente cache, grounding, áudio, imagem e vídeo.
  • Reavalie a arquitetura de acesso quando o Gemini deixar de ser o único provedor na pilha.

Esse processo transforma o Gemini API pricing de uma tabela estática em uma decisão operacional repetível.