Si vous comparez la tarification de l’API Gemini en 2026, la partie la plus difficile n’est pas de trouver une grille tarifaire. C’est de déterminer quelle grille tarifaire s’applique à votre charge de travail.
Les résultats de recherche mélangent régulièrement quatre produits différents : l’API Gemini Developer, l’expérience de test de Google AI Studio, Vertex AI ou d’autres services Google Cloud, et les abonnements Gemini destinés aux consommateurs. Ce guide se concentre sur l’API Gemini Developer et s’appuie sur les pages officielles de Google concernant la tarification et la facturation, vérifiées le 27 juillet 2026.
En bref, le coût de l’API Gemini dépend de cinq variables :
- la famille de modèles que vous sélectionnez
- le volume de jetons d’entrée et de sortie
- si certaines requêtes individuelles franchissent un seuil de long contexte
- si la charge de travail peut utiliser la tarification Batch
- les options supplémentaires telles que le cache de contexte, l’ancrage, l’audio, les images ou la vidéo
Cela signifie que le prix affiché le plus bas par jeton n’est pas toujours le coût de production le plus faible. La comparaison utile est un tableau du coût de la charge de travail avec les mêmes hypothèses appliquées à chaque modèle candidat.
Tarification de l’API Gemini en un coup d’œil
Le tableau ci-dessous résume les principales lignes de l’API Gemini Developer compatibles avec le texte que les équipes sont les plus susceptibles de comparer. Les prix sont exprimés en dollars américains par 1 million de jetons, sur la base de la page officielle de tarification de l’API Gemini Developer de Google.
| Modèle | Statut | Entrée standard | Sortie standard | Entrée Batch | Sortie Batch | Écriture du cache de contexte | Stockage du cache par heure |
|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | Aperçu | 0,40 $ | 2,40 $ | 0,20 $ | 1,20 $ | 0,04 $ | 1,00 $ |
| Gemini 3.5 Flash | Aperçu | 1,50 $ | 9,00 $ | 0,75 $ | 4,50 $ | 0,15 $ | 1,00 $ |
| Gemini 3.5 Flash-Lite | Aperçu | 0,25 $ | 1,50 $ | 0,125 $ | 0,75 $ | 0,025 $ | 1,00 $ |
| Gemini 3.1 Flash-Lite | Aperçu | 0,25 $ | 1,50 $ | 0,125 $ | 0,75 $ | 0,025 $ | 1,00 $ |
| Gemini 2.5 Pro | Stable | 1,25 $ jusqu’à 200k ; 2,50 $ au-delà de 200k | 10,00 $ jusqu’à 200k ; 15,00 $ au-delà de 200k | 0,625 $ jusqu’à 200k ; 1,25 $ au-delà de 200k | 5,00 $ jusqu’à 200k ; 7,50 $ au-delà de 200k | 0,125 $ jusqu’à 200k ; 0,25 $ au-delà de 200k | 4,50 $ |
| Gemini 2.5 Flash | Stable | 0,30 $ | 2,50 $ | 0,15 $ | 1,25 $ | 0,03 $ | 1,00 $ |
| Gemini 2.5 Flash-Lite | Stable | 0,10 $ | 0,40 $ | 0,05 $ | 0,20 $ | 0,01 $ | 1,00 $ |
Pour Gemini 3.6 Flash, Gemini 3.5 Flash, les modèles d’aperçu Flash-Lite et les familles Gemini 2.5 Flash, l’entrée audio est facturée à un tarif plus élevé que l’entrée texte, image ou vidéo. Le tableau utilise le tarif d’entrée texte, image et vidéo afin que les lignes des modèles restent comparables.
Les modèles d’aperçu peuvent changer avant leur sortie stable. Si votre politique de production exige un comportement figé, des fenêtres de dépréciation plus longues ou un identifiant de modèle stable, comparez plutôt l’économie des versions d’aperçu avec les lignes stables Gemini 2.5 au lieu de vous baser uniquement sur le prix.
Ce qui a changé dans l’actualisation du 27 juillet 2026
Le changement le plus important depuis la version précédente de ce guide est la gamme de modèles actuelle.
- Gemini 3.6 Flash Preview apparaît désormais comme une option à haut débit à 0,40 $ à l’entrée et 2,40 $ à la sortie par million de tokens.
- Gemini 3.5 Flash-Lite Preview apparaît désormais à 0,25 $ à l’entrée et 1,50 $ à la sortie par million de tokens.
- La ligne Gemini 3.1 Flash-Lite précédente reste visible, mais les acheteurs doivent confirmer quel identifiant de modèle preview ils prévoient d’utiliser.
- Les modèles stables Gemini 2.5 restent des repères de comparaison utiles pour les équipes qui accordent de l’importance à la prévisibilité du cycle de vie.
C’est pourquoi une page de tarification Gemini a besoin d’une maintenance programmée. Un tableau correct peut devenir stratégiquement trompeur même lorsque chaque ancien chiffre est encore techniquement présent quelque part dans le catalogue.
Tableau du coût de charge de travail de l’API Gemini
Le tableau ci-dessous convertit les tarifs en estimations budgétaires. Ces scénarios ne sont pas des benchmarks de qualité, et les modèles ne sont pas interchangeables. Ils répondent à une question financière plus étroite : à combien s’élèverait la facture en tokens si la même charge de travail s’exécutait sur chaque route ?
Hypothèses
| Charge de travail | Volume de requêtes | Entrée par requête | Sortie par requête | Entrée totale | Sortie totale |
|---|---|---|---|---|---|
| Classification et extraction | 1 000 requêtes | 2 000 tokens | 300 tokens | 2M tokens | 0,3M tokens |
| Assistant augmenté par récupération | 1 000 requêtes | 20 000 tokens | 1 000 tokens | 20M tokens | 1M tokens |
| Révision de longs documents | 100 requêtes | 150 000 tokens | 5 000 tokens | 15M tokens | 0,5M tokens |
Le scénario de longs documents maintient chaque prompt en dessous du seuil de 200k de Gemini 2.5 Pro. Le grounding, la mise en cache, l’audio, la génération d’images et la génération de vidéos sont exclus.
Coût estimé en tokens pour le niveau Standard
| Modèle | Classification | Assistant RAG | Révision de longs documents |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | 0,95 $ | 6,50 $ | 4,50 $ |
| Gemini 3.6 Flash | 1,52 $ | 10,40 $ | 7,20 $ |
| Gemini 2.5 Flash-Lite | 0,32 $ | 2,40 $ | 1,70 $ |
| Gemini 2.5 Flash | 1,35 $ | 8,50 $ | 5,75 $ |
| Gemini 3.5 Flash | 5,70 $ | 39,00 $ | 27,00 $ |
| Gemini 2.5 Pro | 5,50 $ | 35,00 $ | 23,75 $ |
Ces totaux montrent pourquoi un tableau de charge de travail est plus utile qu’une simple liste de modèles.
- Pour l’extraction ciblée, la ligne stable Gemini 2.5 Flash-Lite a le coût en tokens le plus bas de cette तुलनाison.
- Gemini 3.6 Flash coûte plus cher que les routes Lite, mais nettement moins que Gemini 3.5 Flash dans les mêmes hypothèses.
- Dans l’exemple de longs documents, la facture en tokens de Gemini 2.5 Pro est inférieure à celle de Gemini 3.5 Flash parce que le prompt reste sous le seuil Pro. Cela ne prouve pas que c’est le meilleur modèle, mais cela évite une hypothèse trompeuse selon laquelle toute charge de travail Pro devrait coûter plus cher.
- Les applications gourmandes en sortie sont plus sensibles au choix du modèle, car les tokens de sortie coûtent plus cher que les tokens d’entrée texte sur chaque ligne présentée ici.
Ce que la tarification Batch fait aux mêmes charges de travail
Pour les lignes qui prennent en charge l’API Batch, les tarifs de jetons Batch indiqués par Google sont généralement la moitié des tarifs Standard. Si chaque requête dans les scénarios ci-dessus peut s’exécuter de manière asynchrone, les totaux de jetons estimés deviennent :
| Modèle | Classification avec Batch | Assistant RAG avec Batch | Revue de long document avec Batch |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.475 | $3.25 | $2.25 |
| Gemini 3.6 Flash | $0.76 | $5.20 | $3.60 |
| Gemini 2.5 Flash-Lite | $0.16 | $1.20 | $0.85 |
| Gemini 2.5 Flash | $0.675 | $4.25 | $2.875 |
| Gemini 3.5 Flash | $2.85 | $19.50 | $13.50 |
| Gemini 2.5 Pro | $2.75 | $17.50 | $11.875 |
Batch est une décision de facturation et d’architecture. Il convient parfaitement à l’enrichissement hors ligne, aux exécutions d’évaluation, aux résumés nocturnes, aux rattrapages de documents et à d’autres tâches qui ne nécessitent pas de réponse immédiate. Ce n’est pas un substitut au service Standard lorsqu’un utilisateur attend dans un flux de produit interactif.
La formule derrière le coût de l’API Gemini
Pour une charge de travail textuelle sans modules complémentaires, utilisez :
monthly cost =
(input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
Si l’application utilise la mise en cache du contexte, ajoutez les coûts d’écriture dans le cache et de stockage. Si elle utilise le grounding, l’audio, des images générées ou de la vidéo générée, calculez ces lignes séparément, car elles ne partagent pas un taux de jeton universel unique.
Pour les revues financières, conservez les hypothèses à côté du résultat :
| Hypothèse à consigner | Pourquoi c’est important |
|---|---|
| Requêtes par mois | Convertit le comportement par requête en budget |
| Jetons d’entrée moyens et p95 | Les prompts longs peuvent déclencher une tarification Pro plus élevée |
| Jetons de sortie moyens et p95 | La sortie est souvent la partie la plus coûteuse |
| Répartition Standard versus Batch | Le travail asynchrone peut réduire de façon significative les dépenses en jetons |
| Volume d’écriture dans le cache et durée de rétention | La réutilisation peut réduire le coût d’entrée, mais le stockage n’est pas gratuit |
| Requêtes avec grounding | Google Search et Maps ont des quotas et des frais distincts |
| Unités audio, image et vidéo | La tarification par modalité peut dominer la facture des jetons texte |
Niveau gratuit de l’API Gemini versus niveau payant
Google affiche un niveau gratuit pour plusieurs modèles actuels de l’API Gemini Developer. Cela le rend utile pour les expériences, les prototypes et la validation à faible volume. Cela ne fait pas disparaître la question du coût de production.
La documentation de facturation de l’API Gemini distingue l’usage gratuit de l’usage payant et explique comment les projets passent aux niveaux payants. Les équipes doivent confirmer l’éligibilité actuelle, les limites de débit, les conditions d’utilisation des données et la disponibilité des modèles avant de considérer un prototype réussi en niveau gratuit comme une preuve de production.
La distinction pratique est la suivante :
- Utilisez le niveau gratuit pour tester les prompts, le comportement du SDK et l’adéquation du produit.
- Utilisez les tarifs du niveau payant et la télémétrie réelle des jetons pour valider un budget de production.
- N’assumez pas qu’un modèle en aperçu, un quota gratuit ou une limite de débit restera inchangé jusqu’au lancement.
Tarification de Gemini Pro et le seuil des 200k jetons
Gemini 2.5 Pro possède l’un des seuils de tarification les plus importants du tableau actuel. Les prompts jusqu’à 200k jetons utilisent les tarifs d’entrée et de sortie les plus bas. Les prompts au-delà de 200k utilisent les tarifs les plus élevés.
Ce seuil s’applique à la taille du prompt d’une requête individuelle, et non au total mensuel. Une équipe envoyant 20 millions de jetons dans de nombreux petits prompts peut rester au tarif le plus bas, tandis qu’une application à contexte long de plus faible volume peut franchir le seuil à plusieurs reprises.
Suivez au moins ces deux métriques :
- pourcentage de requêtes au-dessus de 200k jetons d’entrée
- contribution au coût de ces requêtes
Si une faible part de prompts trop volumineux génère une grande part des dépenses, envisagez le découpage en segments, la récupération, la synthèse, la réutilisation du cache ou une politique de routage qui réserve le modèle à contexte long aux requêtes qui en ont réellement besoin.
Coûts du cache de contexte, du grounding et des modalités
Les tarifs des jetons ne constituent que la couche de base de la tarification de l’API Gemini.
Cache de contexte
Le tableau officiel indique un prix d’écriture dans le cache et un prix de stockage horaire. La mise en cache peut améliorer l’économie lorsque le même grand contexte est réutilisé suffisamment de fois, mais le point mort dépend du volume d’écriture, de la durée de conservation et de la quantité d’entrée répétée remplacée par le cache.
Grounding avec Google Search et Maps
Le grounding comprend des allocations gratuites propres au modèle, suivies de frais par requête ou par prompt. N’estimez pas une application avec grounding uniquement à partir des tarifs de jetons. Enregistrez le nombre de requêtes avec grounding et rapprochez-les comme une ligne budgétaire distincte.
Audio en direct
L’audio de l’API Live utilise des tarifs d’entrée et de sortie différents de ceux des appels texte ordinaires. Les équipes d’agents vocaux devraient budgéter les jetons audio séparément et inclure la durée de session, le comportement d’interruption et la verbosité des réponses dans les tests de charge.
Génération d’images et de vidéo
Les images et vidéos générées sont tarifées à l’aide d’unités propres à la modalité et de lignes de modèle spécifiques. Traitez-les comme des budgets de production distincts plutôt que comme des extensions d’une estimation basée sur un modèle de texte.
Gemini Developer API par rapport à Vertex AI et aux offres grand public
L’expression « tarification Gemini » peut renvoyer à plusieurs parcours d’achat.
| Produit | Question typique de l’acheteur | Pourquoi il ne faut pas l’inclure dans ce tableau |
|---|---|---|
| Gemini Developer API | Combien coûteront les appels de l’application ? | C’est la grille tarifaire résumée dans ce guide |
| Google AI Studio | Puis-je prototyper et obtenir une clé API ? | Il s’agit d’un environnement de développement, pas d’une grille tarifaire de production universelle distincte |
| Vertex AI | Comment exploiter Gemini dans Google Cloud ? | Les conditions commerciales, les contrôles et les options de service peuvent différer |
| Offres consumer Gemini | Que comprend un abonnement individuel ? | La tarification d’abonnement n’est pas la tarification des jetons de l’API |
| Gemini Enterprise ou Agent Platform | Combien coûte un produit d’entreprise plus large ? | Il s’agit d’un périmètre produit différent des appels de la Developer API |
Lors de la comparaison de fournisseurs ou de passerelles, conservez le même parcours d’achat des deux côtés. Comparer un abonnement grand public avec des jetons API, ou un service cloud managé avec une API développeur, produit une conclusion apparemment claire mais inutilisable.
Quand l’accès direct à Google suffit
L’accès direct à Gemini est souvent le choix le plus simple lorsque :
- Gemini est la seule famille de modèles en production.
- L’équipe est à l’aise avec la facturation et la structure de compte Google.
- L’ingénierie n’a pas besoin de basculement entre fournisseurs ni d’abstraction de routage.
- La finance peut examiner l’utilisation sans consolider d’autres fournisseurs d’IA.
Une passerelle d’API IA devient plus utile lorsque le problème opérationnel dépasse un seul fournisseur :
- le produit utilise Gemini, GPT, Claude ou d’autres familles de modèles
- l’ingénierie veut une surface d’identifiants unique et un routage de modèles centralisé
- la finance veut des soldes, factures ou revues d’utilisation consolidés
- les opérations ont besoin d’un métrage au niveau du modèle et de contrôles de politique partagés
- les équipes veulent changer de route sans reconstruire chaque intégration
La passerelle ne supprime pas la nécessité de comprendre les prix sous-jacents des modèles. Elle modifie la manière dont l’accès, le routage, les achats et les rapports sont gérés autour de ces prix.
Flatkey fournit une couche d’accès API unique pour plusieurs familles de modèles. Consultez la page de tarification de Flatkey pour le modèle commercial actuel, puis comparez le paysage plus large des modèles dans la comparaison des prix des modèles d’IA.
Une liste de contrôle récurrente pour la mise à jour des prix Gemini
Les pages de tarification doivent avoir un responsable désigné de la revue des sources et un créneau de mise à jour récurrent. Pour une requête très demandée telle que Gemini API pricing, une revue mensuelle est un paramètre par défaut raisonnable, avec une revue immédiate après les principales annonces de modèles Google.
Utilisez cette liste de contrôle :
- Comparez l’ordre des modèles et les libellés de cycle de vie sur la page officielle de tarification de Google.
- Enregistrez les nouveaux identifiants de modèles preview, stable, deprecated et removed.
- Vérifiez indépendamment les tarifs Standard, Batch, cache-write et cache-storage.
- Revérifiez les seuils de longueur de prompt et s’ils affectent l’entrée, la sortie ou les deux.
- Vérifiez la disponibilité du niveau gratuit et le libellé du niveau de facturation.
- Recalculez chaque exemple de charge de travail à partir de ses hypothèses publiées.
- Vérifiez que les sections grounding, Live API, image et vidéo n’ont pas subi de changements de prix séparés.
- Confirmez que les liens internes, les affirmations produit et l’appel à l’action public sur la tarification restent exacts.
- Mettez à jour la date visible « checked on » uniquement après avoir terminé la revue de la source.
L’objectif n’est pas de promettre qu’un article sur les prix ne vieillira jamais. L’objectif est de rendre chaque chiffre traçable, chaque scénario reproductible et chaque mise à jour assez rapide pour que la page reste utile.
La décision d’achat
Commencez par la forme de la charge de travail, pas par le nom du modèle.
- Choisissez la route la moins coûteuse qui répond aux exigences de qualité et de latence de la tâche.
- Utilisez Batch pour les travaux asynchrones éligibles.
- Surveillez les jetons de sortie et les points de rupture des longs contextes.
- Budgétez séparément le caching, le grounding, l’audio, l’image et la vidéo.
- Réexaminez l’architecture d’accès lorsque Gemini n’est plus le seul fournisseur dans la pile.
Ce processus transforme la tarification de l’API Gemini d’un tableau statique en une décision opérationnelle reproductible.



