Wenn Sie im Jahr 2026 die Gemini API-Preise vergleichen, besteht die größte Herausforderung nicht darin, eine Preisliste zu finden. Es geht darum zu entscheiden, welche Preisliste für Ihre Workload gilt.
Suchergebnisse vermischen routinemäßig vier verschiedene Produkte: die Gemini Developer API, die Testumgebung von Google AI Studio, Vertex AI oder andere Google-Cloud-Dienste sowie die Gemini-Abonnements für Endnutzer. Dieser Leitfaden konzentriert sich auf die Gemini Developer API und verwendet die offiziellen Preis- und Abrechnungsseiten von Google, geprüft am 27. Juli 2026.
Die kurze Antwort lautet, dass die Gemini-API-Kosten von fünf Variablen abhängen:
- die von Ihnen ausgewählte Modellfamilie
- das Volumen an Eingabe- und Ausgabetokens
- ob einzelne Prompts eine lange Kontextschwelle überschreiten
- ob die Workload Batch-Preise nutzen kann
- Zusatzfunktionen wie Context Caching, Grounding, Audio, Bilder oder Video
Das bedeutet, dass der niedrigste Token-Preis in der Überschrift nicht immer die niedrigsten Produktionskosten sind. Der nützliche Vergleich ist eine Tabelle der Workload-Kosten mit denselben Annahmen für jedes in Frage kommende Modell.
Gemini API-Preise auf einen Blick
Die folgende Tabelle fasst die wichtigsten textfähigen Zeilen der Gemini Developer API zusammen, die Teams am ehesten vergleichen. Die Preise sind in US-Dollar pro 1 Million Tokens angegeben, basierend auf Googles offizieller Preisseite der Gemini Developer API.
| Modell | Status | Standard-Eingabe | Standard-Ausgabe | Batch-Eingabe | Batch-Ausgabe | Context-Cache-Schreiben | Cache-Speicher pro Stunde |
|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | Preview | $0.40 | $2.40 | $0.20 | $1.20 | $0.04 | $1.00 |
| Gemini 3.5 Flash | Preview | $1.50 | $9.00 | $0.75 | $4.50 | $0.15 | $1.00 |
| Gemini 3.5 Flash-Lite | Preview | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 3.1 Flash-Lite | Preview | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 2.5 Pro | Stable | $1.25 bis 200k; $2.50 über 200k | $10.00 bis 200k; $15.00 über 200k | $0.625 bis 200k; $1.25 über 200k | $5.00 bis 200k; $7.50 über 200k | $0.125 bis 200k; $0.25 über 200k | $4.50 |
| Gemini 2.5 Flash | Stable | $0.30 | $2.50 | $0.15 | $1.25 | $0.03 | $1.00 |
| Gemini 2.5 Flash-Lite | Stable | $0.10 | $0.40 | $0.05 | $0.20 | $0.01 | $1.00 |
Für Gemini 3.6 Flash, Gemini 3.5 Flash, die Flash-Lite-Preview-Modelle und die Gemini-2.5-Flash-Familien liegt der Preis für Audio-Eingaben höher als für Text-, Bild- oder Videoeingaben. Die Tabelle verwendet den Preis für Text-, Bild- und Videoeingaben, damit die Modellzeilen vergleichbar bleiben.
Preview-Modelle können sich vor der stabilen Veröffentlichung ändern. Wenn Ihre Produktionsrichtlinie ein festes Verhalten, längere Deaktivierungsfristen oder eine stabile Modell-ID erfordert, vergleichen Sie die Economics der Preview-Modelle mit den stabilen Gemini-2.5-Zeilen, statt nur nach dem Preis zu entscheiden.
Was sich bei der Aktualisierung vom 27. Juli 2026 geändert hat
Die wichtigste Änderung seit der vorherigen Version dieses Leitfadens ist das aktuelle Modellangebot.
- Gemini 3.6 Flash Preview erscheint jetzt als Option mit hohem Durchsatz bei 0,40 $ für Eingaben und 2,40 $ für Ausgaben pro Million Tokens.
- Gemini 3.5 Flash-Lite Preview erscheint jetzt bei 0,25 $ für Eingaben und 1,50 $ für Ausgaben pro Million Tokens.
- Die frühere Zeile für Gemini 3.1 Flash-Lite bleibt sichtbar, Käufer sollten jedoch bestätigen, welches Preview-Modell-Identifikationsmerkmal sie betreiben möchten.
- Die stabilen Gemini-2.5-Modelle bleiben nützliche Vergleichsanker für Teams, die Wert auf Vorhersagbarkeit des Lebenszyklus legen.
Deshalb benötigt eine Gemini-Preisseite geplante Pflege. Eine korrekte Tabelle kann strategisch irreführend werden, selbst wenn jede alte Zahl technisch immer noch irgendwo im Katalog vorhanden ist.
Gemini API-Workload-Kostentabelle
Die folgende Tabelle wandelt Raten in Budgetschätzungen um. Diese Szenarien sind keine Qualitäts-Benchmarks, und die Modelle sind nicht austauschbar. Sie beantworten eine engere Finanzfrage: Wie hoch wäre die Token-Rechnung, wenn derselbe Workload über jede Route ausgeführt würde?
Annahmen
| Workload | Anforderungsvolumen | Eingabe pro Anforderung | Ausgabe pro Anforderung | Gesamteingabe | Gesamtausgabe |
|---|---|---|---|---|---|
| Klassifizierung und Extraktion | 1.000 Anfragen | 2.000 Tokens | 300 Tokens | 2 Mio. Tokens | 0,3 Mio. Tokens |
| Retrieval-gestützter Assistent | 1.000 Anfragen | 20.000 Tokens | 1.000 Tokens | 20 Mio. Tokens | 1 Mio. Tokens |
| Überprüfung langer Dokumente | 100 Anfragen | 150.000 Tokens | 5.000 Tokens | 15 Mio. Tokens | 0,5 Mio. Tokens |
Das Langdokumenten-Szenario hält jede Eingabe unter der 200k-Schwelle von Gemini 2.5 Pro. Grounding, Caching, Audio, Bildgenerierung und Videogenerierung sind ausgeschlossen.
Geschätzte Token-Kosten der Standard-Stufe
| Modell | Klassifizierung | RAG-Assistent | Überprüfung langer Dokumente |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | 0,95 $ | 6,50 $ | 4,50 $ |
| Gemini 3.6 Flash | 1,52 $ | 10,40 $ | 7,20 $ |
| Gemini 2.5 Flash-Lite | 0,32 $ | 2,40 $ | 1,70 $ |
| Gemini 2.5 Flash | 1,35 $ | 8,50 $ | 5,75 $ |
| Gemini 3.5 Flash | 5,70 $ | 39,00 $ | 27,00 $ |
| Gemini 2.5 Pro | 5,50 $ | 35,00 $ | 23,75 $ |
Diese Gesamtsummen zeigen, warum eine Workload-Tabelle nützlicher ist als eine Modellliste.
- Für schmale Extraktion hat die stabile Zeile Gemini 2.5 Flash-Lite in diesem Vergleich die niedrigsten Token-Kosten.
- Gemini 3.6 Flash kostet mehr als die Lite-Routen, aber deutlich weniger als Gemini 3.5 Flash unter denselben Annahmen.
- Im Beispiel mit langen Dokumenten ist die Token-Rechnung von Gemini 2.5 Pro niedriger als die von Gemini 3.5 Flash, weil die Eingabe unter der Pro-Schwelle bleibt. Das beweist nicht, dass es das bessere Modell ist, verhindert aber die irreführende Annahme, dass jeder Pro-Workload mehr kosten muss.
- Anwendungen mit hohem Ausgabeanteil reagieren empfindlicher auf die Modellwahl, da Ausgabetokens auf jeder hier gezeigten Zeile mehr kosten als Text-Eingabetokens.
Was Batch-Preise mit denselben Workloads machen
Für Zeilen, die die Batch API unterstützen, liegen Googles angegebene Batch-Token-Raten in der Regel bei der Hälfte der Standard-Raten. Wenn jede Anfrage in den obigen Szenarien asynchron ausgeführt werden kann, ergeben sich folgende geschätzte Token-Gesamtkosten:
| Modell | Klassifizierung mit Batch | RAG-Assistent mit Batch | Lange-Dokumente-Review mit Batch |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.475 | $3.25 | $2.25 |
| Gemini 3.6 Flash | $0.76 | $5.20 | $3.60 |
| Gemini 2.5 Flash-Lite | $0.16 | $1.20 | $0.85 |
| Gemini 2.5 Flash | $0.675 | $4.25 | $2.875 |
| Gemini 3.5 Flash | $2.85 | $19.50 | $13.50 |
| Gemini 2.5 Pro | $2.75 | $17.50 | $11.875 |
Batch ist eine Abrechnungs- und Architekturentscheidung. Es eignet sich gut für Offline-Enrichment, Evaluierungsläufe, nächtliche Zusammenfassungen, Dokument-Backfills und andere Jobs, die keine sofortige Antwort erfordern. Es ist kein Ersatz für den Standard-Service, wenn ein Nutzer in einem interaktiven Produktfluss wartet.
Die Formel hinter den Gemini-API-Kosten
Für einen Text-Workload ohne Zusatzfunktionen verwenden Sie:
monthly cost =
(input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
Wenn die Anwendung Context Caching verwendet, fügen Sie Kosten für Cache-Schreiben und Speicherung hinzu. Wenn sie Grounding, Audio, generierte Bilder oder generiertes Video verwendet, berechnen Sie diese Posten separat, da sie nicht alle denselben universellen Token-Preis teilen.
Für Finanzprüfungen sollten Sie die Annahmen neben dem Ergebnis festhalten:
| Zu erfassende Annahme | Warum das wichtig ist |
|---|---|
| Anfragen pro Monat | Wandelt das Verhalten pro Anfrage in ein Budget um |
| Durchschnittliche und p95 Input-Tokens | Lange Prompts können höhere Pro-Preise auslösen |
| Durchschnittliche und p95 Output-Tokens | Die Ausgabe ist oft der teurere Teil |
| Anteil Standard gegenüber Batch | Asynchrone Arbeit kann den Token-Verbrauch deutlich senken |
| Volumen der Cache-Schreibvorgänge und Aufbewahrungsdauer | Wiederverwendung kann Input-Kosten sparen, aber Speicher ist nicht kostenlos |
| Grounded Requests | Google Search und Maps haben separate Kontingente und Gebühren |
| Audio-, Bild- und Video-Einheiten | Die Preisgestaltung nach Modalität kann die Text-Token-Rechnung dominieren |
Gemini API Free Tier vs. Paid Tier
Google zeigt für mehrere aktuelle Gemini-Developer-API-Modelle ein kostenloses Kontingent an. Das ist nützlich für Experimente, Prototypen und Validierungen mit geringem Volumen. Damit entfällt jedoch nicht die Frage nach den Produktionskosten.
Die Gemini-API-Abrechnungsdokumentation trennt kostenlose und kostenpflichtige Nutzung und erklärt, wie Projekte in kostenpflichtige Stufen übergehen. Teams sollten aktuelle Berechtigung, Ratenlimits, Datenverwendungsbedingungen und Modellverfügbarkeit prüfen, bevor sie einen erfolgreichen Free-Tier-Prototypen als Produktionsnachweis werten.
Der praktische Unterschied ist:
- Nutzen Sie den kostenlosen Tarif, um Prompts, das SDK-Verhalten und die Produktpassung zu testen.
- Nutzen Sie die Raten des kostenpflichtigen Tarifs und echte Token-Telemetrie, um ein Produktionsbudget freizugeben.
- Nehmen Sie nicht an, dass ein Preview-Modell, ein kostenloses Kontingent oder ein Ratenlimit bis zum Launch unverändert bleiben.
Gemini Pro-Preise und der 200k-Token-Kipppunkt
Gemini 2.5 Pro hat eine der wichtigsten Preisgrenzen in der aktuellen Tabelle. Prompts bis zu 200k Token verwenden die niedrigeren Eingabe- und Ausgaberaten. Prompts über 200k verwenden die höheren Raten.
Diese Schwelle gilt für die Prompt-Größe einer einzelnen Anfrage, nicht für die monatliche Gesamtsumme. Ein Team, das 20 Millionen Token in vielen kleinen Prompts sendet, kann auf der niedrigeren Rate bleiben, während eine Anwendung mit geringerem Volumen und langem Kontext die Schwelle wiederholt überschreiten kann.
Verfolgen Sie mindestens diese beiden Metriken:
- Prozentsatz der Anfragen mit mehr als 200k Eingabe-Token
- Kostenbeitrag dieser Anfragen
Wenn ein kleiner Anteil übergroßer Prompts einen großen Teil der Ausgaben verursacht, ziehen Sie Chunking, Retrieval, Zusammenfassung, Cache-Wiederverwendung oder eine Routing-Richtlinie in Betracht, die das Long-Context-Modell nur für Anfragen reserviert, die es tatsächlich benötigen.
Kontext-Cache, Grounding und Modalitätskosten
Token-Raten sind nur die Basisschicht der Gemini API-Preisgestaltung.
Kontext-Cache
Die offizielle Tabelle führt einen Preis für das Schreiben in den Cache sowie einen stündlichen Speicherpreis auf. Caching kann die Wirtschaftlichkeit verbessern, wenn derselbe große Kontext oft genug wiederverwendet wird, aber der Break-even-Punkt hängt vom Schreibvolumen, der Aufbewahrungsdauer und davon ab, wie viel wiederholte Eingabe der Cache ersetzt.
Google Search- und Maps-Grounding
Grounding umfasst modellspezifische kostenlose Kontingente, gefolgt von Gebühren pro Abfrage oder pro Prompt. Schätzen Sie eine geerdete Anwendung nicht allein aus Token-Raten. Erfassen Sie die Anzahl der geerdeten Anfragen und gleichen Sie sie als eigene Position ab.
Live-Audio
Audio in der Live API verwendet andere Eingabe- und Ausgaberaten als gewöhnliche Textaufrufe. Teams für Sprachagenten sollten Audio-Token separat budgetieren und Sitzungsdauer, Unterbrechungsverhalten und Antwortumfang in Lasttests berücksichtigen.
Bild- und Videogenerierung
Generierte Bilder und Videos werden anhand modalitätsspezifischer Einheiten und Modellzeilen bepreist. Betrachten Sie sie als separate Produktionsbudgets und nicht als Erweiterung einer Schätzung für ein Textmodell.
Gemini Developer API versus Vertex AI und Consumer-Tarife
Der Ausdruck „Gemini-Preisgestaltung“ kann sich auf mehrere Beschaffungswege beziehen.
| Produkt | Typische Frage des Käufers | Warum es nicht in diese Tabelle gemischt werden sollte |
|---|---|---|
| Gemini Developer API | Was kosten Anwendungsaufrufe? | Dies ist die in diesem Leitfaden zusammengefasste Preisliste |
| Google AI Studio | Kann ich Prototypen erstellen und einen API-Schlüssel erhalten? | Es ist eine Entwicklungsoberfläche, keine separate universelle Preisliste für den produktiven Einsatz |
| Vertex AI | Wie betreibe ich Gemini in Google Cloud? | Kommerzielle Bedingungen, Kontrollen und Serviceoptionen können sich unterscheiden |
| Consumer Gemini-Tarife | Was ist in einem individuellen Abonnement enthalten? | Abonnementpreise sind keine API-Token-Preise |
| Gemini Enterprise oder Agent Platform | Was kostet ein umfassenderes Unternehmensprodukt? | Es ist ein anderer Produktumfang als Developer-API-Aufrufe |
Beim Vergleich von Anbietern oder Gateways sollten Sie auf beiden Seiten denselben Beschaffungsweg zugrunde legen. Ein Vergleich eines Consumer-Abonnements mit API-Tokens oder eines verwalteten Cloud-Dienstes mit einer Developer-API führt zu einem sauber wirkenden, aber unbrauchbaren Ergebnis.
Wann direkter Google-Zugriff ausreicht
Der direkte Gemini-Zugriff ist oft die einfachste Wahl, wenn:
- Gemini die einzige Modellfamilie in der Produktion ist.
- Das Team mit der Abrechnung und Kontostruktur von Google vertraut ist.
- Die Entwicklung kein Cross-Provider-Failover oder keine Routenabstraktion benötigt.
- Die Finanzabteilung die Nutzung prüfen kann, ohne andere KI-Anbieter zusammenzuführen.
Ein AI API Gateway wird nützlicher, wenn sich das Betriebsproblem über einen Anbieter hinaus ausweitet:
- das Produkt Gemini, GPT, Claude oder andere Modellfamilien verwendet
- die Entwicklung eine einzige Credential-Oberfläche und zentrale Modellrouting-Funktionalität wünscht
- die Finanzabteilung konsolidierte Salden, Rechnungen oder Nutzungsprüfungen möchte
- der Betrieb Metrikierung auf Modellebene und gemeinsame Richtlinienkontrollen benötigt
- Teams Routen ändern wollen, ohne jede Integration neu aufzubauen
Das Gateway ersetzt nicht die Notwendigkeit, die zugrunde liegenden Modellpreise zu verstehen. Es verändert, wie Zugriff, Routing, Beschaffung und Reporting rund um diese Preise verwaltet werden.
Flatkey bietet eine API-Zugriffsschicht für mehrere Modellfamilien. Prüfen Sie die aktuelle Flatkey-Preisseite für das kommerzielle Modell und vergleichen Sie dann die breitere Modelllandschaft in der Vergleichsstudie zu KI-Modellpreisen.
Checkliste für eine wiederkehrende Gemini-Preisaktualisierung
Preisseiten sollten eine benannte verantwortliche Person für die Quellenprüfung und einen wiederkehrenden Aktualisierungszeitpunkt haben. Für eine stark nachgefragte Suchanfrage wie Gemini API pricing ist eine monatliche Prüfung ein sinnvoller Standard, mit einer sofortigen Prüfung nach wichtigen Google-Modellankündigungen.
Verwenden Sie diese Checkliste:
- Vergleichen Sie die Modellreihenfolge und die Lebenszyklus-Labels auf der offiziellen Preisseite von Google.
- Dokumentieren Sie neue Preview-, Stable-, Deprecated- und entfernte Modellkennungen.
- Überprüfen Sie Standard-, Batch-, Cache-Write- und Cache-Storage-Tarife unabhängig voneinander.
- Prüfen Sie die Schwellenwerte für die Prompt-Länge erneut und ob sie sich auf Eingabe, Ausgabe oder beides auswirken.
- Überprüfen Sie die Verfügbarkeit des Free-Tiers und die Formulierung der Billing-Tiers.
- Berechnen Sie jedes Workload-Beispiel anhand seiner veröffentlichten Annahmen neu.
- Prüfen Sie die Abschnitte zu Grounding, Live API, Bild und Video auf separate Preisänderungen.
- Bestätigen Sie, dass interne Links, Produktaussagen und der öffentliche Pricing-CTA weiterhin korrekt sind.
- Aktualisieren Sie das sichtbare Datum „geprüft am“ erst nach Abschluss der Quellenprüfung.
Ziel ist nicht zu versprechen, dass ein Artikel zu Preisen niemals veralten wird. Ziel ist es, jede Zahl nachvollziehbar, jedes Szenario reproduzierbar und jede Aktualisierung schnell genug zu machen, damit die Seite nützlich bleibt.
Die Kaufentscheidung
Beginnen Sie mit der Workload-Struktur, nicht mit dem Modellnamen.
- Wählen Sie den kostengünstigsten Pfad, der die Qualitäts- und Latenzanforderungen der Aufgabe erfüllt.
- Verwenden Sie Batch für geeignete asynchrone Arbeit.
- Achten Sie auf Output-Tokens und Schwellenwerte bei langem Kontext.
- Planen Sie Caching, Grounding, Audio, Bild und Video separat ein.
- Überprüfen Sie die Zugriffsarchitektur erneut, wenn Gemini nicht mehr der einzige Anbieter im Stack ist.
Dieser Prozess macht aus Gemini API pricing eine statische Tabelle und eine wiederholbare Betriebsentscheidung.



