Die DeepSeek-API-Preisgestaltung ist niedrig genug, um Aufmerksamkeit zu erregen, aber der reine Token-Preis ist in einem Produktionsbudget nur die erste Zeile. Cache-Verhalten, Ausgabelänge, Thinking-Tokens, Batch-Berechtigung, Kontextstufen, Wiederholungsversuche und Änderungen im Modell-Lebenszyklus können die tatsächlichen Kosten erheblich beeinflussen.
Dieser Leitfaden vergleicht DeepSeek mit repräsentativen Modellen von OpenAI, Anthropic Claude, Google Gemini und Alibaba Qwen anhand offizieller öffentlicher Preise, die am 27. Juli 2026 geprüft wurden. Er zeigt außerdem ein reproduzierbares Beispiel für Kosten pro Anfrage sowie einen Aktualisierungs-Workflow, den Ihr Team wiederverwenden kann, wenn sich die Anbieterpreise ändern.
Preis-Snapshot: Die Preise der Anbieter ändern sich häufig. Behandeln Sie jede untenstehende Angabe als Vergleich mit Datum und prüfen Sie die verlinkte Preis-Seite des Anbieters, bevor Sie Guthaben kaufen oder eine Produktions-Routing-Richtlinie festlegen.
DeepSeek-API-Preisgestaltung auf einen Blick
Die offizielle API-Tabelle von DeepSeek konzentriert sich derzeit auf zwei V4-Modell-IDs. Beide unterstützen Nicht-Thinking- und Thinking-Modi, und automatisches Kontext-Caching kann den Preis für wiederholte Eingaben deutlich senken.
| DeepSeek-Modell | Input bei Cache-Treffer / 1 Mio. Tokens | Input bei Cache-Miss / 1 Mio. Tokens | Output / 1 Mio. Tokens | Veröffentlichte Parallelitätsgrenze |
|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 | $0.14 | $0.28 | 2,500 |
deepseek-v4-pro |
$0.003625 | $0.435 | $0.87 | 500 |
Quelle: DeepSeek Models & Pricing.
Die Lücke zwischen Input bei Cache-Treffer und Input bei Cache-Miss ist ungewöhnlich groß. Dadurch werden Prompt-Struktur und wiederverwendeter Kontext wirtschaftlich wichtig. Eine Workload, die wiederholt dieselbe Richtlinie, dasselbe Schema, dasselbe Dokumentpräfix oder denselben langen System-Prompt sendet, kann sich wirtschaftlich ganz anders verhalten als eine Ad-hoc-Chat-Workload, selbst wenn die gesamten Token-Zahlen ähnlich aussehen.
Auch Parallelität gehört zur Preisdiskussion. Ein niedriger Token-Preis führt nicht automatisch zu niedrigeren Kosten pro erfolgreicher Anfrage, wenn die Anwendung zusätzliche Warteschlangen, Fallbacks oder Wiederholungen benötigt, um ihr Traffic-Ziel zu erreichen.
DeepSeek im Vergleich zu OpenAI-, Claude-, Gemini- und Qwen-Preisen
Es gibt keine perfekte Modell-zu-Modell-Entsprechung zwischen Anbietern. Die folgende Tabelle verwendet aktuelle repräsentative Textmodelle, um die Mechanik der Abrechnung von Input und Output zu vereinheitlichen - nicht, um gleiche Qualität, Latenz, Kontextverhalten oder Tool-Performance zu behaupten.
| Anbieter und Modell | Standard-Eingabe / 1 Mio. | Zwischengespeicherte Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Wichtige Preisbedingung |
|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 | Automatisches Kontext-Caching; Denk- und Nicht-Denk-Modi |
| DeepSeek V4 Pro | $0.435 | $0.003625 | $0.87 | Geringere veröffentlichte Parallelität als Flash |
| OpenAI GPT-5.4 | $2.50 | $0.25 | $15.00 | Batch- und niedrig priorisierte Verarbeitung können die effektiven Kosten verändern |
| Anthropic Claude Sonnet 5 | $2.00 | $0.20 | $10.00 | Einführungspreis bis zum 31. August 2026; Standardpreise gelten ab dem 1. September |
| Google Gemini 3.6 Flash | $1.50 | $0.15 plus Speicher | $7.50 | Standard-Bezahlstufe; Batch und Flex listen niedrigere Raten |
| Alibaba Qwen3.7-Max | $1.65 | Kontext-Cache-Rabatt verfügbar | $4.951 | Listenpreis; Region, Kontextstufe und temporäre Aktionen können die Abrechnung verändern |
Offizielle Referenzen: OpenAI API-Preisgestaltung, Anthropic Claude-Preisgestaltung, Gemini API-Preisgestaltung und Alibaba Cloud Model Studio-Preisgestaltung.
Das zentrale Ergebnis ist klar: Die veröffentlichten Text-Token-Raten von DeepSeek sind in diesem Vergleich deutlich niedriger. Die betriebliche Schlussfolgerung ist weniger eindeutig. Modellangebote unterscheiden sich in Leistungsfähigkeit, Ausgabeverhalten, enthaltenen Reasoning-Tokens, Service-Stufen, regionaler Verfügbarkeit, Cache-Implementierung und Lebenszyklus-Stabilität. Ein Produktionsvergleich benötigt sowohl Preis- als auch Workload-Nachweise.
Ein reproduzierbarer Kosten-pro-Anfrage-Vergleich
Angenommen, eine erfolgreiche Anfrage verwendet:
- 2.000 nicht zwischengespeicherte Eingabetokens
- 500 Ausgabetokens
- Standard-Synchronverarbeitung
- Keine Tools, Grounding, Bilder, Audio- oder Speichergebühren
- Keine erneuten Versuche oder fehlgeschlagenen Anfragen
- Keine Mengenverpflichtungen oder temporären Rabatte
Die Formel lautet:
Anfragekosten = (Eingabetokens / 1.000.000 × Eingaberate) + (Ausgabetokens / 1.000.000 × Ausgaberate)
| Modell | Kosten pro Anfrage | Kosten für 10.000 Anfragen |
|---|---|---|
| DeepSeek V4 Flash | $0.000420 | $4.20 |
| DeepSeek V4 Pro | $0.001305 | $13.05 |
| Qwen3.7-Max | $0.005776 | $57.76 |
| Gemini 3.6 Flash | $0.006750 | $67.50 |
| Claude Sonnet 5, Einführungstarif | $0.009000 | $90.00 |
| GPT-5.4 | $0.012500 | $125.00 |
Diese Zahlen sind arithmetisch, nicht eine qualitätsbereinigte Rangfolge. Wenn ein Modell längere Antworten erzeugt, mehr Wiederholungen benötigt, zusätzliche Tool-Aufrufe erfordert oder bei der Zielaufgabe häufiger fehlschlägt, kann sich der scheinbare Token-Preisvorteil verringern oder umkehren.
Für eine tiefere Budgetierungsmethode verwenden Sie ein Framework für Kosten pro AI-API-Anfrage, das Wiederholungen und erfolgreiche Ergebnisse statt nur Tokens berücksichtigt.
Warum Cache-Ökonomie die DeepSeek-Kosten dominieren kann
Die Verwendung des Standard-Input-Tarifs für jede Anfrage kann die DeepSeek-Ausgaben überschätzen, wenn wiederkehrender Kontext konsequent den Cache trifft. Sie kann die Ausgaben auch unterschätzen, wenn sich Prompts zu stark ändern, um zu profitieren.
Verfolgen Sie diese Felder getrennt:
- Cache-fähige Input-Tokens: Stabile Präfixe, gemeinsame Anweisungen, wiederholte Dokumente oder Schemata.
- Cache-Treffer-Input-Tokens: Der Anteil, der tatsächlich zum Cache-Treffer-Tarif des Anbieters abgerechnet wird.
- Cache-Fehl-Input-Tokens: Neuer oder geänderter Input, der zum vollen Tarif abgerechnet wird.
- Output-Tokens: Einschließlich Reasoning- oder Thinking-Tokens, wenn der Anbieter sie als Output zählt.
- Cache-Speicher- und Schreibgebühren: Relevant für Anbieter, die Speicherdauer oder Cache-Erstellung separat abrechnen.
Übernehmen Sie nicht den angenommenen Cache-Treffer-Anteil eines Anbieters in die Prognose eines anderen Anbieters, ohne ihn zu messen. DeepSeek automatisches Caching, OpenAI gecachter Input, Anthropic Prompt Caching, Gemini Kontext-Caching und Qwen Kontext-Caching haben nicht dieselben Regeln oder Gebührenstrukturen.
Batch-Rabatte sind nützlich – aber nicht austauschbar
OpenAI bewirbt einen Rabatt von 50 % für die Batch API. Auch Anthropics Batch API bietet 50 % Rabatt auf Input- und Output-Tokens. Gemini 3.6 Flash weist Batch-Input mit $0.75 und Output mit $3.75 pro Million Tokens aus, also die Hälfte der Standardtarife im bezahlten Tarif. Die Qwen-Preisunterlagen trennen Listenpreise, Batch-Rabatte, Kontextstufen und temporäre regionale Aktionen.
Batch-Preise helfen nur, wenn der Workload asynchrone Abschlussfenster akzeptieren kann und das ausgewählte Modell oder der Endpunkt berechtigt ist. Verwenden Sie keinen Batch-Tarif, um einen interaktiven Chat, eine Agenten-Schleife oder eine latenzsensitive Produktionsanfrage zu prognostizieren.
Fünf Faktoren, die vor der Wahl der günstigsten API normalisiert werden sollten
1. Kosten pro erfolgreicher Aufgabe vergleichen
Führen Sie denselben repräsentativen Evaluierungssatz durch jedes Kandidatenmodell aus. Erfassen Sie Tokens, Wiederholungen, Tool-Aufrufe, Latenz und Aufgabenerfolg. Teilen Sie die Gesamtausgaben durch die erfolgreichen Ergebnisse.
2. Thinking- von Nicht-Thinking-Workloads trennen
DeepSeek V4 unterstützt beide Modi. Qwen3.7-Max unterstützt ebenfalls Thinking- und Non-Thinking-Modi, während Gemini beim verglichenen Modell Thinking-Tokens in die Ausgabepreisgestaltung einbezieht. Ein Workflow für Support mit kurzen Antworten und ein aufschlussintensiver Reasoning-Agent sollten nicht dieselbe gemischte Schätzung verwenden.
3. Kontextstufen sichtbar halten
Einige Anbieter erhöhen die Preise für größere Prompts oder veröffentlichen gestaffelte Preise nach Eingabelänge. Wenn Produktions-Prompts eine Stufengrenze überschreiten können, modellieren Sie diese Grenze explizit, statt für jede Anfrage einfach die günstigste Zeile zu verwenden.
4. Retry- und Fallback-Overhead messen
Der nützliche Zähler ist der gesamte Anbieteraufwand, einschließlich fehlgeschlagener Versuche. Der nützliche Nenner sind abgeschlossene Geschäftsvorgänge. Genau hier werden Observability und zentralisierte Request-Logs Teil der Preisanalyse.
5. Modell-Aliase und End-of-Life-Daten verfolgen
Aliase können auf neue Snapshots umgestellt werden, und Modelle können eingestellt oder neu bepreist werden. Fixieren Sie Versionen, wo Stabilität wichtig ist, dokumentieren Sie das Fallback-Verhalten und benennen Sie eine verantwortliche Person, die die Lebenszyklus-Hinweise des Anbieters prüft.
Direkter DeepSeek-Zugang vs. ein einheitliches API-Gateway
Der direkte Zugang zum Anbieter kann ausreichen, wenn ein Team eine Modellfamilie, ein Billing-Konto und eine Region nutzt. Der operative Aufwand steigt, wenn das Team anbieterspezifische Keys, Rechnungsformate, Rate Limits, Fallback-Pfade und Nutzungssteuerungen hinzufügt.
Eine einheitliche Zugriffsschicht kann den Vergleich erleichtern, indem sie Request-Logs, Ausgaben-Transparenz, Kontingente und Routing-Richtlinien zentralisiert. Sie macht unterschiedliche Modelle nicht identisch, und Teams sollten weiterhin modellspezifisches Verhalten und Endpoint-Unterstützung validieren.
Flatkey bietet ein OpenAI-kompatibles Gateway für mehrere Modellfamilien mit zentraler Nutzungsverfolgung. Prüfen Sie die aktuellen Modellpreise und verfügbaren Routen und vergleichen Sie sie anschließend mit der direkten Anbieterpreisgestaltung für Ihren Workload und Ihre Region.
Sie können auch den umfassenderen Preisvergleich von KI-Modellen sowie den fokussierten Kostenleitfaden für DeepSeek vs. Qwen nutzen, wenn Sie eine Shortlist erstellen.
Ein geplanter Workflow zur Aktualisierung der DeepSeek-Preise
Das Interesse an den DeepSeek-Preisen ist hoch, und die Preisliste kann sich schnell ändern. Betrachten Sie diese Seite – und Ihr internes Kostenmodell – als gepflegtes Asset.
| Aktualisierungsschritt | Zu erfassende Nachweise | Freigabefrage |
|---|---|---|
| Offizielle DeepSeek-Preise prüfen | Modell-IDs, Cache-Treffer-Eingabe, Cache-Fehl-Treffereingabe, Ausgabe, Parallelität | Hat sich irgendein Tarif oder Modellname geändert? |
| Hinweise zum Lebenszyklus prüfen | Alias-Änderungen, End-of-Life-Daten, Versionszuordnung | Muss der Produktionscode migriert werden? |
| Vergleichsanbieter aktualisieren | Aktuelle repräsentative Tarife von OpenAI, Claude, Gemini und Qwen | Ist der Vergleich weiterhin fair und klar eingeordnet? |
| Workloads neu berechnen | Eingabe, Ausgabe, Cache, Batch, Wiederholungen, erfolgreiche Aufgaben | Hat sich der wirtschaftliche Gewinner für irgendeinen Workload geändert? |
| Regionale Bedingungen prüfen | Verfügbarkeit, Steuern, Aktionen, Währung, Servicestufe | Sind die lokalen Kosten wesentlich anders? |
| Interne Routen validieren | Preisseite, Vergleichsleitfäden, Kontingent-Inhalte | Funktionieren alle Links zur Umwandlung und Information noch? |
| Prüfdatum festhalten | Quell-URLs, Prüfer, geänderte Felder, nächste Überprüfung | Ist die Seite bereit zur erneuten Veröffentlichung? |
Planen Sie diese Überprüfung monatlich ein und lösen Sie eine außerplanmäßige Prüfung aus, wenn ein Anbieter ein neues Flaggschiffmodell, eine Einstellung, eine Aktion oder eine Abrechnungsänderung ankündigt.
Häufig gestellte Fragen
Wie viel kostet die DeepSeek API?
Am 27. Juli 2026 führte DeepSeek V4 Flash mit 0,14 $ pro Million Cache-Fehl-Treffer-Eingabetokens, 0,0028 $ pro Million Cache-Treffer-Eingabetokens und 0,28 $ pro Million Ausgabetokens auf. V4 Pro kostete entsprechend 0,435 $, 0,003625 $ und 0,87 $. Prüfen Sie die offizielle Preisseite vor der Budgetplanung erneut.
Ist DeepSeek günstiger als OpenAI, Claude, Gemini und Qwen?
Die veröffentlichten Text-Token-Tarife liegen unter den repräsentativen Modellen in diesem veralteten Snapshot. Das beweist jedoch nicht die niedrigsten Kosten pro erfolgreicher Aufgabe. Ausgabelänge, Wiederholungen, Fähigkeiten, Caching, Batch-Fähigkeit und Betrieb spielen alle eine Rolle.
Berechnet DeepSeek weniger für zwischengespeicherte Eingaben?
Ja. Die offizielle V4-Tabelle veröffentlicht einen separaten Cache-Treffer-Eingabetarif, der deutlich niedriger ist als der Cache-Fehl-Treffer-Tarif. Die tatsächlichen Einsparungen hängen davon ab, ob Produktionsanfragen Cache-Treffer erzeugen.
Sollte ich Anbieterpreise oder Gateway-Preise vergleichen?
Vergleichen Sie beides. Direkte Anbieterpreise bilden die Basis. Gateway-Preise sollten mit dem enthaltenen Zugang, der Abrechnung, dem Routing, der Beobachtbarkeit, dem Support und den betrieblichen Kontrollen bewertet werden.
Wie oft sollte eine DeepSeek-Preisseite aktualisiert werden?
Monatlich ist ein praktischer Ausgangspunkt für eine kommerzielle Vergleichsseite. Aktualisieren Sie außerdem sofort nach einer Produkteinführung, einer Einstellungsankündigung, einer Preisänderung oder einer wesentlichen Aktion.
Die Entscheidungsregel
Beginnen Sie mit der offiziellen Token-Tabelle, bleiben Sie aber nicht dort stehen. Messen Sie einen repräsentativen Workload, trennen Sie zwischengespeicherte und nicht zwischengespeicherte Eingaben, berücksichtigen Sie Ausgaben und Wiederholungen und vergleichen Sie die Kosten pro erfolgreicher Aufgabe. Planen Sie dann die Quellprüfung so, dass die heute günstige Route morgen nicht zu einer veralteten Annahme wird.
Entdecken Sie Flatkey-Preise, um aktuelle Modellrouten zu vergleichen und den Aktualisierungs-Workflow in die Praxis umzusetzen.



