Wenn Ihre wichtigste Einschränkung die API-Ausgaben sind, ist die Entscheidung DeepSeek API vs. Qwen API nicht mehr nah genug, um sie aus dem Gedächtnis zu treffen. Beide Anbieter haben ihre Low-Cost-Modelllinien verändert, und der günstigste Weg hängt von vier Faktoren ab: ungespeicherter Input, gespeicherter Input, Output-Volumen und davon, ob Ihr Workload Batch-Inferenz nutzen kann.
Dieser Leitfaden wurde am Dienstag, 28. Juli 2026 anhand von First-Party-Preisinformationen und Model-Lifecycle-Dokumentation geprüft. Die kurze Antwort lautet:
- Qwen Flash hat für die meisten ungespeicherten, gespeicherten und Batch-Text-Workloads den niedrigeren reinen Listenpreis.
- DeepSeek V4 Flash bietet eine sehr niedrige Cache-Trefferrate und einen einfacheren globalen Direct Endpoint, aber seine höheren Cache-Miss- und Output-Preise bedeuten, dass Sie einen ungewöhnlich cache-lastigen Request-Mix benötigen, bevor sich dieser Vorteil auf die Rechnung auswirkt.
- DeepSeek V4 Pro kann als kostenorientierter Reasoning-Kandidat gegenüber höherpreisigen Qwen-Tiers dienen, aber die Modellqualität ist nicht austauschbar. Testen Sie die Kosten pro erfolgreicher Aufgabe, nicht nur Tokens.
- Starten Sie keinen neuen Workflow auf Qwen Turbo. Alibaba Cloud nennt ein Auslaufdatum von 30. November 2026 und empfiehlt Qwen Flash als Ersatz.
DeepSeek vs. Qwen: Kostenfazit nach Workflow
| Workflow | Kostenorientierter Standard | Warum | Vor Produktion prüfen |
|---|---|---|---|
| Kurzer Chat oder Extraktion | Qwen Flash | Niedrigere Listenpreise für Input und Output | Region, exakter Modell-Snapshot, Qualitätsgrenze |
| Offline-Auswertung mit hohem Volumen | Qwen Batch-Inferenz | Geeignete Modelle erhalten 50 % Rabatt auf Input und Output | Exaktes Modell und Region unterstützen Batch |
| Wiederholter langer Kontext | In den meisten Fällen Qwen Flash | Der niedrigere Basispreis von Qwen überwiegt bei üblichen Trefferquoten DeepSeeks Cache-Rabatt | Cache-Trefferrate sowie Cache-Erstellung/Speicherung messen |
| Extrem cache-lastiger Input | Beides berechnen | Gespeicherter Input bei DeepSeek ist günstig, aber Misses und Output kosten mehr | Token-Verhältnis, Trefferquote, Output-Volumen |
| Reasoning-intensive Aufgaben | DeepSeek V4 Pro und den relevanten Qwen-Tier testen | DeepSeek Pro hat veröffentlichte niedrigere Output-Preise als Qwen 3.7 Plus | Genauigkeit, Retries, Tool-Nutzung, Latenz |
| Schnellstes Direct-Provider-Setup | DeepSeek | Eine dokumentierte globale OpenAI-kompatible Basis-URL | Datenregion und Beschaffungsanforderungen |
| Häufiger Modellwechsel | Gemeinsames Gateway und Logs | Operative Wechselkosten können Token-Einsparungen aufheben | Routing, Budgets, Observability, Rollback |
Dies ist ein Kostenvergleich, kein universelles Modell-Ranking. Ein Modell, das mehr Retries, längere Prompts oder menschliche Korrektur benötigt, kann trotz niedrigerem Token-Preis verlieren.
Aktuelle DeepSeek-API-Preise
Die DeepSeek-Preisseite, aktualisiert am 28. Juli, führt zwei V4-Textmodelle auf. Die Preise gelten pro eine Million Tokens.
| Modell | Cache-Treffer-Eingabe | Cache-Fehl-Eingabe | Ausgabe | Kontext | Maximale Ausgabe |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
DeepSeek dokumentiert automatisches Context Caching und stellt separate Preise für Treffer und Fehlversuche bereit. Außerdem bietet es einen mit OpenAI kompatiblen Endpunkt unter https://api.deepseek.com sowie einen mit Anthropic kompatiblen Endpunkt unter https://api.deepseek.com/anthropic.
Die auffälligste Zahl ist der Cache-Trefferpreis von V4 Flash: Er beträgt nur 2 % der Cache-Fehlrate. Dieser Rabatt sollte jedoch nicht isoliert betrachtet werden. Ein Fehlversuch kostet immer noch mehr als das Sechsfache des ersten Standard-Eingabepreises von Qwen Flash, und auch die Ausgabe von DeepSeek V4 Flash ist teurer.
Aktuelle Qwen-API-Preise
Alibaba Cloud Model Studio listet die Qwen-Preise nach Modell, Eingabelänge, Ausgabemodus und Bereitstellungsregion auf. Für eine globale Bereitstellung mit Eingaben bis zu 128K Tokens ist die relevante kostengünstige Zeile:
| Modell | Standard-Eingabe | Ausgabe | Impliziter Cache-Treffer | Expliziter Cache-Treffer | Batch-Rabatt |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
20 % des Standard-Eingabepreises | 10 % des Standard-Eingabepreises | 50 % für unterstützte Batch-Jobs |
Für den Bereitstellungsmodus Singapur führt dieselbe Seite qwen-flash mit $0.05 für Eingaben und $0.40 für Ausgaben für Prompts bis zu 128K auf. Dieser regionale Unterschied ist der Grund, warum eine gültige Qwen-Prognose den Bereitstellungsmodus und den Endpunkt erfassen muss, statt einfach eine einzelne Schlagzeile zu übernehmen.
Auch das Caching von Qwen erfordert eine präzise Modellierung:
- Implizite Cache-Treffer werden mit 20 % des Standard-Eingabepreises berechnet.
- Explizite Cache-Treffer werden mit 10 % des Standard-Eingabepreises berechnet.
- Die Erstellung eines expliziten Caches wird mit 125 % des Standard-Eingabepreises berechnet, und die Cache-Speicherung wird separat berechnet.
- Die Batch-Inferenz gewährt berechtigten Modellen einen Rabatt von 50 % auf Eingabe und Ausgabe, aber gehen Sie nicht davon aus, dass Rabatte sich addieren, sofern der Anbieter diese Kombination nicht für Ihr Modell und Ihre Region dokumentiert.
Alibaba Cloud weist außerdem darauf hin, dass qwen-flash ein fortlaufender Alias ist. Verwenden Sie eine datierte Modell-ID, wenn Reproduzierbarkeit wichtig ist, und planen Sie dann Migrationstests, bevor dieser Snapshot ausläuft.
Drei Workload-Berechnungen
Die folgenden Formeln verwenden öffentliche Listenpreise, keine zeitlich begrenzten Aktionen oder ausgehandelten Verträge. Sie vergleichen nur direkte Token-Kosten des Anbieters und schließen Steuern, Netzwerkkosten, Cache-Speicherung und Entwicklungsaufwand aus.
Szenario 1: kurzer Chat ohne Cache
Annahmen:
- 10.000 Anfragen
- 1.000 Eingabetokens pro Anfrage
- 500 Ausgabetokens pro Anfrage
- Keine Cache-Treffer
- Qwen globale
qwen3.5-flasherste Preisstufe
| Route | Eingabeberechnung | Ausgabeberechnung | Geschätzte Gesamtkosten |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
Für diese Anfrageform kostet Qwen zu den veröffentlichten Listenpreisen etwa 54 % weniger. Das Ergebnis kann sich ändern, wenn Sie eine andere Qwen-Region verwenden, die erste Eingabestufe überschreiten oder genügend Retries benötigen, um den Token-Vorteil wieder auszugleichen.
Scenario 2: Wiederholter langer Kontext mit 90 % Cache-Hits
Annahmen:
- 10.000 Anfragen
- 10.000 Eingabetoken pro Anfrage
- 1.000 Ausgabetoken pro Anfrage
- 90 % der Eingabetoken werden zum Cache-Hit-Tarif abgerechnet
- Qwen verwendet implizites Caching
| Route | Eingabe bei Cache-Miss | Eingabe bei Cache-Hit | Ausgabe | Geschätzte Gesamtkosten |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
DeepSeek hat die niedrigere Cache-Hit-Rate, aber Qwen gewinnt dieses 90%-Hit-Szenario dennoch, weil die Miss- und Ausgabepreise von Qwen niedriger sind.
Nur für die Eingabe allein wird DeepSeek V4 Flash gegenüber Qwens implizitem Cache-Mix erst dann günstiger, wenn der Cache-Hit-Anteil ungefähr 98,7 % oder höher liegt. Sobald Ausgabetoken einbezogen werden, ist die erforderliche Hit-Rate noch höher. Mit Qwens explizitem Caching ist der Hit-Preis selbst niedriger als bei DeepSeek, obwohl Erstellungs- und Speicherkosten berücksichtigt werden müssen.
Scenario 3: Offline-Batch-Verarbeitung
Annahmen:
- 100 Millionen Eingabetoken
- 20 Millionen Ausgabetoken
- Qwen-Modell und Region sind für den veröffentlichten 50%-Batch-Rabatt berechtigt
- DeepSeek wird zum standardmäßigen synchronen Listenpreis berechnet, da auf der Preisseite kein entsprechender Batch-Rabatt veröffentlicht ist
| Route | Berechnung | Geschätzte Gesamtkosten |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash batch | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
Für ausfallsichere Bewertungen, Labeling-, Zusammenfassungs- oder Synthetic-Data-Jobs kann die Batch-Berechtigung wichtiger sein als kleine Cache-Unterschiede. Bestätigen Sie vor der Freigabe der Prognose, dass Ihr genaues Modell, der Bereitstellungsmodus und der Aufgabentyp qualifiziert sind.
Eine bessere Break-even-Formel
Verwenden Sie dieses Arbeitsblatt statt eines einzelnen Token-Preisfelds zu vergleichen:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
Berechnen Sie dann die Kosten pro erfolgreich erledigter Aufgabe:
successful_task_cost = monthly_cost / accepted_outputs
Diese zweite Zahl erfasst die Betriebskosten, die in Token-Tabellen übersehen werden. Wenn ein günstigerer Weg mehr ungültiges JSON, Tool-Call-Fehler, lange Reasoning-Traces oder manuelle Prüfung erzeugt, können seine tatsächlichen Kosten höher sein.
Betriebliche Unterschiede, die die Gesamtkosten beeinflussen
Region und Endpoint-Design
DeepSeek dokumentiert einen globalen Direkt-Endpoint. Qwen verwendet Alibaba Cloud Model Studio-Endpunkte, die an Bereitstellungsmodus und Region gebunden sind. Die regionale Konfiguration kann Governance verbessern, beeinflusst aber auch die Modellverfügbarkeit, Preiszeilen, Anmeldedaten und das Failover-Design.
Erfassen Sie diese Felder in jeder Freigabe:
- Anbieter und exakte Modell-ID
- Bereitstellungsregion oder -modus
- Basis-URL
- Eingabelängen-Tier
- Thinking- oder Non-Thinking-Ausgabemodus
- Cache-Methode
- Batch-Eignung
- Datum der Preisprüfung
Modell-Lebenszyklus
Qwen Turbo soll am 30. November 2026 eingestellt werden, und Alibaba Cloud empfiehlt Qwen Flash als Ersatz. Neue Systeme sollten den vertrauten Namen von Turbo oder die niedrigere Non-Thinking-Ausgabezeile nicht als dauerhaftes Sparmodell betrachten.
Rollierende Aliase sind für Experimente praktisch, bringen aber das Risiko stiller Änderungen mit sich. Fixieren Sie in der Produktion datierte Versionen, halten Sie einen kleinen Evaluierungssatz vor und testen Sie die nächste Version vor der Einstellung.
Qualitäts- und Retry-Budget
Vergleichen Sie DeepSeek V4 Flash und Qwen Flash nicht so, als würden sie identische Ergebnisse liefern. Bewerten Sie jeden Weg anhand der tatsächlichen Aufgabe: Extraktionsgenauigkeit, Erfolgsrate von Code-Tests, vollständige Tool-Calls, Validität strukturierter Ausgaben, Latenz und menschliche Akzeptanz.
Ein praktisches Routing-Gate ist:
- Verwerfen Sie Modelle unterhalb der Qualitätsuntergrenze.
- Vergleichen Sie die Kosten pro akzeptierter Ausgabe unter den verbleibenden Modellen.
- Fügen Sie Retry- und Fallback-Kosten hinzu.
- Führen Sie den günstigeren Weg mit einem Rollback-Schwellenwert als Canary ein.
- Berechnen Sie nach der ersten Woche Produktionsverkehr neu.
Für ein wiederholbares Test-Framework verwenden Sie den Multi-Model-Prompt-Testing-Workflow. Für einen breiteren Kontext der Raten vergleichen Sie den aktuellen KI-Modell-Preisvergleich und die Flatkey-Preisseite.
Wann DeepSeek die bessere Wahl ist
DeepSeek verdient den ersten Test, wenn:
- Sie einen einfachen globalen Direkt-Endpoint wünschen.
- Ihre Workload eine außergewöhnlich hohe, gemessene Cache-Wiederverwendung aufweist.
- DeepSeek V4 Pro die Qualitätsuntergrenze für Reasoning zu niedrigeren Kosten pro erfolgreicher Aufgabe erfüllt als die von Ihnen getestete Qwen-Stufe.
- Ihr Team DeepSeek bereits zuverlässig betreibt und der Migrationsaufwand die prognostizierten Einsparungen übersteigen würde.
Wann Qwen die bessere Wahl ist
Qwen verdient den ersten Test, wenn:
- Rohes Token-Volumen der primäre Kostentreiber ist.
- Sie kurze oder mittellange ungecachte Prompts ausführen.
- Sie zeitlich unkritische Jobs haben, die für Batch-Inferenz geeignet sind.
- Sie explizites oder implizites Caching effektiv nutzen können.
- Das regionale Bereitstellungsmodell von Alibaba Cloud zu Ihren Compliance- und Betriebsanforderungen passt.
FAQ
Ist DeepSeek 2026 günstiger als Qwen?
Nicht durchgängig. Zu den öffentlichen Listenpreisen vom 28. Juli ist Qwen 3.5 Flash in den in diesem Leitfaden gezeigten Beispielen für kurzzeitig ungecachte, zu 90 % gecachte und zulässige Batch-Nutzung günstiger. DeepSeek kann dennoch bei den Kosten pro erfolgreicher Aufgabe, der betrieblichen Einfachheit oder einem bestimmten Vergleich auf höherer Ebene die bessere Wahl sein.
Welche API ist besser für Automatisierung mit hohem Volumen?
Beginnen Sie mit Qwen Flash, wenn die Arbeit Batch-Inference nutzen kann oder nur eine geringe Latenzempfindlichkeit hat. Testen Sie DeepSeek parallel dazu, wenn die Cache-Wiederverwendung außergewöhnlich hoch ist oder die Ausgabequalität Wiederholungen reduziert. Genehmigen Sie den Pfad mit den niedrigsten Kosten pro akzeptiertem Ergebnis.
Macht DeepSeeks Cache-Preis es für RAG günstiger?
Nicht automatisch. Der Eingabepreis bei Cache-Treffer von DeepSeek ist sehr niedrig, aber die Raten für Cache-Fehler und Ausgaben sind höher als die Erststufenraten von Qwen 3.5 Flash. Messen Sie das tatsächliche Trefferverhältnis, das Prompt-zu-Ausgabe-Verhältnis und die Cache-Methode von Qwen, bevor Sie sich entscheiden.
Sollte ich Qwen Turbo für eine neue Anwendung verwenden?
Nein. Alibaba Cloud nennt für Qwen Turbo das Auslaufen zum 30. November 2026 und empfiehlt die Migration zu Qwen Flash.
Wie oft sollte die API-Preisgestaltung überprüft werden?
Überprüfen Sie monatlich aktive Produktionspfade und sofort, wenn ein Anbieter Modell-IDs, Auslaufdaten, Cache-Regeln, Batch-Support, regionale Verfügbarkeit oder Listenpreise ändert.
Mit Produktionsverkehr entscheiden, nicht nach einem Schlagzeilen-Tarif
Für die meisten kostenbewussten Text-Workflows ist Qwen Flash am 28. Juli 2026 der günstigere Ausgangspunkt. DeepSeek bleibt dort testenswert, wo seine Endpunkt-Einfachheit, sein Cache-Verhalten oder die Aufgabengüte die Gesamtkosten des Betriebs senken.
Speichern Sie die Arbeitsblattvorlage für die Anfrageform, fixieren Sie exakte Modellversionen und halten Sie den Pfad reversibel. Wenn Sie einen Ort suchen, um beide Anbieter zu testen, ohne Client-Code neu zu schreiben, beginnen Sie mit dem Flatkey-Integrations-Starter, führen Sie denselben Evaluierungssatz aus und leiten Sie Produktionsverkehr erst dann um, wenn die Kosten-pro-Erfolg-Zahlen stabil sind.



