Cost, Billing, and Ops22. September 2026Flatkey Team

12 kostenlose LLM-APIs in 2026: Rate Limits, Kontext und versteckte Limits im Vergleich

Ein quellengestützter Vergleich von 12 kostenlosen LLM-APIs im Jahr 2026, einschließlich wiederkehrender Free-Tiers, kostenloser Modellzugänge, Testguthaben und lokaler APIs.

12 kostenlose LLM-APIs in 2026: Rate Limits, Kontext und versteckte Limits im Vergleich

Kostenlose LLM-APIs sind nützlich, wenn Sie noch entscheiden, was Sie bauen möchten, aber das Wort „kostenlos“ verbirgt mehrere unterschiedliche Geschäftsmodelle. Einige Anbieter geben Ihnen ein wiederkehrendes Freikontingent. Einige stellen kostenlose Modellrouten mit täglichen Request-Limits bereit. Einige geben zeitlich begrenzte Testguthaben. Andere sind nur deshalb kostenlos, weil Sie das Modell lokal ausführen und Ihre eigene Hardware zum limitierenden Faktor wird.

Dieser Leitfaden vergleicht 12 kostenlose LLM-APIs im Jahr 2026 aus der Sicht eines Indie Hackers: Was Sie ohne bezahlten Produktionsvertrag testen können, wo Rate Limits in der Regel auftauchen, welche Kontextfenster-Einschränkungen wichtig sind und welche versteckten Limits ein Prototyp nach der ersten Demo zerstören können.

Die kurze Antwort: Nutzen Sie kostenlose APIs, um Prompts, Schemas, Latenz und Modell-Fit zu validieren. Behandeln Sie einen Free-Tier nicht als Produktionskapazität, bevor Sie nicht die aktuelle Quoten-Seite des Anbieters, die Regeln zur Aktivierung der Abrechnung, modell­spezifische Limits, die Datenrichtlinie und den Fallback-Pfad geprüft haben.

Schnellauswahl

Anwendungsfall Hier anfangen Warum
Schnelle Tests für gehostete Textgenerierung GroqCloud oder Google Gemini API Beide veröffentlichen Hinweise zu Free-Tier/Rate-Limits, und der Einstieg ist unkompliziert.
Viele kostenlose Modellvarianten testen OpenRouter Kostenlose Modell-IDs, die auf :free enden, erleichtern breite Vergleiche, aber die täglichen Limits hängen von Guthaben ab.
Experimente mit Edge-Apps Cloudflare Workers AI Die tägliche Neurons-Zuteilung und die Workers-Integration sind für kleine Apps leicht nachvollziehbar.
Modelltests auf Guthabenbasis Hugging Face, Cerebras, Cohere, Replicate Gut für gezielte Evaluierungen, aber das Limit sind oft Guthaben oder monatliche Aufrufe, nicht nur RPM.
Experimente für die China-Region oder mit starkem Qwen-Fokus Alibaba Cloud Model Studio oder SiliconFlow Nützlich, wenn Ihr Publikum, Ihre Abrechnung oder Ihr Modellzugriff Infrastruktur in der China-Region erfordert.
Lokales Testen ohne Cloud-Rechnung Ollama oder llama.cpp server Kein Provider-Rate-Limit, aber Kontext, Durchsatz und Verfügbarkeit werden zu einem Problem Ihrer Hardware.

Was zählt hier als kostenlose LLM-API?

Für diesen Vergleich bedeutet eine „kostenlose LLM-API“ mindestens eines der folgenden Dinge:

  • Wiederkehrendes Freikontingent: Eine dokumentierte tägliche/monatliche Gratiszuteilung.
  • Kostenlose Modellroute: Eine gehostete API-Route, die gemäß einer Free-Model-Richtlinie ohne Preis pro Token aufgerufen werden kann.
  • Testguthaben: Ein kurzfristiges oder Anmelde-Guthaben, das über die API verbraucht werden kann.
  • Lokale kostenlose API: Ein lokaler HTTP-/OpenAI-kompatibler Server ohne Anbieterrechnung.

Dieser Unterschied ist wichtiger als das Logo des Anbieters. Ein wiederkehrendes Kontingent kann täglich Smoke Tests unterstützen. Ein Testguthaben ist besser für eine konzentrierte Evaluierung. Eine lokale API ist in Dollar kostenlos, aber nicht kostenlos in Bezug auf RAM, GPU, Einrichtungszeit oder Betrieb.

Die 12 kostenlosen LLM-APIs im Vergleich

# Anbieter Kostenloser Mechanismus Veröffentlichter Rate-Limit-Hinweis Kontext-Hinweis Verstecktes Limit, das geprüft werden sollte Am besten geeignet für
1 Google Gemini API Kostenlose Stufe für unterstützte Gemini-API-Modelle Google dokumentiert RPM, TPM und RPD, wobei die Limits pro Projekt und nicht pro API-Schlüssel gelten. Quelle: Gemini API rate limits. Modellabhängig; prüfen Sie die Zeile für das genaue Modell in AI Studio. Billing-Upgrade, Kontingent auf Projektebene, Spend-Tier-Regeln und Volatilität der Modellzeile. Indie-Apps, die vor dem Bezahlen eine ernstzunehmende gehostete kostenlose Stufe benötigen.
2 GroqCloud Freier Zugang auf Developer-Stufe zu unterstützten Modellen Groq veröffentlicht modellabhängige kostenlose Zeilen; Beispiele in der aktuellen Tabelle sind openai/gpt-oss-120b mit 30 RPM, 1K RPD, 8K TPM und 200K TPD. Quelle: Groq rate limits. Modellabhängig; prüfen Sie vor der Verwendung langer Prompts jede Modellzeile. Tägliche Anfrage-Limits und tägliche Token-Limits sind ebenso wichtig wie RPM. Textprototypen mit geringer Latenz und CLI-Tools.
3 OpenRouter free models Kostenlose Modellvarianten, meist mit IDs, die auf :free enden OpenRouter dokumentiert Limits für kostenlose Modelle, einschließlich Limits pro Minute und niedrigerer/höherer täglicher Obergrenzen je nach gekauften Credits über die gesamte Laufzeit. Quelle: OpenRouter limits. Modellabhängig und über Anbieter geroutet; prüfen Sie die Modellseite und die Response-Metadaten. Das tägliche Gratis-Kontingent ändert sich nach Credits; Limits des Upstream-Anbieters können trotzdem als 429s sichtbar werden. Vergleich vieler kostenloser Routen über eine einzige OpenAI-kompatible Base-URL.
4 Hugging Face Inference Providers Monatlich enthaltene Credits Hugging Face dokumentiert monatliche Inference-Providers-Credits: kostenlose Nutzer erhalten ein kleines monatliches Guthaben, während bezahlte Plätze größere enthaltene Credits erhalten. Quelle: Hugging Face Inference Providers pricing. Anbieter- und modellabhängig; viele Routen zeigen den Kontext auf der Modell-/Anbieterseite an. Credit-Guthaben, Modus mit eigenem Provider-Schlüssel und anbieterabhängige Abrechnung nach Verbrauch der Credits. Open Models testen, ohne bei jedem Anbieter Konten zu eröffnen.
5 Cerebras Inference Zeitlich begrenzte kostenlose Testguthaben Cerebras dokumentiert einen kostenlosen Test nach Hinzufügen einer verifizierten Zahlungsmethode, und seine Rate-Limit-Tabelle verwendet Request- und Token-Buckets wie RPM, uncached TPM, total TPM, TPH und TPD. Quelle: Cerebras rate limits. Modellabhängig; prüfen Sie gpt-oss, Qwen und bildfähige Zeilen separat. Verifizierte Zahlungsmethode, Ablauf der Credits, uncached Token-Buckets und total Token-Buckets. Geschwindigkeitstests bestimmter Open-Modelle vor verbindlichen Ausgaben.
6 Cloudflare Workers AI Tägliches kostenloses Neuronen-Kontingent Cloudflare dokumentiert 10.000 Neurons pro Tag in der Workers-AI-Preisgestaltung und 300 Anfragen pro Minute für Textgenerierung, sofern kein Modell Workers Paid erfordert. Quellen: Workers AI-Preisgestaltung und Workers AI-Limits. Modellspezifisch; die Cloudflare-Modellseiten definieren Aufgaben- und Kontextverhalten. Neuronen-Messung, Ausnahmen für kostenpflichtige Modelle, UTC-Reset-Zeitpunkt und Anforderungen an den Workers-Plan. Edge-Apps, Bots und kleine serverlose Experimente.
7 Cohere Kostenlose Evaluierungs-Keys Cohere dokumentiert Evaluierungs-Keys als kostenlos, aber eingeschränkt; neuere Chat-Varianten sind auf 1.000 API-Aufrufe pro Monat begrenzt und Test-Chat-Zeilen auf 20 Anfragen pro Minute. Quelle: Cohere Rate Limits. Modellspezifisch; Command, Embed, Rerank und Parse getrennt prüfen. Monatliches Aufruflimit, endpointspezifische Limits und Produktionslimits für neuere Modelle. Rerank-, Embedding- und Evaluierungen der Command-Familie.
8 Alibaba Cloud Model Studio / Qwen Kostenlose Kontingente für neue Benutzer/modellspezifisch Alibaba veröffentlicht eine Seite zu kostenlosen Modell-Studio-Kontingenten sowie einen separaten Aktivierungsablauf für den Aufruf von Foundation Models. Quellen: Kostenloses Kontingent für Model Studio und Aktivierung von Model Studio. Qwen und andere Model-Studio-Zeilen sind modellspezifisch. Dauer des kostenlosen Kontingents, Kontaktivierung, regionaler Arbeitsbereich, Aktivierung abrechenbarer Dienste und Token-Einheiten. Qwen-lastige Apps und Tests in der Region Asien/China.
9 SiliconFlow Kostenlose Modelle nach Kontoverifizierung Die FAQ von SiliconFlow sagt, dass kostenlose Modelle nach der Realnamen-Verifizierung aufgerufen werden können, Aufrufe kostenloser Modelle mit null berechnet werden und feste Limits für kostenlose Modelle im Modellkatalog angezeigt werden. Quelle: SiliconFlow-Ratelimit-FAQ. Modellkatalog-spezifisch. Realnamen-Verifizierung, Limit-Zeilen nur im Katalog und Anforderungen an Region/Konto. Tests des Zugriffs auf Modelle für den China-Markt, wo SiliconFlow verfügbar ist.
10 Replicate API-Zugriff auf Guthabenbasis und öffentliche Modell-API Replicate dokumentiert 600 create-prediction-Anfragen pro Minute, 3.000 RPM für andere Endpunkte, stärkeres Throttling bei niedrigem Guthaben und ein Limit von 1 Anfrage/Sekunde plus 6 RPM, wenn Guthaben ohne Zahlungsmethode gewährt wird. Quelle: Replicate Rate Limits. Modellspezifisch; jede Modellseite definiert Eingaben und Limits. Guthabenstand, Status der Zahlungsmethode, Kaltstarts und Verfügbarkeit durch den Modelleigentümer. Tests einer breiten Palette gehosteter Open-Source-Modelle und Medienmodelle.
11 Lokale Ollama-API Kostenlose lokale HTTP-API Ollama stellt /api/generate, /api/chat, Streaming und lokale localhost:11434-Aufrufe bereit. Quelle: Ollama API reference. Wird vom lokalen Modell und von Laufzeitoptionen wie kontextbezogenen Parametern gesteuert. Ihr RAM/VRAM, Modellgröße, lokale Verfügbarkeit und kein verwaltetes SLA. Offline-Prototypen, Tests mit privaten Daten und günstige lokale Smoke-Tests.
12 llama.cpp server Kostenloser lokaler Server im OpenAI-Stil llama-server unterstützt Fehler im OpenAI-Stil, das Laden von Modellen, /models, /props sowie Server-/Laufzeitoptionen wie Kontexteinstellungen. Quelle: llama.cpp server README. Wird durch das GGUF-Modell und die Server-Flags festgelegt, einschließlich der Konfiguration des Kontexts. Build-Komplexität, Hardware-Durchsatz, Kontextspeicher und Parallelität. Entwickler, die maximale lokale Kontrolle und Experimente mit OpenAI-Kompatibilität wünschen.

Der Vergleich, der wirklich zählt

RPM ist die am einfachsten zu vergleichende Kennzahl, aber selten das Limit, das Sie zuerst überrascht. Kostenlose LLM-APIs scheitern in der Regel auf eine von sechs Arten:

  1. Die täglichen Anfragen sind aufgebraucht, bevor das RPM-Limit erreicht ist. Ein Dienst kann Ihnen erlauben, 20 oder 30 Anfragen pro Minute zu senden, stoppt aber dennoch nach einer kleinen täglichen Obergrenze.
  2. Token-pro-Minute-Limits bestrafen lange Prompts. Ein tägliches oder minütliches 200K-Token-Kontingent kann schnell verschwinden, wenn Sie Retrieval, Coding-Agents oder große Kontextfenster testen.
  3. Credits sind nicht dasselbe wie ein Kontingent. Hugging Face, Cerebras, Replicate und ähnliche credit-basierte Setups können sich kostenlos anfühlen, bis das Guthaben oder das Ablaufzeitfenster endet.
  4. Kostenlose Modelle sind nicht alle Modelle. Kostenlose Routen decken oft ausgewählte Modell-IDs, ältere Varianten, kleine Modelle oder spezielle :free-Routen ab.
  5. Die Aktivierung der Abrechnung ändert das Verhalten. Das Hinzufügen einer Zahlungsmethode kann kostenpflichtige Routen, höhere Obergrenzen oder ein anderes tägliches Limit freischalten. Es kann Sie auch Kosten aussetzen, wenn Sie harte Limits vergessen.
  6. Lokale APIs verlagern das Limit auf Ihren Rechner. Ollama und llama.cpp umgehen das Kontingent des Anbieters, aber ein Laptop ist kein gehosteter Inferenz-Cluster.

Wenn Sie entscheiden, was Sie zuerst testen, wählen Sie den Anbieter nach dem Engpass:

Engpass, der Ihnen wichtig ist Besserer Ausgangspunkt
Anfragen pro Minute GroqCloud, Cloudflare Workers AI, Replicate
Tägliche kostenlose Smoke-Tests Google Gemini API, Cloudflare Workers AI, OpenRouter kostenlose Modelle
Vergleich mehrerer Modelle OpenRouter, Hugging Face Inference Providers, Replicate
Geschwindigkeit von Open Models GroqCloud, Cerebras, Fireworks-artige kostenpflichtige Pfade nach der Validierung
Regionsspezifischer Zugriff Alibaba Cloud Model Studio, SiliconFlow
Kein externer Datenpfad Ollama, llama.cpp server

Checkliste für versteckte Limits

Bevor Sie eine kostenlose LLM-API in Ihre App einbinden, beantworten Sie diese Fragen:

  • Ist der kostenlose Mechanismus wiederkehrend, nur als Testversion verfügbar oder nur kreditbasiert?
  • Sind die Limits auf Konto-, Projekt-, Key- oder Modell-Ebene festgelegt?
  • Setzt sich das Kontingent täglich, monatlich oder nur nach einer manuellen Aufladung zurück?
  • Ändert eine Zahlungsmethode das Limit oder das Abrechnungsrisiko?
  • Werden Eingabe-Token, Ausgabe-Token, zwischengespeicherte Token, Audio-Sekunden, Bilder oder Neuronen separat gemessen?
  • Unterstützt das kostenlose Modell das Kontextfenster, das Ihr Workflow benötigt?
  • Sind Tool-Aufrufe, JSON-Modus, Vision, Streaming und Embeddings enthalten?
  • Trainiert, protokolliert oder speichert der Anbieter Ihre Daten im kostenlosen Tarif anders?
  • Können Sie Nutzungsprotokolle exportieren, bevor Sie das Limit erreichen?
  • Was ist Ihr Fallback, wenn der kostenlose Pfad 429, 402 oder einen Anbieter-Kapazitätsfehler zurückgibt?

Diese letzte Frage ist wichtig, weil die meisten Ausfälle in Free-Tiers nicht dramatisch sind. Sie sehen aus wie ein funktionierender Prototyp, der während einer Demo plötzlich Rate-Limit-Fehler zurückgibt.

Ein einfacher Testplan für kostenlose LLM-APIs

Führen Sie denselben kleinen Test über jeden Anbieter hinweg aus, bevor Sie die Antworten vergleichen:

  1. Latenztest: 20 kurze Prompts, Streaming ein und aus, falls verfügbar.
  2. Kontexttest: 1K, 8K, 32K und Ihre reale maximale Prompt-Größe.
  3. Schema-Test: eine JSON-Ausgabe, eine Tool-Call-ähnliche Ausgabe, ein Test zur Wiederherstellung bei fehlerhaftem Input.
  4. Kosten-/Kontingenttest: wiederholen, bis der Anbieter das verbleibende Kontingent, das 429-Verhalten oder ein tägliches Limit offenlegt.
  5. Fallback-Test: Modelle oder Anbieter wechseln, ohne den App-Code zu ändern.

Für OpenAI-kompatible Endpunkte halten Sie die Änderung in der App klein:

curl "$BASE_URL/v1/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MODEL_ID",
    "messages": [
      {"role": "system", "content": "Return valid JSON only."},
      {"role": "user", "content": "Summarize the hidden caps of this free API in one object."}
    ],
    "temperature": 0.2
  }'

Verwenden Sie für jeden Anbieter denselben Prompt, dasselbe Timeout, dieselbe Retry-Policy und dieselbe Max-Token-Einstellung. Andernfalls vergleichen Sie Ihre Client-Konfiguration und nicht die API.

Wenn kostenlose Tarife nicht mehr ausreichen

Kostenlose LLM-APIs sind hervorragend zum Lernen, für Demos und für frühe Validierung geeignet. Sie sind kein Ersatz für produktives Routing, sobald Sie Nutzer, geplante Jobs oder Agenten-Loops haben.

Hier hilft ein Gateway-Ansatz. Flatkey ist für Teams gedacht, die einen Schlüssel, ein Guthaben und eine Rechnung wollen, während sie offizielle Modell-Endpunkte und Pay-per-Call-Tools testen und darüber routen. Wenn Sie über Experimente mit nur einem Anbieter hinaus sind, beginnen Sie mit dem Flatkey API-Schnellstart, dem Leitfaden zum KI-Modellkatalog und dem Leitfaden zu KI-API-Kontingentlimits, bevor Sie wieder einen anbieterspezifischen Client hart codieren.

Häufig gestellte Fragen

Was ist die beste kostenlose LLM-API im Jahr 2026?

Es gibt nicht die eine beste kostenlose LLM-API. Die Google Gemini API und Cloudflare Workers AI sind stark für Experimente mit wiederkehrenden kostenlosen Kontingenten, GroqCloud ist stark für schnelle gehostete Texttests, OpenRouter ist stark für den Vergleich kostenloser Modelle, und Ollama oder llama.cpp sind am besten, wenn Sie überhaupt keine Cloud-Rechnung wollen.

Sind kostenlose LLM-APIs für den Produktionseinsatz sicher?

Nutzen Sie sie in der Produktion nur, nachdem Sie aktuelle Limits, Datenrichtlinien, Abrechnungsverhalten und Fallback-Handling geprüft haben. Viele kostenlose Tarife haben kein Produktions-SLA, niedrigere Tagesobergrenzen oder modellspezifische Limits, die sich ändern können.

Welche kostenlose LLM-API hat das höchste Rate Limit?

Das hängt von der Aufgabenart und dem Modell ab. Replicate veröffentlicht hohe standardmäßige RPMs pro Endpunkt, Cloudflare veröffentlicht Aufgaben-Limits wie 300 RPM für Textgenerierung, und Groq veröffentlicht modellspezifische RPMs plus Token-Limits. Die höchste RPM ist nicht immer die höchste nutzbare Kapazität.

Bieten kostenlose LLM-APIs lange Kontextfenster?

Manchmal. Kontextfenster sind in der Regel modellspezifisch und nicht tarifstufenspezifisch. Prüfen Sie immer die genaue Modellzeile und testen Sie dann Ihre tatsächliche Prompt-Größe, da TPM-Limits die Nutzung langer Kontexte blockieren können, bevor das beworbene Kontextfenster des Modells greift.

Warum lokale APIs in eine Liste kostenloser LLM-APIs aufnehmen?

Lokale APIs sind die einzige wirklich billfreie Option ohne Anbieterrechnung. Sie sind nützlich für Tests mit privaten Daten, Offline-Prototypen und wiederholbare Smoke-Tests. Der Nachteil ist, dass Ihr Rechner zum Rate Limit, zur Zuverlässigkeitsschicht und zum Skalierungsplan wird.