Les API LLM gratuites sont utiles lorsque vous hésitez encore sur ce que vous allez construire, mais le mot « gratuit » cache plusieurs structures d’offre différentes. Certains fournisseurs proposent un quota gratuit récurrent. Certains exposent des routes de modèles gratuites avec des plafonds de requêtes quotidiens. Certains donnent des crédits d’essai à durée limitée. D’autres ne sont gratuits que parce que vous exécutez le modèle en local et que votre propre matériel devient le facteur limitant.
Ce guide compare 12 API LLM gratuites en 2026 du point de vue d’un indie hacker : ce que vous pouvez tester sans contrat de production payant, où les limites de débit apparaissent généralement, quelles réserves liées à la fenêtre de contexte comptent, et quels plafonds cachés peuvent faire échouer un prototype après la première démo.
La réponse courte : utilisez les API gratuites pour valider les prompts, les schémas, la latence et l’adéquation du modèle. Ne considérez pas un palier gratuit comme une capacité de production tant que vous n’avez pas vérifié la page de quota actuelle du fournisseur, les règles d’activation de la facturation, les limites spécifiques au modèle, la politique de données et le mécanisme de repli.
Sélections rapides
| Cas d’usage | Commencez ici | Pourquoi |
|---|---|---|
| Tests rapides de génération de texte hébergée | GroqCloud ou Google Gemini API | Les deux publient des indications sur le niveau gratuit et les limites de débit, et le parcours d’intégration est simple. |
| Tester de nombreuses variantes de modèles gratuits | OpenRouter | Les identifiants de modèles gratuits se terminant par :free facilitent une large comparaison, mais les plafonds quotidiens dépendent des crédits. |
| Expériences d’applications en périphérie | Cloudflare Workers AI | L’allocation quotidienne de Neurons et l’intégration à Workers sont faciles à appréhender pour les petites applications. |
| Essais de modèles basés sur des crédits | Hugging Face, Cerebras, Cohere, Replicate | Idéal pour des évaluations ciblées, mais le plafond correspond souvent à des crédits ou à des appels mensuels, pas seulement au RPM. |
| Expériences en région Chine ou fortement centrées sur Qwen | Alibaba Cloud Model Studio ou SiliconFlow | Utile lorsque votre audience, votre facturation ou l’accès au modèle nécessitent une infrastructure en région Chine. |
| Test local sans facture cloud | Ollama ou serveur llama.cpp | Aucune limite de débit du fournisseur, mais le contexte, le débit et la disponibilité deviennent un problème matériel. |
Qu’est-ce qui compte ici comme une API LLM gratuite ?
Pour cette comparaison, une « API LLM gratuite » signifie au moins l’un de ces éléments :
- Quota gratuit récurrent : une allocation gratuite quotidienne/mensuelle documentée.
- Route de modèle gratuite : une route API hébergée qui peut être appelée sans coût par jeton dans le cadre d’une politique de modèle gratuit.
- Crédits d’essai : un solde de crédits à durée limitée ou offert à l’inscription, dépensable via l’API.
- API locale gratuite : un serveur local HTTP/OpenAI-compatible sans facture fournisseur.
Cette distinction compte davantage que le logo du fournisseur. Un quota récurrent peut prendre en charge des tests de fumée chaque jour. Un crédit d’essai est mieux adapté à une évaluation concentrée. Une API locale est gratuite en dollars, mais pas en RAM, GPU, temps de configuration ni en exploitation.
Les 12 API LLM gratuites comparées
| # | Fournisseur | Mécanisme gratuit | Signal de limite de débit publié | Signal de contexte | Plafond caché à vérifier | Meilleure adéquation |
|---|---|---|---|---|---|---|
| 1 | Google Gemini API | Niveau gratuit pour les modèles Gemini API pris en charge | Google documente les RPM, TPM et RPD, avec des limites appliquées par projet plutôt que par clé API. Source : Limites de débit de Gemini API. | Spécifique au modèle ; vérifiez la ligne du modèle exact dans AI Studio. | Passage à la facturation, quota au niveau du projet, règles de niveau de dépenses et volatilité de la ligne du modèle. | Applications indie qui ont besoin d’un niveau gratuit hébergé sérieux avant de payer. |
| 2 | GroqCloud | Accès gratuit au niveau développeur pour les modèles pris en charge | Groq publie des lignes gratuites spécifiques aux modèles ; les exemples du tableau actuel incluent openai/gpt-oss-120b avec 30 RPM, 1K RPD, 8K TPM et 200K TPD. Source : Limites de débit Groq. |
Spécifique au modèle ; vérifiez chaque ligne de modèle avant d’utiliser de longues requêtes. | Les plafonds quotidiens de requêtes et de jetons sont aussi importants que les RPM. | Prototypes de texte à faible latence et outils CLI. |
| 3 | Modèles gratuits OpenRouter | Variantes de modèles gratuites, généralement avec des IDs se terminant par :free |
OpenRouter documente des plafonds de requêtes pour les modèles gratuits, y compris des limites par minute et des plafonds journaliers plus bas ou plus élevés selon les crédits achetés à vie. Source : Limites OpenRouter. | Spécifique au modèle et acheminé par fournisseur ; inspectez la page du modèle et les métadonnées de réponse. | Le quota quotidien gratuit change après l’achat de crédits ; les limites du fournisseur en amont peuvent toujours se manifester sous forme de 429. | Comparer de nombreux chemins gratuits via une seule URL de base compatible OpenAI. |
| 4 | Hugging Face Inference Providers | Crédits mensuels inclus | Hugging Face documente des crédits mensuels Inference Providers : les utilisateurs gratuits reçoivent un petit solde de crédit mensuel, avec des crédits inclus plus importants pour les sièges payants. Source : Tarification de Hugging Face Inference Providers. | Spécifique au fournisseur et au modèle ; de nombreux chemins exposent le contexte sur la page du modèle/fournisseur. | Solde de crédits, mode clé fournisseur personnalisée et facturation spécifique au fournisseur après épuisement des crédits. | Essayer des modèles ouverts sans ouvrir de compte chez chaque fournisseur. |
| 5 | Cerebras Inference | Crédits d’essai gratuits limités dans le temps | Cerebras documente un essai gratuit après ajout d’un moyen de paiement vérifié, et son tableau des limites de débit utilise des buckets de requêtes et de jetons tels que RPM, TPM non mis en cache, TPM total, TPH et TPD. Source : Limites de débit Cerebras. | Spécifique au modèle ; vérifiez séparément les lignes gpt-oss, Qwen et celles capables de gérer les images. |
Moyen de paiement vérifié, expiration des crédits, buckets de jetons non mis en cache et buckets de jetons totaux. | Tests de vitesse de modèles ouverts spécifiques avant d’engager des dépenses. |
| 6 | Cloudflare Workers AI | Allocation quotidienne gratuite de Neurons | Cloudflare indique 10 000 Neurons par jour sur la tarification de Workers AI et 300 requêtes par minute pour la génération de texte, sauf si un modèle nécessite Workers Paid. Sources : Tarification de Workers AI et Limites de Workers AI. | Spécifique au modèle ; les pages des modèles Cloudflare définissent le comportement de la tâche et du contexte. | Mesure des Neurons, exceptions pour les modèles payants, heure de réinitialisation en UTC et exigences du plan Workers. | Applications en périphérie, bots et petites expériences serverless. |
| 7 | Cohere | Clés d'évaluation gratuites | Cohere documente les clés d'évaluation comme gratuites mais limitées, avec des variantes de chat plus récentes limitées à 1 000 appels API par mois et des lignes de chat d'essai à 20 requêtes par minute. Source : Limites de débit Cohere. | Spécifique au modèle ; vérifiez Command, Embed, Rerank et Parse séparément. | Plafond mensuel d'appels, limites spécifiques aux points de terminaison et limites de production pour les modèles plus récents. | Évaluations de Rerank, d'embedding et de la famille Command. |
| 8 | Alibaba Cloud Model Studio / Qwen | Quotas gratuits pour nouveaux utilisateurs / spécifiques au modèle | Alibaba publie une page de quota gratuit Model Studio et un flux d'activation séparé pour appeler les modèles de base. Sources : Quota gratuit Model Studio et Activation de Model Studio. | Qwen et les autres lignes de Model Studio sont spécifiques au modèle. | Durée du quota gratuit, activation du compte, espace de travail régional, activation des services facturés et unités de jetons. | Applications fortement axées sur Qwen et tests dans la région Asie/Chine. |
| 9 | SiliconFlow | Modèles gratuits après vérification du compte | La FAQ de SiliconFlow indique que les modèles gratuits peuvent être appelés après vérification d'identité, que les appels aux modèles gratuits sont facturés à zéro et que les limites fixes des modèles gratuits sont affichées dans le catalogue de modèles. Source : FAQ sur les limites de débit de SiliconFlow. | Spécifique au catalogue de modèles. | Vérification d'identité, lignes de limites disponibles uniquement dans le catalogue, et exigences de région/compte. | Tests d'accès aux modèles du marché chinois là où SiliconFlow est disponible. |
| 10 | Replicate | Accès API basé sur des crédits et API publique de modèles | Replicate documente 600 requêtes de création de prédiction par minute, 3 000 RPM pour les autres points de terminaison, un bridage plus fort à l'approche d'un faible crédit, et un plafond de 1 requête/seconde plus 6 RPM lorsque des crédits sont accordés sans moyen de paiement. Source : Limites de débit de Replicate. | Spécifique au modèle ; chaque page de modèle définit les entrées et les limites. | Solde de crédits, état du moyen de paiement, démarrages à froid et disponibilité du propriétaire du modèle. | Tests d'un large éventail de modèles open source hébergés et de modèles multimédias. |
| 11 | API locale Ollama | API HTTP locale gratuite | Ollama expose /api/generate, /api/chat, le streaming et les appels locaux à localhost:11434. Source : référence de l’API Ollama. |
Contrôlé par le modèle local et les options d’exécution, notamment les paramètres liés au contexte. | Votre RAM/VRAM, la taille du modèle, la disponibilité locale et aucune SLA gérée. | Prototypes hors ligne, tests de données privées et tests de fumée locaux à faible coût. |
| 12 | serveur llama.cpp | Serveur local gratuit de type OpenAI | llama-server prend en charge les erreurs de type OpenAI, le chargement de modèles, /models, /props et des options serveur/exécution telles que les paramètres de contexte. Source : README du serveur llama.cpp. |
Défini par le modèle GGUF et les drapeaux du serveur, y compris la configuration du contexte. | Complexité de compilation, débit du matériel, mémoire de contexte et concurrence. | Développeurs qui veulent un contrôle local maximal et des expérimentations compatibles avec OpenAI. |
La comparaison qui compte vraiment
Le RPM est le chiffre le plus facile à comparer, mais ce n’est rarement pas la limite qui vous surprend en premier. Les API LLM gratuites échouent généralement de l’une des six façons suivantes :
- Les requêtes quotidiennes s’épuisent avant le RPM. Un service peut vous laisser envoyer 20 ou 30 requêtes par minute, mais s’arrêter malgré tout après un petit plafond quotidien.
- Les plafonds de jetons par minute pénalisent les longues invites. Un quota journalier ou minute de 200K jetons peut disparaître rapidement si vous testez la recherche augmentée, des agents de codage ou de grandes fenêtres de contexte.
- Les crédits ne sont pas la même chose que le quota. Hugging Face, Cerebras, Replicate et des configurations similaires basées sur des crédits peuvent sembler gratuites jusqu’à ce que le solde ou la fenêtre d’expiration se ferme.
- Tous les modèles gratuits ne sont pas tous les modèles. Les routes gratuites couvrent souvent des identifiants de modèles sélectionnés, des variantes plus anciennes, des petits modèles ou des routes spéciales
:free. - L’activation de la facturation change le comportement. L’ajout d’un moyen de paiement peut débloquer des routes payantes, des plafonds plus élevés ou un plafond quotidien différent. Cela peut aussi vous exposer à des dépenses si vous oubliez les limites strictes.
- Les API locales déplacent la limite vers votre machine. Ollama et llama.cpp évitent le quota du fournisseur, mais un ordinateur portable n’est pas un cluster d’inférence hébergé.
Si vous devez décider quoi tester en premier, choisissez le fournisseur selon le goulot d’étranglement :
| Goulot d’étranglement qui vous importe | Meilleur point de départ |
|---|---|
| Requêtes par minute | GroqCloud, Cloudflare Workers AI, Replicate |
| Tests de fumée quotidiens sans coût | Google Gemini API, Cloudflare Workers AI, modèles gratuits d’OpenRouter |
| Comparaison de plusieurs modèles | OpenRouter, Hugging Face Inference Providers, Replicate |
| Vitesse des modèles ouverts | GroqCloud, Cerebras, parcours payants de type Fireworks après validation |
| Accès spécifique à une région | Alibaba Cloud Model Studio, SiliconFlow |
| Aucun chemin de données externe | Ollama, serveur llama.cpp |
Liste de contrôle des plafonds cachés
Avant d’intégrer une API LLM gratuite dans votre application, répondez à ces questions :
- Le mécanisme gratuit est-il récurrent, limité à une période d'essai ou basé uniquement sur des crédits ?
- Les limites s'appliquent-elles au niveau du compte, du projet, de la clé ou du modèle ?
- Le quota se réinitialise-t-il quotidiennement, mensuellement ou uniquement après un rechargement manuel ?
- Un moyen de paiement modifie-t-il le plafond ou le risque de facturation ?
- Les jetons d'entrée, jetons de sortie, jetons mis en cache, secondes d'audio, images ou neurones sont-ils mesurés séparément ?
- Le modèle gratuit prend-il en charge la fenêtre de contexte dont votre flux de travail a besoin ?
- Les appels d'outils, le mode JSON, la vision, le streaming et les embeddings sont-ils inclus ?
- Le fournisseur entraîne-t-il ses modèles sur vos données, les journalise-t-il ou les conserve-t-il différemment dans l'offre gratuite ?
- Pouvez-vous exporter les journaux d'utilisation avant d'atteindre le plafond ?
- Quelle est votre solution de secours lorsque la route gratuite renvoie une erreur 429, 402 ou une erreur de capacité du fournisseur ?
Cette dernière question est importante, car la plupart des pannes de l'offre gratuite ne sont pas spectaculaires. Elles ressemblent à un prototype fonctionnel qui commence à renvoyer des erreurs de limite de débit pendant une démonstration.
Un plan de test simple pour les API LLM gratuites
Exécutez la même petite évaluation chez chaque fournisseur avant de comparer les réponses :
- Test de latence : 20 prompts courts, streaming activé et désactivé si disponible.
- Test de contexte : 1K, 8K, 32K et la taille maximale réelle de votre prompt.
- Test de schéma : une sortie JSON, une sortie de type appel d'outil, un test de récupération après entrée mal formée.
- Test de coût/quota : répétez jusqu'à ce que le fournisseur expose le quota restant, le comportement 429 ou un plafond quotidien.
- Test de bascule : changez de modèle ou de fournisseur sans modifier le code de l'application.
Pour les points de terminaison compatibles OpenAI, gardez la modification de l'application minimale :
curl "$BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MODEL_ID",
"messages": [
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Summarize the hidden caps of this free API in one object."}
],
"temperature": 0.2
}'
Utilisez le même prompt, le même délai d'attente, la même politique de retry et le même réglage de jetons max pour chaque fournisseur. Sinon, vous comparez la configuration de votre client, et non l'API.
Quand les offres gratuites ne suffisent plus
Les API LLM gratuites sont excellentes pour l'apprentissage, les démonstrations et la validation اولیه. Elles ne remplacent pas un routage de production une fois que vous avez des utilisateurs, des tâches planifiées ou des boucles d'agents.
C'est là qu'un modèle de passerelle aide. Flatkey est conçu pour les équipes qui veulent une seule clé, un seul solde et une seule facture tout en testant et en routant entre des points de terminaison de modèles officiels et des outils pay-per-call. Si vous êtes passé au-delà des expérimentations avec un seul fournisseur, commencez par le guide de démarrage rapide de l'API Flatkey, le guide du catalogue de modèles d'IA et le guide des limites de quota des API d'IA avant de coder en dur un autre client spécifique à un fournisseur.
Questions fréquemment posées
Quelle est la meilleure API LLM gratuite en 2026 ?
Il n’existe pas une seule meilleure API LLM gratuite. Google Gemini API et Cloudflare Workers AI sont solides pour des expérimentations récurrentes avec quota gratuit, GroqCloud est solide pour des tests de texte hébergés rapides, OpenRouter est solide pour comparer des modèles gratuits, et Ollama ou llama.cpp sont les meilleurs lorsque vous ne voulez aucun frais cloud du tout.
Les API LLM gratuites sont-elles sûres pour la production ?
Utilisez-les en production uniquement après avoir vérifié les limites actuelles, la politique de données, le comportement de facturation et la gestion des solutions de secours. De nombreux niveaux gratuits n’ont pas de SLA de production, ont des plafonds quotidiens plus bas ou des limites spécifiques au modèle qui peuvent changer.
Quelle API LLM gratuite a la limite de débit la plus élevée ?
Cela dépend du type de tâche et du modèle. Replicate publie des RPM d’endpoint par défaut élevés, Cloudflare publie des limites au niveau des tâches comme 300 RPM pour la génération de texte, et Groq publie des RPM spécifiques au modèle ainsi que des plafonds de jetons. Le RPM le plus élevé n’est pas toujours la capacité utilisable la plus élevée.
Les API LLM gratuites incluent-elles de longues fenêtres de contexte ?
Parfois. Les fenêtres de contexte sont généralement spécifiques au modèle, et non au niveau gratuit. Vérifiez toujours la ligne exacte du modèle, puis testez la taille réelle de votre prompt, car les limites de TPM peuvent bloquer l’utilisation d’un long contexte avant la fenêtre de contexte annoncée par le modèle.
Pourquoi inclure des API locales dans une liste d’API LLM gratuites ?
Les API locales sont la seule option réellement sans facture de fournisseur. Elles sont utiles pour les tests de données privées, les prototypes hors ligne et les tests de fumée reproductibles. Le compromis est que votre machine devient la limite de débit, la couche de fiabilité et le plan de mise à l’échelle.



