無料の LLM API は、何を作るべきかまだ検討している段階では便利ですが、「無料」という言葉の裏にはいくつか異なる契約形態が隠れています。定期的な無料枠を提供するプロバイダーもあれば、日次のリクエスト上限付きで無料のモデルルートを公開しているところもあります。短期間だけ使えるトライアルクレジットを付与するところもあります。あるいは、モデルをローカルで実行し、自分のハードウェアが制約になるだけなので無料というケースもあります。
このガイドでは、2026年時点の無料 LLM API 12選を、個人開発者の視点から比較します。つまり、有料の本番契約なしで何を試せるのか、レート制限は通常どこで現れるのか、コンテキストウィンドウの注意点として何が重要か、そしてどの隠れた上限が最初のデモ後にプロトタイプを壊しうるのか、という観点です。
要するに、無料 API はプロンプト、スキーマ、レイテンシ、モデル適合性を検証するために使いましょう。プロバイダーの最新のクォータページ、課金有効化ルール、モデル固有の制限、データポリシー、フォールバック経路を確認するまでは、無料プランを本番容量だと見なしてはいけません。
クイックピック
| ユースケース | ここから始める | 理由 |
|---|---|---|
| 高速なホスト型テキスト生成テスト | GroqCloud または Google Gemini API | どちらも無料枠/レート制限のガイダンスを公開しており、導入経路もシンプルです。 |
| 多数の無料モデルバリエーションのテスト | OpenRouter | :free で終わる無料モデル ID により幅広い比較がしやすいですが、日次上限はクレジットに依存します。 |
| エッジアプリの実験 | Cloudflare Workers AI | 日次の Neurons 割り当てと Workers 連携は、小規模アプリで理解しやすいです。 |
| クレジットベースのモデル試用 | Hugging Face, Cerebras, Cohere, Replicate | 対象を絞った評価には向いていますが、上限は RPM だけでなく、クレジットや月間呼び出し回数であることが多いです。 |
| 中国リージョンまたは Qwen 中心の実験 | Alibaba Cloud Model Studio または SiliconFlow | 対象ユーザー、課金、またはモデルアクセスに中国リージョンのインフラが必要な場合に便利です。 |
| クラウド料金ゼロのローカルテスト | Ollama または llama.cpp server | プロバイダーのレート制限はありませんが、コンテキスト、スループット、稼働率は自分のハードウェアの問題になります。 |
ここでいう無料 LLM API とは何か?
この比較では、「無料 LLM API」とは少なくとも次のいずれかを指します:
- 定期的な無料枠: 文書化された日次/月次の無料割り当て。
- 無料モデルルート: 無料モデルポリシーの下で、トークン単価なしで呼び出せるホスト型 API ルート。
- トライアルクレジット: API 経由で消費できる短期または登録時付与のクレジット残高。
- ローカル無料 API: プロバイダー請求のないローカル HTTP/OpenAI 互換サーバー。
この区別は、プロバイダーのロゴ以上に重要です。定期的なクォータがあれば、毎日のスモークテストを支えられます。トライアルクレジットは、集中的な評価に向いています。ローカル API は金銭的には無料ですが、RAM、GPU、セットアップ時間、運用コストが無料というわけではありません。
12 の無料 LLM API を比較
| # | プロバイダー | 無料利用の仕組み | 公開されているレート制限の संकेत | コンテキストの संकेत | 確認すべき隠れた上限 | 最適な用途 |
|---|---|---|---|---|---|---|
| 1 | Google Gemini API | 対応する Gemini API モデルの無料ティア | Google は RPM、TPM、RPD を公開しており、制限は API キー単位ではなくプロジェクト単位で適用されます。出典: Gemini API rate limits. | モデル固有。AI Studio で対象モデルの行を確認してください。 | 課金アップグレード、プロジェクトレベルのクォータ、支出ティアのルール、そしてモデル行の変動性。 | 本格的なホスト型無料ティアが必要で、あとで課金するインディーアプリ。 |
| 2 | GroqCloud | 対応モデルへの無料の開発者ティアアクセス | Groq はモデル固有の無料行を公開しています。現在の表の例には、openai/gpt-oss-120b が 30 RPM、1K RPD、8K TPM、200K TPD で掲載されています。出典: Groq rate limits. |
モデル固有。長いプロンプトを使う前に各モデル行を確認してください。 | 1日あたりのリクエスト上限と1日あたりのトークン上限は、RPM と同じくらい重要です。 | 低レイテンシのテキスト試作と CLI ツール。 |
| 3 | OpenRouter free models | 無料のモデル変種。通常、ID の末尾は :free |
OpenRouter は、購入した累計クレジットに応じて、分あたり制限や日次上限の高低が異なる無料モデルのリクエスト上限を文書化しています。出典: OpenRouter limits. | モデル固有かつプロバイダー経由。モデルページとレスポンスメタデータを確認してください。 | 無料の日次クォータはクレジット後に変化し、上流プロバイダーの制限は引き続き 429 として表面化する場合があります。 | 1つの OpenAI 互換ベース URL から多数の無料ルートを比較する用途。 |
| 4 | Hugging Face Inference Providers | 毎月付与されるクレジット | Hugging Face は月次の Inference Providers クレジットを公開しています。無料ユーザーには少額の月間クレジット残高が付与され、より多い付与クレジットは有料席に提供されます。出典: Hugging Face Inference Providers pricing. | プロバイダーおよびモデル固有。多くのルートではモデル/プロバイダーページにコンテキストが表示されます。 | クレジット残高、カスタムプロバイダーキー・モード、そしてクレジット消化後のプロバイダー固有課金。 | 各プロバイダーでアカウントを作成せずにオープンモデルを試す用途。 |
| 5 | Cerebras Inference | 期間限定の無料トライアルクレジット | Cerebras は、認証済みの支払い方法を追加した後に無料トライアルを提供していると文書化しており、レート制限表では RPM、未キャッシュ TPM、総 TPM、TPH、TPD などのリクエストおよびトークンバケットを使用しています。出典: Cerebras rate limits. | モデル固有。gpt-oss、Qwen、画像対応の行は個別に確認してください。 |
認証済みの支払い方法、クレジットの有効期限、未キャッシュのトークンバケット、総トークンバケット。 | 支出を確定する前に、特定のオープンモデルの速度をテストする用途。 |
| 6 | Cloudflare Workers AI | 1日あたりの無料 Neurons 割り当て | Cloudflare の Workers AI 料金ページでは 1日あたり 10,000 Neurons、また Workers Paid が必要なモデルを除き Text Generation では 1分あたり 300 リクエストが明記されています。出典: Workers AI pricing と Workers AI limits。 | モデル固有。Cloudflare のモデルページでタスクとコンテキストの挙動が定義されます。 | Neuron のメータリング、有料モデルの例外、UTC リセット時刻、Workers プラン要件。 | エッジアプリ、ボット、小規模なサーバーレス実験。 |
| 7 | Cohere | 無料の評価キー | Cohere は評価キーを無料だが制限付きと記載しており、新しいチャット系バリアントは月 1,000 API 呼び出しに制限され、試用チャットの行は 1分あたり 20 リクエストです。出典: Cohere rate limits。 | モデル固有。Command、Embed、Rerank、Parse を個別に確認してください。 | 月間呼び出し上限、エンドポイント固有の制限、新しいモデル向けの本番制限。 | Rerank、埋め込み、Command ファミリーの評価。 |
| 8 | Alibaba Cloud Model Studio / Qwen | 新規ユーザー/モデル固有の無料クォータ | Alibaba は Model Studio の無料クォータページと、基盤モデルを呼び出すための別の有効化フローを公開しています。出典: Model Studio free quota と Model Studio activation。 | Qwen およびその他の Model Studio の行はモデル固有です。 | 無料クォータの期間、アカウント有効化、リージョンワークスペース、課金対象サービスの有効化、トークン単位。 | Qwen を多用するアプリとアジア/中国リージョンでのテスト。 |
| 9 | SiliconFlow | アカウント認証後の無料モデル | SiliconFlow の FAQ では、実名認証後に無料モデルを呼び出せること、無料モデルの呼び出しは 0 課金であること、固定の無料モデル制限はモデルカタログに表示されることが示されています。出典: SiliconFlow rate-limit FAQ。 | モデルカタログ固有。 | 実名認証、カタログのみの制限行、リージョン/アカウント要件。 | SiliconFlow が利用可能な、中国市場向けモデルアクセスのテスト。 |
| 10 | Replicate | クレジットベースの API アクセスと公開モデル API | Replicate は、prediction 作成リクエスト 1分あたり 600 件、その他のエンドポイントは 3,000 RPM、低クレジット付近ではより強いスロットリング、さらに支払い方法なしでクレジットが付与された場合は 1 秒あたり 1 リクエストと 6 RPM の上限があると記載しています。出典: Replicate rate limits。 | モデル固有。各モデルページで入力と制限が定義されます。 | クレジット残高、支払い方法の状態、コールドスタート、モデル所有者の利用可能性。 | 幅広いホスト型オープンソースモデルとメディアモデルのテスト。 |
| 11 | Ollama ローカル API | 無料のローカル HTTP API | Ollama は /api/generate、/api/chat、ストリーミング、そしてローカルの localhost:11434 呼び出しを公開しています。出典: Ollama API reference。 |
ローカルモデルと、コンテキスト関連パラメータなどのランタイムオプションによって制御されます。 | 必要なのはあなたの RAM/VRAM、モデルサイズ、ローカル稼働時間であり、管理された SLA はありません。 | オフラインのプロトタイプ、プライベートデータのテスト、安価なローカルのスモークテスト。 |
| 12 | llama.cpp サーバー | 無料のローカル OpenAI 風サーバー | llama-server は、OpenAI 風のエラー、モデル読み込み、/models、/props、およびコンテキスト設定などのサーバー/ランタイムオプションをサポートします。出典: llama.cpp server README。 |
GGUF モデルとサーバーフラグによって設定され、コンテキスト構成も含まれます。 | ビルドの複雑さ、ハードウェアのスループット、コンテキストメモリ、並行処理。 | 最大限のローカル制御と OpenAI 互換の実験を求める開発者。 |
本当に重要な比較
RPM は比較しやすい数値ですが、最初に驚かされる上限であることはまれです。無料の LLM API は通常、次の 6 つのいずれかの形で失敗します:
- 1 日あたりのリクエスト上限が RPM より先に尽きる。 サービスによっては 1 分あたり 20 回や 30 回のリクエストを送れても、少額の日次上限に達すると停止します。
- 1 分あたりのトークン上限は長いプロンプトに不利。 20 万トークンの日次または分単位の枠は、検索、コーディングエージェント、または大きなコンテキストウィンドウを試すとすぐに消えることがあります。
- クレジットはクォータと同じではない。 Hugging Face、Cerebras、Replicate などのクレジット制は、残高または有効期限が切れるまで無料に感じられることがあります。
- 無料モデルはすべてのモデルではない。 無料ルートは、多くの場合、選択されたモデル ID、旧バージョン、小型モデル、または特別な
:freeルートを対象とします。 - 課金の有効化で挙動が変わる。 支払い方法を追加すると、課金ルート、より高い上限、または異なる日次上限が解除されることがあります。また、ハードリミットを忘れると支出が発生する可能性もあります。
- ローカル API は上限を自分のマシンに移す。 Ollama と llama.cpp はプロバイダーのクォータを回避しますが、ノート PC はホスティングされた推論クラスタではありません。
まず何を試すべきか決めるなら、ボトルネックでプロバイダーを選んでください:
| 気にするボトルネック | より適した開始点 |
|---|---|
| 1 分あたりのリクエスト数 | GroqCloud、Cloudflare Workers AI、Replicate |
| 日次の無料スモークテスト | Google Gemini API、Cloudflare Workers AI、OpenRouter の無料モデル |
| 複数モデルの比較 | OpenRouter、Hugging Face Inference Providers、Replicate |
| オープンモデルの速度 | GroqCloud、Cerebras、検証後の Fireworks 風有料パス |
| 地域限定アクセス | Alibaba Cloud Model Studio、SiliconFlow |
| 外部データ経路なし | Ollama、llama.cpp サーバー |
隠れた上限チェックリスト
無料の LLM API をアプリに組み込む前に、次の質問に答えてください:
- 無料メカニズムは、継続型、トライアルのみ、クレジットのみのどれですか?
- 制限はアカウント単位、プロジェクト単位、キー単位、モデル単位のどれですか?
- クォータは日次、月次、または手動のチャージ後にのみリセットされますか?
- 支払い方法によって上限や請求リスクは変わりますか?
- 入力トークン、出力トークン、キャッシュ済みトークン、音声秒数、画像、ニューロンは別々に計測されますか?
- 無料モデルは、あなたのワークフローに必要なコンテキストウィンドウをサポートしていますか?
- ツール呼び出し、JSONモード、ビジョン、ストリーミング、埋め込みは含まれますか?
- プロバイダーは無料プランで、あなたのデータを学習に使う、記録する、保持する扱いを有料プランと変えていますか?
- 上限に達する前に利用ログをエクスポートできますか?
- 無料経路が 429、402、またはプロバイダーの容量エラーを返したときの代替手段は何ですか?
最後の質問が重要なのは、無料プランの障害の大半が劇的なものではないからです。デモ中にレート制限エラーを返し始める、動いているように見えるプロトタイプのような形で現れます。
無料LLM APIのためのシンプルなテスト計画
回答を比較する前に、各プロバイダーで同じ小規模な評価を実行してください。
- レイテンシーテスト: 20個の短いプロンプト。利用可能ならストリーミングのオン/オフ両方で実施。
- コンテキストテスト: 1K、8K、32K、そして実際に必要な最大プロンプトサイズ。
- スキーマテスト: 1つのJSON出力、1つのツール呼び出し風出力、1つの不正入力回復テスト。
- コスト/クォータテスト: プロバイダーが残りクォータ、429の挙動、または日次上限を明らかにするまで繰り返す。
- フェイルオーバーテスト: アプリコードを変更せずにモデルまたはプロバイダーを切り替える。
OpenAI互換のエンドポイントでは、アプリ側の変更を最小限に抑えてください。
curl "$BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MODEL_ID",
"messages": [
{"role": "system", "content": "有効なJSONのみを返してください。"},
{"role": "user", "content": "この無料APIの隠れた上限を1つのオブジェクトで要約してください。"}
],
"temperature": 0.2
}'
すべてのプロバイダーで、同じプロンプト、タイムアウト、リトライポリシー、最大トークン設定を使用してください。そうしないと、APIではなくクライアント設定を比較していることになります。
無料プランで十分でなくなるとき
無料LLM APIは、学習、デモ、初期検証には非常に有用です。しかし、ユーザー、定期ジョブ、エージェントループがある段階では、本番ルーティングの代わりにはなりません。
そこでゲートウェイパターンが役立ちます。Flatkeyは、公式モデルエンドポイントや従量課金のツール全体をテストしながらルーティングしたいチーム向けに、1つのキー、1つの残高、1つの請求書で運用できるよう設計されています。1つのプロバイダーでの実験を超えているなら、別のプロバイダー固有クライアントをハードコードする前に、Flatkey APIクイックスタート、AIモデルカタログガイド、AI APIクォータ制限ガイドから始めてください。
よくある質問
2026年に最適な無料LLM APIは何ですか?
無料LLM APIに唯一のベストはありません。Google Gemini APIとCloudflare Workers AIは継続的な無料枠の検証に強く、GroqCloudは高速なホスト型テキストテストに強く、OpenRouterは無料モデルの比較に強く、Ollamaやllama.cppはクラウド料金を一切かけたくない場合に最適です。
無料LLM APIは本番環境で安全に使えますか?
本番で使うのは、現在の制限、データポリシー、課金動作、フォールバック処理を確認してからにしてください。多くの無料枠には本番SLAがなく、日次上限が低かったり、モデルごとの上限が変更されることがあります。
最もレート制限が高い無料LLM APIはどれですか?
タスクの種類とモデルによります。Replicateは高いデフォルトのエンドポイントRPMを公開しており、Cloudflareはテキスト生成向けに300 RPMなどのタスクレベルの制限を公開し、GroqはモデルごとのRPMとトークン上限を公開しています。最高のRPMが、必ずしも実際に使える最大容量とは限りません。
無料LLM APIには長いコンテキストウィンドウが含まれますか?
場合によります。コンテキストウィンドウは通常、無料枠ではなくモデル固有です。必ず正確なモデル行を確認し、その後で実際のプロンプトサイズをテストしてください。TPM制限により、モデルが公表しているコンテキストウィンドウに達する前に長コンテキストの使用がブロックされることがあるためです。
なぜ無料LLM API一覧にローカルAPIを含めるのですか?
ローカルAPIは、真にプロバイダー課金が発生しない唯一の選択肢です。プライベートデータのテスト、オフラインのプロトタイプ、再現性のあるスモークテストに有用です。代わりに、レート制限、信頼性レイヤー、スケーリング計画を自分のマシンが担うことになります。



