免费 LLM API 在你还在决定要做什么时非常有用,但“免费”这个词背后隐藏着几种不同的交易结构。有些提供商会给你一个可重复领取的免费额度。有些会提供带有每日请求上限的免费模型路由。有些会给你短期试用积分。还有一些之所以免费,只是因为你在本地运行模型,而限制因素变成了你自己的硬件。
本指南从独立开发者的角度比较了 2026 年的 12 个免费 LLM API:你可以在没有付费生产合同的情况下测试什么,速率限制通常会出现在哪里,哪些上下文窗口注意事项很重要,以及哪些隐藏上限会在第一次演示后就让原型失效。
简短答案是:用免费 API 来验证提示词、Schema、延迟和模型匹配度。在你检查过提供商当前的额度页面、计费激活规则、模型特定限制、数据政策和备用方案之前,不要把免费层当作生产容量。
快速推荐
| 使用场景 | 从这里开始 | 原因 |
|---|---|---|
| 快速的托管文本生成测试 | GroqCloud 或 Google Gemini API | 两者都发布了免费层/速率限制指南,而且上手路径很直接。 |
| 测试大量免费模型变体 | OpenRouter | 以 :free 结尾的免费模型 ID 让广泛比较变得容易,但每日上限取决于积分。 |
| 边缘应用实验 | Cloudflare Workers AI | 每天的 Neurons 分配和 Workers 集成很容易理解,适合小型应用。 |
| 基于积分的模型试用 | Hugging Face、Cerebras、Cohere、Replicate | 适合有针对性的评估,但上限通常是积分或每月调用次数,而不只是 RPM。 |
| 中国区或以 Qwen 为主的实验 | Alibaba Cloud Model Studio 或 SiliconFlow | 当你的受众、计费或模型访问需要中国区基础设施时很有用。 |
| 零云账单的本地测试 | Ollama 或 llama.cpp server | 没有提供商速率限制,但上下文、吞吐量和可用性会变成你的硬件问题。 |
这里什么算作免费 LLM API?
在本次比较中,“免费 LLM API”指以下至少一种:
- 可重复领取的免费额度: 有文档说明的每日/月度免费配额。
- 免费模型路由: 在免费模型政策下,可通过托管 API 路由调用且不按 token 收费。
- 试用积分: 可通过 API 消耗的短期或注册赠送积分余额。
- 本地免费 API: 没有提供商账单的本地 HTTP/OpenAI 兼容服务器。
这个区分比提供商的 logo 更重要。可重复领取的配额可以支持每天的烟雾测试。试用积分更适合集中评估。本地 API 在金钱上是免费的,但在内存、GPU、配置时间或运维上并不免费。
对比的 12 个免费 LLM API
| # | 提供商 | 免费机制 | 已公开的速率限制信号 | 上下文信号 | 需要检查的隐藏上限 | 最佳适用场景 |
|---|---|---|---|---|---|---|
| 1 | Google Gemini API | 适用于受支持的 Gemini API 模型的免费层 | Google 文档说明了 RPM、TPM 和 RPD,且限制按项目而非按 API key 应用。来源:Gemini API rate limits。 | 因模型而异;请在 AI Studio 中查看对应模型的准确行。 | 升级计费、项目级配额、消费层级规则以及模型行的波动。 | 在付费前需要一个真正可用的托管免费层的独立开发应用。 |
| 2 | GroqCloud | 面向受支持模型的免费开发者层访问 | Groq 发布按模型划分的免费行;当前表中的示例包括 openai/gpt-oss-120b,其限制为 30 RPM、1K RPD、8K TPM 和 200K TPD。来源:Groq rate limits。 |
因模型而异;使用长提示词前请查看每个模型的对应行。 | 日请求上限和日 token 上限与 RPM 同样重要。 | 低延迟文本原型和 CLI 工具。 |
| 3 | OpenRouter free models | 免费模型变体,通常以 :free 结尾的 ID 标识 |
OpenRouter 文档说明了免费模型请求上限,包括每分钟限制,以及根据购买的终身 credits 不同而变化的更低/更高日上限。来源:OpenRouter limits。 | 因模型和路由的提供商而异;请查看模型页面和响应元数据。 | 在 credits 变化后,免费的日配额会变化;上游提供商限制仍可能以 429 错误形式出现。 | 通过一个兼容 OpenAI 的基础 URL 比较多条免费路由。 |
| 4 | Hugging Face Inference Providers | 每月包含的 credits | Hugging Face 文档说明了每月 Inference Providers credits:免费用户可获得少量每月 credit 余额,付费席位则包含更多 credits。来源:Hugging Face Inference Providers pricing。 | 按提供商和模型而定;许多路由会在模型/提供商页面展示上下文。 | credit 余额、自定义 provider-key 模式,以及 credits 用尽后的按提供商计费。 | 在不为每个提供商都开通账户的情况下尝试开源模型。 |
| 5 | Cerebras Inference | 有时限的免费试用 credits | Cerebras 文档说明,添加经过验证的支付方式后可获得免费试用,其速率限制表使用请求和 token 桶,例如 RPM、未缓存 TPM、总 TPM、TPH 和 TPD。来源:Cerebras rate limits。 | 因模型而异;请分别查看 gpt-oss、Qwen 以及具备图像能力的行。 |
经过验证的支付方式、credits 到期、未缓存 token 桶以及总 token 桶。 | 在正式投入成本前对特定开源模型进行速度测试。 |
| 6 | Cloudflare Workers AI | 每日免费 Neurons 配额 | Cloudflare 在 Workers AI 定价中说明每天 10,000 Neurons,并且对于文本生成每分钟 300 个请求,除非某个模型需要 Workers Paid。来源:Workers AI pricing 和 Workers AI limits。 | 因模型而异;Cloudflare 的模型页面定义任务和上下文行为。 | Neuron 计量、付费模型例外、UTC 重置时间,以及 Workers 套餐要求。 | 边缘应用、机器人和小型无服务器实验。 |
| 7 | Cohere | 免费评估密钥 | Cohere 说明评估密钥免费但受限,较新的聊天变体限制为每月 1,000 次 API 调用,试用聊天行限制为每分钟 20 次请求。来源:Cohere rate limits。 | 因模型而异;请分别查看 Command、Embed、Rerank 和 Parse。 | 每月调用上限、端点特定限制,以及较新模型的生产限制。 | Rerank、embedding 和 Command 系列评估。 |
| 8 | Alibaba Cloud Model Studio / Qwen | 新用户/特定模型免费配额 | 阿里云发布了 Model Studio 免费配额页面,以及用于调用基础模型的单独激活流程。来源:Model Studio free quota 和 Model Studio activation。 | Qwen 和其他 Model Studio 条目都因模型而异。 | 免费配额时长、账户激活、区域工作空间、计费服务激活和 token 单位。 | 重度使用 Qwen 的应用以及亚洲/中国区域测试。 |
| 9 | SiliconFlow | 账户验证后可使用免费模型 | SiliconFlow 的 FAQ 说明,完成实名认证后即可调用免费模型,免费模型调用按零计费,固定的免费模型限制会显示在模型目录中。来源:SiliconFlow rate-limit FAQ。 | 仅限模型目录相关。 | 实名认证、仅目录内的限制行,以及区域/账户要求。 | 在 SiliconFlow 可用的情况下测试中国市场模型访问。 |
| 10 | Replicate | 基于信用额度的 API 访问和公开模型 API | Replicate 说明 create-prediction 请求为每分钟 600 次,其他端点为 3,000 RPM,在信用额度较低时会更强力限流;当在没有支付方式的情况下获批信用额度时,限制为每秒 1 次请求加每分钟 6 次请求。来源:Replicate rate limits。 | 因模型而异;每个模型页面定义输入和限制。 | 信用余额、支付方式状态、冷启动以及模型所有者可用性。 | 测试范围广泛的托管开源模型和媒体模型。 |
| 11 | Ollama 本地 API | 免费本地 HTTP API | Ollama 提供 /api/generate、/api/chat、流式传输,以及本地 localhost:11434 调用。来源:Ollama API reference。 |
由本地模型和运行时选项控制,例如与上下文相关的参数。 | 你的 RAM/VRAM、模型大小、本地运行时间,以及没有托管 SLA。 | 离线原型、私有数据测试,以及低成本本地冒烟测试。 |
| 12 | llama.cpp server | 免费本地 OpenAI 风格服务器 | llama-server 支持 OpenAI 风格错误、模型加载、/models、/props,以及诸如上下文设置之类的服务器/运行时选项。来源:llama.cpp server README。 |
由 GGUF 模型和服务器标志设置,包括上下文配置。 | 构建复杂度、硬件吞吐量、上下文内存和并发。 | 希望获得最大本地控制权并进行 OpenAI 兼容实验的开发者。 |
真正重要的对比
RPM 是最容易比较的数字,但它很少是你首先遇到的那个意外上限。免费 LLM API 通常会以以下六种方式之一失效:
- 每日请求数会先耗尽,而不是 RPM。 某个服务可能允许你每分钟发送 20 或 30 个请求,但在一个很小的每日上限后就停止。
- 每分钟 token 上限会惩罚长提示词。 如果你测试检索、编码代理或大上下文窗口,200K token 的每日或每分钟配额桶会很快耗尽。
- 积分不等于配额。 Hugging Face、Cerebras、Replicate 以及类似的基于积分的方案,可能会让你感觉是免费的,直到余额或到期窗口关闭。
- 免费模型并不等于所有模型。 免费路线通常只覆盖选定的模型 ID、较旧的变体、小模型或特殊的
:free路线。 - 启用计费会改变行为。 添加支付方式可能会解锁付费路线、更高上限或不同的每日上限。它也可能让你在忘记硬性限制时产生支出。
- 本地 API 会把上限转移到你的机器上。 Ollama 和 llama.cpp 避免了提供商配额,但笔记本电脑并不是托管推理集群。
如果你决定先测试什么,请按瓶颈选择提供商:
| 你关心的瓶颈 | 更好的起点 |
|---|---|
| 每分钟请求数 | GroqCloud、Cloudflare Workers AI、Replicate |
| 每日免费冒烟测试 | Google Gemini API、Cloudflare Workers AI、OpenRouter 免费模型 |
| 多模型对比 | OpenRouter、Hugging Face Inference Providers、Replicate |
| 开放模型速度 | GroqCloud、Cerebras、验证后可用的 Fireworks 风格付费路径 |
| 区域特定访问 | Alibaba Cloud Model Studio、SiliconFlow |
| 没有外部数据路径 | Ollama、llama.cpp server |
隐藏上限清单
在把免费 LLM API 接入你的应用之前,请回答这些问题:
- 免费机制是循环提供、仅试用,还是仅限额度?
- 限制是账户级、项目级、密钥级,还是模型级?
- 配额是每天重置、每月重置,还是只有手动充值后才重置?
- 付款方式会改变上限或计费风险吗?
- 输入 token、输出 token、缓存 token、音频秒数、图片或神经元是否分别计量?
- 免费模型是否支持你的工作流所需的上下文窗口?
- 是否包含工具调用、JSON 模式、视觉、流式输出和 embeddings?
- 提供商在免费层是否会以不同方式训练、记录或保留你的数据?
- 你能否在达到上限前导出使用日志?
- 当免费路径返回 429、402 或提供商容量错误时,你的备用方案是什么?
最后一个问题很重要,因为大多数免费层故障并不戏剧化。它们看起来像一个可用的原型,却在演示期间开始返回速率限制错误。
免费 LLM API 的简单测试计划
在比较答案之前,先对每个提供商运行同一组小型评估:
- 延迟测试:20 个简短提示,如可用,分别开启和关闭流式输出。
- 上下文测试:1K、8K、32K,以及你真实的最大提示大小。
- Schema 测试:一个 JSON 输出、一个工具调用风格输出、一个错误输入恢复测试。
- 成本/配额测试:重复执行,直到提供商暴露剩余配额、429 行为或每日上限。
- 备用方案测试:在不更改应用代码的情况下切换模型或提供商。
对于 OpenAI 兼容端点,请尽量保持应用改动很小:
curl "$BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MODEL_ID",
"messages": [
{"role": "system", "content": "仅返回有效的 JSON。"},
{"role": "user", "content": "用一个对象总结这个免费 API 的隐藏上限。"}
],
"temperature": 0.2
}'
对每个提供商都使用相同的提示、超时、重试策略和最大 token 设置。否则你比较的是客户端配置,而不是 API。
当免费层不再足够时
免费 LLM API 非常适合学习、演示和早期验证。一旦你有了用户、定时任务或 agent 循环,它们就不能替代生产路由。
这就是网关模式发挥作用的地方。Flatkey 面向那些希望在测试和跨官方模型端点及按次付费工具路由时,使用一个密钥、一个余额和一张发票的团队。如果你已经不再只是做单一提供商实验,可以先查看 Flatkey API 快速入门、AI 模型目录指南 和 AI API 配额限制指南,然后再硬编码另一个特定提供商的客户端。
常见问题
2026 年最好的免费 LLM API 是什么?
没有单一“最好”的免费 LLM API。Google Gemini API 和 Cloudflare Workers AI 适合持续的免费额度实验,GroqCloud 适合快速的托管文本测试,OpenRouter 适合免费模型对比,而 Ollama 或 llama.cpp 则最适合你完全不想产生云端账单的情况。
免费 LLM API 适合用于生产环境吗?
只有在你验证过当前限制、数据政策、计费行为以及故障切换处理之后,才应将它们用于生产环境。许多免费层没有生产级 SLA、每日上限更低,或者存在可能变化的特定模型上限。
哪个免费 LLM API 的速率限制最高?
这取决于任务类型和模型。Replicate 公布了较高的默认端点 RPM,Cloudflare 公布了任务级限制,例如文本生成 300 RPM,而 Groq 则公布了按模型划分的 RPM 以及 token 上限。最高的 RPM 并不总是意味着最高的可用容量。
免费 LLM API 是否包含长上下文窗口?
有时会。上下文窗口通常是模型特定的,而不是免费层特定的。请务必查看具体的模型条目,然后再测试你的真实提示词长度,因为 TPM 限制可能会在模型所宣称的上下文窗口之前,就阻止长上下文使用。
为什么在免费 LLM API 列表中包含本地 API?
本地 API 是唯一真正不产生提供商账单的选项。它们适合私有数据测试、离线原型开发以及可重复的冒烟测试。代价是你的机器会成为速率限制、可靠性层和扩展计划。



