Cost, Billing, and Ops2026年9月22日Flatkey Team

2026 年 12 个免费 LLM API:速率限制、上下文与隐藏上限对比

基于来源的 2026 年 12 个免费 LLM API 对比,涵盖周期性免费额度、免费模型路径、试用积分和本地 API。

2026 年 12 个免费 LLM API:速率限制、上下文与隐藏上限对比

免费 LLM API 在你还在决定要做什么时非常有用,但“免费”这个词背后隐藏着几种不同的交易结构。有些提供商会给你一个可重复领取的免费额度。有些会提供带有每日请求上限的免费模型路由。有些会给你短期试用积分。还有一些之所以免费,只是因为你在本地运行模型,而限制因素变成了你自己的硬件。

本指南从独立开发者的角度比较了 2026 年的 12 个免费 LLM API:你可以在没有付费生产合同的情况下测试什么,速率限制通常会出现在哪里,哪些上下文窗口注意事项很重要,以及哪些隐藏上限会在第一次演示后就让原型失效。

简短答案是:用免费 API 来验证提示词、Schema、延迟和模型匹配度。在你检查过提供商当前的额度页面、计费激活规则、模型特定限制、数据政策和备用方案之前,不要把免费层当作生产容量。

快速推荐

使用场景 从这里开始 原因
快速的托管文本生成测试 GroqCloud 或 Google Gemini API 两者都发布了免费层/速率限制指南,而且上手路径很直接。
测试大量免费模型变体 OpenRouter :free 结尾的免费模型 ID 让广泛比较变得容易,但每日上限取决于积分。
边缘应用实验 Cloudflare Workers AI 每天的 Neurons 分配和 Workers 集成很容易理解,适合小型应用。
基于积分的模型试用 Hugging Face、Cerebras、Cohere、Replicate 适合有针对性的评估,但上限通常是积分或每月调用次数,而不只是 RPM。
中国区或以 Qwen 为主的实验 Alibaba Cloud Model Studio 或 SiliconFlow 当你的受众、计费或模型访问需要中国区基础设施时很有用。
零云账单的本地测试 Ollama 或 llama.cpp server 没有提供商速率限制,但上下文、吞吐量和可用性会变成你的硬件问题。

这里什么算作免费 LLM API?

在本次比较中,“免费 LLM API”指以下至少一种:

  • 可重复领取的免费额度: 有文档说明的每日/月度免费配额。
  • 免费模型路由: 在免费模型政策下,可通过托管 API 路由调用且不按 token 收费。
  • 试用积分: 可通过 API 消耗的短期或注册赠送积分余额。
  • 本地免费 API: 没有提供商账单的本地 HTTP/OpenAI 兼容服务器。

这个区分比提供商的 logo 更重要。可重复领取的配额可以支持每天的烟雾测试。试用积分更适合集中评估。本地 API 在金钱上是免费的,但在内存、GPU、配置时间或运维上并不免费。

对比的 12 个免费 LLM API

# 提供商 免费机制 已公开的速率限制信号 上下文信号 需要检查的隐藏上限 最佳适用场景
1 Google Gemini API 适用于受支持的 Gemini API 模型的免费层 Google 文档说明了 RPM、TPM 和 RPD,且限制按项目而非按 API key 应用。来源:Gemini API rate limits 因模型而异;请在 AI Studio 中查看对应模型的准确行。 升级计费、项目级配额、消费层级规则以及模型行的波动。 在付费前需要一个真正可用的托管免费层的独立开发应用。
2 GroqCloud 面向受支持模型的免费开发者层访问 Groq 发布按模型划分的免费行;当前表中的示例包括 openai/gpt-oss-120b,其限制为 30 RPM、1K RPD、8K TPM 和 200K TPD。来源:Groq rate limits 因模型而异;使用长提示词前请查看每个模型的对应行。 日请求上限和日 token 上限与 RPM 同样重要。 低延迟文本原型和 CLI 工具。
3 OpenRouter free models 免费模型变体,通常以 :free 结尾的 ID 标识 OpenRouter 文档说明了免费模型请求上限,包括每分钟限制,以及根据购买的终身 credits 不同而变化的更低/更高日上限。来源:OpenRouter limits 因模型和路由的提供商而异;请查看模型页面和响应元数据。 在 credits 变化后,免费的日配额会变化;上游提供商限制仍可能以 429 错误形式出现。 通过一个兼容 OpenAI 的基础 URL 比较多条免费路由。
4 Hugging Face Inference Providers 每月包含的 credits Hugging Face 文档说明了每月 Inference Providers credits:免费用户可获得少量每月 credit 余额,付费席位则包含更多 credits。来源:Hugging Face Inference Providers pricing 按提供商和模型而定;许多路由会在模型/提供商页面展示上下文。 credit 余额、自定义 provider-key 模式,以及 credits 用尽后的按提供商计费。 在不为每个提供商都开通账户的情况下尝试开源模型。
5 Cerebras Inference 有时限的免费试用 credits Cerebras 文档说明,添加经过验证的支付方式后可获得免费试用,其速率限制表使用请求和 token 桶,例如 RPM、未缓存 TPM、总 TPM、TPH 和 TPD。来源:Cerebras rate limits 因模型而异;请分别查看 gpt-oss、Qwen 以及具备图像能力的行。 经过验证的支付方式、credits 到期、未缓存 token 桶以及总 token 桶。 在正式投入成本前对特定开源模型进行速度测试。
6 Cloudflare Workers AI 每日免费 Neurons 配额 Cloudflare 在 Workers AI 定价中说明每天 10,000 Neurons,并且对于文本生成每分钟 300 个请求,除非某个模型需要 Workers Paid。来源:Workers AI pricingWorkers AI limits 因模型而异;Cloudflare 的模型页面定义任务和上下文行为。 Neuron 计量、付费模型例外、UTC 重置时间,以及 Workers 套餐要求。 边缘应用、机器人和小型无服务器实验。
7 Cohere 免费评估密钥 Cohere 说明评估密钥免费但受限,较新的聊天变体限制为每月 1,000 次 API 调用,试用聊天行限制为每分钟 20 次请求。来源:Cohere rate limits 因模型而异;请分别查看 Command、Embed、Rerank 和 Parse。 每月调用上限、端点特定限制,以及较新模型的生产限制。 Rerank、embedding 和 Command 系列评估。
8 Alibaba Cloud Model Studio / Qwen 新用户/特定模型免费配额 阿里云发布了 Model Studio 免费配额页面,以及用于调用基础模型的单独激活流程。来源:Model Studio free quotaModel Studio activation Qwen 和其他 Model Studio 条目都因模型而异。 免费配额时长、账户激活、区域工作空间、计费服务激活和 token 单位。 重度使用 Qwen 的应用以及亚洲/中国区域测试。
9 SiliconFlow 账户验证后可使用免费模型 SiliconFlow 的 FAQ 说明,完成实名认证后即可调用免费模型,免费模型调用按零计费,固定的免费模型限制会显示在模型目录中。来源:SiliconFlow rate-limit FAQ 仅限模型目录相关。 实名认证、仅目录内的限制行,以及区域/账户要求。 在 SiliconFlow 可用的情况下测试中国市场模型访问。
10 Replicate 基于信用额度的 API 访问和公开模型 API Replicate 说明 create-prediction 请求为每分钟 600 次,其他端点为 3,000 RPM,在信用额度较低时会更强力限流;当在没有支付方式的情况下获批信用额度时,限制为每秒 1 次请求加每分钟 6 次请求。来源:Replicate rate limits 因模型而异;每个模型页面定义输入和限制。 信用余额、支付方式状态、冷启动以及模型所有者可用性。 测试范围广泛的托管开源模型和媒体模型。
11 Ollama 本地 API 免费本地 HTTP API Ollama 提供 /api/generate/api/chat、流式传输,以及本地 localhost:11434 调用。来源:Ollama API reference 由本地模型和运行时选项控制,例如与上下文相关的参数。 你的 RAM/VRAM、模型大小、本地运行时间,以及没有托管 SLA。 离线原型、私有数据测试,以及低成本本地冒烟测试。
12 llama.cpp server 免费本地 OpenAI 风格服务器 llama-server 支持 OpenAI 风格错误、模型加载、/models/props,以及诸如上下文设置之类的服务器/运行时选项。来源:llama.cpp server README 由 GGUF 模型和服务器标志设置,包括上下文配置。 构建复杂度、硬件吞吐量、上下文内存和并发。 希望获得最大本地控制权并进行 OpenAI 兼容实验的开发者。

真正重要的对比

RPM 是最容易比较的数字,但它很少是你首先遇到的那个意外上限。免费 LLM API 通常会以以下六种方式之一失效:

  1. 每日请求数会先耗尽,而不是 RPM。 某个服务可能允许你每分钟发送 20 或 30 个请求,但在一个很小的每日上限后就停止。
  2. 每分钟 token 上限会惩罚长提示词。 如果你测试检索、编码代理或大上下文窗口,200K token 的每日或每分钟配额桶会很快耗尽。
  3. 积分不等于配额。 Hugging Face、Cerebras、Replicate 以及类似的基于积分的方案,可能会让你感觉是免费的,直到余额或到期窗口关闭。
  4. 免费模型并不等于所有模型。 免费路线通常只覆盖选定的模型 ID、较旧的变体、小模型或特殊的 :free 路线。
  5. 启用计费会改变行为。 添加支付方式可能会解锁付费路线、更高上限或不同的每日上限。它也可能让你在忘记硬性限制时产生支出。
  6. 本地 API 会把上限转移到你的机器上。 Ollama 和 llama.cpp 避免了提供商配额,但笔记本电脑并不是托管推理集群。

如果你决定先测试什么,请按瓶颈选择提供商:

你关心的瓶颈 更好的起点
每分钟请求数 GroqCloud、Cloudflare Workers AI、Replicate
每日免费冒烟测试 Google Gemini API、Cloudflare Workers AI、OpenRouter 免费模型
多模型对比 OpenRouter、Hugging Face Inference Providers、Replicate
开放模型速度 GroqCloud、Cerebras、验证后可用的 Fireworks 风格付费路径
区域特定访问 Alibaba Cloud Model Studio、SiliconFlow
没有外部数据路径 Ollama、llama.cpp server

隐藏上限清单

在把免费 LLM API 接入你的应用之前,请回答这些问题:

  • 免费机制是循环提供、仅试用,还是仅限额度?
  • 限制是账户级、项目级、密钥级,还是模型级?
  • 配额是每天重置、每月重置,还是只有手动充值后才重置?
  • 付款方式会改变上限或计费风险吗?
  • 输入 token、输出 token、缓存 token、音频秒数、图片或神经元是否分别计量?
  • 免费模型是否支持你的工作流所需的上下文窗口?
  • 是否包含工具调用、JSON 模式、视觉、流式输出和 embeddings?
  • 提供商在免费层是否会以不同方式训练、记录或保留你的数据?
  • 你能否在达到上限前导出使用日志?
  • 当免费路径返回 429、402 或提供商容量错误时,你的备用方案是什么?

最后一个问题很重要,因为大多数免费层故障并不戏剧化。它们看起来像一个可用的原型,却在演示期间开始返回速率限制错误。

免费 LLM API 的简单测试计划

在比较答案之前,先对每个提供商运行同一组小型评估:

  1. 延迟测试:20 个简短提示,如可用,分别开启和关闭流式输出。
  2. 上下文测试:1K、8K、32K,以及你真实的最大提示大小。
  3. Schema 测试:一个 JSON 输出、一个工具调用风格输出、一个错误输入恢复测试。
  4. 成本/配额测试:重复执行,直到提供商暴露剩余配额、429 行为或每日上限。
  5. 备用方案测试:在不更改应用代码的情况下切换模型或提供商。

对于 OpenAI 兼容端点,请尽量保持应用改动很小:

curl "$BASE_URL/v1/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MODEL_ID",
    "messages": [
      {"role": "system", "content": "仅返回有效的 JSON。"},
      {"role": "user", "content": "用一个对象总结这个免费 API 的隐藏上限。"}
    ],
    "temperature": 0.2
  }'

对每个提供商都使用相同的提示、超时、重试策略和最大 token 设置。否则你比较的是客户端配置,而不是 API。

当免费层不再足够时

免费 LLM API 非常适合学习、演示和早期验证。一旦你有了用户、定时任务或 agent 循环,它们就不能替代生产路由。

这就是网关模式发挥作用的地方。Flatkey 面向那些希望在测试和跨官方模型端点及按次付费工具路由时,使用一个密钥、一个余额和一张发票的团队。如果你已经不再只是做单一提供商实验,可以先查看 Flatkey API 快速入门AI 模型目录指南AI API 配额限制指南,然后再硬编码另一个特定提供商的客户端。

常见问题

2026 年最好的免费 LLM API 是什么?

没有单一“最好”的免费 LLM API。Google Gemini API 和 Cloudflare Workers AI 适合持续的免费额度实验,GroqCloud 适合快速的托管文本测试,OpenRouter 适合免费模型对比,而 Ollama 或 llama.cpp 则最适合你完全不想产生云端账单的情况。

免费 LLM API 适合用于生产环境吗?

只有在你验证过当前限制、数据政策、计费行为以及故障切换处理之后,才应将它们用于生产环境。许多免费层没有生产级 SLA、每日上限更低,或者存在可能变化的特定模型上限。

哪个免费 LLM API 的速率限制最高?

这取决于任务类型和模型。Replicate 公布了较高的默认端点 RPM,Cloudflare 公布了任务级限制,例如文本生成 300 RPM,而 Groq 则公布了按模型划分的 RPM 以及 token 上限。最高的 RPM 并不总是意味着最高的可用容量。

免费 LLM API 是否包含长上下文窗口?

有时会。上下文窗口通常是模型特定的,而不是免费层特定的。请务必查看具体的模型条目,然后再测试你的真实提示词长度,因为 TPM 限制可能会在模型所宣称的上下文窗口之前,就阻止长上下文使用。

为什么在免费 LLM API 列表中包含本地 API?

本地 API 是唯一真正不产生提供商账单的选项。它们适合私有数据测试、离线原型开发以及可重复的冒烟测试。代价是你的机器会成为速率限制、可靠性层和扩展计划。