Cost, Billing, and Ops22 tháng 9, 2026Flatkey Team

12 API LLM miễn phí năm 2026: So sánh giới hạn tốc độ, ngữ cảnh và các giới hạn ẩn

So sánh có dẫn nguồn về 12 API LLM miễn phí năm 2026, bao gồm các gói miễn phí định kỳ, tuyến mô hình miễn phí, tín dụng dùng thử và API cục bộ.

12 API LLM miễn phí năm 2026: So sánh giới hạn tốc độ, ngữ cảnh và các giới hạn ẩn

Các API LLM miễn phí rất hữu ích khi bạn هنوز đang quyết định sẽ xây dựng gì, nhưng từ "miễn phí" che giấu một số cấu trúc ưu đãi khác nhau. Một số nhà cung cấp cho bạn hạn mức miễn phí định kỳ. Một số cung cấp các tuyến mô hình miễn phí với giới hạn yêu cầu hằng ngày. Một số cấp tín dụng dùng thử ngắn hạn. Những cái khác chỉ miễn phí vì bạn chạy mô hình cục bộ và phần cứng của chính bạn trở thành yếu tố giới hạn.

Hướng dẫn này so sánh 12 API LLM miễn phí trong năm 2026 từ góc nhìn của một indie hacker: bạn có thể kiểm thử gì mà không cần hợp đồng sản xuất trả phí, giới hạn tốc độ thường xuất hiện ở đâu, những lưu ý nào về cửa sổ ngữ cảnh là quan trọng, và những giới hạn ẩn nào có thể làm hỏng một nguyên mẫu sau bản demo đầu tiên.

Câu trả lời ngắn gọn: hãy dùng các API miễn phí để xác thực prompt, schema, độ trễ và mức độ phù hợp của mô hình. Đừng xem tầng miễn phí như năng lực cho môi trường sản xuất cho đến khi bạn đã kiểm tra trang hạn mức hiện tại của nhà cung cấp, quy tắc kích hoạt thanh toán, giới hạn theo từng mô hình, chính sách dữ liệu và đường dự phòng.

Lựa chọn nhanh

Trường hợp sử dụng Bắt đầu ở đây Vì sao
Kiểm thử tạo văn bản được lưu trữ nhanh GroqCloud hoặc Google Gemini API Cả hai đều công bố hướng dẫn về tầng miễn phí/giới hạn tốc độ, và quy trình khởi tạo rất đơn giản.
Kiểm thử nhiều biến thể mô hình miễn phí OpenRouter Các mã định danh mô hình miễn phí kết thúc bằng :free giúp so sánh diện rộng dễ dàng, nhưng giới hạn hằng ngày phụ thuộc vào tín dụng.
Thử nghiệm ứng dụng edge Cloudflare Workers AI Phân bổ Neurons hằng ngày và tích hợp Workers rất dễ hiểu đối với các ứng dụng nhỏ.
Thử nghiệm mô hình dựa trên tín dụng Hugging Face, Cerebras, Cohere, Replicate Tốt cho các đánh giá có mục tiêu, nhưng giới hạn thường là tín dụng hoặc số lần gọi theo tháng, chứ không chỉ RPM.
Thử nghiệm ở khu vực Trung Quốc hoặc thiên về Qwen Alibaba Cloud Model Studio hoặc SiliconFlow Hữu ích khi đối tượng người dùng, thanh toán hoặc quyền truy cập mô hình của bạn cần hạ tầng ở khu vực Trung Quốc.
Kiểm thử cục bộ không phát sinh hóa đơn đám mây Ollama hoặc máy chủ llama.cpp Không có giới hạn tốc độ từ nhà cung cấp, nhưng ngữ cảnh, thông lượng và thời gian hoạt động trở thành vấn đề của phần cứng bạn.

Điều gì được xem là API LLM miễn phí ở đây?

Trong so sánh này, "API LLM miễn phí" có nghĩa là ít nhất một trong những điều sau:

  • Hạn mức miễn phí định kỳ: Một phân bổ miễn phí hằng ngày/hằng tháng đã được ghi rõ.
  • Tuyến mô hình miễn phí: Một tuyến API được lưu trữ có thể gọi mà không tính phí theo token theo chính sách mô hình miễn phí.
  • Tín dụng dùng thử: Số dư tín dụng ngắn hạn hoặc tín dụng khi đăng ký có thể được sử dụng qua API.
  • API cục bộ miễn phí: Một máy chủ HTTP cục bộ/tương thích OpenAI không có hóa đơn từ nhà cung cấp.

Sự khác biệt đó quan trọng hơn logo của nhà cung cấp. Một hạn mức định kỳ có thể hỗ trợ kiểm tra nhanh mỗi ngày. Tín dụng dùng thử phù hợp hơn cho một đợt đánh giá tập trung. Một API cục bộ miễn phí về tiền, nhưng không miễn phí về RAM, GPU, thời gian thiết lập hoặc vận hành.

So sánh 12 API LLM miễn phí

# Nhà cung cấp Cơ chế miễn phí Tín hiệu giới hạn tốc độ đã công bố Tín hiệu ngữ cảnh Giới hạn ẩn cần kiểm tra Phù hợp nhất cho
1 Google Gemini API Gói miễn phí cho các mô hình Gemini API được hỗ trợ Google công bố RPM, TPM và RPD, với các giới hạn được áp dụng theo dự án thay vì theo API key. Nguồn: Gemini API rate limits. Tùy theo từng mô hình; hãy kiểm tra hàng của mô hình cụ thể trong AI Studio. Nâng cấp thanh toán, hạn ngạch cấp dự án, quy tắc theo mức chi tiêu và độ biến động của hàng mô hình. Các ứng dụng indie cần một gói miễn phí lưu trữ nghiêm túc trước khi trả phí.
2 GroqCloud Quyền truy cập tầng nhà phát triển miễn phí cho các mô hình được hỗ trợ Groq công bố các hàng miễn phí theo từng mô hình; ví dụ trong bảng hiện tại bao gồm openai/gpt-oss-120b với 30 RPM, 1K RPD, 8K TPM và 200K TPD. Nguồn: Groq rate limits. Tùy theo từng mô hình; hãy kiểm tra từng hàng mô hình trước khi dùng prompt dài. Giới hạn yêu cầu hằng ngày và giới hạn token hằng ngày quan trọng không kém RPM. Nguyên mẫu văn bản độ trễ thấp và công cụ CLI.
3 Mô hình miễn phí của OpenRouter Các biến thể mô hình miễn phí, thường có ID kết thúc bằng :free OpenRouter tài liệu hóa các giới hạn yêu cầu của mô hình miễn phí, bao gồm giới hạn mỗi phút và ngưỡng hằng ngày thấp hơn/cao hơn tùy theo số tín dụng đã mua trong suốt thời gian sử dụng. Nguồn: OpenRouter limits. Tùy theo mô hình và định tuyến qua nhà cung cấp; kiểm tra trang mô hình và siêu dữ liệu phản hồi. Hạn ngạch miễn phí hằng ngày thay đổi sau khi có tín dụng; giới hạn của nhà cung cấp upstream vẫn có thể xuất hiện dưới dạng 429. So sánh nhiều tuyến miễn phí qua một base URL tương thích OpenAI.
4 Hugging Face Inference Providers Tín dụng bao gồm hằng tháng Hugging Face tài liệu hóa tín dụng hằng tháng của Inference Providers: người dùng miễn phí nhận một số dư tín dụng hằng tháng nhỏ, còn gói trả phí có lượng tín dụng bao gồm lớn hơn. Nguồn: Hugging Face Inference Providers pricing. Tùy theo nhà cung cấp và mô hình; nhiều tuyến hiển thị ngữ cảnh trên trang mô hình/nhà cung cấp. Số dư tín dụng, chế độ custom-provider-key, và tính phí theo nhà cung cấp sau khi hết tín dụng. Thử các mô hình mở mà không cần mở tài khoản ở từng nhà cung cấp.
5 Cerebras Inference Tín dụng dùng thử miễn phí có giới hạn thời gian Cerebras tài liệu hóa một bản dùng thử miễn phí sau khi thêm phương thức thanh toán đã xác minh, và bảng giới hạn tốc độ của họ sử dụng các bucket theo yêu cầu và token như RPM, uncached TPM, total TPM, TPH và TPD. Nguồn: Cerebras rate limits. Tùy theo từng mô hình; hãy kiểm tra riêng các hàng gpt-oss, Qwen và có khả năng xử lý ảnh. Phương thức thanh toán đã xác minh, thời hạn hết hạn tín dụng, bucket token chưa cache và bucket token tổng. Kiểm thử tốc độ các mô hình mở cụ thể trước khi quyết định chi tiêu.
6 Cloudflare Workers AI Phân bổ Neuron miễn phí hàng ngày Cloudflare tài liệu hóa 10.000 Neuron mỗi ngày trên trang giá của Workers AI và 300 yêu cầu mỗi phút cho Text Generation, trừ khi một mô hình yêu cầu Workers Paid. Nguồn: Workers AI pricingWorkers AI limits. Tùy theo mô hình; các trang mô hình của Cloudflare xác định hành vi tác vụ và ngữ cảnh. Đo lường Neuron, các ngoại lệ cho mô hình trả phí, thời điểm đặt lại theo UTC và yêu cầu của gói Workers. Ứng dụng edge, bot và các thử nghiệm serverless nhỏ.
7 Cohere Khóa đánh giá miễn phí Cohere tài liệu hóa các khóa đánh giá là miễn phí nhưng có giới hạn, với các biến thể chat mới hơn bị giới hạn ở 1.000 cuộc gọi API mỗi tháng và các hàng chat thử nghiệm ở 20 yêu cầu mỗi phút. Nguồn: Cohere rate limits. Tùy theo mô hình; kiểm tra Command, Embed, Rerank và Parse riêng biệt. Giới hạn cuộc gọi theo tháng, giới hạn theo endpoint và giới hạn sản xuất cho các mô hình mới hơn. Đánh giá Rerank, embedding và họ mô hình Command.
8 Alibaba Cloud Model Studio / Qwen Hạn ngạch miễn phí cho người dùng mới/tùy theo mô hình Alibaba công bố một trang hạn ngạch miễn phí của Model Studio và một quy trình kích hoạt riêng để gọi các foundation model. Nguồn: Model Studio free quotaModel Studio activation. Qwen và các hàng Model Studio khác là tùy theo mô hình. Thời hạn hạn ngạch miễn phí, kích hoạt tài khoản, workspace theo khu vực, kích hoạt dịch vụ có tính phí và đơn vị token. Ứng dụng dùng nhiều Qwen và thử nghiệm tại khu vực châu Á/Trung Quốc.
9 SiliconFlow Mô hình miễn phí sau khi xác minh tài khoản Câu hỏi thường gặp của SiliconFlow cho biết có thể gọi các mô hình miễn phí sau khi xác minh danh tính thật, các cuộc gọi tới mô hình miễn phí được tính phí bằng 0, và các giới hạn cố định của mô hình miễn phí được hiển thị trong danh mục mô hình. Nguồn: SiliconFlow rate-limit FAQ. Tùy theo danh mục mô hình. Xác minh danh tính thật, các hàng giới hạn chỉ có trong danh mục, và yêu cầu về khu vực/tài khoản. Kiểm thử truy cập mô hình thị trường Trung Quốc khi SiliconFlow khả dụng.
10 Replicate Quyền truy cập API dựa trên credit và API mô hình công khai Replicate tài liệu hóa 600 yêu cầu create-prediction mỗi phút, 3.000 RPM cho các endpoint khác, cơ chế throttling mạnh hơn khi credit thấp, và giới hạn 1 yêu cầu/giây cộng với 6 RPM khi được cấp credit mà không có phương thức thanh toán. Nguồn: Replicate rate limits. Tùy theo mô hình; mỗi trang mô hình xác định đầu vào và giới hạn. Số dư credit, trạng thái phương thức thanh toán, cold start và tính sẵn có của chủ sở hữu mô hình. Kiểm thử nhiều mô hình nguồn mở được lưu trữ và các mô hình media.
11 API cục bộ của Ollama API HTTP cục bộ miễn phí Ollama cung cấp /api/generate, /api/chat, streaming và các lệnh gọi cục bộ tới localhost:11434. Nguồn: Tài liệu tham khảo API của Ollama. Được kiểm soát bởi mô hình cục bộ và các tùy chọn runtime như các tham số liên quan đến ngữ cảnh. RAM/VRAM của bạn, kích thước mô hình, thời gian hoạt động cục bộ và không có SLA được quản lý. Tạo mẫu ngoại tuyến, kiểm thử dữ liệu riêng tư và kiểm thử khói cục bộ chi phí thấp.
12 máy chủ llama.cpp Máy chủ kiểu OpenAI cục bộ miễn phí llama-server hỗ trợ lỗi kiểu OpenAI, tải mô hình, /models, /props và các tùy chọn máy chủ/runtime như cài đặt ngữ cảnh. Nguồn: README máy chủ llama.cpp. Được thiết lập bởi mô hình GGUF và các cờ của máy chủ, bao gồm cấu hình ngữ cảnh. Độ phức tạp khi build, thông lượng phần cứng, bộ nhớ ngữ cảnh và khả năng đồng thời. Các nhà phát triển muốn kiểm soát cục bộ tối đa và thử nghiệm tương thích OpenAI.

So sánh thực sự quan trọng

RPM là con số dễ so sánh nhất, nhưng hiếm khi là giới hạn khiến bạn bất ngờ đầu tiên. Các API LLM miễn phí thường thất bại theo một trong sáu cách:

  1. Yêu cầu hằng ngày cạn trước khi RPM cạn. Một dịch vụ có thể cho phép bạn gửi 20 hoặc 30 yêu cầu mỗi phút nhưng vẫn dừng lại sau khi chạm ngưỡng hằng ngày nhỏ.
  2. Giới hạn token mỗi phút phạt các prompt dài. Một hạn mức 200K token theo ngày hoặc theo phút có thể biến mất rất nhanh nếu bạn thử truy xuất, tác nhân lập trình hoặc các cửa sổ ngữ cảnh lớn.
  3. Credit không giống hạn ngạch. Hugging Face, Cerebras, Replicate và các thiết lập dựa trên credit tương tự có thể có cảm giác miễn phí cho đến khi số dư hoặc cửa sổ hết hạn đóng lại.
  4. Không phải mọi mô hình miễn phí đều là mọi mô hình. Các tuyến miễn phí thường chỉ bao gồm các ID mô hình được chọn, các biến thể cũ hơn, mô hình nhỏ hoặc các tuyến :free đặc biệt.
  5. Kích hoạt thanh toán làm thay đổi hành vi. Thêm phương thức thanh toán có thể mở khóa các tuyến trả phí, ngưỡng cao hơn hoặc một hạn mức hằng ngày khác. Nó cũng có thể khiến bạn phải trả tiền nếu quên đặt giới hạn cứng.
  6. API cục bộ chuyển giới hạn sang máy của bạn. Ollama và llama.cpp tránh hạn ngạch của nhà cung cấp, nhưng một chiếc laptop không phải là cụm suy luận được lưu trữ.

Nếu bạn đang quyết định nên thử cái gì trước, hãy chọn nhà cung cấp theo nút thắt cổ chai:

Nút thắt cổ chai bạn quan tâm Điểm khởi đầu tốt hơn
Số yêu cầu mỗi phút GroqCloud, Cloudflare Workers AI, Replicate
Kiểm thử khói miễn phí theo ngày Google Gemini API, Cloudflare Workers AI, các mô hình miễn phí của OpenRouter
So sánh nhiều mô hình OpenRouter, Hugging Face Inference Providers, Replicate
Tốc độ mô hình mở GroqCloud, Cerebras, các lộ trình trả phí kiểu Fireworks sau khi xác thực
Truy cập theo khu vực cụ thể Alibaba Cloud Model Studio, SiliconFlow
Không có đường dữ liệu ra ngoài Ollama, máy chủ llama.cpp

Danh sách kiểm tra các giới hạn ẩn

Trước khi gắn một API LLM miễn phí vào ứng dụng của bạn, hãy trả lời các câu hỏi sau:

  • Cơ chế miễn phí là lặp lại, chỉ dùng thử, hay chỉ có credit?
  • Giới hạn được áp dụng ở cấp tài khoản, cấp dự án, cấp key hay cấp model?
  • Quota có được đặt lại hằng ngày, hằng tháng, hay chỉ sau khi nạp thêm thủ công?
  • Phương thức thanh toán có thay đổi mức trần hoặc rủi ro tính phí không?
  • Token đầu vào, token đầu ra, token được lưu đệm, giây âm thanh, hình ảnh hoặc neurons có được tính riêng không?
  • Model miễn phí có hỗ trợ cửa sổ ngữ cảnh mà quy trình của bạn cần không?
  • Các lệnh gọi công cụ, chế độ JSON, vision, streaming và embeddings có được bao gồm không?
  • Nhà cung cấp có huấn luyện trên, ghi log hoặc lưu giữ dữ liệu của bạn khác đi ở gói miễn phí không?
  • Bạn có thể xuất nhật ký sử dụng trước khi chạm mức trần không?
  • Kế hoạch dự phòng của bạn là gì khi đường miễn phí trả về 429, 402 hoặc lỗi năng lực của nhà cung cấp?

Câu hỏi cuối cùng đó rất quan trọng vì hầu hết các sự cố ngừng hoạt động ở gói miễn phí không quá kịch tính. Chúng trông giống như một bản thử nghiệm đang hoạt động rồi bắt đầu trả về lỗi giới hạn tốc độ trong lúc demo.

Một kế hoạch kiểm thử đơn giản cho API LLM miễn phí

Chạy cùng một bài đánh giá nhỏ trên mọi nhà cung cấp trước khi bạn so sánh câu trả lời:

  1. Kiểm thử độ trễ: 20 prompt ngắn, bật và tắt streaming nếu có sẵn.
  2. Kiểm thử ngữ cảnh: 1K, 8K, 32K và kích thước prompt tối đa thực tế của bạn.
  3. Kiểm thử schema: một đầu ra JSON, một đầu ra kiểu gọi công cụ, một bài kiểm tra khôi phục khi đầu vào lỗi định dạng.
  4. Kiểm thử chi phí/quota: lặp lại cho đến khi nhà cung cấp hiển thị quota còn lại, hành vi 429 hoặc mức trần hằng ngày.
  5. Kiểm thử dự phòng: chuyển đổi model hoặc nhà cung cấp mà không thay đổi mã ứng dụng.

Với các endpoint tương thích OpenAI, hãy giữ thay đổi ở ứng dụng ở mức nhỏ:

curl "$BASE_URL/v1/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MODEL_ID",
    "messages": [
      {"role": "system", "content": "Chỉ trả về JSON hợp lệ."},
      {"role": "user", "content": "Tóm tắt các giới hạn ẩn của API miễn phí này trong một object."}
    ],
    "temperature": 0.2
  }'

Hãy dùng cùng một prompt, timeout, chính sách retry và thiết lập max-token cho mọi nhà cung cấp. Nếu không, bạn đang so sánh cấu hình client của mình chứ không phải API.

Khi các gói miễn phí không còn đủ nữa

Các API LLM miễn phí rất tuyệt cho việc học, demo và xác thực ban đầu. Chúng không phải là sự thay thế cho routing trong production khi bạn đã có người dùng, job theo lịch hoặc các vòng lặp tác tử.

Đó là lúc mô hình gateway phát huy tác dụng. Flatkey được xây dựng cho các đội muốn một key, một số dư và một hóa đơn khi thử nghiệm và định tuyến qua các endpoint model chính thức và các công cụ tính phí theo lượt gọi. Nếu bạn đã vượt qua giai đoạn thử nghiệm với một nhà cung cấp, hãy bắt đầu với Flatkey API quickstart, AI model catalog guide, và AI API quota limits guide trước khi hardcode thêm một client phụ thuộc vào nhà cung cấp khác.

Các câu hỏi thường gặp

API LLM miễn phí tốt nhất năm 2026 là gì?

Không có một API LLM miễn phí nào là tốt nhất cho mọi trường hợp. Google Gemini API và Cloudflare Workers AI rất phù hợp cho các thử nghiệm có hạn mức miễn phí định kỳ, GroqCloud mạnh cho các bài kiểm tra văn bản được lưu trữ với tốc độ cao, OpenRouter mạnh cho việc so sánh các mô hình miễn phí, và Ollama hoặc llama.cpp là lựa chọn tốt nhất khi bạn muốn hoàn toàn không phát sinh hóa đơn đám mây.

API LLM miễn phí có an toàn cho môi trường production không?

Chỉ nên dùng cho production sau khi bạn đã xác minh các giới hạn hiện tại, chính sách dữ liệu, hành vi tính phí và cơ chế dự phòng. Nhiều gói miễn phí không có SLA cho production, có ngưỡng sử dụng hằng ngày thấp hơn hoặc các giới hạn theo từng mô hình có thể thay đổi.

API LLM miễn phí nào có giới hạn tốc độ cao nhất?

Điều này phụ thuộc vào loại tác vụ và mô hình. Replicate công bố các mức RPM mặc định cao cho endpoint, Cloudflare công bố các giới hạn theo tác vụ như 300 RPM cho tạo văn bản, và Groq công bố RPM theo từng mô hình cùng giới hạn token. RPM cao nhất không phải lúc nào cũng là năng lực sử dụng thực tế cao nhất.

API LLM miễn phí có bao gồm cửa sổ ngữ cảnh dài không?

Đôi khi có. Cửa sổ ngữ cảnh thường phụ thuộc vào mô hình, không phải riêng gói miễn phí. Hãy luôn kiểm tra đúng hàng của mô hình rồi thử kích thước prompt thực tế của bạn, vì giới hạn TPM có thể chặn việc dùng ngữ cảnh dài trước cả khi cửa sổ ngữ cảnh được công bố của mô hình phát huy tác dụng.

Tại sao lại đưa API cục bộ vào danh sách API LLM miễn phí?

API cục bộ là lựa chọn duy nhất thực sự không phát sinh hóa đơn từ nhà cung cấp. Chúng hữu ích cho các bài kiểm tra dữ liệu riêng tư, nguyên mẫu ngoại tuyến và các bài smoke test có thể lặp lại. Đổi lại, máy của bạn sẽ trở thành giới hạn tốc độ, lớp độ tin cậy và kế hoạch mở rộng.