Đăng nhậpLiên hệBắt đầu miễn phí
Cost, Billing, and Ops23 tháng 7, 2026Flatkey Team

Giới hạn hạn ngạch AI API: So sánh giá OpenAI, Claude, Gemini và Qwen

So sánh giá token của OpenAI, Claude, Gemini và Qwen, rồi chuyển ước tính chi phí mỗi yêu cầu thành hạn ngạch cho nhóm, môi trường, khóa và khối lượng công việc.

Giới hạn hạn ngạch AI API: So sánh giá OpenAI, Claude, Gemini và Qwen

So sánh giá API AI chỉ hữu ích nếu kết quả đó thay đổi cách đội ngũ của bạn kiểm soát chi tiêu. Một bảng tỷ lệ token đầu vào và đầu ra có thể giúp chọn mô hình, nhưng nó không ngăn được một key phát triển, tự động hóa mất kiểm soát, hay lưu lượng production bất ngờ làm tiêu tốn toàn bộ ngân sách hàng tháng.

Mục tiêu thực tế là chuyển giá của nhà cung cấp thành giới hạn hạn ngạch AI API cho đội nhóm, môi trường, key và khối lượng công việc.

Hướng dẫn này so sánh giá các mô hình văn bản tiêu biểu của OpenAI, Anthropic Claude, Google Gemini và Alibaba Cloud Qwen, sau đó cho thấy cách các nhóm nền tảng, vận hành và tài chính có thể chuyển các mức giá đó thành ranh giới sử dụng có thể thực thi.

Ảnh chụp giá: 23/07/2026. Giá của nhà cung cấp, tên mô hình, bậc ngữ cảnh, phạm vi sẵn có theo khu vực, chiết khấu batch và quy tắc cache có thể thay đổi. Hãy kiểm tra các trang giá chính thức được liên kết và trang giá Flatkey hiện tại trước khi đưa ra quyết định mua hoặc triển khai.

So sánh giá AI API trong nháy mắt

Bảng dưới đây sử dụng các mô hình đa dụng tiêu biểu thay vì khẳng định chúng hoàn toàn tương đương về năng lực. Giá được liệt kê theo 1 triệu token ở mức giá công bố tiêu chuẩn.

Nhà cung cấp Mô hình tiêu biểu Đầu vào Đầu ra Chi tiết giá quan trọng
OpenAI GPT-5.4 $2.50 $15.00 Input được cache được tính giá riêng; Batch và Flex có thể giảm chi phí cho các khối lượng công việc đủ điều kiện
Anthropic Claude Sonnet 5 $2.00 $10.00 Cache write và cache hit có mức giá riêng; có thể áp dụng phụ phí cho endpoint theo khu vực
Google Gemini 3.5 Pro $1.00 $6.00 Mức giá cao hơn áp dụng khi vượt ngưỡng prompt 200,000 token được liệt kê; Batch rẻ hơn
Alibaba Cloud Qwen3.7-Max $1.65 $4.951 Trang giá toàn cầu chính thức liệt kê mức giá input theo bậc và giá cache-hit riêng

Tài liệu tham khảo chính thức: giá API OpenAI, giá Claude, giá API Gemini, và giá Alibaba Cloud Model Studio.

Những con số này là điểm khởi đầu, không phải bảng xếp hạng. Các tác tử nhiều đầu ra, phân tích ngữ cảnh dài, truy xuất thân thiện với cache, phân loại batch và trải nghiệm khách hàng nhạy với độ trễ đều có thể tạo ra “người thắng” về chi phí khác nhau.

Chuẩn hóa mọi mô hình theo chi phí cho mỗi yêu cầu thành công

Giá token trở nên hữu ích trong vận hành khi được chuyển thành đơn vị mà đội ngũ ứng dụng có thể nhận biết: một yêu cầu thành công, một tài liệu hoàn tất, một ticket được giải quyết, hoặc một kết quả quy trình được tạo ra.

Với một yêu cầu văn bản, hãy bắt đầu với:

request cost =
  (input tokens / 1,000,000 × input rate)
  + (output tokens / 1,000,000 × output rate)
  + cache and tool charges

Giả sử một yêu cầu dùng 2,000 token đầu vào và trả về 500 token đầu ra, không có cache, công cụ, lần thử lại, hay phụ phí ngữ cảnh dài.

Mô hình Chi phí ước tính mỗi yêu cầu Số yêu cầu được hỗ trợ bởi hạn ngạch sản xuất $300
GPT-5.4 $0.01250 24,000
Claude Sonnet 5 $0.00900 33,333
Gemini 3.5 Pro $0.00500 60,000
Qwen3.7-Max khoảng $0.00578 khoảng 51,943

Phép tính đơn giản này làm rõ hai факт quan trọng:

  1. Độ dài đầu ra có thể chi phối chi phí ngay cả khi mức giá đầu vào có vẻ rẻ.
  2. Hạn ngạch nên dựa trên hình dạng yêu cầu dự kiến và khối lượng kinh doanh, chứ không chỉ dựa trên giá token của nhà cung cấp.

Để có quy trình chuyên sâu hơn, hãy dùng hướng dẫn chi phí trên mỗi yêu cầu AI API để bao gồm các lần thử lại, hành vi cache, tỷ lệ lỗi và xử lý downstream.

Thiết lập một ngân sách danh mục trước khi thiết lập hạn ngạch mô hình

Thiết kế hạn ngạch nên bắt đầu từ số tiền tối đa mà doanh nghiệp sẵn sàng chi, chứ không phải từ thông lượng lý thuyết của một mô hình.

Giả sử ngân sách AI API hàng tháng đã được phê duyệt là $500. Đừng phân bổ ngay toàn bộ $500 cho các khóa đang hoạt động. Hãy giữ một khoản dự phòng rõ ràng cho các đợt tăng đột biến lưu lượng, khôi phục sự cố, thay đổi giá và di chuyển hệ thống.

Lớp ngân sách Tỷ lệ Số tiền ví dụ
Dự phòng vận hành 20% $100
Phát triển 8% $40
Staging và đánh giá 12% $60
Sản xuất 60% $300

Cấu trúc phân tầng này tạo ra một chế độ lỗi hữu ích: một thử nghiệm phát triển ồn ào có thể làm cạn biên giới $40 của nó mà không làm gián đoạn sản xuất.

Các tỷ lệ phần trăm chính xác nên phản ánh sản phẩm của bạn. Một chương trình đánh giá ở giai đoạn đầu có thể phân bổ nhiều hơn cho thử nghiệm, trong khi một ứng dụng trưởng thành có thể bảo vệ phân bổ sản xuất lớn hơn và quỹ thử nghiệm nhỏ hơn.

Hãy dùng hệ thống phân cấp hạn ngạch thay vì một ngưỡng chung duy nhất

Một giới hạn cấp tài khoản duy nhất tốt hơn là không có giới hạn, nhưng nó quá rộng để quy trách nhiệm. Hãy tạo các ranh giới lồng nhau phản ánh cách công việc được sở hữu.

1. Hạn ngạch tài khoản hoặc tổ chức

Đây là ngưỡng cứng hàng tháng đã thống nhất với bộ phận tài chính. Nó nên bao phủ mọi nhà cung cấp, mô hình, môi trường và nhóm cùng rút từ một số dư.

2. Hạn ngạch môi trường

Tách riêng development, staging và production. Đừng để một khóa dùng chung không giới hạn làm mờ nguồn sử dụng hoặc khiến lưu lượng phi sản xuất cạnh tranh trực tiếp với khách hàng.

3. Hạn ngạch nhóm hoặc trung tâm chi phí

Gán giới hạn cho các mảng sản phẩm, chương trình tự động hóa hoặc phòng ban. Nhóm sở hữu một quy trình cũng nên sở hữu dự báo của nó và giải thích các sai lệch đáng kể.

4. Hạn ngạch khóa API

Hãy dùng các khóa riêng biệt cho ứng dụng và môi trường. Giới hạn ở cấp khóa mang lại phạm vi ảnh hưởng thực tế nếu thông tin xác thực bị rò rỉ, một vòng lặp chạy quá thường xuyên, hoặc một lần triển khai gửi các yêu cầu sai định dạng.

5. Hạn ngạch workload hoặc mô hình

Hãy dành các mô hình đắt tiền cho những yêu cầu thực sự xứng đáng. Các tác vụ trích xuất, phân loại và định tuyến khối lượng lớn có thể dùng mô hình chi phí thấp hơn, trong khi một tác vụ suy luận phức tạp hoặc hướng tới khách hàng có thể nhận mức cấp phát cho mô hình cao cấp nhỏ hơn.

Flatkey cung cấp một khóa API và một bảng điều khiển duy nhất trên các mô hình được hỗ trợ, với mức sử dụng được tính phí theo mức tiêu thụ thực tế. Các đội nhóm có thể đặt giới hạn hạn ngạch và xem xét mức tiêu thụ tập trung thay vì phải đối soát các tài khoản riêng của từng nhà cung cấp. Xem tình trạng sẵn có của mô hình và mức giá hiện tại trên giá Flatkey.

Thêm ngưỡng cảnh báo trước giới hạn cứng

Một hạn ngạch cứng ngăn chi tiêu không giới hạn, nhưng nó nên là tuyến phòng thủ cuối cùng. Hãy thêm cảnh báo và thay đổi chính sách trước khi tài khoản chạm mức ngân sách còn lại bằng không.

Ngưỡng Hành động khuyến nghị
50% So sánh chi tiêu thực tế với mốc dự kiến trong tháng
70% Rà soát các khóa, mô hình và khối lượng công việc lớn nhất
85% Tạm dừng các đánh giá không thiết yếu và giảm giới hạn đầu ra
95% Yêu cầu một ngoại lệ được chủ sở hữu phê duyệt cho chi tiêu bổ sung
100% Chặn, suy giảm hoặc định tuyến theo chính sách duy trì hoạt động đã được ghi nhận

Cảnh báo 50% không tự động là vấn đề. Chạm một nửa ngân sách vào nửa chặng đường của tháng có thể hoàn toàn đúng kế hoạch. Tín hiệu hữu ích là mối quan hệ giữa ngân sách đã tiêu thụthời gian đã trôi qua, được điều chỉnh theo tính mùa vụ hàng tuần và các đợt ra mắt đã lên kế hoạch.

Quyết định điều gì sẽ xảy ra khi hạn ngạch đạt tới

Mỗi hạn ngạch đều cần một chính sách phản ứng. Nếu không, sự kiện giới hạn đầu tiên trong thực tế sẽ trở thành một sự cố xử lý tức thời.

Chọn một hoặc nhiều hành vi sau:

  • Chặn: từ chối các yêu cầu mới cho đến khi hạn ngạch được đặt lại hoặc chủ sở hữu tăng hạn mức.
  • Suy giảm: rút ngắn đầu ra tối đa, vô hiệu hóa các công cụ tùy chọn hoặc giảm độ sâu truy xuất.
  • Định tuyến: chuyển lưu lượng đủ điều kiện sang mô hình được phê duyệt có chi phí thấp hơn.
  • Xếp hàng: trì hoãn các tác vụ không tương tác cho đến cửa sổ ngân sách tiếp theo.
  • Leo thang: yêu cầu tăng tạm thời với chủ sở hữu, trong đó ghi lại lý do, số tiền và thời hạn hết hiệu lực.

Đừng âm thầm chuyển đổi mô hình đối với các quy trình có ràng buộc về tuân thủ, chất lượng, khu vực lưu trữ dữ liệu hoặc hợp đồng. Một phương án thay thế rẻ hơn chỉ hữu ích khi nó đã được phê duyệt cho loại yêu cầu đó và được kiểm thử theo cùng các tiêu chí chấp nhận.

Bao gồm các chi phí mà bảng token cơ bản bỏ sót

Mô hình hạn ngạch của bạn nên tính đến nhiều hơn là đầu vào và đầu ra không được lưu cache.

Hành vi cache

OpenAI, Claude, Gemini và Qwen công bố các điều khoản cache khác nhau. Hãy ước tính tỷ lệ trúng cache thực tế cho từng khối lượng công việc và tách riêng phí ghi cache khỏi khoản tiết kiệm từ việc đọc cache.

Ngữ cảnh dài

Một số nhà cung cấp tăng giá sau khi prompt vượt qua ngưỡng ngữ cảnh. Vì vậy, một quy trình xử lý tài liệu có thể có đường cong chi phí phi tuyến ngay cả khi số lượng yêu cầu vẫn không đổi.

Thử lại và phương án dự phòng

Một yêu cầu thất bại hai lần trước khi thành công có thể tốn nhiều hơn phản hồi thành công duy nhất được hiển thị trong phân tích sản phẩm. Hãy đo số lần thử trên mỗi lần thành công và bao gồm cả các cuộc gọi dự phòng có tính phí.

Công cụ, tìm kiếm và media

Tìm kiếm web, thực thi mã, embeddings, tạo hình ảnh, âm thanh và video thường sử dụng các đơn vị riêng hoặc phí cho mỗi lần gọi. Đừng ép các khối lượng công việc đó vào mô hình hạn ngạch token văn bản.

Batch và các cấp ưu tiên

Xử lý theo lô có thể giảm chi phí đối với các khối lượng công việc chịu được độ trễ. Xử lý ưu tiên hoặc theo khu vực có thể làm tăng chi phí. Hãy áp dụng đúng hạng dịch vụ cho từng dự báo hạn ngạch.

Quy trình thiết lập hạn ngạch hàng tháng thực tế

Hãy dùng trình tự này cho một ứng dụng mới hoặc khi thiết lập lại ngân sách theo quý.

  1. Kiểm kê khối lượng công việc. Ghi lại chủ sở hữu, môi trường, khóa, mô hình, khối lượng yêu cầu, token đầu vào, token đầu ra và tiêu chí thành công.
  2. Xác minh mức giá hiện tại. Kiểm tra các trang chính thức của nhà cung cấp và bảng giá trực tiếp trên cổng của bạn trong cùng một ngày.
  3. Tính kinh tế đơn vị. Ước tính chi phí trên mỗi yêu cầu và chi phí cho mỗi kết quả kinh doanh thành công.
  4. Mô hình hóa ba kịch bản. Tạo các trường hợp kỳ vọng, lưu lượng cao và sự cố với cơ chế thử lại và biến thiên đầu ra.
  5. Đặt mức trần danh mục. Xác nhận mức tối đa hàng tháng và khoản dự phòng với bộ phận tài chính.
  6. Phân bổ hạn ngạch lồng nhau. Chia chi tiêu giữa các môi trường, nhóm, khóa và các lớp khối lượng công việc.
  7. Cấu hình cảnh báo. Gán ngưỡng, kênh, người chịu trách nhiệm và thời hạn phản hồi.
  8. Tài liệu hóa hành vi giới hạn. Xác định chính sách chặn, suy giảm, định tuyến, xếp hàng và ngoại lệ.
  9. Rà soát hàng tuần. So sánh mức chi thực tế, chi phí đơn vị và dự báo đến khi hoàn tất.
  10. Thiết lập lại một cách có chủ đích. Không chuyển các giới hạn ngoại lệ tạm thời sang kỳ tiếp theo mà không xem xét lại.

Danh sách kiểm tra chính sách hạn ngạch

Trước khi bật lưu lượng sản xuất, hãy xác nhận rằng:

  • Mỗi ứng dụng sản xuất đều có một chủ sở hữu được chỉ định và khóa riêng của nó.
  • Môi trường phát triển và staging không thể tiêu thụ phần phân bổ cho sản xuất.
  • Tài khoản có mức trần hàng tháng cứng và một khoản dự phòng vận hành.
  • Các mô hình cao cấp có giới hạn riêng theo từng khối lượng công việc.
  • Cảnh báo được kích hoạt trước khi chạm ngưỡng dừng cứng và đến được đúng người chịu trách nhiệm.
  • Chi phí thử lại, bộ nhớ đệm, công cụ và phương án dự phòng được hiển thị trong dự báo.
  • Phản hồi hạn ngạch bảo toàn các quy trình quan trọng hoặc thất bại một cách an toàn.
  • Các mức tăng tạm thời bao gồm số tiền, người phê duyệt, lý do và ngày hết hạn.
  • Bộ phận tài chính có thể đối soát chi tiêu theo nhóm và môi trường.
  • Nguồn giá mô hình hiện tại và ngày xác minh được ghi lại.

Câu hỏi thường gặp

Giới hạn hạn ngạch AI API là gì?

Giới hạn hạn ngạch AI API là một ngưỡng tối đa về mức sử dụng hoặc chi tiêu áp dụng cho một tài khoản, môi trường, nhóm, khóa API, mô hình hoặc khối lượng công việc. Nó giúp ngăn ngừa mức tiêu thụ bất ngờ và làm rõ trách nhiệm sở hữu.

Hạn ngạch nên dựa trên token, yêu cầu hay tiền?

Hãy dùng tiền cho mức trần danh mục vì các mô hình có mức giá đầu vào, đầu ra, bộ nhớ đệm và công cụ khác nhau. Hãy dùng token và yêu cầu làm rào chắn vận hành khi chúng ánh xạ rõ ràng với một khối lượng công việc. Chính sách mạnh nhất sẽ theo dõi cả ba.

Nên rà soát hạn ngạch AI API bao lâu một lần?

Hãy rà soát tốc độ chi tiêu ít nhất hàng tuần và sau khi có thay đổi mô hình, thay đổi giá, ra mắt lớn, bất thường lưu lượng hoặc cập nhật chính sách định tuyến. Các hệ thống có lưu lượng lớn có thể cần giám sát hằng ngày hoặc gần thời gian thực.

Mô hình rẻ nhất có phải luôn là cách tốt nhất để giảm áp lực hạn ngạch không?

Không. Mức giá token thấp hơn có thể bị bù trừ bởi đầu ra dài hơn, nhiều lần thử lại hơn, tỷ lệ hoàn thành tác vụ kém hơn hoặc khối lượng xem xét bổ sung. Hãy so sánh chi phí trên mỗi kết quả thành công và kiểm thử chất lượng trước khi định tuyến lưu lượng sản xuất.

Cần giữ lại bao nhiêu ngân sách dự phòng?

Không có một tỷ lệ phần trăm chung cho tất cả. Mức dự phòng 10% đến 25% là một phạm vi lập kế hoạch hữu ích cho nhiều nhóm, nhưng các khối lượng công việc quan trọng hoặc biến động cao có thể cần nhiều hơn. Khoản dự phòng nên có người phụ trách và chính sách ngoại lệ rõ ràng.

Một khóa API dùng chung có còn có thể kiểm soát chi tiêu tốt không?

Một tài khoản cổng trung gian có thể tập trung hóa việc thanh toán và quyền truy cập mô hình, nhưng ứng dụng và môi trường vẫn nên dùng các khóa riêng biệt hoặc các danh tính chính sách tương đương. Sự tách biệt đó giúp hạn ngạch, thu hồi quyền, kiểm toán và phản ứng sự cố chính xác hơn.

Biến giá mô hình thành chính sách vận hành

So sánh giá API AI tốt nhất không dừng lại ở con số thấp nhất trong một bảng. Nó kết thúc bằng một ngân sách mà bộ phận tài chính có thể phê duyệt, các ranh giới mà kỹ thuật có thể thực thi, và dữ liệu sử dụng mà vận hành có thể giải thích.

Bắt đầu với trang giá Flatkey hiện tại, ước tính chi phí cho mỗi yêu cầu thành công, dành riêng một phần ngân sách danh mục, và phân bổ hạn ngạch cho môi trường, nhóm, khóa và khối lượng công việc. Sau đó, dùng bảng điều khiển để giữ cho việc sử dụng mô hình và mức tiêu thụ của từng nhóm luôn hiển thị khi lưu lượng thay đổi.

Lấy một khóa API Flatkey và tích hợp giới hạn hạn ngạch vào quá trình triển khai trước đợt tăng tải đầu tiên ở môi trường sản xuất.