Đăng nhậpLiên hệBắt đầu miễn phí
Cost, Billing, and Ops29 tháng 7, 2026Flatkey Team

So sánh giá API AI: OpenAI vs Claude vs Gemini vs Qwen (2026)

So sánh giá API hiện tại của OpenAI, Claude, Gemini và Qwen bằng các khối lượng công việc thực tế đã chuẩn hóa và chi phí trên mỗi kết quả được chấp nhận.

So sánh giá API AI: OpenAI vs Claude vs Gemini vs Qwen (2026)

Việc so sánh giá API AI rất khó vì mức giá token đầu vào rẻ nhất hiếm khi tạo ra quy trình làm việc sản xuất rẻ nhất. Token đầu ra có thể đắt gấp nhiều lần token đầu vào, prompt được cache có thể làm thay đổi hóa đơn, các bậc theo độ dài ngữ cảnh có thể được áp dụng, và một mô hình có giá thấp hơn có thể đòi hỏi nhiều lần thử lại hơn hoặc cần con người chỉnh sửa.

Hướng dẫn này so sánh giá niêm yết công khai hiện tại cho các mô hình văn bản đại diện của OpenAI, Anthropic Claude, Google Gemini và Alibaba Qwen. Đồng thời, hướng dẫn còn quy đổi các mức giá này sang một khối lượng công việc đã chuẩn hóa để bạn có thể ước tính ngân sách thực tế thay vì chỉ chọn từ một bảng giá theo mỗi triệu token.

Kiểm tra giá: Các mức giá đã được đối chiếu với các trang chính thức của nhà cung cấp vào ngày 29 tháng 7 năm 2026. Giá được tính bằng đô la Mỹ cho mỗi 1 triệu token, trừ khi có ghi chú khác. Nhà cung cấp có thể thay đổi tên mô hình, trạng thái xem trước, mức độ sẵn có theo khu vực, ngưỡng ngữ cảnh, chiết khấu và giá. Hãy xác nhận trang chính thức được liên kết trước khi đưa ra quyết định mua cho môi trường sản xuất.

Câu trả lời nhanh: API AI nào rẻ nhất?

Về chi phí token thô, các mô hình có giá thấp hơn của Qwen là những lựa chọn rẻ nhất trong so sánh này. Gemini cũng có mức giá cạnh tranh cao, đặc biệt là trong các họ Flash và Flash-Lite. OpenAI và Claude nhìn chung có giá niêm yết cao hơn, nhưng các mô hình của họ vẫn có thể có chi phí cho mỗi tác vụ thành công thấp nhất khi chúng giảm số lần thử lại, lỗi công cụ, thời gian rà soát hoặc lưu lượng chuyển sang phương án dự phòng cho một khối lượng công việc cụ thể.

Không có bên thắng tuyệt đối:

  • Ưu tiên chất lượng tác vụ trước: Hãy kiểm thử prompt, công cụ, schema, ngôn ngữ và các trường hợp biên của chính bạn.
  • Đo riêng đầu vào và đầu ra: Tác vụ sinh nội dung nặng về đầu ra có thể cho ra thứ hạng rất khác so với phân loại hoặc trích xuất.
  • Tính cả chi phí khi lỗi: Số lần thử lại, các cuộc gọi dự phòng, rà soát của con người và lỗi mà khách hàng nhìn thấy đều ảnh hưởng đến giá thực tế.
  • Kiểm tra lại chiết khấu và ngưỡng: Bộ nhớ đệm, batch, độ dài ngữ cảnh, endpoint theo khu vực và giá khuyến mại ban đầu có thể làm thay đổi đáng kể tổng chi phí.

Bảng so sánh giá API AI

Bảng sau nhóm các mô hình đại diện thành các dải hàng đầu, cân bằng và tiết kiệm. Đây là các dải mua sắm, không phải tuyên bố về chất lượng hay năng lực tương đương.

Nhà cung cấp Mô hình Phân khúc so sánh Đầu vào / 1M token Đầu ra / 1M token Lưu ý giá quan trọng
OpenAI GPT-5.6 Sol Flagship $5.00 $30.00 Giá niêm yết tiêu chuẩn cho token văn bản
Anthropic Claude Opus 5 Flagship $5.00 $25.00 Giá tiêu chuẩn cho prompt và completion
Google Gemini 3.1 Pro Preview Flagship $2.00 $12.00 Mức giá hiển thị cho prompt lên đến 200K token; mức long-context cao hơn sẽ áp dụng trên ngưỡng đó
Alibaba Cloud Qwen3.7-Max Flagship $2.50 $7.50 Triển khai toàn cầu, hỗ trợ đến tầng ngữ cảnh 256K token
OpenAI GPT-5.6 Terra Cân bằng $2.50 $15.00 Giá niêm yết tiêu chuẩn cho token văn bản
Anthropic Claude Sonnet 5 Cân bằng $2.00 $10.00 Giá ưu đãi đến hết ngày 31 tháng 8 năm 2026; từ ngày 1 tháng 9 năm 2026 là $3.00 cho đầu vào và $15.00 cho đầu ra
Google Gemini 3.6 Flash Cân bằng $1.50 $7.50 Tầng trả phí tiêu chuẩn; Batch được liệt kê riêng
Alibaba Cloud Qwen3.7-Plus Cân bằng $0.40 $1.60 Giá triển khai toàn cầu, áp dụng cho tầng ngữ cảnh đến 256K token
OpenAI GPT-5.6 Luna Tiết kiệm $1.00 $6.00 Giá niêm yết tiêu chuẩn cho token văn bản
Anthropic Claude Haiku 4.5 Tiết kiệm $1.00 $5.00 Giá tiêu chuẩn cho prompt và completion
Google Gemini 3.5 Flash-Lite Tiết kiệm $0.30 $2.50 Tầng trả phí tiêu chuẩn; giá Batch thấp hơn được liệt kê riêng
Alibaba Cloud Qwen3.7-Flash Tiết kiệm $0.03 $0.13 Mức giá triển khai toàn cầu được hiển thị cho các yêu cầu đến 32K token; các tầng ngữ cảnh cao hơn sẽ đắt hơn

Nguồn chính thức: bảng giá API OpenAI, bảng giá Anthropic Claude, bảng giá Gemini API, và bảng giá Alibaba Cloud Model Studio.

Chi phí khối lượng công việc chuẩn hóa: 1.000 job sản xuất

Các mức giá token tĩnh sẽ hữu ích hơn sau khi bạn áp dụng cùng một cấu trúc yêu cầu cho mọi ứng viên. Giả sử một khối lượng công việc xử lý:

  • 1.000 job hoàn tất
  • 20.000 token đầu vào cho mỗi job
  • 2.000 token đầu ra cho mỗi job
  • không có giảm giá cho input được cache hoặc batch
  • không có lần thử lại hoặc lời gọi dự phòng

Điều đó tương đương 20 triệu token đầu vào và 2 triệu token đầu ra.

Công thức là:

chi phí khối lượng công việc = (token đầu vào / 1.000.000 × đơn giá đầu vào)
                             + (token đầu ra / 1.000.000 × đơn giá đầu ra)

Ước tính cho phân khúc Flagship

Mô hình Chi phí đầu vào Chi phí đầu ra Tổng cho 1.000 tác vụ
GPT-5.6 Sol $100.00 $60.00 $160.00
Claude Opus 5 $100.00 $50.00 $150.00
Gemini 3.1 Pro Preview $40.00 $24.00 $64.00
Qwen3.7-Max $50.00 $15.00 $65.00

Ước tính cho nhóm cân bằng

Mô hình Chi phí đầu vào Chi phí đầu ra Tổng cho 1.000 tác vụ
GPT-5.6 Terra $50.00 $30.00 $80.00
Claude Sonnet 5, mức giá khởi điểm $40.00 $20.00 $60.00
Gemini 3.6 Flash $30.00 $15.00 $45.00
Qwen3.7-Plus $8.00 $3.20 $11.20

Cùng khối lượng công việc đó của Claude Sonnet 5 sẽ là $90.00 theo mức giá công bố ngày 1 tháng 9 năm 2026: $60.00 đầu vào cộng $30.00 đầu ra.

Ước tính cho nhóm ngân sách

Mô hình Chi phí đầu vào Chi phí đầu ra Tổng cho 1.000 tác vụ
GPT-5.6 Luna $20.00 $12.00 $32.00
Claude Haiku 4.5 $20.00 $10.00 $30.00
Gemini 3.5 Flash-Lite $6.00 $5.00 $11.00
Qwen3.7-Flash $0.60 $0.26 $0.86

Các tổng này là so sánh phép tính, không phải xếp hạng hiệu năng. Một mô hình có chi phí $11 cho mỗi nghìn tác vụ không rẻ hơn trong thực tế nếu chỉ 70% kết quả của nó được chấp nhận trong khi một mô hình $30 đạt tỷ lệ chấp nhận 98%.

So sánh chi phí trên mỗi tác vụ thành công, không chỉ riêng chi phí token

Một chỉ số triển khai tốt hơn là chi phí trên mỗi kết quả được chấp nhận:

chi phí trên mỗi kết quả được chấp nhận = tổng chi tiêu cho mô hình / số kết quả được chấp nhận

Giả sử hai ứng viên cùng xử lý 1.000 tác vụ:

Ứng viên Chi tiêu cho mô hình Kết quả được chấp nhận Chi phí trên mỗi kết quả được chấp nhận
Mô hình có giá niêm yết thấp hơn $20 700 $0.0286
Mô hình có giá niêm yết cao hơn $30 980 $0.0306

Trong ví dụ này, mô hình rẻ hơn vẫn thắng sít sao, nhưng khoảng cách nhỏ hơn nhiều so với chênh lệch giá niêm yết cho thấy. Thêm thời gian kỹ thuật, các lần leo thang hỗ trợ khách hàng, hoặc phương án dự phòng trả phí cho 300 kết quả bị từ chối, và thứ hạng có thể đảo ngược.

Đối với mỗi mô hình, hãy ghi lại ít nhất:

  1. Tỷ lệ chấp nhận: Phần trăm đầu ra vượt qua các cổng chất lượng tự động và do con người kiểm tra.
  2. Tỷ lệ thử lại: Tần suất cần gọi lại cùng một mô hình.
  3. Tỷ lệ chuyển dự phòng: Tần suất lưu lượng được chuyển sang mô hình đắt hơn.
  4. Độ dài đầu ra trung bình: Các mô hình dài dòng có thể tạo ra hóa đơn lớn hơn ngay cả khi mức giá đầu vào thấp.
  5. Độ trễ tại phân vị mục tiêu: Một mô hình rẻ nhưng không đáp ứng SLA của sản phẩm của bạn có thể không thể sử dụng.
  6. Độ tin cậy của công cụ và lược đồ: Đầu ra có cấu trúc không hợp lệ hoặc các lệnh gọi công cụ thất bại sẽ tạo ra chi phí ẩn.
  7. Phút rà soát của con người: Việc chỉnh sửa thủ công có thể chiếm phần lớn chi phí token trong các quy trình công việc doanh nghiệp.

Cách hoạt động của giá API OpenAI

OpenAI tách riêng giá cho đầu vào chưa được lưu cache, đầu vào đã được lưu cache và đầu ra, đồng thời liệt kê các tùy chọn xử lý bổ sung như Batch và Flex cho các mô hình được hỗ trợ. Tỷ lệ đầu ra cao hơn nhiều so với tỷ lệ đầu vào ở các mô hình trên, vì vậy việc kiểm soát độ dài phản hồi là rất quan trọng.

OpenAI có thể là lựa chọn phù hợp khi ứng dụng của bạn đã được xây dựng xoay quanh các API của họ và mô hình đã chọn hoạt động đáng tin cậy trên bộ đánh giá của bạn. Với các nhóm ưu tiên OpenAI, việc tích hợp trực tiếp có thể đơn giản về mặt vận hành. Với các nhóm liên tục thử nghiệm nhà cung cấp khác, chi phí duy trì các client, thông tin xác thực, giới hạn và báo cáo riêng biệt trở thành một phần của phép so sánh.

Cách hoạt động của giá API Claude

Anthropic định giá các yêu cầu Claude tiêu chuẩn theo token đầu vào và đầu ra, đồng thời công bố các quy tắc riêng cho lưu cache prompt, yêu cầu ngữ cảnh dài và xử lý batch. Giai đoạn giới thiệu của Claude Sonnet 5 đặc biệt quan trọng đối với việc lập ngân sách: một thử nghiệm ra mắt vào tháng 8 năm 2026 không nên ngoại suy mức giá giới thiệu sang tháng 9 mà không điều chỉnh.

Giá Claude nên được đánh giá cùng với hành vi ngữ cảnh dài, việc sử dụng công cụ, chất lượng mã và lượng rà soát mà một quy trình làm việc yêu cầu. Với các tác nhân lập trình và tác vụ kinh doanh phức tạp, tỷ lệ token cao hơn có thể vẫn kinh tế nếu mô hình hoàn thành nhiều tác vụ hơn mà không cần can thiệp.

Cách hoạt động của giá API Gemini

Google liệt kê các gói API Gemini miễn phí và trả phí, các mức giá đầu vào và đầu ra theo từng mô hình, cùng các mức giá Batch riêng cho những mô hình được hỗ trợ. Một số mô hình Gemini cũng định giá prompt khác nhau khi ngữ cảnh vượt qua một ngưỡng, vì vậy kích thước prompt trung bình là chưa đủ—bạn cần phân bố kích thước yêu cầu.

Các dòng Flash và Flash-Lite của Gemini rất hấp dẫn cho khối lượng công việc lớn, trong khi các mô hình Pro nhắm đến những tác vụ khó hơn. Nhãn preview cũng rất quan trọng: các nhóm sản xuất nên xác minh trạng thái vòng đời, giới hạn và kế hoạch di chuyển ngoài giá cả.

Cách hoạt động của giá API Qwen

Alibaba Cloud Model Studio liệt kê giá Qwen triển khai toàn cầu với các bậc độ dài ngữ cảnh cho một số mô hình. Qwen3.7-Flash cực kỳ rẻ cho các yêu cầu ngắn trong bảng công bố, nhưng mức giá tăng lên ở các cửa sổ ngữ cảnh lớn hơn. Vì vậy, khu vực, chế độ triển khai và mã định danh mô hình chính xác nên được ghi lại trong mọi bài benchmark.

Qwen rất hấp dẫn đối với định tuyến nhạy cảm với chi phí, các ứng dụng đa ngôn ngữ, và các đội ngũ muốn có thêm một nhà cung cấp để lựa chọn. Như với mọi họ mô hình, hãy kiểm tra chất lượng, độ an toàn, độ trễ, hành vi của công cụ và khả năng sẵn có theo khu vực trước khi định tuyến lưu lượng production.

Cached input, Batch, và các bậc ngữ cảnh có thể làm thay đổi bên thắng cuộc

So sánh nổi bật ở trên cố ý sử dụng các mức giá đồng bộ tiêu chuẩn chưa có cached. Khối lượng công việc thực tế có thể phải trả ít hơn — hoặc đôi khi nhiều hơn — vì các biến số sau:

Cached input

Các system prompt lặp lại lớn, định nghĩa công cụ, chính sách và tiền tố tài liệu có thể đủ điều kiện cho mức giá cached-input. Hãy đo tỷ lệ cache-hit thực tế thay vì giả định mọi token lặp lại đều được giảm giá.

Batch processing

OpenAI, Anthropic và Google công bố các tùy chọn bất đồng bộ hoặc batch được giảm giá cho các trường hợp sử dụng được hỗ trợ. Batch có thể hữu ích cho đánh giá, làm giàu dữ liệu, phân loại ngoại tuyến và xử lý tài liệu ban đêm, nhưng nó không thay thế cho một endpoint tương tác có độ trễ thấp.

Long-context thresholds

Gemini và Qwen công bố các bậc phụ thuộc vào ngữ cảnh cho một số mô hình, và Anthropic ghi rõ các điều kiện giá cho long-context. Một vài yêu cầu cực lớn có thể làm tăng mức giá bình quân ngay cả khi yêu cầu trung vị nhỏ.

Different tokenizers

Một triệu token từ một nhà cung cấp không nhất thiết tương đương với cùng lượng văn bản nguồn hay mã nguồn khi dùng tokenizer của nhà cung cấp khác. Hãy dùng mức sử dụng do nhà cung cấp báo cáo từ các cuộc gọi thực tế thay vì ước tính mọi mô hình từ một tokenizer.

Regional and platform differences

Giá trên marketplace đám mây, theo khu vực, theo lưu trú dữ liệu, hoặc trên nền tảng được quản lý có thể khác với API toàn cầu trực tiếp của nhà cung cấp. Hãy ghi rõ endpoint và thực thể thanh toán bên cạnh mọi mức giá trong bảng đánh giá của bạn.

Quy trình đánh giá giá API AI thực tiễn

Hãy dùng quy trình bảy bước này trước khi chọn mô hình mặc định:

  1. Cố định một bộ kiểm thử đại diện. Bao gồm các prompt thường gặp, prompt khó, ngữ cảnh dài, gọi công cụ, đầu ra có cấu trúc, các trường hợp đa ngôn ngữ và các chế độ lỗi đã biết.
  2. Ghim chính xác model ID. Đừng benchmark một alias có thể âm thầm chuyển sang mô hình mới hơn.
  3. Chạy từng ứng viên với cùng một thang chấm. Chấm độ chính xác của tác vụ, tính hợp lệ của định dạng, độ an toàn, độ trễ và công sức của người đánh giá.
  4. Thu thập mức sử dụng do nhà cung cấp báo cáo. Lưu input, cached input, output, lần thử lại và lỗi cho mọi cuộc gọi.
  5. Áp dụng đúng bậc giá. Bao gồm ngưỡng ngữ cảnh, cache hit, batch, các giai đoạn giới thiệu và mức giá theo khu vực.
  6. Tính chi phí trên mỗi kết quả được chấp nhận. Bao gồm cả chi phí fallback và retry, không chỉ chi phí của lần gọi đầu tiên.
  7. Triển khai canary bên thắng cuộc trong production. Theo dõi chất lượng và độ lệch chi phí trước khi mở rộng lưu lượng.

Một sản phẩm đa mô hình nên lặp lại quy trình này bất cứ khi nào một nhà cung cấp thay đổi giá, phát hành mô hình mới, ngừng một bản preview, hoặc sửa đổi một alias.

Khi một unified AI API gateway hữu ích

Tài khoản trực tiếp từ nhà cung cấp là hợp lý khi một nhà cung cấp là tiêu chuẩn rõ ràng. Gánh nặng vận hành tăng lên khi một sản phẩm cần OpenAI cho một quy trình, Claude cho quy trình khác, Gemini cho đường dẫn khối lượng cao, và Qwen cho tuyến đường nhạy cảm về chi phí hoặc theo khu vực.

Một lớp truy cập hợp nhất có thể giảm chi phí tích hợp bằng cách cung cấp một thông tin xác thực, một endpoint tương thích OpenAI, và một chế độ xem mức sử dụng trên tất cả các mô hình được hỗ trợ. Điều này không loại bỏ nhu cầu kiểm thử các khả năng đặc thù của từng nhà cung cấp hoặc đọc các quy tắc giá hiện tại.

Flatkey được thiết kế cho quy trình làm việc đa mô hình này. Bạn có thể xem danh mục giá mô hình hiện tại, so sánh các ứng viên, và dùng tích hợp tương thích OpenAI để thay đổi model ID mà không cần duy trì một mẫu client riêng cho từng nhà cung cấp. Để biết chi tiết triển khai, xem quy trình kiểm thử prompt đa mô hìnhhướng dẫn theo dõi chi phí API AI.

Danh sách kiểm tra so sánh giá API AI

Trước khi phê duyệt một nhà cung cấp hoặc mô hình, hãy xác nhận:

  • [ ] Trang giá chính thức và ngày kiểm tra đã được ghi lại.
  • [ ] Model ID chính xác, khu vực, endpoint và trạng thái vòng đời đã được cố định.
  • [ ] Tốc độ input, cached input và output được tách riêng.
  • [ ] Các ngưỡng độ dài ngữ cảnh được bao gồm.
  • [ ] Giá khởi điểm có ngày hết hạn trong dự báo.
  • [ ] Giả định batch phù hợp với nhu cầu độ trễ của sản phẩm.
  • [ ] Mức sử dụng tokenizer thực tế lấy từ các cuộc gọi thử nghiệm.
  • [ ] Chi phí retry, fallback và rà soát thủ công được bao gồm.
  • [ ] Chi phí trên mỗi kết quả được chấp nhận được tính toán.
  • [ ] Một canary trên môi trường production xác minh kết quả benchmark.

Câu hỏi thường gặp

API Gemini có rẻ hơn API OpenAI không?

Đối với các mô hình đại diện và mức giá tiêu chuẩn trong so sánh ngày 29 tháng 7 năm 2026 này, Gemini có giá token thô thấp hơn so với các bậc mua tương ứng của OpenAI. Tuy nhiên, giá trị triển khai tốt hơn vẫn phụ thuộc vào chất lượng tác vụ, độ dài đầu ra, số lần retry, độ trễ, và tỷ lệ kết quả được chấp nhận.

API Claude có đắt hơn API OpenAI không?

Điều đó phụ thuộc vào các mô hình được chọn. Claude Opus 5 và GPT-5.6 Sol có cùng mức $5 cho input trong ảnh chụp này, trong khi Claude Opus 5 có mức output thấp hơn. Giá khởi điểm của Claude Sonnet 5 thấp hơn GPT-5.6 Terra, nhưng Anthropic công bố mức giá Sonnet 5 cao hơn bắt đầu từ ngày 1 tháng 9 năm 2026.

Vì sao giá API Qwen lại thấp như vậy?

Alibaba Cloud định vị các mô hình Qwen và các tầng ngữ cảnh khác nhau cho các khối lượng công việc khác nhau. Mức giá thấp nhất của Qwen3.7-Flash áp dụng cho ngữ cảnh ngắn hơn, và các tầng cao hơn có chi phí nhiều hơn. Giá niêm yết thấp cần được kiểm chứng so với chất lượng, độ trễ, tính sẵn sàng và các yêu cầu vận hành.

Nhà cung cấp nào cung cấp API rẻ nhất cho các coding agent?

Không có câu trả lời đáng tin cậy chỉ dựa trên mức giá token. Các tác nhân lập trình tạo ra các cuộc hội thoại dài, lặp lại lược đồ công cụ, sinh ra lượng đầu ra lớn và có thể phát sinh các lần thử lại tốn kém. Hãy đo lường khả năng điều hướng kho lưu trữ, chất lượng bản vá, tỷ lệ thành công của kiểm thử, tính hợp lệ của lệnh gọi công cụ và mức can thiệp của con người, rồi tính chi phí trên mỗi tác vụ lập trình được chấp nhận.

Giá API AI nên được xem xét lại với tần suất như thế nào?

Hãy kiểm tra giá chính thức ít nhất hàng tháng và bất cứ khi nào nhà cung cấp ra mắt một mô hình, thay đổi bản xem trước, công bố giai đoạn giới thiệu, hoặc cập nhật các quy tắc về ngữ cảnh và bộ nhớ đệm. Các đội có lưu lượng cao nên tự động hóa việc kiểm tra phiên bản giá và cảnh báo khi có thay đổi đáng kể.

Khuyến nghị cuối cùng

Hãy dùng bảng giá để tạo danh sách rút gọn, chứ không phải để quyết định tuyến cuối cùng. Qwen và Gemini dẫn đầu về chi phí thô trong nhiều dải ở ảnh chụp này, trong khi OpenAI và Claude có thể xứng đáng với mức giá cao hơn trong các quy trình mà chất lượng và độ tin cậy giúp giảm số lần thử lại hoặc khâu rà soát.

Phương pháp bền vững rất đơn giản: benchmark các mã định danh mô hình chính xác, sử dụng mức sử dụng token do nhà cung cấp báo cáo, áp dụng mọi quy tắc định giá, và tối ưu theo chi phí trên mỗi tác vụ được chấp nhận. Sau đó, luôn giữ sẵn ít nhất một lựa chọn thay thế đã được xác thực, vì giá cả và hiệu năng mô hình thay đổi nhanh hơn hầu hết lộ trình sản xuất.