Đăng nhậpLiên hệBắt đầu miễn phí
Cost, Billing, and Ops27 tháng 7, 2026Flatkey Team

Giá API DeepSeek (2026): So sánh OpenAI, Claude, Gemini và Qwen

So sánh giá API DeepSeek với OpenAI, Claude, Gemini và Qwen bằng mức giá token theo thời điểm, phép tính khối lượng công việc có thể tái lập, lưu ý về cache và quy trình làm mới theo lịch.

Giá API DeepSeek (2026): So sánh OpenAI, Claude, Gemini và Qwen

Giá API DeepSeek đủ thấp để thu hút sự chú ý, nhưng mức giá token thô chỉ là dòng đầu tiên trong ngân sách sản xuất. Hành vi cache, độ dài đầu ra, token suy luận, điều kiện đủ cho batch, các tầng ngữ cảnh, cơ chế thử lại và thay đổi vòng đời mô hình đều có thể làm chi phí thực tế biến động.

Hướng dẫn này so sánh DeepSeek với các mô hình tiêu biểu của OpenAI, Anthropic Claude, Google Gemini và Alibaba Qwen bằng cách sử dụng giá công khai chính thức được kiểm tra vào 27 tháng 7, 2026. Hướng dẫn cũng trình bày một ví dụ chi phí trên mỗi yêu cầu có thể tái lập và một quy trình làm mới mà nhóm của bạn có thể dùng lại khi mức giá của nhà cung cấp thay đổi.

Ảnh chụp giá: Giá của nhà cung cấp thay đổi thường xuyên. Hãy coi mọi con số bên dưới là một so sánh theo thời điểm, sau đó kiểm tra trang giá gốc được liên kết trước khi mua credit hoặc thiết lập chính sách định tuyến cho môi trường sản xuất.

Giá API DeepSeek trong nháy mắt

Bảng API chính thức của DeepSeek hiện tập trung vào hai mã mô hình V4. Cả hai đều hỗ trợ chế độ không suy luận và suy luận, và bộ nhớ đệm ngữ cảnh tự động có thể giảm mạnh chi phí cho đầu vào lặp lại.

Mô hình DeepSeek Đầu vào khi cache trúng / 1M token Đầu vào khi cache trượt / 1M token Đầu ra / 1M token Giới hạn đồng thời đã công bố
deepseek-v4-flash $0.0028 $0.14 $0.28 2,500
deepseek-v4-pro $0.003625 $0.435 $0.87 500

Nguồn: DeepSeek Models & Pricing.

Chênh lệch giữa đầu vào khi cache trúng và cache trượt là rất lớn một cách bất thường. Điều đó khiến cấu trúc prompt và ngữ cảnh lặp lại trở nên quan trọng về mặt kinh tế. Một khối lượng công việc liên tục gửi cùng một chính sách, schema, tiền tố tài liệu hoặc system prompt dài có thể có hành vi rất khác so với khối lượng công việc chat tự phát, ngay cả khi tổng số token trông có vẻ tương tự.

Đồng thời cũng cần xét đến đồng thời trong thảo luận về giá. Mức giá token thấp hơn không tự động tạo ra chi phí trên mỗi yêu cầu thành công thấp hơn nếu ứng dụng cần thêm hàng đợi, phương án dự phòng hoặc cơ chế thử lại để đáp ứng mục tiêu lưu lượng.

So sánh giá DeepSeek với OpenAI, Claude, Gemini và Qwen

Không có mô hình nào tương đương hoàn hảo giữa các nhà cung cấp. Bảng bên dưới sử dụng các mô hình văn bản tiêu biểu hiện tại để chuẩn hóa cơ chế tính phí đầu vào và đầu ra—không nhằm khẳng định chất lượng, độ trễ, hành vi ngữ cảnh hay hiệu năng công cụ là tương đương.

Nhà cung cấp và mô hình Đầu vào tiêu chuẩn / 1M Đầu vào được lưu đệm / 1M Đầu ra / 1M Điều kiện định giá quan trọng
DeepSeek V4 Flash $0.14 $0.0028 $0.28 Tự động lưu đệm ngữ cảnh; chế độ thinking và non-thinking
DeepSeek V4 Pro $0.435 $0.003625 $0.87 Giới hạn đồng thời được công bố thấp hơn Flash
OpenAI GPT-5.4 $2.50 $0.25 $15.00 Xử lý theo lô và ưu tiên thấp hơn có thể làm thay đổi chi phí thực tế
Anthropic Claude Sonnet 5 $2.00 $0.20 $10.00 Giá khởi điểm đến hết ngày 31 tháng 8 năm 2026; giá tiêu chuẩn bắt đầu từ ngày 1 tháng 9
Google Gemini 3.6 Flash $1.50 $0.15 cộng phí lưu trữ $7.50 Tầng trả phí tiêu chuẩn; Batch và Flex niêm yết mức giá thấp hơn
Alibaba Qwen3.7-Max $1.65 Giảm giá cho context-cache khả dụng $4.951 Giá niêm yết; khu vực, tầng ngữ cảnh và các khuyến mãi tạm thời có thể làm thay đổi cách tính phí

Tài liệu tham khảo chính thức: OpenAI API pricing, Anthropic Claude pricing, Gemini API pricing, và Alibaba Cloud Model Studio pricing.

Kết luận nổi bật là rõ ràng: các mức giá token văn bản được công bố của DeepSeek thấp hơn đáng kể trong bức tranh này. Tuy nhiên, kết luận vận hành thì không đơn giản như vậy. Các mô hình của nhà cung cấp khác nhau về năng lực, hành vi đầu ra, token suy luận được bao gồm, các tầng dịch vụ, mức độ sẵn có theo khu vực, cách triển khai lưu đệm và độ ổn định vòng đời. Một so sánh cho môi trường sản xuất cần cả giá lẫn dữ liệu về khối lượng công việc.

So sánh chi phí trên mỗi yêu cầu có thể tái lập

Giả sử một yêu cầu thành công sử dụng:

  • 2.000 token đầu vào không được lưu đệm
  • 500 token đầu ra
  • Xử lý đồng bộ tiêu chuẩn
  • Không có công cụ, grounding, hình ảnh, âm thanh hoặc phí lưu trữ
  • Không có lần thử lại hoặc yêu cầu thất bại
  • Không có cam kết khối lượng hoặc chiết khấu tạm thời

Công thức là:

request cost = (input tokens / 1,000,000 × input rate) + (output tokens / 1,000,000 × output rate)

Mô hình Chi phí mỗi yêu cầu Chi phí cho 10.000 yêu cầu
DeepSeek V4 Flash $0.000420 $4.20
DeepSeek V4 Pro $0.001305 $13.05
Qwen3.7-Max $0.005776 $57.76
Gemini 3.6 Flash $0.006750 $67.50
Claude Sonnet 5, introductory rate $0.009000 $90.00
GPT-5.4 $0.012500 $125.00

Các con số này là phép tính số học, không phải bảng xếp hạng đã điều chỉnh theo chất lượng. Nếu một mô hình tạo ra câu trả lời dài hơn, cần nhiều lần thử lại hơn, cần thêm các lần gọi công cụ, hoặc thất bại thường xuyên hơn với tác vụ mục tiêu, thì lợi thế về giá token hiển nhiên có thể thu hẹp hoặc đảo ngược.

Để có phương pháp lập ngân sách sâu hơn, hãy dùng một khung chi phí cho mỗi yêu cầu API AI bao gồm cả các lần thử lại và kết quả thành công, thay vì chỉ dựa vào token.

Tại sao kinh tế bộ nhớ đệm có thể chi phối chi phí DeepSeek

Sử dụng mức giá đầu vào tiêu chuẩn cho mọi yêu cầu có thể làm phóng đại chi tiêu DeepSeek khi ngữ cảnh lặp lại liên tục trúng bộ nhớ đệm. Nó cũng có thể làm thấp hơn thực tế nếu các prompt thay đổi quá nhiều để được hưởng lợi.

Theo dõi các trường này riêng biệt:

  1. Token đầu vào đủ điều kiện cho cache: Các tiền tố ổn định, hướng dẫn dùng chung, tài liệu lặp lại hoặc lược đồ.
  2. Token đầu vào cache-hit: Phần thực tế bị tính phí theo mức cache-hit của nhà cung cấp.
  3. Token đầu vào cache-miss: Đầu vào mới hoặc đã chỉnh sửa bị tính phí theo mức đầy đủ.
  4. Token đầu ra: Bao gồm cả reasoning hoặc thinking tokens khi nhà cung cấp tính chúng là đầu ra.
  5. Chi phí lưu trữ và ghi cache: Có liên quan với các nhà cung cấp tính phí riêng cho thời gian lưu trữ hoặc việc tạo cache.

Đừng đưa tỷ lệ cache-hit giả định của một nhà cung cấp sang dự báo của nhà cung cấp khác mà không đo lường. Tự động caching của DeepSeek, cached input của OpenAI, prompt caching của Anthropic, context caching của Gemini, và context caching của Qwen không có cùng quy tắc hay cấu trúc phí.

Giảm giá batch hữu ích — nhưng không thể thay thế cho nhau

OpenAI quảng cáo mức giảm giá 50% cho Batch API. Batch API của Anthropic cũng cung cấp mức giảm 50% cho token đầu vào và đầu ra. Gemini 3.6 Flash niêm yết batch input ở mức $0.75 và output ở mức $3.75 cho mỗi triệu token, bằng một nửa mức giá Standard paid-tier. Tài liệu giá của Qwen tách riêng giá niêm yết, giảm giá batch, các cấp độ ngữ cảnh và các chương trình khuyến mãi khu vực tạm thời.

Giá batch chỉ có ích khi khối lượng công việc có thể chấp nhận khung thời gian hoàn thành không đồng bộ và mô hình hoặc endpoint đã chọn đủ điều kiện. Đừng dùng mức giá batch để dự báo một cuộc trò chuyện tương tác, vòng lặp tác nhân, hay một yêu cầu sản xuất nhạy cảm về độ trễ.

Năm yếu tố cần chuẩn hóa trước khi chọn API rẻ nhất

1. So sánh chi phí trên mỗi tác vụ thành công

Chạy cùng một bộ đánh giá đại diện qua từng mô hình ứng viên. Ghi lại token, số lần thử lại, số lần gọi công cụ, độ trễ và mức độ thành công của tác vụ. Chia tổng chi phí cho số kết quả thành công.

2. Tách biệt các khối lượng công việc có suy luận và không suy luận

DeepSeek V4 hỗ trợ cả hai chế độ. Qwen3.7-Max cũng hỗ trợ chế độ suy luận và không suy luận, trong khi Gemini bao gồm token suy luận trong giá đầu ra cho mô hình được so sánh. Một quy trình làm việc hỗ trợ câu trả lời ngắn và một tác nhân thiên về suy luận không nên dùng chung một ước tính gộp.

3. Giữ các bậc ngữ cảnh luôn hiển thị

Một số nhà cung cấp tăng giá cho prompt lớn hơn hoặc công bố mức giá theo bậc dựa trên độ dài đầu vào. Nếu các prompt trong sản xuất có thể vượt qua ranh giới một bậc, hãy mô hình hóa ranh giới đó một cách rõ ràng thay vì dùng hàng rẻ nhất cho mọi yêu cầu.

4. Đo lường chi phí retry và fallback

Tử số hữu ích là toàn bộ chi tiêu cho nhà cung cấp, bao gồm cả các lần thử thất bại. Mẫu số hữu ích là các tác vụ kinh doanh hoàn thành. Đây là lúc khả năng quan sát và nhật ký yêu cầu tập trung trở thành một phần của phân tích giá.

5. Theo dõi alias của mô hình và ngày ngừng hỗ trợ

Alias có thể chuyển sang các snapshot mới, và các mô hình có thể bị ngừng hỗ trợ hoặc thay đổi giá. Hãy ghim phiên bản ở nơi cần tính ổn định, ghi lại hành vi fallback, và chỉ định một người phụ trách xem xét các thông báo vòng đời từ nhà cung cấp.

Truy cập DeepSeek trực tiếp vs cổng API hợp nhất

Truy cập trực tiếp từ nhà cung cấp có thể là đủ khi một nhóm dùng một họ mô hình, một tài khoản thanh toán và một khu vực. Gánh nặng vận hành sẽ tăng khi nhóm bổ sung khóa riêng theo từng nhà cung cấp, định dạng hóa đơn, giới hạn tốc độ, đường fallback và kiểm soát mức sử dụng.

Một lớp truy cập hợp nhất có thể giúp việc so sánh dễ hơn bằng cách tập trung nhật ký yêu cầu, khả năng hiển thị chi tiêu, hạn mức và chính sách định tuyến. Điều đó không làm cho các mô hình khác nhau trở nên giống hệt nhau, và các nhóm vẫn nên xác thực hành vi riêng của từng mô hình cũng như hỗ trợ endpoint.

Flatkey cung cấp một cổng tương thích OpenAI cho nhiều họ mô hình với khả năng theo dõi mức sử dụng tập trung. Xem giá mô hình hiện tại và các tuyến khả dụng, sau đó so sánh với giá trực tiếp từ nhà cung cấp cho khối lượng công việc và khu vực của bạn.

Bạn cũng có thể dùng so sánh giá mô hình AI rộng hơn và hướng dẫn chi phí DeepSeek vs Qwen chuyên sâu khi xây dựng danh sách rút gọn.

Quy trình làm mới giá DeepSeek theo lịch

Mức độ quan tâm đến giá DeepSeek rất cao và bảng giá có thể thay đổi nhanh chóng. Hãy xem trang này—và mô hình chi phí nội bộ của bạn—như một tài sản được duy trì.

Bước làm mới Bằng chứng cần thu thập Câu hỏi phê duyệt
Kiểm tra bảng giá chính thức của DeepSeek ID mô hình, đầu vào cache-hit, đầu vào cache-miss, đầu ra, đồng thời Có bất kỳ mức giá hoặc tên mô hình nào thay đổi không?
Kiểm tra các thông báo vòng đời Thay đổi alias, ngày ngừng hỗ trợ, ánh xạ phiên bản Mã sản xuất có cần di chuyển không?
Làm mới các nhà cung cấp so sánh Mức giá đại diện hiện tại của OpenAI, Claude, Gemini và Qwen So sánh vẫn công bằng và được nêu rõ điều kiện đi kèm chứ?
Tính toán lại khối lượng công việc Đầu vào, đầu ra, cache, batch, lần thử lại, tác vụ thành công Nhà cung cấp nào có lợi thế kinh tế đã thay đổi cho bất kỳ khối lượng công việc nào không?
Xem xét các điều kiện theo khu vực Khả dụng, thuế, khuyến mãi, tiền tệ, gói dịch vụ Chi phí địa phương có khác biệt đáng kể không?
Xác thực các tuyến nội bộ Trang giá, hướng dẫn so sánh, nội dung hạn mức Tất cả các liên kết chuyển đổi và hướng dẫn còn hoạt động không?
Ghi lại ngày kiểm tra URL nguồn, người duyệt, các trường đã thay đổi, lần xem xét tiếp theo Trang đã sẵn sàng để đăng lại chưa?

Lên lịch xem xét này hàng tháng, và kích hoạt kiểm tra ngoài chu kỳ khi một nhà cung cấp công bố mô hình chủ lực mới, thông báo ngừng hỗ trợ, khuyến mãi hoặc thay đổi tính phí.

Câu hỏi thường gặp

API DeepSeek có giá bao nhiêu?

Vào ngày 27 tháng 7 năm 2026, DeepSeek niêm yết V4 Flash ở mức $0.14 cho mỗi triệu token đầu vào cache-miss, $0.0028 cho mỗi triệu token đầu vào cache-hit, và $0.28 cho mỗi triệu token đầu ra. V4 Pro lần lượt là $0.435, $0.003625 và $0.87. Hãy kiểm tra lại trang giá chính thức trước khi lập ngân sách.

DeepSeek có rẻ hơn OpenAI, Claude, Gemini và Qwen không?

Mức giá token văn bản đã công bố của họ thấp hơn các mô hình đại diện trong ảnh chụp có thời điểm này. Điều đó không chứng minh chi phí thấp nhất trên mỗi tác vụ thành công. Độ dài đầu ra, số lần thử lại, năng lực, caching, điều kiện đủ cho batch và vận hành đều quan trọng.

DeepSeek có tính phí thấp hơn cho đầu vào đã được cache không?

Có. Bảng V4 chính thức công bố một mức giá đầu vào cache-hit riêng, thấp hơn nhiều so với mức cache-miss. Mức tiết kiệm thực tế phụ thuộc vào việc các yêu cầu sản xuất có tạo ra cache-hit hay không.

Tôi nên so sánh mức giá của nhà cung cấp hay mức giá của gateway?

Hãy so sánh cả hai. Mức giá trực tiếp của nhà cung cấp tạo thành đường cơ sở. Giá gateway nên được đánh giá cùng với quyền truy cập đi kèm, thanh toán, định tuyến, khả năng quan sát, hỗ trợ và các kiểm soát vận hành.

Nên cập nhật trang giá DeepSeek bao lâu một lần?

Hàng tháng là một mốc thực tế cho một trang so sánh thương mại. Đồng thời làm mới ngay sau khi ra mắt mô hình, thông báo ngừng hỗ trợ, thay đổi giá hoặc một chương trình khuyến mãi đáng kể.

Quy tắc quyết định

Bắt đầu với bảng token chính thức, nhưng đừng dừng ở đó. Đo một khối lượng công việc đại diện, tách riêng đầu vào có cache và không có cache, bao gồm đầu ra và các lần thử lại, rồi so sánh chi phí trên mỗi tác vụ thành công. Sau đó lên lịch xem xét nguồn để tuyến đường rẻ hôm nay không trở thành giả định lỗi thời vào ngày mai.

Khám phá giá Flatkey để so sánh các tuyến mô hình hiện tại và áp dụng quy trình làm mới vào thực tế.