Nếu ràng buộc chính của bạn là chi phí API, thì quyết định DeepSeek API vs Qwen API không còn đủ gần để có thể đưa ra chỉ bằng trí nhớ. Cả hai nhà cung cấp đều đã thay đổi các dòng mô hình chi phí thấp của họ, và lộ trình rẻ nhất phụ thuộc vào bốn yếu tố: input không được cache, input được cache, khối lượng output, và liệu workload của bạn có thể dùng batch inference hay không.
Hướng dẫn này đã được đối chiếu với giá niêm yết của bên thứ nhất và tài liệu vòng đời mô hình vào Thứ Ba, ngày 28 tháng 7 năm 2026. Câu trả lời ngắn gọn là:
- Qwen Flash có giá niêm yết thô thấp hơn cho hầu hết các workload văn bản không cache, có cache và batch.
- DeepSeek V4 Flash có tỷ lệ cache-hit rất thấp và một endpoint trực tiếp toàn cầu đơn giản hơn, nhưng mức phí cache-miss và output cao hơn của nó có nghĩa là bạn cần một tỷ lệ request thiên về cache bất thường trước khi lợi thế đó làm thay đổi hóa đơn.
- DeepSeek V4 Pro có thể là một ứng viên reasoning ưu tiên chi phí so với các tier Qwen có giá cao hơn, nhưng chất lượng mô hình không thể thay thế lẫn nhau. Hãy kiểm tra chi phí cho tác vụ thành công, không chỉ token.
- Đừng bắt đầu một workflow mới trên Qwen Turbo. Alibaba Cloud liệt kê ngày ngừng hỗ trợ là 30 tháng 11 năm 2026 và khuyến nghị Qwen Flash làm phương án thay thế.
DeepSeek so với Qwen: kết luận về chi phí theo từng workflow
| Workflow | Mặc định ưu tiên chi phí | Lý do | Xác minh trước khi đưa vào sản xuất |
|---|---|---|---|
| Chat ngắn hoặc trích xuất | Qwen Flash | Giá niêm yết input và output thấp hơn | Khu vực, snapshot mô hình chính xác, ngưỡng chất lượng |
| Đánh giá ngoại tuyến khối lượng lớn | Qwen batch inference | Các mô hình đủ điều kiện được giảm 50% cho input và output | Mô hình chính xác và hỗ trợ batch theo khu vực |
| Ngữ cảnh dài lặp lại | Qwen Flash trong hầu hết trường hợp | Giá cơ bản thấp hơn của Qwen lấn át khoản giảm cache của DeepSeek ở tỷ lệ hit thông thường | Đo tỷ lệ cache-hit và chi phí tạo/lưu trữ cache |
| Input cực kỳ thiên về cache | Tính toán cả hai | Input được cache của DeepSeek rất rẻ, nhưng các lượt miss và output của nó lại đắt hơn | Tỷ lệ token, tỷ lệ hit, khối lượng output |
| Tác vụ nặng về reasoning | Kiểm tra DeepSeek V4 Pro và tier Qwen phù hợp | DeepSeek Pro có giá output công bố thấp hơn Qwen 3.7 Plus | Độ chính xác, số lần thử lại, sử dụng công cụ, độ trễ |
| Cài đặt direct-provider nhanh nhất | DeepSeek | Một base URL toàn cầu tương thích OpenAI đã được tài liệu hóa | Yêu cầu về vùng dữ liệu và mua sắm |
| Chuyển đổi mô hình thường xuyên | Gateway và log dùng chung | Chi phí chuyển đổi vận hành có thể xóa sạch khoản tiết kiệm token | Routing, số dư, khả năng quan sát, rollback |
Đây là so sánh chi phí, không phải xếp hạng mô hình tổng quát. Một mô hình cần nhiều lần thử lại hơn, prompt dài hơn, hoặc cần con người chỉnh sửa có thể thua cuộc dù giá token thấp hơn.
Giá API DeepSeek hiện tại
Trang giá của DeepSeek, được cập nhật ngày 28 tháng 7, liệt kê hai mô hình văn bản V4. Giá được tính trên một triệu token.
| Mô hình | Input trúng cache | Input trượt cache | Output | Ngữ cảnh | Output tối đa |
|---|---|---|---|---|---|
deepseek-v4-flash |
$0.0028 |
$0.14 |
$0.28 |
1M |
384K |
deepseek-v4-pro |
$0.003625 |
$0.435 |
$0.87 |
1M |
384K |
DeepSeek tài liệu hóa cơ chế lưu đệm ngữ cảnh tự động và công bố riêng giá cho lượt trúng và trượt. Họ cũng cung cấp một endpoint tương thích OpenAI tại https://api.deepseek.com và một endpoint tương thích Anthropic tại https://api.deepseek.com/anthropic.
Con số đáng chú ý nhất là giá cache-hit của V4 Flash: nó chỉ bằng 2% mức cache-miss. Nhưng khoản giảm giá đó không nên được đánh giá tách biệt. Một lượt miss vẫn đắt hơn giá input chuẩn bậc đầu của Qwen Flash hơn sáu lần, và output của DeepSeek V4 Flash cũng đắt hơn.
Giá API Qwen hiện tại
Alibaba Cloud Model Studio liệt kê giá Qwen theo mô hình, độ dài input, chế độ output và khu vực triển khai. Với triển khai toàn cầu và input lên đến 128K token, hàng chi phí thấp phù hợp là:
| Mô hình | Input chuẩn | Output | Lượt trúng cache ngầm định | Lượt trúng cache tường minh | Giảm giá batch |
|---|---|---|---|---|---|
qwen3.5-flash |
$0.022 |
$0.216 |
20% của giá input chuẩn | 10% của giá input chuẩn | 50% cho các job batch được hỗ trợ |
Với chế độ triển khai Singapore, cùng trang đó liệt kê qwen-flash ở mức $0.05 cho input và $0.40 cho output với prompt lên đến 128K. Khác biệt theo khu vực này là lý do khiến một dự báo Qwen hợp lệ phải ghi rõ chế độ triển khai và endpoint thay vì sao chép một con số nổi bật duy nhất.
Cơ chế cache của Qwen cũng cần được mô hình hóa chính xác:
- Lượt trúng cache ngầm định được tính phí bằng 20% giá input chuẩn.
- Lượt trúng cache tường minh được tính phí bằng 10% giá input chuẩn.
- Việc tạo cache tường minh được tính phí bằng 125% giá input chuẩn và lưu trữ cache được tính riêng.
- Suy luận batch cung cấp cho các mô hình đủ điều kiện mức giảm 50% cho input và output, nhưng đừng giả định các khoản giảm giá có thể cộng dồn trừ khi nhà cung cấp ghi rõ sự kết hợp đó cho mô hình và khu vực của bạn.
Alibaba Cloud cũng lưu ý rằng qwen-flash là một bí danh luân phiên. Hãy cố định một model ID có ngày tháng khi tính tái lập là quan trọng, sau đó lên lịch kiểm thử di chuyển trước khi snapshot đó hết hạn.
Ba phép tính khối lượng công việc
Các công thức dưới đây sử dụng giá niêm yết công khai, không phải khuyến mãi tạm thời hay hợp đồng đã đàm phán. Chúng chỉ so sánh phí token trực tiếp từ nhà cung cấp và không bao gồm thuế, phí mạng, lưu trữ cache và chi phí nhân sự kỹ thuật.
Kịch bản 1: chat ngắn không dùng cache
Giả định:
- 10.000 yêu cầu
- 1.000 token input cho mỗi yêu cầu
- 500 token output cho mỗi yêu cầu
- Không có lượt trúng cache
- Bậc giá đầu tiên của
qwen3.5-flashtoàn cầu
| Tuyến | Tính toán đầu vào | Tính toán đầu ra | Tổng ước tính |
|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
5M × $0.28 = $1.40 |
$2.80 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
5M × $0.216 = $1.08 |
$1.30 |
Với dạng yêu cầu này, Qwen rẻ hơn khoảng 54% theo mức giá niêm yết công khai. Kết quả có thể thay đổi nếu bạn dùng một khu vực Qwen khác, vượt qua bậc đầu tiên của đầu vào, hoặc cần đủ số lần thử lại để xóa đi lợi thế token.
Kịch bản 2: ngữ cảnh dài lặp lại với 90% lượt cache hit
Giả định:
- 10.000 yêu cầu
- 10.000 token đầu vào cho mỗi yêu cầu
- 1.000 token đầu ra cho mỗi yêu cầu
- 90% token đầu vào được tính theo mức giá cache-hit
- Qwen sử dụng cơ chế cache ngầm
| Tuyến | Đầu vào cache miss | Đầu vào cache hit | Đầu ra | Tổng ước tính |
|---|---|---|---|---|
| DeepSeek V4 Flash | 10M × $0.14 = $1.40 |
90M × $0.0028 = $0.252 |
10M × $0.28 = $2.80 |
$4.452 |
| Qwen 3.5 Flash | 10M × $0.022 = $0.22 |
90M × $0.0044 = $0.396 |
10M × $0.216 = $2.16 |
$2.776 |
DeepSeek có tỷ lệ cache-hit thấp hơn, nhưng Qwen vẫn thắng trong kịch bản 90% hit này vì giá cho lượt miss và giá đầu ra của Qwen thấp hơn.
Chỉ tính riêng đầu vào, DeepSeek V4 Flash chỉ trở nên rẻ hơn so với tổ hợp cache ngầm của Qwen khi tỷ lệ cache-hit vào khoảng 98,7% trở lên. Khi tính cả token đầu ra, tỷ lệ hit cần thiết còn cao hơn nữa. Với cơ chế cache rõ ràng của Qwen, giá cho lượt hit bản thân nó thấp hơn DeepSeek, dù vẫn phải cộng thêm chi phí tạo và lưu trữ cache.
Kịch bản 3: xử lý batch ngoại tuyến
Giả định:
- 100 triệu token đầu vào
- 20 triệu token đầu ra
- Mô hình và khu vực của Qwen đủ điều kiện nhận mức giảm giá batch 50% được công bố
- DeepSeek được tính theo giá niêm yết đồng bộ tiêu chuẩn vì trang giá của nó không công bố mức giảm batch tương đương
| Tuyến | Tính toán | Tổng ước tính |
|---|---|---|
| DeepSeek V4 Flash | (100M × $0.14) + (20M × $0.28) |
$19.60 |
| Qwen 3.5 Flash batch | 50% × [(100M × $0.022) + (20M × $0.216)] |
$3.26 |
Đối với các công việc đánh giá, gán nhãn, tóm tắt hoặc tạo dữ liệu tổng hợp có thể chấp nhận độ trễ, điều kiện đủ batch có thể quan trọng hơn những khác biệt nhỏ về cache. Hãy xác nhận rằng đúng mô hình, chế độ triển khai và loại công việc của bạn đủ điều kiện trước khi phê duyệt dự báo.
Công thức hòa vốn tốt hơn
Hãy dùng bảng tính này thay vì so sánh một ô giá token duy nhất:
monthly_cost =
uncached_input_millions × uncached_input_rate
+ cached_input_millions × cached_input_rate
+ output_millions × output_rate
+ cache_creation_cost
+ cache_storage_cost
+ retry_cost
+ platform_or_network_fees
Sau đó tính chi phí trên mỗi tác vụ thành công:
successful_task_cost = monthly_cost / accepted_outputs
Con số thứ hai này nắm bắt các chi phí vận hành mà các bảng token bỏ sót. Nếu một lộ trình rẻ hơn tạo ra nhiều JSON không hợp lệ hơn, lỗi gọi công cụ, chuỗi suy luận dài, hoặc cần rà soát thủ công, thì chi phí thực tế của nó có thể cao hơn.
Những khác biệt vận hành ảnh hưởng đến tổng chi phí
Thiết kế vùng và endpoint
DeepSeek công bố một endpoint trực tiếp toàn cầu. Qwen sử dụng các endpoint Alibaba Cloud Model Studio gắn với chế độ triển khai và khu vực. Cấu hình theo vùng có thể cải thiện quản trị, nhưng cũng ảnh hưởng đến khả năng sẵn có của mô hình, các dòng giá, thông tin xác thực và thiết kế chuyển đổi dự phòng.
Ghi lại các trường này trong mọi phê duyệt:
- Nhà cung cấp và mã mô hình chính xác
- Khu vực hoặc chế độ triển khai
- Base URL
- Bậc độ dài đầu vào
- Chế độ đầu ra thinking hoặc non-thinking
- Phương thức cache
- Điều kiện đủ cho batch
- Ngày kiểm tra giá
Vòng đời mô hình
Qwen Turbo dự kiến sẽ ngừng hoạt động vào 30 tháng 11 năm 2026, và Alibaba Cloud khuyến nghị Qwen Flash làm bản thay thế. Các hệ thống mới không nên xem tên quen thuộc của Turbo hay dòng đầu ra non-thinking thấp hơn như một kế hoạch tiết kiệm bền vững.
Các bí danh luân phiên rất tiện cho thử nghiệm nhưng lại đưa vào rủi ro thay đổi âm thầm. Hãy ghim các phiên bản có ngày trong production, duy trì một bộ đánh giá nhỏ, và kiểm thử phiên bản kế tiếp trước khi ngừng hoạt động.
Chất lượng và ngân sách retry
Đừng so sánh DeepSeek V4 Flash và Qwen Flash như thể chúng tạo ra kết quả giống hệt nhau. Hãy đánh giá từng lộ trình theo tác vụ thực tế: độ chính xác trích xuất, tỷ lệ qua kiểm thử mã, hoàn tất gọi công cụ, tính hợp lệ của đầu ra có cấu trúc, độ trễ và mức chấp nhận của con người.
Một ngưỡng định tuyến thực tế là:
- Loại bỏ các mô hình dưới ngưỡng chất lượng.
- So sánh chi phí trên mỗi đầu ra được chấp nhận giữa các mô hình còn lại.
- Cộng thêm chi phí retry và fallback.
- Canary lộ trình rẻ hơn với ngưỡng rollback.
- Tính toán lại sau tuần đầu tiên của lưu lượng production.
Để có một bộ khung kiểm thử lặp lại, hãy dùng quy trình kiểm thử prompt đa mô hình. Để có bối cảnh về mức giá rộng hơn, hãy so sánh so sánh giá mô hình AI hiện tại và trang bảng giá của Flatkey.
Khi DeepSeek là lựa chọn tốt hơn
DeepSeek đáng để kiểm thử đầu tiên khi:
- Bạn muốn một endpoint trực tiếp toàn cầu đơn giản.
- Khối lượng công việc của bạn có mức tái sử dụng cache được đo lường đặc biệt cao.
- DeepSeek V4 Pro đáp ứng ngưỡng chất lượng suy luận với chi phí trên mỗi tác vụ thành công thấp hơn tier Qwen mà bạn đã thử nghiệm.
- Nhóm của bạn đã vận hành DeepSeek ổn định và công sức di chuyển sẽ vượt quá khoản tiết kiệm dự kiến.
Khi Qwen là lựa chọn tốt hơn
Qwen đáng để kiểm thử đầu tiên khi:
- Chi phí token thô là ràng buộc chính.
- Bạn chạy các prompt ngắn hoặc trung bình không có cache.
- Bạn có các tác vụ chịu được độ trễ và đủ điều kiện cho batch inference.
- Bạn có thể sử dụng cache tường minh hoặc ngầm một cách hiệu quả.
- Mô hình triển khai theo vùng của Alibaba Cloud phù hợp với yêu cầu tuân thủ và vận hành của bạn.
Câu hỏi thường gặp
DeepSeek có rẻ hơn Qwen trong năm 2026 không?
Không phải trên mọi phương diện. Theo giá niêm yết công khai ngày 28 tháng 7, Qwen 3.5 Flash rẻ hơn trong các ví dụ ngắn chưa được cache, đã cache 90% và theo lô đủ điều kiện trong hướng dẫn này. DeepSeek vẫn có thể thắng về chi phí trên mỗi tác vụ thành công, tính đơn giản trong vận hành, hoặc ở một phép so sánh cụ thể thuộc phân khúc cao hơn.
API nào tốt hơn cho tự động hóa khối lượng lớn?
Hãy bắt đầu bằng cách thử Qwen Flash nếu công việc có thể dùng suy luận theo lô hoặc ít nhạy cảm với độ trễ. Hãy thử DeepSeek song song nếu khả năng tái sử dụng cache cực kỳ cao hoặc chất lượng đầu ra của nó giúp giảm số lần thử lại. Phê duyệt tuyến có chi phí thấp nhất trên mỗi kết quả được chấp nhận.
Giá cache của DeepSeek có khiến nó rẻ hơn cho RAG không?
Không tự động. Giá đầu vào khi cache-hit của DeepSeek rất thấp, nhưng mức giá khi cache-miss và đầu ra lại cao hơn các mức bậc đầu tiên của Qwen 3.5 Flash. Hãy đo tỷ lệ hit thực tế, tỷ lệ prompt-to-output và phương thức cache của Qwen trước khi quyết định.
Có nên dùng Qwen Turbo cho một ứng dụng mới không?
Không. Alibaba Cloud niêm yết việc ngừng Qwen Turbo vào ngày 30 tháng 11 năm 2026 và khuyến nghị chuyển sang Qwen Flash.
Nên xem lại giá API bao lâu một lần?
Hãy xem lại hàng tháng đối với các tuyến sản xuất đang hoạt động và ngay lập tức khi nhà cung cấp thay đổi ID mô hình, ngày ngừng hỗ trợ, quy tắc cache, hỗ trợ batch, khả năng sẵn có theo khu vực hoặc giá niêm yết.
Hãy chọn theo lưu lượng sản xuất, không phải theo mức giá tiêu đề
Đối với hầu hết các quy trình làm việc văn bản nhạy cảm với chi phí, Qwen Flash là điểm khởi đầu có giá thấp hơn vào ngày 28 tháng 7 năm 2026. DeepSeek vẫn đáng để thử ở những nơi mà sự đơn giản của endpoint, hành vi cache hoặc chất lượng tác vụ của nó làm giảm tổng chi phí vận hành.
Lưu lại bảng tính kiểu yêu cầu, ghim các phiên bản mô hình chính xác và giữ cho tuyến có thể đảo ngược. Nếu bạn muốn một nơi để thử cả hai nhà cung cấp mà không phải viết lại mã client, hãy bắt đầu với Flatkey integration starter, chạy cùng một bộ đánh giá, và chỉ chuyển lưu lượng sản xuất sau khi các số liệu chi phí trên mỗi kết quả thành công đã ổn định.



