Model and Modality Playbooks22 tháng 9, 2026Flatkey

DeepSeek V4 vs GPT-5: Lựa chọn frontier rẻ nhất?

So sánh giá DeepSeek V4 vs GPT-5, chi phí cache, ngữ cảnh và các kiểm tra định tuyến trước khi chọn tuyến API model rẻ nhất.

DeepSeek V4 vs GPT-5: Lựa chọn frontier rẻ nhất?

DeepSeek V4 vs GPT-5: Lựa chọn frontier rẻ nhất?

DeepSeek V4 vs GPT-5: Lựa chọn frontier rẻ nhất? là một câu hỏi sai nếu bạn chỉ so sánh giá token hiển thị trên một dòng. Đây mới là câu hỏi đúng nếu bạn so sánh một workload thực tế: input không được cache, input đã cache, độ dài output, số lần retry, hỗ trợ tính năng và tuyến bạn có thể xác minh trong production.

Câu trả lời ngắn: các tuyến API DeepSeek V4 hiện tại thường rẻ hơn GPT-5 theo đơn giá token đã công bố, đặc biệt khi bạn có thể dùng deepseek-flash hoặc chạy trong khung giờ thấp điểm của DeepSeek. Nhưng "lựa chọn frontier rẻ nhất" không nên có nghĩa là "luôn chọn DeepSeek." GPT-5 vẫn nên nằm trong phạm vi so sánh khi bạn cần tooling đặc thù của OpenAI, input ảnh qua tuyến GPT, hành vi của Responses API, hoặc một baseline đánh giá GPT quen thuộc. Hãy xem DeepSeek V4 vs GPT-5 là một quyết định về tuyến định tuyến, không phải quyết định về thương hiệu.

Tính đến lần kiểm tra nguồn này vào ngày 22 tháng 9, 2026, tài liệu API của DeepSeek liệt kê deepseek-flash là DeepSeek-V4.1-Flash và deepseek-v4-pro là DeepSeek-V4-Pro-0813. Trang GPT-5 chính thức của OpenAI liệt kê gpt-5 ở mức $1.25 cho mỗi 1M token input, $0.125 cho mỗi 1M token input đã cache, và $10 cho mỗi 1M token output. Điều đó làm chênh lệch giá niêm yết trở nên rõ ràng, nhưng câu trả lời an toàn cho production vẫn là chuẩn hóa theo output đã được chấp nhận.

Câu trả lời nhanh: DeepSeek V4 vs GPT-5

Nếu workload của bạn nhạy cảm về chi phí cho sinh văn bản, hỗ trợ lập trình, rà soát ngữ cảnh dài, hoặc định tuyến agent, hãy bắt đầu bằng cách test DeepSeek V4.1 Flash so với GPT-5. Nếu tuyến này vượt qua các bài smoke test về tính năng và ngưỡng output đã chấp nhận, đó có thể là mặc định có chi phí thấp hơn. Nếu workload phụ thuộc vào hành vi tool đặc thù của GPT, baseline model của OpenAI, hoặc một đường hỗ trợ trực tiếp từ OpenAI, hãy giữ GPT-5 trong danh sách ứng viên.

Điểm quyết địnhTuyến DeepSeek V4Tuyến GPT-5
Chi phí token công bố thấp nhấtThường là deepseek-flash, đặc biệt trong giờ thấp điểmKhông phải rẻ nhất theo giá token
Ứng viên DeepSeek chất lượng cao hơndeepseek-v4-proSo sánh với gpt-5 hoặc một tuyến GPT mới hơn nếu benchmark của bạn cho phép
Ngưỡng context và outputTài liệu DeepSeek liệt kê context 1M và output tối đa 384K cho các model API DeepSeek hiện tạiTài liệu OpenAI liệt kê cửa sổ context 400K, input tối đa 272K và output tối đa 128K cho GPT-5
So sánh input đã cacheTỷ lệ cache-hit của DeepSeek rất thấp trong bảng giá chính thứcInput đã cache của GPT-5 là $0.125 cho mỗi 1M token
Kiểm tra tính năngJSON, tool calls, Responses API, Anthropic API, chế độ thinking, và hỗ trợ vision theo từng modelChat Completions, Responses, streaming, structured outputs, function calling, prompt caching, input ảnh, và các công cụ Responses được hỗ trợ
Hành động Flatkey tốt nhất đầu tiênXác minh deepseek-flashdeepseek-v4-pro trong thư mục model và /v1/modelsXác minh khả dụng của gpt-5 và đúng dòng model GPT mà bạn định gọi

Kết luận thực tế: DeepSeek V4 vs GPT-5 chỉ là một chiến thắng về chi phí cho DeepSeek sau khi parser, tool calls, mục tiêu latency và chính sách fallback của bạn vẫn vượt qua.

Ảnh chụp giá chính thức hiện tại

Giá của DeepSeek tính theo mỗi 1M token và được chia theo cache hit, cache miss, output, cùng các khung giờ peak/off-peak. OpenAI định giá token văn bản GPT-5 với các hàng input, input được cache và output.

Model routeInput cache hitInput cache miss / inputOutputNotes
deepseek-flash off-peak$0.003$0.15$0.60DeepSeek-V4.1-Flash
deepseek-flash peak$0.006$0.30$1.20DeepSeek-V4.1-Flash
deepseek-v4-pro off-peak$0.022$0.66$1.98DeepSeek-V4-Pro-0813
deepseek-v4-pro peak$0.044$1.32$3.96Peak uncached input can be slightly above GPT-5 input
gpt-5 standard$0.125 cached input$1.25 input$10.00OpenAI GPT-5 standard token pricing

Bảng này trả lời câu hỏi hẹp về tốc độ token. DeepSeek Flash rẻ hơn GPT-5 ở tất cả các hàng tốc độ token được liệt kê. DeepSeek V4 Pro rẻ hơn GPT-5 ở input được cache và output, và rẻ hơn ở input chưa cache ngoài giờ off-peak, nhưng hàng input chưa cache trong giờ peak của nó hơi cao hơn input của GPT-5. Vì vậy, câu trả lời chính xác cho DeepSeek V4 vs GPT-5 không phải là "DeepSeek luôn thắng." Mà là "DeepSeek thường thắng trong so sánh tốc độ token, nhưng hãy kiểm tra chính xác thành phần mix."

Công thức chi phí quan trọng

Hãy dùng chi phí theo output được chấp nhận, không phải giá token thô:

accepted_output_cost =
  (
    uncached_input_tokens * input_price
    + cached_input_tokens * cached_input_price
    + output_tokens * output_price
    + retry_tokens
    + fallback_tokens
  )
  / accepted_outputs

Ví dụ, một yêu cầu với 100K token input chưa cache và 20K token output có chi phí khoảng:

RoutePrice windowApproximate request cost before retries
deepseek-flashoff-peak$0.027
deepseek-flashpeak$0.054
deepseek-v4-prooff-peak$0.1056
deepseek-v4-propeak$0.2112
gpt-5standard$0.325

Cùng phép tính đó sẽ có lợi hơn cho DeepSeek khi input cache-hit chiếm ưu thế. Nó sẽ kém thuận lợi hơn nếu route DeepSeek của bạn cần nhiều lần retry hơn, tạo ra nhiều JSON bị từ chối hơn, hoặc phải fallback sang model khác thường xuyên hơn.

Đó là lý do quyết định DeepSeek V4 vs GPT-5 nên được ghi log theo từng workload. Một câu trả lời rẻ nhưng ứng dụng của bạn từ chối thì không còn rẻ nữa.

Tại sao peak và off-peak làm thay đổi câu trả lời

Trang giá của DeepSeek cho biết mức off-peak chỉ bằng một nửa mức peak. Trang này định nghĩa giờ peak là 01:00-04:00 và 06:00-10:00 UTC, từ thứ Hai đến thứ Sáu, không tính ngày lễ công cộng của Trung Quốc. Tất cả các giờ còn lại đều là off-peak, bao gồm cuối tuần và các ngày lễ công cộng của Trung Quốc.

Nếu lưu lượng của bạn có thể xử lý theo lô, xếp hàng, hoặc mang tính agentic hơn là chặn người dùng, việc lên lịch ngoài giờ peak có thể làm thay đổi đáng kể kết quả DeepSeek V4 vs GPT-5. Với lưu lượng tương tác, hãy giả định rằng một số yêu cầu sẽ rơi vào khung giờ peak và lập ngân sách theo hàng cao hơn.

Hãy dùng quy tắc này:

Loại khối lượng công việcGiả định giá an toàn hơn
Chat thời gian thực, trợ lý lập trình, tác nhân hướng tới người dùngDự trù DeepSeek ở mức giá cao nhất trừ khi dữ liệu lưu lượng của bạn chứng minh điều ngược lại
Tóm tắt theo lô, đánh giá ban đêm, tác vụ làm giàu dữ liệuCân nhắc lên lịch ngoài giờ cao điểm, sau đó xác minh nhật ký sử dụng thực tế
Quy trình tác nhân hỗn hợpTách các luồng tiền cảnh và hậu cảnh
Lập ngân sách doanh nghiệpGhi cả các dòng giờ cao điểm và ngoài giờ cao điểm trong bảng điểm mô hình

Mức độ phù hợp tính năng trước khi xét mức giá

Bảng giá không thể cho bạn biết liệu một tuyến mô hình có phù hợp với sản phẩm của bạn hay không. Trước khi chuyển lưu lượng sản xuất, hãy kiểm thử các tính năng mà ứng dụng của bạn thực sự sử dụng.

Tính năngKiểm tra tuyến DeepSeek V4Kiểm tra tuyến GPT-5
Chat completionsPrompt ngắn không streaming và streamingPrompt ngắn không streaming và streaming
Responses APIXác nhận các tham số được hỗ trợ và các trường bị bỏ quaXác nhận hành vi Responses và đầu ra công cụ
JSON / đầu ra có cấu trúcXác thực theo schema của bạn và đường dẫn sửa lỗiXác thực theo schema của bạn và đường dẫn sửa lỗi
Lời gọi công cụPhân tích đối số lời gọi công cụ và các lần thử lạiPhân tích đối số lời gọi công cụ và các lần thử lại
Ngữ cảnh dàiKiểm thử các đầu vào dài thực tế, không phải nhồi token giả lậpKiểm thử các đầu vào dài thực tế, không phải nhồi token giả lập
VisionTài liệu DeepSeek liệt kê vision cho Flash và không cho ProTài liệu OpenAI liệt kê đầu vào hình ảnh cho GPT-5
Đọc lại mức sử dụngXác nhận model, số token, chi phí, trạng thái và độ trễXác nhận model, số token, chi phí, trạng thái và độ trễ

Đừng cho rằng tương thích với OpenAI đồng nghĩa với hành vi giống hệt. Điều đó chỉ có nghĩa là bề mặt tích hợp có thể đủ tương đồng để kiểm thử nhanh. Quyết định DeepSeek V4 vs GPT-5 vẫn phải vượt qua bộ phân tích cú pháp, lớp công cụ và ngưỡng chấp nhận của người dùng của bạn.

Đi trực tiếp với nhà cung cấp hay dùng bộ định tuyến Flatkey?

Bạn có thể so sánh trực tiếp DeepSeek V4 và GPT-5 bằng khóa nhà cung cấp. Bạn cũng có thể định tuyến cả hai qua Flatkey khi bạn muốn một client tương thích OpenAI, một số dư, một danh mục model và một luồng rà soát mức sử dụng duy nhất.

Hướng dẫn bắt đầu nhanh của Flatkey cho thấy SDK OpenAI trỏ tới:

https://router.flatkey.ai/v1

Lợi thế vận hành không phải là bộ định tuyến kỳ diệu biến mọi model thành tương đương. Lợi thế là bạn có thể giữ client ổn định trong khi thay đổi model ID, rồi xem lại mức sử dụng token và chi phí tại một nơi.

Sử dụng bản ghi tuyến này trước khi kiểm thử:

route_test:
  question: "DeepSeek V4 vs GPT-5"
  base_url: "https://router.flatkey.ai/v1"
  candidates:
    - deepseek-flash
    - deepseek-v4-pro
    - gpt-5
  required_checks:
    - account_accessible_model_ids
    - pricing_units
    - feature_smoke_tests
    - usage_log_readback
    - accepted_output_cost
    - fallback_policy
  launch_rule: "Chỉ triển khai khi cả chi phí đầu ra được chấp nhận và chất lượng đều đạt"

Đối với chi tiết thiết lập, hãy sử dụng hướng dẫn truy cập DeepSeek APIFlatkey API quickstart. Nếu bạn đang thay thế các chuỗi model DeepSeek cũ, hãy sử dụng DeepSeek V4 migration checklist trước khi thay đổi cấu hình production.

Bảng điểm thực tế

Hãy dùng bảng điểm này thay vì kết luận chỉ bằng một câu là “model rẻ nhất”.

CriterionWeightHow to score it
Accepted-output cost30%Chi phí sau khi tính retries, output bị từ chối, và fallback
Feature compatibility20%Streaming, tools, JSON, image input, long context, Responses API
Latency and concurrency15%p50, p90, tỷ lệ timeout, giới hạn của nhà cung cấp
Quality on your task20%Tỷ lệ pass của eval, review thủ công, tỷ lệ lỗi, mức chấp nhận của khách hàng
Operational control10%Usage logs, rollback, allowlists, review billing
Vendor or compliance requirement5%Hợp đồng, kiểm soát dữ liệu, yêu cầu dùng trực tiếp nhà cung cấp

DeepSeek thường nên thắng ở hàng đầu tiên. GPT-5 có thể thắng hoặc vẫn cần thiết ở các hàng về tính năng, baseline, hoặc kiểm soát nhà cung cấp. Flatkey hữu ích khi vấn đề thực sự của bạn là chuyển tuyến mà không phải viết lại ứng dụng mỗi khi model thay đổi.

Khi DeepSeek V4 là mặc định tốt hơn

Chọn DeepSeek V4 trước khi:

  • Bạn nhạy cảm với chi phí và có thể đánh giá nhanh chất lượng output được chấp nhận.
  • Workload của bạn nặng về văn bản, code, hoặc ngữ cảnh dài.
  • Ứng dụng của bạn có thể chuyển các tác vụ batch sang khung giờ thấp điểm.
  • Bạn có thể chấp nhận kiểm thử hành vi tính năng trước khi ra mắt.
  • Bạn muốn một ứng viên chi phí thấp bên cạnh các route Qwen, Gemini, Claude, và GPT.

Đây là lúc DeepSeek V4 vs GPT-5 trở thành một câu trả lời SEO mạnh và một câu trả lời sản phẩm thực tế: DeepSeek là route nên thử đầu tiên khi áp lực chi phí là có thật.

Khi GPT-5 vẫn nên nằm trong bài kiểm thử

Hãy giữ GPT-5 trong phép so sánh khi:

  • Baseline eval hiện tại của bạn được xây dựng trên GPT-5.
  • Bạn phụ thuộc vào các tools của OpenAI-specific Responses API hoặc hành vi image-input.
  • Bạn cần hỗ trợ trực tiếp từ OpenAI, procurement, hoặc sự đồng bộ về tài liệu.
  • Sản phẩm của bạn đã hiển thị sẵn route GPT cho khách hàng.
  • Một model OpenAI mới hơn mới là mục tiêu thực sự, nhưng GPT-5 vẫn là điểm so sánh kế thừa.

Một lưu ý quan trọng: tài liệu GPT-5 hiện tại của OpenAI mô tả GPT-5 là model trước đây của họ cho các tác vụ coding, reasoning, và agentic, và khuyến nghị GPT-6 Astra là model mới nhất. Nếu người mua đang hỏi về route frontier mới nhất của OpenAI thay vì riêng GPT-5, đừng âm thầm giả vờ GPT-5 là lựa chọn OpenAI mới nhất. Hãy giữ khớp với tiêu đề bài viết, nhưng cập nhật cuộc trao đổi với người mua.

Khuyến nghị cuối cùng

Với hầu hết các workflow API nhạy cảm về chi phí, DeepSeek V4 vs GPT-5 bắt đầu bằng chiến thắng của DeepSeek về giá token công bố. Hãy dùng deepseek-flash làm bài test đầu tiên chi phí thấp, thêm deepseek-v4-pro khi bạn cần một ứng viên DeepSeek cao cấp hơn, và giữ gpt-5 làm baseline GPT khi hành vi đặc thù của OpenAI là quan trọng.

Sau đó đưa ra quyết định cuối cùng từ logs:

  1. Xác minh model ID thông qua tài liệu của nhà cung cấp hoặc thư mục model của Flatkey.
  2. Chạy cùng một bộ prompt qua DeepSeek và GPT-5.
  3. Đo chi phí của output được chấp nhận, không phải chi phí token thô.
  4. Kiểm tra usage logs cho model, số lượng token, chi phí, trạng thái và độ trễ.
  5. Chỉ ưu tiên tuyến rẻ nhất nếu chất lượng, hành vi parser và rủi ro fallback đều đạt yêu cầu.

Vai trò của Flatkey là làm cho bài kiểm thử đó có thể đảo ngược: một OpenAI-compatible base URL, một key, một model catalog và một nơi để xem usage. Đó là cách an toàn nhất để trả lời DeepSeek V4 vs GPT-5: Lựa chọn frontier rẻ nhất? mà không biến một bài viết về giá thành một tuyên bố benchmark không được hỗ trợ.

Câu hỏi thường gặp

DeepSeek V4 có rẻ hơn GPT-5 không?

Dựa trên các mức token được công bố hiện tại, DeepSeek Flash rẻ hơn GPT-5 ở tất cả các hàng token được liệt kê, và DeepSeek V4 Pro rẻ hơn ở output và cached input. Peak uncached input của DeepSeek V4 Pro hơi cao hơn input của GPT-5, vì vậy câu trả lời chính xác còn phụ thuộc vào tỷ lệ input, cache, output và peak/off-peak của bạn.

DeepSeek V4 Pro có giống DeepSeek V4.1 Flash không?

Không. Bảng giá hiện tại của DeepSeek liệt kê deepseek-flash là DeepSeek-V4.1-Flash và deepseek-v4-pro là DeepSeek-V4-Pro-0813. Hãy xem chúng là các tuyến model riêng biệt với giá và kiểm tra tính năng riêng.

Tôi có nên thay GPT-5 bằng DeepSeek V4 không?

Chỉ thay sau khi kiểm thử trên workload. DeepSeek có thể là tuyến rẻ hơn, nhưng bạn vẫn cần kiểm tra output được chấp nhận, tool calls, hành vi JSON, độ trễ, usage logs và khả năng rollback.

Tôi có thể so sánh cả hai qua một OpenAI-compatible client không?

Có. Với Flatkey, hãy trỏ OpenAI SDK tới https://router.flatkey.ai/v1, dùng Flatkey API key và đổi tham số model sang tuyến ứng viên bạn đang kiểm thử. Xác minh các model ID có sẵn trước khi triển khai.

Tôi nên đọc những trang nội bộ nào của Flatkey tiếp theo?

Bắt đầu với DeepSeek API access, DeepSeek V4 migration, DeepSeek V4 Pro vs Flash, Claude vs GPT API routing, và AI model catalog guide.