Cost, Billing, and Ops8 tháng 9, 2026Flatkey Team

Các trường hợp sử dụng máy tính chi phí LLM theo từng giai đoạn phễu

Tìm hiểu chỉ số máy tính chi phí LLM nào phù hợp ở từng giai đoạn phễu, từ ước tính cơ hội sơ bộ đến chi phí cho mỗi tác vụ được chấp nhận, ngân sách kích hoạt, kiểm tra biên lợi nhuận và cảnh báo lệch giữ chân.

Các trường hợp sử dụng máy tính chi phí LLM theo từng giai đoạn phễu

Máy tính chi phí LLM chỉ hữu ích khi nó trả lời đúng câu hỏi kinh doanh. Cùng một phép tính token có thể hỗ trợ một nhà sáng lập ước tính một tính năng mới, một đội tăng trưởng lập kế hoạch ra mắt, một quản lý sản phẩm so sánh chất lượng mô hình, hoặc một trưởng vận hành cố gắng ngăn một quy trình tác tử chạy mất kiểm soát. Các đầu vào có thể chồng lấp, nhưng quyết định ở mỗi giai đoạn phễu lại khác nhau.

Hướng dẫn này ánh xạ các trường hợp sử dụng thực tế của máy tính chi phí LLM theo từng giai đoạn phễu, từ nhận biết đến giữ chân. Hãy dùng nó khi bạn đã hiểu cơ bản về giá token và cần một cách lặp lại để quyết định nên thử gì, nên triển khai gì, và nên theo dõi gì sau khi ra mắt.

Câu trả lời nhanh

Hãy dùng máy tính chi phí LLM để đưa ra một quyết định cho mỗi giai đoạn phễu:

Funnel stageCâu hỏi của máy tínhKết quả tốt nhất
AwarenessTrường hợp sử dụng này có đáng để khám phá không?Khoảng chi phí hàng tháng ước tính
EvaluationChúng ta nên thử mô hình hoặc tuyến nào trước?So sánh các kịch bản
ActivationNgười dùng có thể đạt được giá trị mà không làm vỡ ngân sách không?Chi phí trên mỗi người dùng đã kích hoạt
ConversionChi phí AI có phù hợp với mô hình biên lợi nhuận không?Chi phí trên mỗi kết quả đủ điều kiện
RetentionTải công việc nào đang trôi lệch hoặc làm lãng phí chi tiêu?Ngưỡng kiểm soát ngân sách và cảnh báo

Phần lớn các đội làm cho máy tính trở nên quá chung chung. Một máy tính chi phí LLM tốt hơn sẽ bắt đầu từ giai đoạn, rồi chọn chỉ số phù hợp với quyết định kế tiếp.

Máy tính chi phí LLM nên đo lường gì

Công thức cơ bản rất đơn giản:

estimated_cost =
  (input_tokens / 1,000,000 * input_price)
+ (output_tokens / 1,000,000 * output_price)
+ cache_write_cost
+ cached_input_cost
+ tool_call_cost
+ image_audio_or_video_cost
+ retry_and_fallback_cost

Công thức đó là cần thiết, nhưng chưa đủ. Nó cho bạn biết hóa đơn của nhà cung cấp, chứ không cho biết tải công việc có lành mạnh hay không.

Một máy tính chi phí LLM thực tế cũng nên theo dõi:

TrườngVì sao quan trọng
Tỷ lệ tác vụ được chấp nhậnKết quả rẻ sẽ trở nên đắt nếu con người từ chối chúng
Tỷ lệ thử lạiCác lần thử lại ẩn có thể xóa sạch khoản tiết kiệm từ giá mô hình
Tỷ lệ cache hitNgữ cảnh được tái sử dụng làm thay đổi chi phí đầu vào hiệu dụng
Số lần gọi công cụ trên mỗi tác vụTác tử có thể chi cho công cụ nhiều hơn so với token văn bản
Phút rà soát của con ngườiMột số quy trình làm việc "rẻ" lại chuyển chi phí sang người vận hành
Khoảng độ trễCác tuyến chậm hơn có thể giảm chi phí API nhưng làm giảm chuyển đổi
Người chịu trách nhiệm ngân sáchChi tiêu cần có chủ sở hữu là đội, sản phẩm hoặc chiến dịch

Để biết các mức giá hiện tại theo từng token, hãy luôn kiểm tra các tham chiếu giá trực tiếp như trang giá của OpenAI API, trang giá Anthropic, trang giá Google Gemini API, và bảng giá Flatkey cùng thư mục mô hình. Các trang giá của nhà cung cấp hiện nay thường tách riêng chi phí cho đầu vào, đầu vào được cache, đầu ra, batch, theo khu vực, và theo từng phương thức, nên các giả định cũ của máy tính có thể cho ra câu trả lời sai.

Giai đoạn Nhận thức: Ước tính liệu trường hợp sử dụng có khả thi hay không

Ở giai đoạn nhận thức, người đọc đang tự hỏi: "AI có thể giúp với quy trình này không, và chi phí có hợp lý chút nào không?"

Máy tính chi phí LLM nên giữ ở mức ước lượng thô. Đừng giả vờ chính xác trước khi bạn có prompt thực tế, độ dài đầu ra thực tế hoặc tỷ lệ chấp nhận thực tế. Hãy dùng các khoảng:

Đầu vàoƯớc tính thấpƯớc tính cao
Số yêu cầu mỗi tháng10,000100,000
Số token đầu vào mỗi yêu cầu5004,000
Số token đầu ra mỗi yêu cầu2002,000
Tỷ lệ thử lại0%20%
Tỷ lệ đầu ra được chấp nhận80%40%

Quyết định không phải là "mô hình nào rẻ nhất?" Quyết định là trường hợp sử dụng này có nên nằm trong lộ trình hay không. Nếu ước tính cao nhất vẫn chấp nhận được, hãy chạy một nguyên mẫu. Nếu ước tính cao nhất làm hỏng bài toán kinh doanh, hãy thu nhỏ quy trình trước khi chọn mô hình: tóm tắt ít ngữ cảnh hơn, giới hạn độ dài đầu ra, trì hoãn nội dung đa phương tiện phong phú, hoặc xem liệu một bước dựa trên quy tắc có thể loại bỏ một phần prompt hay không.

Các trường hợp sử dụng tốt nhất ở giai đoạn nhận thức:

Trường hợp sử dụngKết quả của máy tính
Ý tưởng tính năng AI mớiPhạm vi chi phí API hàng tháng
Quy trình nội dung hoặc nghiên cứuChi phí cho mỗi bản nháp hoặc bản tóm tắt
Triển khai trợ lý lập trình nội bộChi phí cho mỗi nhà phát triển đang hoạt động
Trợ lý hỗ trợ khách hàngPhạm vi chi phí cho mỗi ticket được giải quyết

Ở giai đoạn này, một máy tính chi phí LLM tốt nên giúp cuộc họp tiếp theo ngắn hơn. Nó không nên cố gắng trở thành một mô hình mua sắm/phê duyệt đầy đủ.

Giai đoạn Đánh giá: So sánh các mô hình và lựa chọn định tuyến

Ở giai đoạn đánh giá, nhóm đã có các prompt mẫu và muốn chọn một mô hình, tuyến định tuyến, hoặc thiết lập gateway để thử nghiệm. Đây là lúc máy tính chi phí LLM trở thành công cụ so sánh các kịch bản.

Sử dụng cùng một khối lượng công việc cho mọi dòng:

Kịch bảnToken đầu vàoToken đầu raTỷ lệ cache hitTỷ lệ thử lạiTỷ lệ chấp nhậnChi phí cho mỗi tác vụ được chấp nhận
Mô hình nhanh1,20045020%12%72%Tính toán
Mô hình suy luận mạnh hơn1,20065020%5%88%Tính toán
Tuyến ngữ cảnh được cache1,20045065%8%78%Tính toán
Tuyến dự phòng1,20045020%3%82%Tính toán

Chỉ số then chốt là chi phí trên mỗi tác vụ được chấp nhận:

cost_per_accepted_task =
  total_api_cost / accepted_outputs

Điều này quan trọng vì giá token thấp hơn không phải lúc nào cũng làm giảm chi phí vận hành. Một mô hình rẻ hơn nhưng cần nhiều lần thử lại hơn, prompt dài hơn, hoặc nhiều chỉnh sửa thủ công hơn có thể thua một mô hình có giá cao hơn nhưng tỷ lệ đầu ra được chấp nhận tốt hơn.

Đối với các nhóm sử dụng Flatkey, đây là giai đoạn mà một thư mục mô hình hợp nhất và một endpoint tương thích OpenAI sẽ giúp ích. Bạn có thể so sánh giá mô hình, độ dài ngữ cảnh, tình trạng route và mức sử dụng trong cùng một quy trình mua sắm thay vì phải chuyển qua lại giữa nhiều dashboard của nhà cung cấp. Máy tính vẫn cần dữ liệu khối lượng công việc của bạn; Flatkey cung cấp bề mặt tính cước và định tuyến. Để có một bảng tính chi tiết hơn, hãy kết hợp bài viết này với quy trình LLM Cost Calculator for Growth Teams.

Giai đoạn Activation: Lập ngân sách cho hành trình người dùng thực đầu tiên

Activation là giai đoạn đầu tiên mà hành vi người dùng trở nên quan trọng. Bạn không còn chỉ tính một prompt nữa. Bạn đang tính một hành trình:

activation_cost =
  signup_intake
+ first_generation
+ rewrite_or_retry
+ explanation_or_chat_followup
+ optional tool calls

Một LLM cost calculator cho activation nên trả lời: "Người dùng mới có thể đạt đến khoảnh khắc aha trong ngân sách của chúng ta không?"

Các chỉ số hữu ích ở giai đoạn activation:

Chỉ sốVí dụ sử dụng
Chi phí trên mỗi người dùng đã kích hoạtKinh tế của bản dùng thử miễn phí và onboarding
Chi phí cho mỗi tác vụ đầu tiên thành côngRào chắn cho tăng trưởng do sản phẩm dẫn dắt
Chi phí cho mỗi phiên onboardingLập kế hoạch demo có hỗ trợ bán hàng
Chi phí cho mỗi lần thiết lập agentKích hoạt công cụ dành cho developer

Đây cũng là giai đoạn phù hợp để thêm giới hạn ngân sách. Một người dùng miễn phí có thể được dùng model chi phí thấp hơn, context ngắn hơn hoặc ít lần thử lại hơn. Một người dùng trial đủ điều kiện có thể được dùng model mạnh hơn vì khoảnh khắc activation đáng giá hơn. Một buổi demo bán hàng có thể dùng route cao cấp vì mục tiêu là tạo niềm tin, chứ không phải tối thiểu hóa chi phí đơn vị.

LLM cost calculator của bạn nên làm cho các chính sách đó trở nên rõ ràng. Nếu đội ngũ chỉ thấy chi tiêu hàng tháng gộp chung, họ sẽ không biết activation có quá đắt hay workload retention đang ngốn ngân sách.

Giai đoạn Conversion: Gắn chi phí AI với doanh thu hoặc pipeline

Ở giai đoạn conversion, máy tính nên ngừng chỉ nói bằng token. Nó nên kết nối chi phí mô hình với doanh thu, pipeline hoặc biên lợi nhuận.

Sử dụng góc nhìn chi phí theo phễu:

Quy trình conversionChỉ số của máy tínhQuyết định
Nghiên cứu sales bằng AIChi phí cho mỗi bản tóm tắt account đủ điều kiệnGiữ nếu nó cải thiện năng suất của sales rep
Soạn thảo đề xuất bằng AIChi phí cho mỗi đề xuất được chấp nhậnGiữ nếu biên lợi nhuận gộp hỗ trợ được
Tạo nội dung sáng tạo cho ecommerceChi phí cho mỗi creative được phê duyệtGiữ nếu tốc độ thử nghiệm sáng tạo được cải thiện
Soạn thảo xử lý leo thang hỗ trợChi phí cho mỗi escalation được giải quyếtGiữ nếu nó giảm thời gian xử lý
Quy trình agent cho developerChi phí cho mỗi thay đổi được merge hoặc tác vụ được chấp nhậnGiữ nếu thời gian chu kỳ kỹ thuật được cải thiện

LLM cost calculator nên bao gồm cả các chi phí không phải token ở đây:

gross_workflow_cost =
  api_cost
+ tool_cost
+ review_minutes * loaded_hourly_rate
+ failed_output_cost

Sau đó so sánh nó với chỉ số giá trị:

cost_as_percentage_of_value =
  gross_workflow_cost / revenue_or_pipeline_value

Bạn không cần một mô hình phân bổ hoàn hảo để đưa ra quyết định tốt hơn. Bạn cần một máy tính giúp tách biệt một bản demo rẻ tiền với một quy trình làm việc có lợi nhuận.

Giai đoạn giữ chân: theo dõi drift, lãng phí và tình trạng route

Retention là nơi logic của máy tính trở thành vận hành. Sau khi ra mắt, cùng một bảng tính nên trở thành một dashboard hoặc một bản đánh giá định kỳ.

Hãy theo dõi:

Tín hiệuĐiều đó có thể có nghĩa là
Input tokens trên mỗi tác vụ tăngPrompts đang tích lũy ngữ cảnh mà không được cắt gọn
Output tokens tăngPhản hồi quá dài dòng hoặc max tokens quá cao
Tỷ lệ cache hit giảmNgữ cảnh được dùng lại không được cấu trúc đúng cách
Tỷ lệ retry tăngChất lượng prompt, model hoặc route đã thay đổi
Chi phí trên mỗi tác vụ được chấp nhận tăngNgười dùng đang từ chối nhiều đầu ra hơn
Số lần gọi công cụ trên mỗi tác vụ tăngKế hoạch của agent đang bị lặp vòng hoặc tìm kiếm quá mức

Đây là lúc sổ cái ở cấp request trở nên quan trọng. Flatkey định vị bề mặt sử dụng của mình xoay quanh một khóa, một số dư và khả năng hiển thị mức sử dụng theo từng request trên các model và công cụ. Với kiểm soát chi phí ở giai đoạn retention, điều đó có nghĩa là các nhóm có thể xem xét số lượng token, số tiền chi tiêu, request ID, ngân sách và allowlist trong cùng một lớp vận hành thay vì phải đối soát nhiều bản xuất từ nhà cung cấp. Nếu giai đoạn này là vấn đề chính của bạn, hãy xem thêm dự báo chi tiêu AI APIgiới hạn quota AI API.

Retention cũng là nơi dành cho các cảnh báo:

Cảnh báoĐiều kiện kích hoạt
Cảnh báo cho chủ ngân sáchDự án đạt 80% mức trần hàng tháng
Cảnh báo drift promptMedian input tokens tăng 25% so với tuần trước
Cảnh báo retryTỷ lệ retry vượt ngưỡng đã thống nhất
Cảnh báo chuyển modelRoute dự phòng trở thành route chính
Cảnh báo mức độ chấp nhậnTỷ lệ tác vụ được chấp nhận giảm xuống dưới mục tiêu

Máy tính chi phí LLM không còn chỉ là một tệp lập kế hoạch. Nó trở thành chuẩn để giải thích vì sao chi tiêu thay đổi.

Mẫu máy tính phễu có thể sao chép

Hãy dùng cấu trúc bảng tính này:

CộtMô tả
Giai đoạn phễuNhận biết, đánh giá, kích hoạt, chuyển đổi, giữ chân
Tên quy trình làm việcNhiệm vụ cụ thể, không phải một lĩnh vực sản phẩm rộng
Chủ sở hữuNhóm, dự án, chiến dịch hoặc chủ sở hữu sản phẩm
Số yêu cầu mỗi kỳKhối lượng dự kiến hàng tháng hoặc hàng tuần
Token đầu vào trên mỗi yêu cầuTrung vị và p90 khi có
Token đầu ra trên mỗi yêu cầuTrung vị và p90 khi có
Tỷ lệ đầu vào được lưu đệmPhần trăm ngữ cảnh có thể tái sử dụng
Số lần gọi công cụ trên mỗi yêu cầuTìm kiếm, trình duyệt, làm giàu dữ liệu, tệp, hình ảnh hoặc các công cụ khác
Tỷ lệ thử lại/điều phối dự phòngCác lần gọi bổ sung do lỗi, đầu ra kém hoặc chính sách dự phòng
Tỷ lệ tác vụ được chấp nhậnPhần trăm đầu ra đạt tới người dùng hoặc mục tiêu kinh doanh
Chi phí APIChi phí token, phương thức và công cụ
Chi phí rà soátThời gian rà soát hoặc sửa chữa của con người
Chi phí trên mỗi tác vụ được chấp nhậnChỉ số so sánh cuối cùng
Quyết định theo giai đoạnKhám phá, thử nghiệm, ra mắt, mở rộng, giới hạn hoặc ngừng

Hãy giữ cho quyết định theo giai đoạn thật rõ ràng. Nếu không, bảng tính sẽ chỉ là một tài liệu báo cáo khác mà mọi người đọc nhưng không ai hành động.

Các lỗi thường gặp

Lỗi phổ biến nhất của máy tính chi phí LLM là dùng giá token như câu trả lời cuối cùng. Giá token chỉ là một đầu vào. Chỉ số quyết định thường là chi phí trên mỗi tác vụ được chấp nhận, chi phí trên mỗi người dùng được kích hoạt hoặc chi phí trên mỗi kết quả đủ điều kiện.

Các lỗi khác:

LỗiCách khắc phục
Bỏ qua token đầu raĐầu ra của mô hình có thể chiếm phần lớn chi phí trong các quy trình làm việc dài dòng
Bỏ qua các lần thử lạiTheo dõi các cuộc gọi thất bại, đầu ra yếu và các lần thử dự phòng
Lấy trung bình tất cả người dùng với nhauPhân đoạn theo giai đoạn phễu và chủ sở hữu khối lượng công việc
Quên hành vi của bộ nhớ đệmTách đầu vào mới khỏi ngữ cảnh được lưu đệm hoặc lặp lại
Bỏ qua các công cụQuy trình tác nhân có thể gọi các công cụ tìm kiếm, trình duyệt, làm giàu dữ liệu, hình ảnh hoặc video
Sử dụng giá cũLiên kết máy tính với các trang giá trực tiếp và làm mới trước khi ra mắt
Chỉ so sánh các mô hình về chi phíBao gồm tỷ lệ đầu ra được chấp nhận, độ trễ và gánh nặng rà soát

Flatkey phù hợp ở đâu

Flatkey hữu ích khi máy tính cần chuyển từ bảng tính sang quy trình vận hành. Một nhóm có thể định tuyến các cuộc gọi mô hình thông qua một URL gốc tương thích với OpenAI, so sánh các mô hình trong danh mục mô hình, giám sát mức sử dụng và chi phí, và giữ các cuộc gọi mô hình và công cụ trên một bề mặt thanh toán. Quyết định kiến trúc rộng hơn được trình bày trong hướng dẫn về AI API gateway, trong khi các nguyên tắc cơ bản về giá được trình bày trong AI Model Pricing là gì và khi nào nó quan trọng?.

Điều đó không loại bỏ nhu cầu kỷ luật trong việc tính toán. Bạn vẫn cần xác định các giai đoạn, chủ sở hữu, chỉ số đầu ra được chấp nhận và các giới hạn ngân sách. Điểm khác biệt là dữ liệu sử dụng và các điều khiển sẽ dễ tập trung hơn khi các cuộc gọi mô hình, cuộc gọi công cụ, ngân sách, danh sách cho phép và bản ghi sử dụng ở cấp yêu cầu cùng nằm trong một lớp.

Nếu bạn đang xây dựng phiên bản đầu tiên của một máy tính chi phí LLM, hãy bắt đầu đơn giản:

  1. Chọn một giai đoạn của phễu.
  2. Chọn một quy trình làm việc.
  3. Ước tính khối lượng yêu cầu và dạng token.
  4. Thêm các giả định về retry, cache và gọi công cụ.
  5. Tính chi phí cho mỗi tác vụ được chấp nhận.
  6. So sánh hai hoặc ba tùy chọn mô hình hoặc tuyến xử lý.
  7. Thiết lập một chủ sở hữu ngân sách và nhịp rà soát.

Sau đó, kết nối máy tính với mức sử dụng thực tế trước khi quy trình làm việc mở rộng.

Câu hỏi thường gặp

Trường hợp sử dụng chính của máy tính chi phí LLM là gì?

Trường hợp sử dụng chính của máy tính chi phí LLM là quyết định liệu một quy trình AI có đáng để thử nghiệm, ra mắt, mở rộng hay giới hạn hay không. Đầu ra tốt nhất của máy tính phụ thuộc vào giai đoạn của phễu: phạm vi hàng tháng cho nhận biết, chi phí cho mỗi tác vụ được chấp nhận cho đánh giá, chi phí cho mỗi người dùng được kích hoạt cho kích hoạt, tác động biên lợi nhuận cho chuyển đổi, và cảnh báo sai lệch cho duy trì.

Máy tính chi phí LLM có nên so sánh trực tiếp giá mô hình không?

Có, nhưng so sánh trực tiếp giá mô hình chỉ là lớp đầu tiên. Hãy so sánh giá đầu vào, giá đầu ra, đầu vào được lưu cache, tùy chọn batch, độ trễ, tỷ lệ retry, tỷ lệ đầu ra được chấp nhận và chi phí công cụ. Đầu ra hữu ích không phải là "mô hình rẻ nhất." Mà là mô hình hoặc tuyến xử lý tạo ra chi phí cho mỗi tác vụ được chấp nhận tốt nhất cho quy trình làm việc cụ thể.

Các nhóm nên làm mới các giả định của máy tính với tần suất thế nào?

Hãy làm mới các giả định trước một đợt ra mắt lớn, sau khi đổi mô hình, sau khi viết lại prompt, sau một đợt tăng đột biến lưu lượng, và trong lần rà soát ngân sách hàng tháng. Giá của nhà cung cấp và hành vi mô hình có thể thay đổi, vì vậy các trang giá trực tiếp và hồ sơ sử dụng ở cấp độ yêu cầu nên là nguồn sự thật.

Gateway thay đổi cách hoạt động của máy tính chi phí LLM như thế nào?

Một gateway không thay đổi phép tính cốt lõi, nhưng nó có thể giúp dữ liệu dễ thu thập hơn. Nếu các lệnh gọi mô hình, lệnh gọi công cụ, ngân sách, danh sách cho phép và sổ cái yêu cầu nằm sau một khóa và một lớp thanh toán, máy tính có thể dùng một góc nhìn vận hành thay vì đối soát nhiều bảng điều khiển của các nhà cung cấp.

Kết luận

Một máy tính chi phí LLM không nên là một widget token chung chung. Nó nên là một hệ thống ra quyết định. Ở giai đoạn nhận biết, nó định cỡ cơ hội. Ở giai đoạn đánh giá, nó so sánh các kịch bản. Ở giai đoạn kích hoạt, nó bảo vệ hành trình người dùng đầu tiên. Ở giai đoạn chuyển đổi, nó kiểm tra biên lợi nhuận. Ở giai đoạn duy trì, nó giải thích sự sai lệch.

Flatkey hữu ích khi hệ thống ra quyết định đó cần giá mô hình theo thời gian thực, một khóa, một lớp thanh toán, và khả năng hiển thị ở cấp độ yêu cầu trên các lệnh gọi mô hình và công cụ. Hãy bắt đầu từ giai đoạn máy tính, rồi kết nối nó với mức sử dụng thực tế trước khi chi tiêu trở nên vô hình. Để kiểm tra thiết lập, hãy bắt đầu từ tài liệu Flatkey hoặc so sánh các tùy chọn mô hình hiện tại trong thư mục mô hình.