Model and Modality Playbooks22 tháng 9, 2026Flatkey Team

Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến

Kimi K3 đã ra mắt. Kiểm tra giá API trực tiếp, ngữ cảnh 1M, các điều khiển suy luận, lưu ý về cache và kiểm tra định tuyến Flatkey trước khi triển khai production.

Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến

Kimi K3 đã ra mắt dành cho các đội API cần một mô hình ngữ cảnh dài cho lập trình, công việc tri thức, suy luận thị giác và các quy trình tác tử. Tóm tắt ngắn: mã model chính thức là kimi-k3, Kimi công bố cửa sổ ngữ cảnh 1.048.576 token, giá trực tiếp của Kimi được công bố theo mỗi 1 triệu token, và Flatkey hiện cung cấp route kimi-k3 thông qua một endpoint tương thích OpenAI.

Hướng dẫn này dành cho các đội sản phẩm đang quyết định liệu Kimi K3 có nên được đưa vào kế hoạch định tuyến sản xuất ngay hôm nay hay không. Nó bao gồm giá API, giới hạn cửa sổ ngữ cảnh, ghi chú tương thích, kiểm tra route và các câu hỏi vận hành cần trả lời trước khi gửi lưu lượng thực. Hãy đọc Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến như một danh sách kiểm tra ra mắt, chứ không chỉ là một thông báo model.

Trả lời nhanh

Đối với các đội đang tìm kiếm Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến, những факт quan trọng trong ngày phát hành là:

MụcChi tiết hiện tại có nguồn hỗ trợ
Official model IDkimi-k3
Direct Kimi endpoint patternOpenAI-compatible Chat Completions tại https://api.moonshot.ai/v1
Cửa sổ ngữ cảnh1.048.576 token
Giá đầu vào trực tiếp$3.00 cho mỗi 1M token
Giá đầu vào được cache trực tiếp$0.30 cho mỗi 1M token
Giá ghi cache trực tiếp$3.00 cho mỗi 1M token với TTL 5 phút; $6.00 cho mỗi 1M token với TTL 1 giờ
Giá đầu ra trực tiếp$15.00 cho mỗi 1M token
Chế độ suy nghĩLuôn bật; kiểm soát mức nỗ lực với các giá trị reasoning_effort low, high hoặc max
Route Flatkeykimi-k3 có sẵn trong dữ liệu route của Flatkey dưới nhóm China LLM

Việc ra mắt không chỉ là một cửa sổ ngữ cảnh lớn hơn. Danh sách model chính thức của Kimi mô tả K3 là model mạnh nhất của họ cho đến nay, với 2.8T tham số, khả năng hiểu hình ảnh gốc và cửa sổ ngữ cảnh 1M token cho kỹ thuật phần mềm, công việc tri thức và suy luận sâu.

Kimi K3 Có Gì Thay Đổi

Kimi K3 thay thế các route Kimi cũ hơn như model mà các đội nên đánh giá cho việc tiếp tục hỗ trợ Kimi. Tài liệu model của Kimi đánh dấu kimi-k2.5 và series moonshot-v1 là ngừng hỗ trợ vào ngày 31 tháng 8 năm 2026, và hướng người dùng đến kimi-k3 để tiếp tục được hỗ trợ.

Điều đó quan trọng đối với việc định tuyến. Nếu ứng dụng của bạn vẫn lưu các alias moonshot-v1-*, kimi-latest hoặc kimi-k2-* cũ hơn trong cấu hình, cách an toàn không phải là tìm và thay thế mù quáng. Hãy coi đây là một quá trình di chuyển route:

  1. Tìm mọi mã model Kimi trong code, prompt, cấu hình đánh giá và cài đặt workspace của khách hàng.
  2. Chuyển một workload staging sang kimi-k3.
  3. Chạy kiểm tra nhanh (smoke test) về ngữ cảnh, gọi công cụ, JSON, thị giác và streaming.
  4. So sánh chi phí đầu ra được chấp nhận, không chỉ giá theo token.
  5. Thêm một route dự phòng trước khi triển khai sản xuất.

Các đội Flatkey có thể dùng cùng quy trình đánh giá trong ngày phát hành trong danh sách kiểm tra đánh giá model mới trước khi đưa Kimi K3 vào route chính.

Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến cho các đội

Giá API trực tiếp của Kimi cho K3 được công bố dưới dạng giá token trên mỗi 1 triệu token. Đối với Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến, các dòng giá trực tiếp hiện tại là:

Hạng mục tính phíGiá trực tiếp của KimiLưu ý cho đội sản phẩm
Ghi cache, TTL 5 phút$3.00 / 1M tokensTTL mặc định nếu không chỉ định TTL
Ghi cache, TTL 1 giờ$6.00 / 1M tokensChỉ hữu ích khi cửa sổ tái sử dụng dài hơn đáng giá với chi phí ghi
Input đã được cache$0.30 / 1M tokensÁp dụng khi các tiền tố lặp lại trúng vào bộ nhớ đệm ngữ cảnh
Input$3.00 / 1M tokensÁp dụng cho các token prompt không được cache
Output$15.00 / 1M tokensThường là yếu tố chi phối lớn nhất đối với các vòng lặp tác tử và suy luận dài dòng

Đây là phần của Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến mà các đội nên chuyển thành bài toán khối lượng công việc. Một tuyến đường ngữ cảnh dài có thể trông có vẻ rẻ ở giá input nhưng vẫn trở nên đắt nếu mỗi yêu cầu tạo ra một lần ghi cache lớn, tạo output suy luận dài, hoặc lặp lại ngữ cảnh có giá trị thấp.

Dùng công thức lập kế hoạch này:

accepted_output_cost =
  (cache_write_tokens * cache_write_rate)
  + (cached_input_tokens * cached_input_rate)
  + (uncached_input_tokens * input_rate)
  + (output_tokens * output_rate)
  divided by accepted results

Đối với quyết định triển khai sản xuất, hãy chạy công thức đó trên một mẫu thực tế. Bao gồm các lần sinh nội dung thất bại, thử lại, vòng lặp gọi công cụ và các output bị cổng chất lượng sản phẩm của bạn từ chối.

Lưu ý về cửa sổ ngữ cảnh và bộ nhớ đệm

Kimi công bố cửa sổ ngữ cảnh 1.048.576 token cho Kimi K3. Điều này khiến nó phù hợp cho các tác vụ lập trình trên toàn bộ kho mã, rà soát tài liệu lớn, phân tích sản phẩm nhiều tệp và các phiên tác tử kéo dài.

Nhưng cửa sổ 1M token không loại bỏ nhu cầu kỷ luật về ngữ cảnh:

  • Giữ các tiền tố ổn định ổn định để bộ nhớ đệm tự động có thể hoạt động.
  • Tránh đưa mọi tài liệu vào mọi yêu cầu khi truy xuất sẽ rẻ hơn.
  • Giới hạn độ dài output cho các tác vụ không cần suy luận dạng dài.
  • Giữ một mô hình dự phòng nhỏ hơn cho các yêu cầu ngắn không hưởng lợi từ ngữ cảnh 1M.
  • Đo độ trễ tách biệt với giá vì prompt dài sẽ thay đổi trải nghiệm người dùng ngay cả khi vẫn vừa khớp.

Tài liệu của Kimi nói rằng bộ nhớ đệm tự động áp dụng cho các yêu cầu model thông thường, không cần cache ID, TTL hay tham số bổ sung. Họ cũng lưu ý rằng một yêu cầu mới chỉ có thể trúng prefix cache khi prompt trước đó vượt quá 256 token. Các đội sản phẩm nên xác minh hành vi cache trong log của riêng họ trước khi hứa hẹn giảm chi phí từ Kimi K3.

Tương thích API và hình dạng yêu cầu

Hướng dẫn bắt đầu nhanh của Kimi sử dụng OpenAI Python SDK với base_url="https://api.moonshot.ai/v1"model="kimi-k3". Điều đó khiến Kimi K3 trở thành một lựa chọn thực tế cho các đội đã dùng các client Chat Completions tương thích với OpenAI.

Các chi tiết tương thích vẫn cần một bài kiểm tra khói trong ngày phát hành:

from openai import OpenAI

client = OpenAI(
    api_key="MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "user", "content": "Tóm tắt các rủi ro định tuyến cho bản phát hành này."}
    ],
)

print(completion.choices[0].message.content)

Với Flatkey, hãy giữ ID mô hình là kimi-k3, chuyển các lời gọi tương thích qua bộ định tuyến Flatkey, và xác minh tuyến trong quy trình của hướng dẫn danh mục mô hình AI trước khi đưa vào production. Trang mô hình là nơi phù hợp để xác nhận tình trạng sẵn có hiện tại, hỗ trợ endpoint, và giá tuyến hiệu lực.

Ghi chú định tuyến cho các nhóm Flatkey

API giá hiện tại của Flatkey hiển thị kimi-k3 là khả dụng và được định tuyến qua nhóm China LLM với hỗ trợ endpoint OpenAI. Trang mô hình công khai của Flatkey cũng hiển thị một tuyến mô hình Kimi K3 và cho biết đây là mô hình chat/completions với ngữ cảnh 1M token.

Trước khi thêm Kimi K3 vào bộ định tuyến production, hãy ghi lại bản ghi rà soát tuyến này. Đây là hiện vật bàn giao cho Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến khi các nhóm nền tảng, sản phẩm và tài chính cần cùng một nguồn thông tin chuẩn:

model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
  - long-context coding
  - knowledge-work agent sessions
  - visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
  chat_completions: required
  streaming: test_required
  structured_output: test_required
  tool_calls: test_required
  vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
  - short_context_default
  - cheaper_coding_route
rollback_condition:
  - error_rate_above_threshold
  - accepted_output_cost_above_budget
  - latency_p95_above_slo

Điều này biến Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến từ một thông báo phát hành thành một danh sách kiểm tra vận hành.

Danh sách kiểm tra production

Sử dụng danh sách kiểm tra Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến này trước khi chuyển lưu lượng:

Kiểm traNhững gì cần xác minh
ID mô hìnhkimi-k3 hoạt động trong môi trường staging và không bị ẩn sau một cấp tài khoản mà khóa production của bạn không có
Nạp tiền/truy cậpKimi cho biết K3 được mở khóa sau khi nạp tiền thành công, với cấp tài khoản ảnh hưởng đến giới hạn tốc độ
Ngữ cảnhPrompt lớn nhất của bạn nằm dưới 1.048.576 token và vẫn còn chỗ cho đầu ra
Ngân sách đầu ramax_completion_tokens được kiểm soát cho từng workload
Mức độ suy luậnlow, high, và max được kiểm thử theo độ trễ, chi phí và chất lượng
Bộ nhớ đệmCác workload có tiền tố lặp lại thực sự chạm vào cache trong log
VisionKhông mặc định giả định các URL ảnh công khai; tài liệu Kimi nêu đầu vào base64 hoặc ms://<file-id>
Công cụCác vòng lặp gọi công cụ trả về toàn bộ thông điệp của assistant, không chỉ content
Dự phòngMột route rẻ hơn hoặc ổn định hơn đã sẵn sàng trước khi lưu lượng production chuyển sang
Thanh toánLog trực tiếp của nhà cung cấp và log sử dụng Flatkey đối soát khớp cho cùng một workload mẫu

Khi nào nên định tuyến Kimi K3

Kimi K3 đáng để thử trước khi workload có một hoặc nhiều đặc điểm sau:

  • Ngữ cảnh codebase lớn, chuỗi lập kế hoạch dài hoặc phân tích nhiều tài liệu.
  • Các tác vụ mà chất lượng suy luận quan trọng hơn độ trễ thô.
  • Quy trình có thể hưởng lợi từ bộ nhớ đệm theo tiền tố lặp lại.
  • Đánh giá đa phương thức khi văn bản và đầu vào hình ảnh nên nằm trong cùng một lượt suy luận.
  • Các tác vụ agent khi cửa sổ ngữ cảnh lớn hơn giúp giảm việc ghép nối truy xuất dễ lỗi.

Đây không phải là route mặc định cho mọi yêu cầu. Các tác vụ phân loại ngắn, trích xuất và tin nhắn hỗ trợ có thể hoạt động tốt hơn trên một mô hình rẻ hơn, độ trễ thấp hơn. Mẫu định tuyến thực tế là dành Kimi K3 cho các workload mà ngữ cảnh 1M, mức độ suy luận hoặc hiểu thị giác làm thay đổi tỷ lệ đầu ra được chấp nhận.

Câu hỏi thường gặp

Kimi K3 đã hoạt động qua API chưa?

Có. Tài liệu API của Kimi bao gồm phần bắt đầu nhanh Kimi K3, danh sách mô hình, trang giá và banner ra mắt. Dữ liệu route của Flatkey cũng cho thấy kimi-k3 khả dụng cho định tuyến kiểu OpenAI tính đến ngày 22 tháng 9 năm 2026.

Cửa sổ ngữ cảnh của Kimi K3 là gì?

Kimi liệt kê cửa sổ ngữ cảnh của Kimi K3 là 1.048.576 token. Hãy xem đó là dung lượng, không phải khuyến nghị gửi mọi tài liệu có sẵn trong mỗi lần gọi.

Giá API của Kimi K3 là bao nhiêu?

Bảng giá trực tiếp của Kimi liệt kê K3 ở mức $3.00 cho mỗi 1M token đầu vào chưa được cache, $0.30 cho mỗi 1M token đầu vào đã được cache, $3.00 hoặc $6.00 cho mỗi 1M token ghi cache tùy theo TTL, và $15.00 cho mỗi 1M token đầu ra. Kiểm tra trang mô hình Flatkey để biết giá route Flatkey hiệu lực hiện tại trước khi ra mắt.

Kimi K3 có hỗ trợ các điều khiển suy luận không?

Có. Kimi cho biết K3 luôn bật chế độ thinking và hỗ trợ trường cấp cao nhất reasoning_effort với low, high, và max, trong đó max là mặc định.

Các nhóm nên sử dụng trang Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến này như thế nào?

Hãy dùng nó như một trang phân loại trong ngày phát hành: xác nhận giá chính thức và các факт về cửa sổ ngữ cảnh, chạy danh sách kiểm tra định tuyến, tính chi phí đầu ra đã được chấp nhận, rồi mới quyết định liệu Kimi K3 có trở thành tuyến chính, tuyến dự phòng hay tuyến thử nghiệm hay không.

Kết luận ngắn gọn

Kimi K3 đã ra mắt: Giá API, cửa sổ ngữ cảnh và lưu ý về định tuyến hữu ích vì bản phát hành này ảnh hưởng đến cả năng lực mô hình lẫn vận hành sản xuất. Điểm nổi bật là 1M ngữ cảnh và một tuyến flagship mới kimi-k3. Tuy nhiên, quyết định vẫn nên dựa trên chi phí đầu ra đã được chấp nhận đo lường được, độ trễ, hành vi cache, độ tin cậy của lệnh gọi công cụ và khả năng sẵn sàng của cơ chế dự phòng.

Flatkey giúp các nhóm giữ cho việc đánh giá này mang tính thực tiễn: một khóa, một số dư, và định tuyến mô hình qua một lớp API dùng chung, với danh mục mô hình và nhật ký sử dụng sẵn có để kiểm tra tuyến trước và sau khi ra mắt.