Nếu bạn đang tìm kiếm Kimi 3 API, tên mô hình chính thức cần dùng trong mã là Kimi K3. Sự khác biệt này rất quan trọng vì tài liệu mô hình, ví dụ SDK, bảng giá và định danh mô hình API đều sử dụng kimi-k3, chứ không phải kimi-3.
Tính đến ngày 11 tháng 9 năm 2026, hướng dẫn Kimi K3 của chính Kimi liệt kê Kimi K3 là mô hình chủ lực cho lập trình dài hạn, công việc tri thức đầu-cuối, suy luận sâu, hiểu hình ảnh, hiểu video và quy trình làm việc với ngữ cảnh 1M token. Nền tảng Kimi API cung cấp mô hình này thông qua các giao thức Chat Completions tương thích OpenAI, Responses tương thích OpenAI và Messages tương thích Anthropic, vì vậy nhà phát triển có thể đánh giá Kimi K3 mà không cần xây dựng lại mọi wrapper yêu cầu từ đầu.
Hướng dẫn này giải thích tình trạng hiện tại của truy vấn tìm kiếm Kimi 3 API, cách gọi trực tiếp Kimi K3, những gì đã thay đổi kể từ phạm vi phủ sóng ra mắt K3 ban đầu, và cách một indie hacker có thể thử Kimi K3 thông qua lộ trình nhà cung cấp trực tiếp hoặc một cổng đa mô hình như Flatkey.
Kimi 3 API vs Kimi K3 API
Kimi K3 là tên chính thức. Kimi 3 API là một cụm từ tìm kiếm hữu ích vì nhiều nhà phát triển dùng ngôn ngữ kiểu phiên bản khi một thế hệ mô hình lớn ra mắt.
Hãy dùng các thuật ngữ theo cách này:
- Trong tiêu đề bài viết và nội dung hướng dẫn, "Kimi 3 API (Kimi K3)" giúp người đọc liên kết cụm từ tìm kiếm với mô hình chính thức.
- Trong các yêu cầu API, dùng
kimi-k3trong trườngmodel. - Trong các ticket kỹ thuật và tài liệu, ưu tiên "Kimi K3" sau phần làm rõ đầu tiên.
Điều này tránh một lỗi đơn giản nhưng tốn kém: sao chép một cụm truy vấn phổ biến vào mã và gỡ lỗi lỗi không tìm thấy mô hình vốn không liên quan gì đến quyền truy cập tài khoản.
Thông tin hiện tại về Kimi K3 API
Tài liệu Kimi API hiện tại mô tả Kimi K3 là một mô hình 2,8 nghìn tỷ tham số với khả năng hiểu hình ảnh gốc và cửa sổ ngữ cảnh 1.048.576 token. Kimi cho biết toàn bộ trọng số mô hình đã được phát hành, thay thế cách diễn đạt trong tuần ra mắt rằng trọng số sẽ được phát hành trước ngày 27 tháng 7 năm 2026.
| Trường | Ghi chú hiện tại cho nhà phát triển |
|---|---|
| Tên mô hình chính thức | Kimi K3 |
| ID mô hình API | kimi-k3 |
| Base URL tương thích OpenAI trực tiếp | https://api.moonshot.ai/v1 |
| Endpoint Chat | /chat/completions |
| Endpoint Responses | /responses |
| Base URL tương thích Anthropic | https://api.moonshot.ai/anthropic |
| Cửa sổ ngữ cảnh | 1.048.576 token |
| Phương thức | Đã ghi nhận hỗ trợ đầu vào văn bản, hình ảnh và video |
| Suy luận | Luôn bật cho K3; dùng reasoning_effort |
| Các giá trị reasoning_effort | low, high, max; mặc định là max |
| Yêu cầu truy cập | Nạp tiền thành công tối thiểu $1 sẽ mở khóa quyền dùng API |
| Giá trực tiếp của Kimi | $0.30 input trúng cache, $3.00 input không trúng cache, $15.00 output trên mỗi 1M token, chưa bao gồm các loại thuế áp dụng |
Giá cả, khả năng cung cấp tuyến truy cập và giới hạn tần suất có thể thay đổi, vì vậy hãy xem các con số cố định như một mục kiểm tra trước khi triển khai, chứ không phải là một hợp đồng vĩnh viễn. Bạn nên kiểm tra tài liệu giá cả và giới hạn tần suất của chính Kimi trước khi lập ngân sách cho một lần ra mắt sản xuất.
Điều gì đã thay đổi kể từ tuần ra mắt?
Nếu bạn đọc một bài viết cũ hơn về Kimi K3, hãy kiểm tra lại các điểm này trước khi làm theo lời khuyên của nó:
- Tài liệu K3 của Kimi hiện cho biết toàn bộ trọng số mô hình đã được phát hành.
- Danh sách mô hình của Kimi hiện định vị
kimi-k3là mục tiêu di chuyển cho một số mã định danh mô hình đã ngừng hỗ trợ. - Các dòng
kimi-k2.5vàmoonshot-v1đã bị ngừng hỗ trợ vào ngày 31 tháng 8 năm 2026, và các lệnh gọi tới những mô hình này hiện trả về lỗi không tìm thấy mô hình theo danh sách mô hình và nhật ký thay đổi nền tảng của Kimi. - Trang tổng quan API hiện ghi nhận ba bề mặt tương thích: OpenAI Chat Completions, OpenAI Responses và Anthropic Messages.
- Hành vi yêu cầu dành riêng cho K3 vẫn rất quan trọng: K3 luôn suy luận, một số tham số lấy mẫu là cố định, và các URL hình ảnh công khai không được hỗ trợ cho đầu vào thị giác.
Đối với một indie hacker hoặc một nhóm sản phẩm AI nhỏ, điểm rút ra thực tế rất đơn giản: nếu một nguyên mẫu cũ dùng mã định danh mô hình Moonshot v1 hoặc K2.x, đừng chỉ đổi base URL và hy vọng phần còn lại sẽ hoạt động. Hãy cập nhật mã định danh mô hình, loại bỏ các tham số suy nghĩ không được hỗ trợ, chạy kiểm tra nhanh, và xác thực lại chi phí cùng giới hạn.
Cách gọi Kimi K3 trực tiếp với OpenAI SDK
Thiết lập tương thích OpenAI của Kimi sử dụng OpenAI SDK với khóa API Moonshot và base URL của Kimi.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{
"role": "user",
"content": "Xem lại danh sách kiểm tra ra mắt này và liệt kê ba lỗ hổng rủi ro nhất.",
}
],
)
print(response.choices[0].message.content)
Chỉ như vậy là đủ cho một lệnh gọi văn bản cơ bản. Nhưng như thế là chưa đủ cho việc di chuyển lên sản xuất. Kimi K3 khác với các mô hình tương thích OpenAI chung theo những cách mà ứng dụng của bạn nên kiểm thử một cách rõ ràng.
Các tham số Kimi K3 bạn không nên bỏ qua
Tham số quan trọng nhất của K3 là reasoning_effort.
Kimi K3 luôn bật chế độ suy nghĩ. Bạn không thể tắt nó, nhưng bạn có thể chọn mức độ nỗ lực suy luận:
lowcho các kiểm tra độ trễ thấp, bản nháp, phân loại hoặc khám phá với chi phí thấp hơn.highcho các tác vụ suy luận khó hơn khi độ trễ là chấp nhận được.maxcho chế độ suy luận sâu nhất của K3 và là mặc định hiện tại.
Tài liệu tham chiếu tham số của Kimi cũng cho biết temperature, top_p, n, presence_penalty, và frequency_penalty là cố định đối với K3. Việc truyền các giá trị không tương thích có thể trả về lỗi, vì vậy hãy bỏ qua các tham số đó trừ khi tài liệu hiện tại nói khác đi.
Đối với các cuộc hội thoại nhiều lượt và các lệnh gọi công cụ, Kimi yêu cầu bạn trả về đầy đủ thông điệp assistant do API trả về, bao gồm cả phần suy luận và các trường gọi công cụ. Nếu ứng dụng hiện tại của bạn chỉ lưu message.content, hãy sửa điều đó trước khi bạn đánh giá K3 trong các quy trình tác tử.
Nhập ảnh và video: sử dụng các định dạng được hỗ trợ
Kimi K3 hỗ trợ hiểu hình ảnh, nhưng hình dạng dữ liệu đầu vào là cụ thể.
Với tin nhắn hình ảnh, message.content phải là một mảng các phần tử, không phải một chuỗi JSON. Tài liệu vision của Kimi hỗ trợ nội dung ảnh base64 và tham chiếu file-ID. Hiện tại, chúng không hỗ trợ hình ảnh định dạng URL công khai cho đầu vào vision.
Với video, hãy tải tệp lên trước rồi tham chiếu bằng định dạng ms://<file-id> trong một phần video_url. Kimi khuyến nghị giữ độ phân giải video ở mức FHD hoặc thấp hơn và sử dụng API ước tính token trước các tác vụ đa phương thức tốn kém.
Điều này quan trọng với các nhóm sản phẩm vì một nhà cung cấp có thể "tương thích OpenAI" cho chat nhưng vẫn có các quy tắc riêng cho ảnh, video, tải tệp lên, giới hạn và thanh toán.
Dùng API Kimi trực tiếp hay qua Flatkey?
Cả hai cách đều hợp lệ. Lựa chọn đúng phụ thuộc vào điều bạn muốn tìm hiểu.
Chọn API Kimi trực tiếp khi:
- bạn muốn đi theo con đường gần nhất tới các tính năng K3 đặc thù của Moonshot;
- ứng dụng của bạn chủ yếu đánh giá Kimi K3 thay vì so sánh nhiều mô hình;
- bạn thoải mái khi quản lý thêm một tài khoản nhà cung cấp, số dư, khóa, hồ sơ giới hạn tốc độ và hóa đơn;
- bạn có thể giữ xử lý tham số đặc thù của Kimi trong mã ứng dụng của mình.
Chọn một cổng đa mô hình như Flatkey khi:
- bạn muốn một base URL tương thích OpenAI trong khi so sánh Kimi K3 với GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Seedance và các mô hình được hỗ trợ khác;
- ứng dụng của bạn cần định tuyến dự phòng, danh sách cho phép mô hình, nhật ký sử dụng, kiểm soát hạn ngạch hoặc thanh toán dùng chung;
- bạn muốn chuyển thông tin xác thực đặc thù của nhà cung cấp và chính sách định tuyến ra khỏi mã tính năng;
- bạn đang xây dựng với các tác tử lập trình hoặc tác vụ tự động có thể tiêu thụ khối lượng token lớn qua nhiều nhà cung cấp.
Danh mục mô hình công khai của Flatkey hiện liệt kê kimi-k3 là khả dụng thông qua kiểu endpoint tương thích OpenAI. Base URL router hiện tại của Flatkey cho các yêu cầu tương thích OpenAI là:
https://router.flatkey.ai/v1
Cấu hình SDK tương ứng là:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FLATKEY_API_KEY"],
base_url="https://router.flatkey.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Compare these three onboarding flows and pick the lowest-risk launch path.",
}
],
)
print(response.choices[0].message.content)
Trước khi dùng trong sản xuất, hãy xác nhận liệu route có hỗ trợ mọi trường yêu cầu đặc thù của Kimi mà khối lượng công việc của bạn cần hay không. Khả năng tương thích là một lối tắt tích hợp, không phải là sự thay thế cho độ bao phủ kiểm thử.
Quy trình đánh giá Kimi K3 thực tế
Hãy sử dụng chuỗi bước này trước khi đưa người dùng thực lên route API Kimi 3:
- Xác nhận ID mô hình và quyền truy cập. Xác minh rằng
kimi-k3xuất hiện trong danh sách mô hình của nhà cung cấp hoặc cổng hiện tại, và xác nhận tài khoản của bạn có số dư cần thiết hoặc quyền tuyến phù hợp. - Chạy một bài kiểm tra nhanh bằng văn bản thuần. Bắt đầu với một prompt ngắn không streaming trước khi thêm công cụ, chế độ JSON, streaming, ngữ cảnh dài hoặc vision.
- Kiểm tra đúng khối lượng công việc thực tế. Dùng các prompt thật từ sản phẩm của bạn: tác vụ tác tử lập trình, phân tích tài liệu, tự động hóa hỗ trợ, nghiên cứu, trích xuất có cấu trúc hoặc xem xét đa phương thức.
- Đo mức độ chấp nhận của đầu ra. Đừng chỉ dựa vào các tuyên bố benchmark. Theo dõi liệu người dùng, người đánh giá hay các trình phân tích downstream có chấp nhận câu trả lời hay không.
- Đo độ trễ và mức dùng token. Ngữ cảnh dài và khả năng suy luận của K3 có thể hữu ích, nhưng chúng cũng có thể làm thay đổi thời gian thực và độ dài đầu ra.
- Kiểm tra hành vi của tham số. Gỡ bỏ các tham số lấy mẫu cố định, đặt
reasoning_effortmột cách có chủ đích, và giữ nguyên đầy đủ các tin nhắn của assistant trong các phiên nhiều lượt. - Kiểm tra các ràng buộc đa phương thức. Dùng base64 hoặc tải tệp lên cho hình ảnh và video, và ước tính chi phí token trước các công việc media lớn.
- Xác định phương án dự phòng. Chọn các mô hình dự phòng có cùng yêu cầu về modality và dạng phản hồi. Quyết định khi nào sẽ thử lại, khi nào sẽ thất bại rõ ràng, hoặc chuyển sang tuyến khác.
- Rà soát nhật ký sử dụng. Xác nhận rằng bạn có thể thấy mô hình, trạng thái, token, token được cache, chi phí, độ trễ, chủ sở hữu và môi trường.
- Triển khai theo từng khối lượng công việc. Bắt đầu với một khối lượng công việc có giới hạn, rồi mở rộng sau khi tuyến đó chứng minh được chất lượng, độ tin cậy và chi phí.
Danh sách kiểm tra chuyển đổi Kimi K3 cho các ứng dụng Kimi cũ
Nếu code của bạn đã sử dụng các ID mô hình Kimi hoặc Moonshot cũ, hãy kiểm tra những điều sau:
- Thay các ID mô hình đã ngừng hỗ trợ như
kimi-k2.5hoặcmoonshot-v1-*bằngkimi-k3hoặc một mô hình hiện tại khác được hỗ trợ. - Gỡ cấu hình
thinkingcủa K2.x khi chuyển sang K3; thay vào đó dùngreasoning_effortở cấp cao nhất. - Ngừng truyền các tham số lấy mẫu không được hỗ trợ.
- Giữ lại đầy đủ các tin nhắn của assistant trong các luồng nhiều lượt và gọi công cụ.
- Kiểm tra lại đầu ra schema JSON, hành vi chọn công cụ, hành vi parser streaming và xử lý lỗi.
- Tính lại kinh tế học của cache-hit và cache-miss dựa trên bảng giá hiện tại.
- Kiểm tra lại giới hạn tốc độ cho gói nạp hiện tại của bạn.
- Cập nhật dashboard, cảnh báo và runbook để
kimi-k3hiển thị như một tuyến mô hình riêng.
Các lỗi thường gặp với Kimi 3 API
Dùng sai tên mô hình
Hãy dùng kimi-k3, không phải kimi-3. Giữ cụm từ "Kimi 3 API" cho mục đích tìm kiếm và giải thích hướng tới người dùng.
Cho rằng OpenAI-compatible là hoàn toàn giống nhau
OpenAI-compatible có nghĩa là bạn có thể tái sử dụng một bề mặt yêu cầu quen thuộc. Điều đó không đảm bảo các tham số mô hình, xử lý đa phương thức, giới hạn tốc độ, các trường sử dụng, hay hành vi đầu ra là giống hệt nhau.
Bỏ qua các lần cache miss
Giá của Kimi K3 tách riêng input cache-hit và cache-miss. Với các ứng dụng ngữ cảnh dài, chỉ một khác biệt nhỏ trong độ ổn định của prefix cũng có thể làm thay đổi đáng kể chi phí hiệu dụng.
Chỉ đánh giá bằng ảnh chụp màn hình benchmark
Tài liệu ra mắt của Kimi có bao gồm các tuyên bố về benchmark và kiến trúc, nhưng quyết định đưa vào sản xuất của bạn nên dựa trên bộ tiêu chí chấp nhận riêng, ngân sách độ trễ, khả năng tương thích của bộ phân tích cú pháp và hành vi dự phòng của bạn.
Chuyển một agent chạy dài phiên giữa chừng
Blog kỹ thuật của Kimi cảnh báo rằng K3 có thể nhạy với lịch sử suy luận. Với các workflow agent, hãy tránh chuyển một phiên đang hoạt động từ mô hình khác sang K3 mà không đặt lại và xác thực trạng thái cuộc hội thoại.
Câu hỏi thường gặp
Kimi 3 có giống Kimi K3 không?
"Kimi 3" là một cụm từ tìm kiếm phổ biến. Kimi K3 là tên mô hình chính thức, và kimi-k3 là mã định danh mô hình API mà nhà phát triển nên sử dụng.
API Kimi K3 hiện đã khả dụng chưa?
Có. Danh sách mô hình hiện tại của Kimi bao gồm kimi-k3, và hướng dẫn Kimi K3 mô tả quyền truy cập API trực tiếp thông qua Kimi API Platform.
Ngữ cảnh của Kimi K3 là bao nhiêu?
Tài liệu Kimi hiện tại liệt kê cửa sổ ngữ cảnh 1.048.576 token cho Kimi K3.
API Kimi K3 có giá bao nhiêu?
Trang giá suy luận hiện tại của Kimi liệt kê Kimi K3 ở mức $0.30 cho mỗi 1M token đầu vào cache-hit, $3.00 cho mỗi 1M token đầu vào cache-miss, và $15.00 cho mỗi 1M token đầu ra, chưa bao gồm các loại thuế áp dụng. Hãy kiểm tra lại trang giá trước khi lập ngân sách vì giá mô hình có thể thay đổi.
Tôi có thể tắt khả năng suy luận của Kimi K3 không?
Không. Kimi K3 luôn suy luận. Bạn có thể đặt reasoning_effort thành low, high hoặc max.
Kimi K3 có hỗ trợ URL hình ảnh không?
Kimi K3 hỗ trợ đầu vào thị giác, nhưng tài liệu vision hiện tại của Kimi cho biết hình ảnh ở định dạng URL công khai không được hỗ trợ. Thay vào đó, hãy dùng nội dung hình ảnh base64 hoặc tải tệp lên.
Tôi có thể gọi Kimi K3 qua Flatkey không?
Danh mục công khai của Flatkey hiện liệt kê kimi-k3 là khả dụng thông qua một loại endpoint tương thích OpenAI. Hãy dùng Flatkey khi bạn muốn một khóa, một base URL router, thanh toán dùng chung, khả năng hiển thị mức sử dụng và các điều khiển định tuyến trên nhiều mô hình được hỗ trợ.
Xây dựng cho lần thay đổi mô hình tiếp theo
Xu hướng tìm kiếm về Kimi 3 API thực ra phản ánh một vấn đề rộng hơn của nhà phát triển: khả năng truy cập mô hình thay đổi nhanh hơn kiến trúc ứng dụng.
Kimi K3 đáng để đánh giá cho lập trình ngữ cảnh dài, công việc tri thức, suy luận sâu và các tác vụ đa phương thức. Nhưng cách làm kỹ thuật bền vững là giữ cho lựa chọn nhà cung cấp có thể cấu hình, kiểm thử rõ ràng hành vi đặc thù của từng mô hình, và tập trung hóa định tuyến, mức sử dụng, fallback và thanh toán trước khi các thử nghiệm mô hình lan rộng khắp codebase của bạn.
Flatkey hỗ trợ mô hình vận hành đó bằng cách cung cấp cho các nhóm một router tương thích OpenAI, một khóa API, một số dư và một dashboard cho các mô hình và công cụ chính thức được hỗ trợ. Bắt đầu với hướng dẫn bắt đầu nhanh API Flatkey, rồi so sánh kimi-k3 với những workload mà ngữ cảnh dài và khả năng suy luận của K3 thực sự có thể cải thiện các chỉ số sản phẩm của bạn.



