如果你正在搜索 Kimi 3 API,那么在代码中应使用的官方模型名称是 Kimi K3。这个区别很重要,因为模型文档、SDK 示例、定价表以及 API 模型标识符都使用 kimi-k3,而不是 kimi-3。
截至 2026 年 9 月 11 日,Kimi 官方的 Kimi K3 指南将 Kimi K3 列为其旗舰模型,适用于长周期编码、端到端知识工作、深度推理、视觉理解、视频理解以及 100 万 token 上下文工作流。Kimi API Platform 通过兼容 OpenAI 的 Chat Completions、兼容 OpenAI 的 Responses,以及兼容 Anthropic 的 Messages 协议提供它,因此开发者无需从头重建每一个请求封装,就可以评估 Kimi K3。
本指南解释 Kimi 3 API 搜索词当前的情况、如何直接调用 Kimi K3、与最初 K3 上线报道相比有哪些变化,以及独立开发者如何通过直连提供商路径或 Flatkey 这样的多模型网关测试 Kimi K3。
Kimi 3 API vs Kimi K3 API
Kimi K3 是官方名称。Kimi 3 API 是一个有用的搜索短语,因为当一个重要模型代际发布时,许多开发者会使用类似版本号的表达方式。
请按以下方式使用这些术语:
- 在文章标题和科普文案中,“Kimi 3 API (Kimi K3)” 有助于读者将搜索短语映射到官方模型。
- 在 API 请求中,在
model字段里使用kimi-k3。 - 在工程工单和文档中,首次说明之后建议使用“Kimi K3”。
这样可以避免一个简单但代价高昂的错误:把流行的查询短语直接复制到代码里,然后去调试一个与账号访问无关的“模型未找到”错误。
当前的 Kimi K3 API 事实
当前的 Kimi API 文档将 Kimi K3 描述为一个拥有 2.8 万亿参数、原生视觉理解能力以及 1,048,576 token 上下文窗口的模型。Kimi 表示完整模型权重已经发布,这取代了上线周“权重计划于 2026 年 7 月 27 日前发布”的说法。
| 字段 | 当前开发者说明 |
|---|---|
| 官方模型名称 | Kimi K3 |
| API 模型 ID | kimi-k3 |
| 直接兼容 OpenAI 的基础 URL | https://api.moonshot.ai/v1 |
| Chat 端点 | /chat/completions |
| Responses 端点 | /responses |
| 兼容 Anthropic 的基础 URL | https://api.moonshot.ai/anthropic |
| 上下文窗口 | 1,048,576 tokens |
| 模态 | 文档中说明支持文本、图像和视频输入 |
| 推理 | K3 始终启用;使用 reasoning_effort |
| 推理强度取值 | low、high、max;默认值为 max |
| 访问要求 | 至少成功充值 1 美元即可解锁 API 使用 |
| 直接 Kimi 定价 | 缓存命中输入 $0.30、缓存未命中输入 $3.00、输出 $15.00 / 100 万 tokens,不含适用税费 |
价格、路由可用性和速率限制都可能变化,因此请将固定数值视为上线前的检查项,而不是永久合同。在为生产环境发布做预算之前,应先查看 Kimi 自己的定价和速率限制文档。
自发布周以来有什么变化?
如果你读过较早的 Kimi K3 文章,在照搬其建议之前,请重新核对这些要点:
- Kimi 的 K3 文档现在说明完整模型权重已经发布。
- Kimi 的模型列表现在将
kimi-k3设为多个已退役模型 ID 的迁移目标。 - 根据 Kimi 的模型列表和平台更新日志,
kimi-k2.5和moonshot-v1系列已于 2026 年 8 月 31 日退役,对这些模型的调用现在会返回 model-not-found 错误。 - API 概览现在记录了三个兼容层:OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages。
- K3 特有的请求行为仍然很重要:K3 始终会进行推理,若干采样参数是固定的,并且不支持用于视觉输入的公开图片 URL。
对于独立开发者或小型 AI 产品团队来说,实际结论很简单:如果旧原型使用的是 Moonshot v1 或 K2.x 的模型 ID,不要只是替换 base URL 就指望其他部分能正常工作。请更新模型 ID,移除不受支持的思考参数,运行冒烟测试,并重新验证成本和限制。
如何使用 OpenAI SDK 直接调用 Kimi K3
Kimi 的 OpenAI 兼容设置使用 OpenAI SDK,配合 Moonshot API 密钥和 Kimi base URL。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{
"role": "user",
"content": "Review this launch checklist and list the three riskiest gaps.",
}
],
)
print(response.choices[0].message.content)
这对于基本的文本调用已经足够。但对于生产环境迁移来说还不够。Kimi K3 与通用的 OpenAI 兼容模型不同,你的应用应该显式测试这些差异。
你不应跳过的 Kimi K3 参数
K3 最重要的参数是 reasoning_effort。
Kimi K3 始终启用思考功能。你不能关闭它,但可以选择推理强度级别:
low:适用于低延迟检查、草稿、分类或更便宜的探索。high:适用于更难的推理任务,且延迟可接受。max:适用于最深度的 K3 推理模式,也是当前默认值。
Kimi 参数参考还说明,temperature、top_p、n、presence_penalty 和 frequency_penalty 在 K3 中是固定的。传入不兼容的值可能会返回错误,因此除非当前文档另有说明,否则请省略这些参数。
对于多轮对话和工具调用,Kimi 说明应返回 API 返回的完整 assistant 消息,包括 reasoning 和 tool-call 字段。如果你现有的应用只保存 message.content,在你将 K3 用于 agent 工作流之前,请先修正这一点。
视觉和视频输入:使用受支持的格式
Kimi K3 支持视觉理解,但输入格式有明确要求。
对于图像消息,message.content 必须是一个由多个部分组成的数组,而不是 JSON 字符串。Kimi 的视觉文档支持 base64 图像内容和文件 ID 引用。目前它们不支持用于视觉输入的公开 URL 格式图像。
对于视频,请先上传文件,并在 video_url 部分中使用 ms://<file-id> 格式引用。Kimi 建议将视频分辨率保持在 FHD 或以下,并在执行昂贵的多模态任务前使用 token 估算 API。
这一点对产品团队很重要,因为某个提供商在聊天场景中可能是“OpenAI-compatible”,但在图像、视频、文件上传、限制和计费方面仍然有其特定规则。
直接使用 Kimi API 还是 Flatkey 路线?
两种方式都可行。正确选择取决于你想了解什么。
在以下情况选择直接使用 Kimi API:
- 你希望走最接近 Moonshot 特定 K3 功能的路径;
- 你的应用主要是在评估 Kimi K3,而不是比较多个模型;
- 你可以接受管理另一个提供商账户、余额、密钥、速率限制配置和发票;
- 你可以在应用代码中处理 Kimi 特定的参数。
在以下情况选择类似 Flatkey 的多模型网关:
- 你希望在比较 Kimi K3 与 GPT、Claude、Gemini、DeepSeek、Qwen、GLM、Seedance 以及其他受支持模型时,使用一个 OpenAI-compatible 的基础 URL;
- 你的应用需要故障转移路由、模型白名单、使用日志、配额控制或共享计费;
- 你希望将提供商特定凭证和路由策略从功能代码中抽离出去;
- 你正在使用可能会在多个提供商之间消耗大量 token 的编码 agent 或自动化任务构建系统。
Flatkey 的公开模型目录目前将 kimi-k3 列为可通过 OpenAI-compatible 端点类型使用。Flatkey 当前用于 OpenAI-compatible 请求的路由基础 URL 是:
https://router.flatkey.ai/v1
对应的 SDK 设置如下:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FLATKEY_API_KEY"],
base_url="https://router.flatkey.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "比较这三种入职流程,并选择最低风险的上线路径。",
}
],
)
print(response.choices[0].message.content)
在生产使用之前,请确认该路由是否支持你的工作负载所需的所有 Kimi 特定请求字段。兼容性是集成捷径,而不是测试覆盖的替代品。
Kimi K3 的实用评估工作流
在将真实用户切换到 Kimi 3 API 路由之前,请按以下顺序进行:
- 确认模型 ID 和访问权限。 验证当前提供商或网关模型列表中是否出现
kimi-k3,并确认你的账户拥有所需余额或路由权限。 - 先做纯文本冒烟测试。 在添加工具、JSON 模式、流式输出、长上下文或视觉能力之前,先从一个简短的非流式提示开始。
- 测试真实工作负载。 使用你产品中的真实提示:编码代理任务、文档分析、支持自动化、研究、结构化抽取或多模态审核。
- 衡量输出接受度。 不要只依赖基准测试宣称。跟踪用户、评审者或下游解析器是否接受该答案。
- 衡量延迟和 token 用量。 K3 的长上下文和推理能力可能很有用,但也可能改变实际耗时和输出长度。
- 测试参数行为。 移除固定的采样参数,明确设置
reasoning_effort,并在多轮会话中保留完整的 assistant 消息。 - 检查多模态约束。 图片和视频使用 base64 或文件上传,并在进行大规模媒体任务前估算 token 成本。
- 定义回退方案。 选择具有相同模态和响应形态要求的回退模型。决定何时重试、显式失败或切换到其他路由。
- 查看使用日志。 确认你可以看到模型、状态、token、缓存 token、成本、延迟、所有者和环境。
- 先上线一个工作负载。 从一个受限的工作负载开始,在该路由证明质量、可靠性和成本之后再扩展。
Kimi K3 迁移清单,适用于旧版 Kimi 应用
如果你的代码已经使用较旧的 Kimi 或 Moonshot 模型 ID,请检查以下内容:
- 将已退役的模型 ID(如
kimi-k2.5或moonshot-v1-*)替换为kimi-k3或其他受支持的当前模型。 - 迁移到 K3 时,移除 K2.x 的
thinking配置;改用顶层的reasoning_effort。 - 停止传递不受支持的采样参数。
- 在多轮和工具调用流程中保留完整的 assistant 消息。
- 重新测试 JSON schema 输出、tool-choice 行为、流式解析器行为和错误处理。
- 根据当前定价表重新计算缓存命中和缓存未命中的经济性。
- 重新检查你当前充值档位的速率限制。
- 更新仪表盘、告警和运行手册,使
kimi-k3作为其自己的模型路由可见。
Kimi 3 API 的常见错误
使用了错误的模型名称
使用 kimi-k3,而不是 kimi-3。保留“Kimi 3 API”这一说法用于搜索和面向用户的说明。
把 OpenAI 兼容误认为完全相同
OpenAI 兼容意味着你可以复用熟悉的请求表面。它并不保证模型参数、多模态处理、速率限制、usage 字段或输出行为完全相同。
忽视缓存未命中
Kimi K3 的定价将缓存命中输入和缓存未命中输入分开计算。对于长上下文应用,前缀稳定性的微小差异可能会显著改变实际成本。
只看基准截图进行评估
Kimi 的发布材料包含基准和架构方面的声明,但你的生产环境决策应来自你自己的验收集、延迟预算、解析器兼容性以及回退行为。
在会话中途切换长时间运行的代理
Kimi 的技术博客警告称,K3 可能对思考历史比较敏感。对于代理工作流,不要在不重置并验证会话状态的情况下,将一个正在运行的会话从另一个模型切换到 K3。
FAQ
Kimi 3 和 Kimi K3 是同一个吗?
“Kimi 3”是常见的搜索词。Kimi K3 是官方模型名称,而 kimi-k3 是开发者应使用的 API 模型 ID。
Kimi K3 API 现在可用了吗?
是的。Kimi 当前的模型列表包含 kimi-k3,而 Kimi K3 指南记录了通过 Kimi API Platform 直接访问 API 的方式。
Kimi K3 的上下文窗口是多少?
Kimi 当前文档列出的 Kimi K3 上下文窗口为 1,048,576 个 token。
Kimi K3 API 的费用是多少?
Kimi 当前的推理定价页面列出 Kimi K3 的价格为:缓存命中输入 token 每 100 万个 $0.30,缓存未命中输入 token 每 100 万个 $3.00,输出 token 每 100 万个 $15.00,不含适用税费。预算前请重新查看定价页面,因为模型价格可能会变动。
我可以关闭 Kimi K3 的推理吗?
不可以。Kimi K3 始终会进行推理。你可以将 reasoning_effort 设为 low、high 或 max。
Kimi K3 支持图片 URL 吗?
Kimi K3 支持视觉输入,但 Kimi 当前的视觉文档说明不支持公开 URL 格式的图片。请改用 base64 图片内容或文件上传。
我可以通过 Flatkey 调用 Kimi K3 吗?
Flatkey 的公开目录目前将 kimi-k3 列为可通过兼容 OpenAI 的端点类型使用。 当你希望使用一个密钥、一个路由器基础 URL、共享计费、用量可见性以及跨多个受支持模型的路由控制时,可以使用 Flatkey。
为下一次模型变更做好准备
Kimi 3 API 的搜索趋势其实反映的是一个更广泛的开发者问题:模型访问变化的速度比应用架构更快。
Kimi K3 值得在长上下文编程、知识工作、深度推理和多模态任务中评估。但更持久的工程做法是让提供方选择保持可配置,明确测试模型特定行为,并在模型实验扩散到整个代码库之前,将路由、用量、回退和计费集中管理。
Flatkey 通过为团队提供一个兼容 OpenAI 的路由器、一个 API 密钥、一个余额以及一个仪表盘,覆盖受支持的官方模型和工具,帮助实现这种运营模式。从 Flatkey API 快速开始 入手,然后将 kimi-k3 与那些 K3 的长上下文和推理能力确实能够改善你产品指标的工作负载进行比较。



