Kimi K3 уже доступен для API-команд, которым нужен маршрут к модели с длинным контекстом для программирования, работы с знаниями, визуального рассуждения и агентных сценариев. Кратко: официальный ID модели — kimi-k3, Kimi указывает контекстное окно в 1,048,576 токенов, прямые цены Kimi опубликованы за 1 млн токенов, а Flatkey в настоящее время предоставляет маршрут kimi-k3 через OpenAI-compatible endpoint.
Это руководство предназначено для продуктовых команд, которые решают, должен ли Kimi K3 уже сегодня войти в производственный план маршрутизации. Оно охватывает цены API, ограничения контекстного окна, замечания по совместимости, проверки маршрута и операционные вопросы, на которые нужно ответить до отправки реального трафика. Читайте Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации как чеклист запуска, а не просто как объявление о модели.
Краткий ответ
Для команд, которые ищут Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации, важные факты дня релиза таковы:
| Пункт | Текущая подтвержденная источниками деталь |
|---|---|
| Официальный ID модели | kimi-k3 |
| Шаблон прямого endpoint Kimi | OpenAI-compatible Chat Completions на https://api.moonshot.ai/v1 |
| Контекстное окно | 1,048,576 токенов |
| Прямая цена входа | $3.00 за 1 млн токенов |
| Прямая цена кэшированного входа | $0.30 за 1 млн токенов |
| Прямая цена записи в кэш | $3.00 за 1 млн токенов для TTL 5 минут; $6.00 за 1 млн токенов для TTL 1 час |
| Прямая цена выхода | $15.00 за 1 млн токенов |
| Режим thinking | Всегда включен; управляйте усилием с помощью значений reasoning_effort low, high или max |
| Маршрут Flatkey | kimi-k3 доступен в данных маршрутов Flatkey в группе China LLM |
Этот релиз — не просто большее контекстное окно. В собственном списке моделей Kimi K3 описан как самая мощная модель на сегодняшний день, с 2.8T параметров, нативным пониманием изображений и контекстным окном на 1 млн токенов для разработки ПО, работы с знаниями и глубокого рассуждения.
Что изменилось с Kimi K3
Kimi K3 заменяет более старые маршруты Kimi как модель, которую командам следует оценить для дальнейшей поддержки Kimi. В документации по моделям Kimi указано, что kimi-k2.5 и серия moonshot-v1 будут прекращены 31 августа 2026 года, и пользователям предлагается kimi-k3 для дальнейшей поддержки.
Это важно для маршрутизации. Если ваше приложение по-прежнему хранит в конфигурации псевдонимы moonshot-v1-*, kimi-latest или более старые kimi-k2-*, безопасный шаг — не слепая замена по поиску и замене. Относитесь к этому как к миграции маршрута:
- Найдите каждый ID модели Kimi в коде, промптах, конфигурациях eval и настройках рабочих пространств клиентов.
- Переведите одну staging-нагрузку на
kimi-k3. - Запустите smoke-тест для контекста, вызова инструментов, JSON, vision и streaming.
- Сравните стоимость принятого вывода, а не только цену за токены.
- Добавьте fallback-маршрут до выката в production.
Команды Flatkey могут использовать тот же процесс оценки в день релиза в чеклисте оценки новой модели перед переводом Kimi K3 на основной маршрут.
Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации для команд
Прямые цены Kimi API для K3 опубликованы как стоимость токенов за 1 млн токенов. Для Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации текущие строки прямого прайсинга таковы:
| Элемент биллинга | Прямая цена Kimi | Примечания для продуктовых команд |
|---|---|---|
| Запись в кэш, TTL 5 минут | $3.00 / 1M tokens | TTL по умолчанию, если TTL не указан |
| Запись в кэш, TTL 1 час | $6.00 / 1M tokens | Полезно только когда более длинное окно повторного использования оправдывает стоимость записи |
| Кэшированный ввод | $0.30 / 1M tokens | Применяется, когда повторяющиеся префиксы попадают в контекстный кэш |
| Ввод | $3.00 / 1M tokens | Применяется к токенам запроса, не попавшим в кэш |
| Вывод | $15.00 / 1M tokens | Часто главный драйвер для циклов агентов и многословных рассуждений |
Это та часть Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации, которую командам следует перевести в математику нагрузки. Маршрут с длинным контекстом может выглядеть доступным по цене ввода и при этом становиться дорогим, если каждый запрос создаёт крупную запись в кэш, генерирует длинный вывод рассуждений или повторяет малоценный контекст.
Используйте такую формулу планирования:
accepted_output_cost =
(cache_write_tokens * cache_write_rate)
+ (cached_input_tokens * cached_input_rate)
+ (uncached_input_tokens * input_rate)
+ (output_tokens * output_rate)
divided by accepted results
Для производственного решения проверьте эту формулу на реальном сэмпле. Включите неудачные генерации, повторы, циклы вызовов инструментов и ответы, отклонённые вашим качественным фильтром продукта.
Контекстное окно и заметки по кэшированию
Kimi указывает контекстное окно в 1 048 576 токенов для Kimi K3. Это делает его актуальным для задач кодирования на уровне репозитория, анализа больших документов, многозального анализа продукта и длительных агентных сессий.
Но окно в 1 млн токенов не отменяет необходимости дисциплины в работе с контекстом:
- Сохраняйте стабильные префиксы неизменными, чтобы автоматическое кэширование могло работать.
- Не помещайте каждый документ в каждый запрос, если поиск по извлечению будет дешевле.
- Ограничивайте длину вывода для задач, которым не требуется развёрнутое рассуждение.
- Держите меньшую запасную модель для коротких запросов, которым не нужен контекст в 1 млн токенов.
- Измеряйте задержку отдельно от цены, потому что длинные промпты меняют пользовательский опыт даже тогда, когда они помещаются.
В документации Kimi сказано, что автоматическое кэширование применяется к обычным запросам модели и не требует cache ID, TTL или дополнительного параметра. Там также отмечается, что новый запрос может попасть в кэш префикса только когда предыдущий промпт превышает 256 токенов. Продуктовым командам следует проверить поведение кэша в собственных логах, прежде чем обещать снижение затрат благодаря Kimi K3.
Совместимость API и форма запроса
В quickstart Kimi используется OpenAI Python SDK с base_url="https://api.moonshot.ai/v1" и model="kimi-k3". Это делает Kimi K3 практичным кандидатом для команд, уже использующих совместимые с OpenAI клиенты Chat Completions.
Детали совместимости всё равно требуют дымового теста в день релиза:
from openai import OpenAI
client = OpenAI(
api_key="MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "user", "content": "Кратко опишите риски маршрутизации для этого релиза."}
],
)
print(completion.choices[0].message.content)
Для Flatkey оставьте идентификатор модели как kimi-k3, направляйте совместимые вызовы через маршрутизатор Flatkey и проверьте маршрут в рабочем процессе руководства по каталогу моделей ИИ перед запуском в production. Страница модели — подходящее место, чтобы подтвердить текущую доступность, поддержку конечных точек и фактическое ценообразование маршрута.
Примечания по маршрутизации для команд Flatkey
Текущий API ценообразования Flatkey показывает kimi-k3 как доступную модель, маршрутизируемую через группу China LLM с поддержкой конечных точек OpenAI. На публичной странице модели Flatkey также отображается маршрут модели Kimi K3 и указано, что это модель chat/completions с контекстом 1M токенов.
Перед добавлением Kimi K3 в production-маршрутизатор зафиксируйте эту запись проверки маршрута. Это передаваемый артефакт для Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации, когда командам платформы, продукта и финансов нужен единый источник истины:
model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
- long-context coding
- knowledge-work agent sessions
- visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
chat_completions: required
streaming: test_required
structured_output: test_required
tool_calls: test_required
vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
- short_context_default
- cheaper_coding_route
rollback_condition:
- error_rate_above_threshold
- accepted_output_cost_above_budget
- latency_p95_above_slo
Это превращает Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации из анонса релиза в рабочий чек-лист.
Чек-лист для production
Используйте этот чек-лист Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации перед переводом трафика:
| Проверка | Что нужно проверить |
|---|---|
| ID модели | kimi-k3 работает в staging и не скрыт за уровнем аккаунта, которого нет у вашего production-ключа |
| Пополнение/доступ | Kimi сообщает, что K3 разблокируется после успешного пополнения, а уровень аккаунта влияет на rate limits |
| Контекст | Ваш самый большой prompt помещается ниже 1,048,576 токенов с запасом для output |
| Бюджет output | max_completion_tokens контролируется для каждой workload |
| Степень reasoning | low, high и max тестируются по latency, cost и quality |
| Кэширование | Workload с повторяющимся префиксом действительно попадает в cache в логах |
| Vision | Публичные image URL не предполагаются; в документации Kimi отдельно указаны input через base64 или ms://<file-id> |
| Инструменты | Циклы tool-call возвращают полное сообщение assistant, а не только content |
| Fallback | Более дешевый или более стабильный route готов до того, как production traffic будет переведен |
| Биллинг | Логи прямого provider и usage logs Flatkey сходятся для одного и того же sample workload |
Когда направлять запросы на Kimi K3
Стоит сначала протестировать Kimi K3, когда workload имеет один или несколько из следующих признаков:
- Большой контекст codebase, длинные planning threads или анализ нескольких документов.
- Задачи, где качество reasoning важнее сырой latency.
- Workflows, которые могут выиграть от caching повторяющегося префикса.
- Multimodal review, где текстовые и визуальные inputs должны обрабатываться за один reasoning pass.
- Agent-задачи, где большее context window снижает хрупкость stitching при retrieval.
Менее вероятно, что это будет route по умолчанию для каждого запроса. Краткая classification, extraction и задачи по support-сообщениям могут работать лучше на более дешевом low-latency model. Практический pattern маршрутизации — резервировать Kimi K3 для workload, где 1M context, reasoning effort или visual understanding меняют accepted-output rate.
Часто задаваемые вопросы
Доступен ли Kimi K3 через API?
Да. В документации API Kimi есть quickstart для Kimi K3, список моделей, страница цен и banner запуска. Данные маршрутов Flatkey также показывают, что kimi-k3 доступен для OpenAI-style routing по состоянию на 22 сентября 2026 года.
Каково context window у Kimi K3?
Kimi указывает context window Kimi K3 как 1,048,576 токенов. Рассматривайте это как capacity, а не как рекомендацию отправлять все доступные документы в каждом запросе.
Какова цена API Kimi K3?
Прямые тарифы Kimi указывают K3 по $3.00 за 1M uncached input tokens, $0.30 за 1M cached input tokens, $3.00 или $6.00 за 1M cache-write tokens в зависимости от TTL и $15.00 за 1M output tokens. Перед запуском проверьте страницу модели Flatkey, чтобы узнать текущую эффективную цену route Flatkey.
Поддерживает ли Kimi K3 настройки reasoning?
Да. Kimi говорит, что у K3 всегда включен thinking mode и поддерживается верхнеуровневое поле reasoning_effort со значениями low, high и max, где max используется по умолчанию.
Как командам использовать страницу Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации?
Используйте это как страницу для triage в день релиза: подтвердите официальные данные о ценах и контексте, выполните контрольный список маршрутизации, рассчитайте стоимость принятого вывода, и только затем решайте, станет ли Kimi K3 основным маршрутом, резервным маршрутом или экспериментальным маршрутом.
Краткий итог
Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации полезен, потому что этот релиз влияет и на возможности модели, и на производственные процессы. Главная новость — 1M контекста и новый флагманский маршрут kimi-k3. Однако решение по-прежнему должно основываться на измеренной стоимости принятого вывода, задержке, поведении кэша, надежности вызовов инструментов и готовности к резервному переключению.
Flatkey помогает командам сделать такую оценку практичной: один ключ, один баланс и маршрутизация моделей через общий API-слой, а каталог моделей и журналы использования доступны для проверки маршрутов до и после запуска.



