Model and Modality Playbooks22 сентября 2026 г.Flatkey Team

Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации

Kimi K3 уже доступен. Перед запуском в продакшн проверьте прямые цены API, контекст 1M, управление рассуждениями, заметки по кэшу и проверки маршрутизации Flatkey.

Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации

Kimi K3 уже доступен для API-команд, которым нужен маршрут к модели с длинным контекстом для программирования, работы с знаниями, визуального рассуждения и агентных сценариев. Кратко: официальный ID модели — kimi-k3, Kimi указывает контекстное окно в 1,048,576 токенов, прямые цены Kimi опубликованы за 1 млн токенов, а Flatkey в настоящее время предоставляет маршрут kimi-k3 через OpenAI-compatible endpoint.

Это руководство предназначено для продуктовых команд, которые решают, должен ли Kimi K3 уже сегодня войти в производственный план маршрутизации. Оно охватывает цены API, ограничения контекстного окна, замечания по совместимости, проверки маршрута и операционные вопросы, на которые нужно ответить до отправки реального трафика. Читайте Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации как чеклист запуска, а не просто как объявление о модели.

Краткий ответ

Для команд, которые ищут Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации, важные факты дня релиза таковы:

ПунктТекущая подтвержденная источниками деталь
Официальный ID моделиkimi-k3
Шаблон прямого endpoint KimiOpenAI-compatible Chat Completions на https://api.moonshot.ai/v1
Контекстное окно1,048,576 токенов
Прямая цена входа$3.00 за 1 млн токенов
Прямая цена кэшированного входа$0.30 за 1 млн токенов
Прямая цена записи в кэш$3.00 за 1 млн токенов для TTL 5 минут; $6.00 за 1 млн токенов для TTL 1 час
Прямая цена выхода$15.00 за 1 млн токенов
Режим thinkingВсегда включен; управляйте усилием с помощью значений reasoning_effort low, high или max
Маршрут Flatkeykimi-k3 доступен в данных маршрутов Flatkey в группе China LLM

Этот релиз — не просто большее контекстное окно. В собственном списке моделей Kimi K3 описан как самая мощная модель на сегодняшний день, с 2.8T параметров, нативным пониманием изображений и контекстным окном на 1 млн токенов для разработки ПО, работы с знаниями и глубокого рассуждения.

Что изменилось с Kimi K3

Kimi K3 заменяет более старые маршруты Kimi как модель, которую командам следует оценить для дальнейшей поддержки Kimi. В документации по моделям Kimi указано, что kimi-k2.5 и серия moonshot-v1 будут прекращены 31 августа 2026 года, и пользователям предлагается kimi-k3 для дальнейшей поддержки.

Это важно для маршрутизации. Если ваше приложение по-прежнему хранит в конфигурации псевдонимы moonshot-v1-*, kimi-latest или более старые kimi-k2-*, безопасный шаг — не слепая замена по поиску и замене. Относитесь к этому как к миграции маршрута:

  1. Найдите каждый ID модели Kimi в коде, промптах, конфигурациях eval и настройках рабочих пространств клиентов.
  2. Переведите одну staging-нагрузку на kimi-k3.
  3. Запустите smoke-тест для контекста, вызова инструментов, JSON, vision и streaming.
  4. Сравните стоимость принятого вывода, а не только цену за токены.
  5. Добавьте fallback-маршрут до выката в production.

Команды Flatkey могут использовать тот же процесс оценки в день релиза в чеклисте оценки новой модели перед переводом Kimi K3 на основной маршрут.

Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации для команд

Прямые цены Kimi API для K3 опубликованы как стоимость токенов за 1 млн токенов. Для Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации текущие строки прямого прайсинга таковы:

Элемент биллингаПрямая цена KimiПримечания для продуктовых команд
Запись в кэш, TTL 5 минут$3.00 / 1M tokensTTL по умолчанию, если TTL не указан
Запись в кэш, TTL 1 час$6.00 / 1M tokensПолезно только когда более длинное окно повторного использования оправдывает стоимость записи
Кэшированный ввод$0.30 / 1M tokensПрименяется, когда повторяющиеся префиксы попадают в контекстный кэш
Ввод$3.00 / 1M tokensПрименяется к токенам запроса, не попавшим в кэш
Вывод$15.00 / 1M tokensЧасто главный драйвер для циклов агентов и многословных рассуждений

Это та часть Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации, которую командам следует перевести в математику нагрузки. Маршрут с длинным контекстом может выглядеть доступным по цене ввода и при этом становиться дорогим, если каждый запрос создаёт крупную запись в кэш, генерирует длинный вывод рассуждений или повторяет малоценный контекст.

Используйте такую формулу планирования:

accepted_output_cost =
  (cache_write_tokens * cache_write_rate)
  + (cached_input_tokens * cached_input_rate)
  + (uncached_input_tokens * input_rate)
  + (output_tokens * output_rate)
  divided by accepted results

Для производственного решения проверьте эту формулу на реальном сэмпле. Включите неудачные генерации, повторы, циклы вызовов инструментов и ответы, отклонённые вашим качественным фильтром продукта.

Контекстное окно и заметки по кэшированию

Kimi указывает контекстное окно в 1 048 576 токенов для Kimi K3. Это делает его актуальным для задач кодирования на уровне репозитория, анализа больших документов, многозального анализа продукта и длительных агентных сессий.

Но окно в 1 млн токенов не отменяет необходимости дисциплины в работе с контекстом:

  • Сохраняйте стабильные префиксы неизменными, чтобы автоматическое кэширование могло работать.
  • Не помещайте каждый документ в каждый запрос, если поиск по извлечению будет дешевле.
  • Ограничивайте длину вывода для задач, которым не требуется развёрнутое рассуждение.
  • Держите меньшую запасную модель для коротких запросов, которым не нужен контекст в 1 млн токенов.
  • Измеряйте задержку отдельно от цены, потому что длинные промпты меняют пользовательский опыт даже тогда, когда они помещаются.

В документации Kimi сказано, что автоматическое кэширование применяется к обычным запросам модели и не требует cache ID, TTL или дополнительного параметра. Там также отмечается, что новый запрос может попасть в кэш префикса только когда предыдущий промпт превышает 256 токенов. Продуктовым командам следует проверить поведение кэша в собственных логах, прежде чем обещать снижение затрат благодаря Kimi K3.

Совместимость API и форма запроса

В quickstart Kimi используется OpenAI Python SDK с base_url="https://api.moonshot.ai/v1" и model="kimi-k3". Это делает Kimi K3 практичным кандидатом для команд, уже использующих совместимые с OpenAI клиенты Chat Completions.

Детали совместимости всё равно требуют дымового теста в день релиза:

from openai import OpenAI

client = OpenAI(
    api_key="MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "user", "content": "Кратко опишите риски маршрутизации для этого релиза."}
    ],
)

print(completion.choices[0].message.content)

Для Flatkey оставьте идентификатор модели как kimi-k3, направляйте совместимые вызовы через маршрутизатор Flatkey и проверьте маршрут в рабочем процессе руководства по каталогу моделей ИИ перед запуском в production. Страница модели — подходящее место, чтобы подтвердить текущую доступность, поддержку конечных точек и фактическое ценообразование маршрута.

Примечания по маршрутизации для команд Flatkey

Текущий API ценообразования Flatkey показывает kimi-k3 как доступную модель, маршрутизируемую через группу China LLM с поддержкой конечных точек OpenAI. На публичной странице модели Flatkey также отображается маршрут модели Kimi K3 и указано, что это модель chat/completions с контекстом 1M токенов.

Перед добавлением Kimi K3 в production-маршрутизатор зафиксируйте эту запись проверки маршрута. Это передаваемый артефакт для Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации, когда командам платформы, продукта и финансов нужен единый источник истины:

model_id: kimi-k3
provider: Moonshot AI / Kimi
route_owner: product-or-platform-team
primary_use_cases:
  - long-context coding
  - knowledge-work agent sessions
  - visual reasoning review
context_window_tokens: 1048576
direct_pricing_checked_at: 2026-09-22
flatkey_route_checked_at: 2026-09-22
endpoint_contract:
  chat_completions: required
  streaming: test_required
  structured_output: test_required
  tool_calls: test_required
  vision_input: test_required
cost_metric: cost_per_accepted_output
fallback_routes:
  - short_context_default
  - cheaper_coding_route
rollback_condition:
  - error_rate_above_threshold
  - accepted_output_cost_above_budget
  - latency_p95_above_slo

Это превращает Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации из анонса релиза в рабочий чек-лист.

Чек-лист для production

Используйте этот чек-лист Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации перед переводом трафика:

ПроверкаЧто нужно проверить
ID моделиkimi-k3 работает в staging и не скрыт за уровнем аккаунта, которого нет у вашего production-ключа
Пополнение/доступKimi сообщает, что K3 разблокируется после успешного пополнения, а уровень аккаунта влияет на rate limits
КонтекстВаш самый большой prompt помещается ниже 1,048,576 токенов с запасом для output
Бюджет outputmax_completion_tokens контролируется для каждой workload
Степень reasoninglow, high и max тестируются по latency, cost и quality
КэшированиеWorkload с повторяющимся префиксом действительно попадает в cache в логах
VisionПубличные image URL не предполагаются; в документации Kimi отдельно указаны input через base64 или ms://<file-id>
ИнструментыЦиклы tool-call возвращают полное сообщение assistant, а не только content
FallbackБолее дешевый или более стабильный route готов до того, как production traffic будет переведен
БиллингЛоги прямого provider и usage logs Flatkey сходятся для одного и того же sample workload

Когда направлять запросы на Kimi K3

Стоит сначала протестировать Kimi K3, когда workload имеет один или несколько из следующих признаков:

  • Большой контекст codebase, длинные planning threads или анализ нескольких документов.
  • Задачи, где качество reasoning важнее сырой latency.
  • Workflows, которые могут выиграть от caching повторяющегося префикса.
  • Multimodal review, где текстовые и визуальные inputs должны обрабатываться за один reasoning pass.
  • Agent-задачи, где большее context window снижает хрупкость stitching при retrieval.

Менее вероятно, что это будет route по умолчанию для каждого запроса. Краткая classification, extraction и задачи по support-сообщениям могут работать лучше на более дешевом low-latency model. Практический pattern маршрутизации — резервировать Kimi K3 для workload, где 1M context, reasoning effort или visual understanding меняют accepted-output rate.

Часто задаваемые вопросы

Доступен ли Kimi K3 через API?

Да. В документации API Kimi есть quickstart для Kimi K3, список моделей, страница цен и banner запуска. Данные маршрутов Flatkey также показывают, что kimi-k3 доступен для OpenAI-style routing по состоянию на 22 сентября 2026 года.

Каково context window у Kimi K3?

Kimi указывает context window Kimi K3 как 1,048,576 токенов. Рассматривайте это как capacity, а не как рекомендацию отправлять все доступные документы в каждом запросе.

Какова цена API Kimi K3?

Прямые тарифы Kimi указывают K3 по $3.00 за 1M uncached input tokens, $0.30 за 1M cached input tokens, $3.00 или $6.00 за 1M cache-write tokens в зависимости от TTL и $15.00 за 1M output tokens. Перед запуском проверьте страницу модели Flatkey, чтобы узнать текущую эффективную цену route Flatkey.

Поддерживает ли Kimi K3 настройки reasoning?

Да. Kimi говорит, что у K3 всегда включен thinking mode и поддерживается верхнеуровневое поле reasoning_effort со значениями low, high и max, где max используется по умолчанию.

Как командам использовать страницу Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации?

Используйте это как страницу для triage в день релиза: подтвердите официальные данные о ценах и контексте, выполните контрольный список маршрутизации, рассчитайте стоимость принятого вывода, и только затем решайте, станет ли Kimi K3 основным маршрутом, резервным маршрутом или экспериментальным маршрутом.

Краткий итог

Kimi K3 уже доступен: цены API, контекстное окно и заметки по маршрутизации полезен, потому что этот релиз влияет и на возможности модели, и на производственные процессы. Главная новость — 1M контекста и новый флагманский маршрут kimi-k3. Однако решение по-прежнему должно основываться на измеренной стоимости принятого вывода, задержке, поведении кэша, надежности вызовов инструментов и готовности к резервному переключению.

Flatkey помогает командам сделать такую оценку практичной: один ключ, один баланс и маршрутизация моделей через общий API-слой, а каталог моделей и журналы использования доступны для проверки маршрутов до и после запуска.