Cost, Billing, and Ops27 июля 2026 г.Big Y

Цены Gemini API в 2026 году: текущая стоимость моделей и калькулятор нагрузок

Сравните актуальные цены Gemini API с воспроизводимыми таблицами стоимости нагрузок для Gemini 3.6 Flash, 3.5 Flash-Lite, моделей Gemini 2.5, Batch-задач, кеширования и длинного контекста.

Цены Gemini API в 2026 году: текущая стоимость моделей и калькулятор нагрузок

Если вы сравниваете цены Gemini API в 2026 году, самое сложное — не найти тарифную сетку. Самое сложное — понять, какая именно тарифная сетка подходит для вашей нагрузки.

В результатах поиска регулярно смешиваются четыре разных продукта: Gemini Developer API, тестовая среда Google AI Studio, Vertex AI или другие сервисы Google Cloud, а также потребительские подписки Gemini. Это руководство посвящено Gemini Developer API и использует официальные страницы Google с ценами и биллингом, проверенные 27 июля 2026 года.

Короткий ответ: стоимость Gemini API зависит от пяти переменных:

  1. выбранного семейства моделей
  2. объёма входных и выходных токенов
  3. пересекают ли отдельные запросы порог длинного контекста
  4. может ли нагрузка использовать тарификацию Batch
  5. дополнительных функций, таких как кеширование контекста, grounding, аудио, изображения или видео

Это означает, что самая низкая заявленная цена за токен не всегда даёт самую низкую стоимость в продакшене. Полезнее сравнивать таблицу стоимости нагрузки с одинаковыми допущениями для каждой кандидатной модели.

Цены Gemini API вкратце

Таблица ниже кратко показывает основные строковые позиции Gemini Developer API с поддержкой текста, которые команды чаще всего сравнивают. Цены указаны в долларах США за 1 миллион токенов на основе официальной страницы цен Gemini Developer API Google.

Модель Статус Стандартный вход Стандартный выход Batch-вход Batch-выход Запись в кеш контекста Хранение кеша в час
Gemini 3.6 Flash Preview $0.40 $2.40 $0.20 $1.20 $0.04 $1.00
Gemini 3.5 Flash Preview $1.50 $9.00 $0.75 $4.50 $0.15 $1.00
Gemini 3.5 Flash-Lite Preview $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 3.1 Flash-Lite Preview $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 2.5 Pro Stable $1.25 до 200k; $2.50 выше 200k $10.00 до 200k; $15.00 выше 200k $0.625 до 200k; $1.25 выше 200k $5.00 до 200k; $7.50 выше 200k $0.125 до 200k; $0.25 выше 200k $4.50
Gemini 2.5 Flash Stable $0.30 $2.50 $0.15 $1.25 $0.03 $1.00
Gemini 2.5 Flash-Lite Stable $0.10 $0.40 $0.05 $0.20 $0.01 $1.00

Для Gemini 3.6 Flash, Gemini 3.5 Flash, preview-моделей Flash-Lite и семейств Gemini 2.5 Flash стоимость аудиовхода выше, чем текста, изображений или видео. В таблице используется ставка для текстового, графического и видео-входа, чтобы строки моделей оставались сопоставимыми.

Preview-модели могут измениться до выхода stable-версии. Если ваша производственная политика требует фиксированного поведения, более длинных сроков вывода из эксплуатации или стабильного идентификатора модели, сравнивайте экономику preview с stable-строками Gemini 2.5 вместо выбора только по цене.

Что изменилось в обновлении от 27 июля 2026 года

Самое важное изменение с предыдущей версии этого руководства — текущая линейка моделей.

  • Gemini 3.6 Flash Preview теперь представлен как вариант с высокой пропускной способностью по цене $0.40 за вход и $2.40 за выход на миллион токенов.
  • Gemini 3.5 Flash-Lite Preview теперь представлен по цене $0.25 за вход и $1.50 за выход на миллион токенов.
  • Более ранняя строка Gemini 3.1 Flash-Lite по-прежнему видна, но покупателям следует подтвердить, какой именно preview-идентификатор модели они собираются использовать.
  • Стабильные модели Gemini 2.5 по-прежнему остаются полезными ориентирами для сравнения для команд, которым важна предсказуемость жизненного цикла.

Вот почему странице с ценами Gemini требуется плановое обслуживание. Корректная таблица может стать стратегически вводящей в заблуждение, даже если все старые цифры по-прежнему технически присутствуют где-то в каталоге.

Таблица стоимости рабочих нагрузок Gemini API

Таблица ниже переводит тарифы в бюджетные оценки. Эти сценарии не являются бенчмарками качества, а модели — взаимозаменяемыми. Они отвечают на более узкий финансовый вопрос: каким будет счет за токены, если одна и та же нагрузка будет выполняться по каждому из маршрутов?

Предположения

Нагрузка Объем запросов Вход на запрос Выход на запрос Общий вход Общий выход
Классификация и извлечение 1,000 запросов 2,000 токенов 300 токенов 2M токенов 0.3M токенов
Ассистент с дополнением через поиск 1,000 запросов 20,000 токенов 1,000 токенов 20M токенов 1M токенов
Проверка длинных документов 100 запросов 150,000 токенов 5,000 токенов 15M токенов 0.5M токенов

Сценарий с длинными документами сохраняет каждый промпт ниже порога Gemini 2.5 Pro в 200k. Grounding, кэширование, генерация аудио, генерация изображений и генерация видео исключены.

Оценочная стоимость токенов в Standard-tier

Модель Классификация RAG-ассистент Проверка длинных документов
Gemini 3.5 Flash-Lite $0.95 $6.50 $4.50
Gemini 3.6 Flash $1.52 $10.40 $7.20
Gemini 2.5 Flash-Lite $0.32 $2.40 $1.70
Gemini 2.5 Flash $1.35 $8.50 $5.75
Gemini 3.5 Flash $5.70 $39.00 $27.00
Gemini 2.5 Pro $5.50 $35.00 $23.75

Эти итоги показывают, почему таблица рабочих нагрузок полезнее, чем список моделей.

  • Для узкого извлечения данных стабильная строка Gemini 2.5 Flash-Lite имеет самую низкую стоимость токенов в этом сравнении.
  • Gemini 3.6 Flash стоит дороже, чем варианты Lite, но существенно дешевле, чем Gemini 3.5 Flash при тех же предположениях.
  • В примере с длинными документами счет за токены у Gemini 2.5 Pro ниже, чем у Gemini 3.5 Flash, потому что промпт остается ниже порога Pro. Это не доказывает, что это лучшая модель, но предотвращает вводящее в заблуждение предположение, что любая нагрузка Pro обязательно должна стоить дороже.
  • Приложения с высоким объемом вывода более чувствительны к выбору модели, потому что токены вывода стоят дороже, чем текстовые токены ввода, во всех показанных здесь строках.

Что делает Batch-ценообразование с теми же рабочими нагрузками

Для строк, которые поддерживают Batch API, указанные Google тарифы Batch по токенам, как правило, вдвое ниже стандартных тарифов. Если каждый запрос в сценариях выше можно выполнять асинхронно, то оценочные итоги по токенам становятся такими:

Модель Классификация с Batch RAG-ассистент с Batch Проверка длинных документов с Batch
Gemini 3.5 Flash-Lite $0.475 $3.25 $2.25
Gemini 3.6 Flash $0.76 $5.20 $3.60
Gemini 2.5 Flash-Lite $0.16 $1.20 $0.85
Gemini 2.5 Flash $0.675 $4.25 $2.875
Gemini 3.5 Flash $2.85 $19.50 $13.50
Gemini 2.5 Pro $2.75 $17.50 $11.875

Batch — это решение и для биллинга, и для архитектуры. Оно отлично подходит для офлайн-обогащения, прогонов оценки, ночных сводок, догрузки документов и других задач, которым не требуется немедленный ответ. Оно не заменяет Standard service, когда пользователь ожидает ответа в интерактивном сценарии продукта.

Формула, лежащая в основе стоимости Gemini API

Для текстовой нагрузки без дополнительных функций используйте:

monthly cost =
  (input tokens / 1,000,000 × input rate)
  + (output tokens / 1,000,000 × output rate)

Если приложение использует context caching, добавьте затраты на запись в кеш и хранение. Если оно использует grounding, аудио, сгенерированные изображения или сгенерированное видео, рассчитывайте эти строки отдельно, потому что для них не действует единая универсальная ставка за токен.

Для финансового анализа сохраняйте допущения рядом с результатом:

Что нужно зафиксировать в допущениях Почему это важно
Запросов в месяц Преобразует поведение на уровне одного запроса в бюджет
Среднее и p95 количество входных токенов Длинные промпты могут привести к более высокой цене Pro
Среднее и p95 количество выходных токенов Выходная часть часто обходится дороже
Доля Standard и Batch Асинхронная работа может существенно снизить расходы на токены
Объём записи в кеш и время хранения Повторное использование может снизить стоимость входа, но хранение не бесплатно
Запросы с grounding У Google Search и Maps есть отдельные лимиты и сборы
Единицы аудио, изображений и видео Ценообразование по модальностям может доминировать над счётом за текстовые токены

Бесплатный тариф Gemini API против платного тарифа

Google показывает бесплатный тариф для нескольких текущих моделей Gemini Developer API. Это делает его полезным для экспериментов, прототипов и проверок с низким объёмом. Но это не снимает вопрос о стоимости в production.

В документации по биллингу Gemini API разделяются бесплатное и платное использование, а также объясняется, как проекты переходят на платные тарифы. Командам следует проверить текущую доступность, лимиты, условия использования данных и доступность моделей, прежде чем считать успешный прототип на бесплатном тарифе доказательством готовности к production.

Практическое различие таково:

  • Используйте бесплатный тариф, чтобы протестировать промпты, поведение SDK и соответствие продукту.
  • Используйте тарифы платного уровня и реальные данные телеметрии по токенам, чтобы утвердить производственный бюджет.
  • Не предполагайте, что preview-модель, бесплатная квота или ограничение скорости останутся неизменными к моменту запуска.

Цены Gemini Pro и порог в 200 тыс. токенов

Gemini 2.5 Pro имеет один из самых важных ценовых порогов в текущей таблице. Для промптов до 200 тыс. токенов действуют более низкие ставки на вход и выход. Для промптов свыше 200 тыс. применяются более высокие ставки.

Этот порог относится к размеру промпта отдельного запроса, а не к месячному итогу. Команда, отправляющая 20 миллионов токенов в множество небольших промптов, может оставаться на более низкой ставке, тогда как приложение с меньшим объемом, но длинным контекстом, может многократно пересекать этот порог.

Отслеживайте как минимум эти две метрики:

  1. доля запросов с количеством входных токенов выше 200 тыс.
  2. вклад этих запросов в общую стоимость

Если небольшая доля слишком больших промптов формирует значительную часть расходов, рассмотрите разбиение на части, retrieval, суммаризацию, повторное использование кэша или маршрутную политику, которая резервирует модель с длинным контекстом только для запросов, которым она действительно нужна.

Кэширование контекста, grounding и стоимость модальностей

Тарифы за токены — это лишь базовый слой ценообразования Gemini API.

Кэширование контекста

В официальной таблице указаны цена записи в кэш и почасовая стоимость хранения. Кэширование может улучшить экономику, когда один и тот же большой контекст переиспользуется достаточно много раз, но точка безубыточности зависит от объема записей, времени хранения и того, сколько повторяющегося входа заменяет кэш.

Grounding в Google Search и Maps

Grounding включает бесплатные лимиты, зависящие от модели, после которых взимаются платежи за запрос или за промпт. Не оценивайте grounded-приложение только по тарифам за токены. Фиксируйте количество grounded-запросов и сверяйте их как отдельную статью расходов.

Аудио в реальном времени

Аудио Live API использует другие ставки на вход и выход по сравнению с обычными текстовыми вызовами. Командам голосовых агентов следует планировать бюджет на аудиотокены отдельно и учитывать длительность сеанса, поведение при прерываниях и многословность ответа в нагрузочных тестах.

Генерация изображений и видео

Сгенерированные изображения и видео оцениваются по единицам и строкам модели, специфичным для соответствующей модальности. Рассматривайте их как отдельные производственные бюджеты, а не как продолжение оценки для текстовой модели.

Gemini Developer API, Vertex AI и потребительские планы

Фраза "цены Gemini" может относиться к нескольким вариантам покупки.

Продукт Типичный вопрос покупателя Почему это не следует смешивать с этой таблицей
Gemini Developer API Сколько будут стоить вызовы приложения? Это прайс-лист, кратко изложенный в данном руководстве
Google AI Studio Могу ли я создавать прототипы и получить API-ключ? Это среда для разработки, а не отдельный универсальный прайс-лист для продакшена
Vertex AI Как мне использовать Gemini внутри Google Cloud? Коммерческие условия, контроль и варианты сервиса могут отличаться
Потребительские планы Gemini Что включает индивидуальная подписка? Стоимость подписки — это не стоимость API-токенов
Gemini Enterprise или Agent Platform Сколько стоит более широкий корпоративный продукт? Это другой продуктовый охват по сравнению с вызовами Developer API

При сравнении поставщиков или шлюзов сохраняйте одинаковый путь покупки с обеих сторон. Сравнение потребительской подписки с API-токенами или управляемого облачного сервиса с API для разработчиков даёт выглядящий аккуратно, но непригодный вывод.

Когда прямого доступа Google достаточно

Прямой доступ к Gemini часто является самым простым выбором, когда:

  • Gemini — единственное семейство моделей в продакшене.
  • Команда комфортно работает со структурой биллинга и аккаунтов Google.
  • Инженерной команде не нужен отказоустойчивый переход между провайдерами или абстракция маршрутизации.
  • Финансы могут анализировать использование без консолидации других ИИ-вендоров.

Шлюз API для ИИ становится полезнее, когда операционная задача выходит за рамки одного провайдера:

  • продукт использует Gemini, GPT, Claude или другие семейства моделей
  • инженерной команде нужен единый контур учётных данных и централизованная маршрутизация моделей
  • финансы хотят консолидированные балансы, счета или обзор использования
  • операциям нужен учёт на уровне модели и общие политики управления
  • команды хотят менять маршруты без перестройки каждой интеграции

Шлюз не отменяет необходимость понимать базовые цены моделей. Он меняет то, как вокруг этих цен управляются доступ, маршрутизация, закупки и отчётность.

Flatkey предоставляет один уровень API-доступа для нескольких семейств моделей. Ознакомьтесь с текущей страницей цен Flatkey для коммерческой модели, а затем сравните более широкий ландшафт моделей в сравнении цен на модели ИИ.

Чек-лист для регулярного обновления цен Gemini

У страниц с ценами должен быть назначенный ответственный за проверку источников и регулярное окно обновления. Для запроса с высоким спросом, такого как цены Gemini API, ежемесячная проверка — разумная отправная точка, а после крупных анонсов моделей Google требуется немедленная проверка.

Используйте этот чек-лист:

  1. Сравните порядок моделей и метки жизненного цикла на официальной странице цен Google.
  2. Зафиксируйте новые идентификаторы моделей preview, stable, deprecated и removed.
  3. Отдельно проверьте ставки Standard, Batch, cache-write и cache-storage.
  4. Повторно проверьте пороги длины промпта и влияют ли они на вход, выход или на оба.
  5. Проверьте доступность бесплатного уровня и формулировки тарифного уровня биллинга.
  6. Пересчитайте каждый пример нагрузки на основе опубликованных допущений.
  7. Проверьте разделы grounding, Live API, image и video на предмет отдельных изменений цен.
  8. Подтвердите, что внутренние ссылки, заявления о продукте и публичный CTA с ценами остаются актуальными.
  9. Обновляйте видимую дату «проверено» только после завершения проверки источника.

Цель не в том, чтобы обещать, что статья о ценах никогда не устареет. Цель — сделать каждую цифру отслеживаемой, каждый сценарий воспроизводимым, а каждое обновление достаточно быстрым, чтобы страница оставалась полезной.

Решение о покупке

Начинайте со структуры нагрузки, а не с названия модели.

  • Выбирайте самый недорогой маршрут, который отвечает требованиям задачи по качеству и задержке.
  • Используйте Batch для подходящих асинхронных задач.
  • Следите за output tokens и порогами длинного контекста.
  • Отдельно закладывайте бюджет на caching, grounding, audio, image и video.
  • Возвращайтесь к архитектуре доступа, когда Gemini перестаёт быть единственным провайдером в стеке.

Такой процесс превращает цены Gemini API из статической таблицы в повторяемое операционное решение.