Cost, Billing, and Ops2026年7月27日Big Y

2026 年 Gemini API 定价:当前模型成本与工作负载计算器

对比当前 Gemini API 定价,并提供 Gemini 3.6 Flash、3.5 Flash-Lite、Gemini 2.5 模型、Batch 任务、缓存和长上下文工作负载的可复现工作负载成本表。

2026 年 Gemini API 定价:当前模型成本与工作负载计算器

如果您正在比较 2026 年的 Gemini API 定价,最难的部分不是找到费率表,而是判断哪一张费率表适用于您的工作负载。

搜索结果通常会混淆四种不同的产品:Gemini Developer API、Google AI Studio 的测试体验、Vertex AI 或其他 Google Cloud 服务,以及面向消费者的 Gemini 订阅。本指南聚焦于 Gemini Developer API,并使用了在 2026 年 7 月 27 日核查的 Google 官方定价和计费页面。

简而言之,Gemini API 成本取决于五个变量:

  1. 您选择的模型家族
  2. 输入和输出 token 数量
  3. 单个提示是否跨越长上下文阈值
  4. 工作负载是否可以使用 Batch 定价
  5. 上下文缓存、grounding、音频、图像或视频等附加项

这意味着,最低的标称 token 价格并不总是最低的生产成本。真正有用的比较方式,是在相同假设下,对每个候选模型制作一张工作负载成本表。

Gemini API 定价一览

下表汇总了团队最可能比较的主要支持文本的 Gemini Developer API 项。价格以每 100 万 token 的美元计,基于 Google 的官方 Gemini Developer API 定价页面

模型 状态 标准输入 标准输出 Batch 输入 Batch 输出 上下文缓存写入 每小时缓存存储
Gemini 3.6 Flash 预览版 $0.40 $2.40 $0.20 $1.20 $0.04 $1.00
Gemini 3.5 Flash 预览版 $1.50 $9.00 $0.75 $4.50 $0.15 $1.00
Gemini 3.5 Flash-Lite 预览版 $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 3.1 Flash-Lite 预览版 $0.25 $1.50 $0.125 $0.75 $0.025 $1.00
Gemini 2.5 Pro 稳定版 $1.25,最高 20 万;$2.50,超过 20 万 $10.00,最高 20 万;$15.00,超过 20 万 $0.625,最高 20 万;$1.25,超过 20 万 $5.00,最高 20 万;$7.50,超过 20 万 $0.125,最高 20 万;$0.25,超过 20 万 $4.50
Gemini 2.5 Flash 稳定版 $0.30 $2.50 $0.15 $1.25 $0.03 $1.00
Gemini 2.5 Flash-Lite 稳定版 $0.10 $0.40 $0.05 $0.20 $0.01 $1.00

对于 Gemini 3.6 Flash、Gemini 3.5 Flash、Flash-Lite 预览版模型以及 Gemini 2.5 Flash 系列,音频输入的费率高于文本、图像或视频输入。为了让各模型行保持可比性,表格使用的是文本、图像和视频输入费率。

预览版模型在稳定发布前可能会发生变化。如果您的生产策略需要固定行为、更长的弃用窗口或稳定的模型标识符,请将预览版的经济性与稳定版 Gemini 2.5 条目进行比较,而不是仅凭价格做选择。

2026 年 7 月 27 日更新中有哪些变化

与本指南上一版本相比,最重要的变化是当前模型阵容。

  • Gemini 3.6 Flash Preview 现作为高吞吐量选项出现,输入每百万 token 0.40 美元,输出每百万 token 2.40 美元。
  • Gemini 3.5 Flash-Lite Preview 现以输入每百万 token 0.25 美元、输出每百万 token 1.50 美元的价格出现。
  • 更早的 Gemini 3.1 Flash-Lite 行仍然可见,但买家应确认他们打算使用的是哪个 preview 模型标识符。
  • 稳定版 Gemini 2.5 模型对于重视生命周期可预测性的团队来说,仍然是有用的比较基准。

这就是为什么 Gemini 定价页面需要定期维护。即使目录中的每个旧数字在技术上仍然存在,正确的表格也可能在战略上具有误导性。

Gemini API 工作负载成本表

下表将费率转换为预算估算。这些场景不是质量基准,模型也不能互换。它们回答的是一个更窄的财务问题:如果相同的工作负载运行在每条路径上,token 账单会是多少?

假设

工作负载 请求量 每个请求的输入 每个请求的输出 总输入 总输出
分类和提取 1,000 次请求 2,000 tokens 300 tokens 2M tokens 0.3M tokens
检索增强型助手 1,000 次请求 20,000 tokens 1,000 tokens 20M tokens 1M tokens
长文档审阅 100 次请求 150,000 tokens 5,000 tokens 15M tokens 0.5M tokens

长文档场景将每个提示保持在 Gemini 2.5 Pro 的 200k 阈值以下。不包括 grounding、缓存、音频、图像生成和视频生成。

估算的 Standard 层级 token 成本

模型 分类 RAG 助手 长文档审阅
Gemini 3.5 Flash-Lite $0.95 $6.50 $4.50
Gemini 3.6 Flash $1.52 $10.40 $7.20
Gemini 2.5 Flash-Lite $0.32 $2.40 $1.70
Gemini 2.5 Flash $1.35 $8.50 $5.75
Gemini 3.5 Flash $5.70 $39.00 $27.00
Gemini 2.5 Pro $5.50 $35.00 $23.75

这些总计说明了为什么工作负载表比模型列表更有用。

  • 对于窄范围提取,在此比较中稳定版 Gemini 2.5 Flash-Lite 行的 token 成本最低。
  • Gemini 3.6 Flash 的成本高于 Lite 路线,但在相同假设下明显低于 Gemini 3.5 Flash。
  • 在长文档示例中,Gemini 2.5 Pro 的 token 账单低于 Gemini 3.5 Flash,因为提示保持在 Pro 阈值以下。这并不能证明它是更好的模型,但它避免了一种误导性的假设,即每个 Pro 工作负载都必须更贵。
  • 输出占比高的应用对模型选择更敏感,因为在这里展示的每一行中,输出 token 的成本都高于文本输入 token。

Batch 定价对相同工作负载的影响

对于支持 Batch API 的行,Google 列出的 Batch 令牌费率通常是 Standard 费率的一半。如果以上场景中的每个请求都可以异步运行,则估算的令牌总成本变为:

模型 使用 Batch 的分类 使用 Batch 的 RAG 助手 使用 Batch 的长文档审查
Gemini 3.5 Flash-Lite $0.475 $3.25 $2.25
Gemini 3.6 Flash $0.76 $5.20 $3.60
Gemini 2.5 Flash-Lite $0.16 $1.20 $0.85
Gemini 2.5 Flash $0.675 $4.25 $2.875
Gemini 3.5 Flash $2.85 $19.50 $13.50
Gemini 2.5 Pro $2.75 $17.50 $11.875

Batch 是一个计费和架构决策。它非常适合离线增强、评估运行、夜间摘要、文档回填以及其他不需要立即响应的任务。当用户正在交互式产品流程中等待时,它不能替代 Standard 服务。

Gemini API 成本背后的公式

对于不包含附加功能的文本工作负载,请使用:

monthly cost =
  (input tokens / 1,000,000 × input rate)
  + (output tokens / 1,000,000 × output rate)

如果应用使用上下文缓存,则需要加上缓存写入和存储成本。如果使用 grounding、音频、生成图像或生成视频,则应分别计算这些项目,因为它们不共享统一的令牌费率。

对于财务审查,请将假设与结果一并保留:

需要记录的假设 重要原因
每月请求数 将单次请求行为转换为预算
平均和 p95 输入令牌数 较长的提示可能触发更高的 Pro 定价
平均和 p95 输出令牌数 输出通常是成本更高的一侧
Standard 与 Batch 的占比 异步工作可显著降低令牌支出
缓存写入量和保留时长 复用可以节省输入成本,但存储并非免费
已 grounding 的请求 Google Search 和 Maps 有单独的额度和费用
音频、图像和视频单位 多模态定价可能主导文本令牌账单

Gemini API 免费层与付费层

Google 为若干当前的 Gemini Developer API 模型提供了免费层。这使它适用于实验、原型和低量验证。但这并不会让生产环境成本问题消失。

Gemini API 计费文档区分了免费和付费用量,并解释了项目如何进入付费层。在将一个成功的免费层原型视为生产证据之前,团队应确认当前的资格、速率限制、数据使用条款以及模型可用性。

实际上的区别是:

  • 使用免费层测试提示、SDK 行为和产品契合度。
  • 使用付费层费率和真实 token 遥测来批准生产预算。
  • 不要假设预览模型、免费额度或速率限制在发布前会保持不变。

Gemini Pro 定价与 200k token 分界点

Gemini 2.5 Pro 在当前表格中拥有最重要的定价阈值之一。最多 200k token 的提示使用较低的输入和输出费率。超过 200k 的提示则使用更高费率。

该阈值适用于单次请求的提示大小,而不是每月总量。一个团队发送 2000 万 token,且分散在许多小提示中,仍可保持较低费率;而一个较低流量但长上下文的应用则可能反复跨过该分界点。

至少跟踪以下两个指标:

  1. 超过 200k 输入 token 的请求占比
  2. 这些请求带来的成本占比

如果少量超大提示驱动了大部分支出,可以考虑分块、检索、摘要、缓存复用,或采用路由策略,将长上下文模型保留给真正需要它的请求。

上下文缓存、 grounding 和多模态成本

token 费率只是 Gemini API 定价的基础层。

上下文缓存

官方表格列出了缓存写入价格和按小时存储价格。当同一大上下文被重复使用足够多次时,缓存可以改善经济性,但盈亏平衡点取决于写入量、保留时长以及缓存替代了多少重复输入。

Google Search 和 Maps grounding

grounding 包含按模型不同的免费额度,之后按每次查询或每个提示收费。不要仅凭 token 费率来估算带 grounding 的应用。请记录带 grounding 的请求数量,并将其作为单独的成本项进行核对。

实时音频

Live API 音频使用的输入和输出费率与普通文本调用不同。语音代理团队应单独为音频 token 预算,并在负载测试中纳入会话时长、中断行为和回复冗长度。

图像和视频生成

生成的图像和视频使用特定于多模态的计量单位和模型行定价。应将它们视为独立的生产预算,而不是文本模型估算的延伸。

Gemini Developer API 与 Vertex AI 及消费者套餐

“Gemini 定价”可能指向几种不同的购买路径。

产品 典型买家问题 为什么不应将其混入此表
Gemini Developer API 应用调用会花费多少? 这是本指南总结的费率卡
Google AI Studio 我可以进行原型设计并获取 API 密钥吗? 它是开发界面,不是单独的通用生产费率卡
Vertex AI 我如何在 Google Cloud 中运行 Gemini? 商业条款、控制项和服务选项可能不同
Consumer Gemini plans 个人订阅包含什么? 订阅定价不是 API token 定价
Gemini Enterprise or Agent Platform 更广泛的企业产品成本是多少? 它与 Developer API 调用属于不同的产品范围

在比较供应商或网关时,请确保双方采用相同的购买路径。将面向消费者的订阅与 API token 进行比较,或将托管云服务与开发者 API 进行比较,都会得出看起来很整洁、但实际上无法使用的结论。

何时直接使用 Google 访问就足够了

在以下情况下,直接访问 Gemini 往往是最简单的选择:

  • Gemini 是生产环境中唯一使用的模型家族。
  • 团队对 Google 的计费和账户结构感到满意。
  • 工程团队不需要跨供应商故障转移或路由抽象。
  • 财务团队可以在不汇总其他 AI 供应商的情况下审查用量。

当运营问题超出单一供应商范围时,AI API 网关会变得更有价值:

  • 产品同时使用 Gemini、GPT、Claude 或其他模型家族
  • 工程团队希望拥有统一的凭证入口和集中化的模型路由
  • 财务团队希望整合余额、发票或用量审查
  • 运营团队需要模型级计量和共享策略控制
  • 团队希望在不重建每个集成的情况下更改路由

网关并不会消除理解底层模型价格的必要。它改变的是围绕这些价格来管理访问、路由、采购和报告的方式。

Flatkey 为多个模型家族提供统一的 API 访问层。请查看当前的 Flatkey 定价页面了解其商业模式,然后在 AI 模型价格比较中对更广泛的模型格局进行比较。

Gemini 定价的周期性刷新清单

定价页面应有指定的来源审查负责人以及定期刷新时间。对于像 Gemini API 定价这样高需求的查询,按月审查是合理的默认频率;在 Google 发布重大模型公告后,应立即进行审查。

请使用以下清单:

  1. 对照 Google 官方定价页面比较模型顺序和生命周期标签。
  2. 记录新的预览版、稳定版、已弃用和已移除模型标识符。
  3. 分别验证 Standard、Batch、cache-write 和 cache-storage 的费率。
  4. 重新检查提示长度阈值,以及它们是否影响输入、输出,或二者都影响。
  5. 验证免费层可用性和计费层级措辞。
  6. 根据已发布的假设重新计算每个工作负载示例。
  7. 检查 grounding、Live API、图像和视频部分是否有单独的价格变动。
  8. 确认内部链接、产品声明和公开定价 CTA 仍然准确。
  9. 仅在完成来源审查后更新可见的“检查于”日期。

目标不是承诺某篇定价文章永不过时。目标是让每个数字都可追溯、每个场景都可复现,并让每次刷新都足够快,以保持页面实用。

购买决策

从工作负载形态入手,而不是从模型名称入手。

  • 选择满足任务质量和延迟要求的最低成本路径。
  • 对符合条件的异步工作使用 Batch。
  • 关注输出 token 和长上下文断点。
  • 分别为缓存、grounding、音频、图像和视频预留预算。
  • 当 Gemini 不再是技术栈中唯一的提供方时,重新审视访问架构。

这一流程把 Gemini API 定价从静态表格转变为可重复的运营决策。