如果您正在比较 2026 年的 Gemini API 定价,最难的部分不是找到费率表,而是判断哪一张费率表适用于您的工作负载。
搜索结果通常会混淆四种不同的产品:Gemini Developer API、Google AI Studio 的测试体验、Vertex AI 或其他 Google Cloud 服务,以及面向消费者的 Gemini 订阅。本指南聚焦于 Gemini Developer API,并使用了在 2026 年 7 月 27 日核查的 Google 官方定价和计费页面。
简而言之,Gemini API 成本取决于五个变量:
- 您选择的模型家族
- 输入和输出 token 数量
- 单个提示是否跨越长上下文阈值
- 工作负载是否可以使用 Batch 定价
- 上下文缓存、grounding、音频、图像或视频等附加项
这意味着,最低的标称 token 价格并不总是最低的生产成本。真正有用的比较方式,是在相同假设下,对每个候选模型制作一张工作负载成本表。
Gemini API 定价一览
下表汇总了团队最可能比较的主要支持文本的 Gemini Developer API 项。价格以每 100 万 token 的美元计,基于 Google 的官方 Gemini Developer API 定价页面。
| 模型 | 状态 | 标准输入 | 标准输出 | Batch 输入 | Batch 输出 | 上下文缓存写入 | 每小时缓存存储 |
|---|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | 预览版 | $0.40 | $2.40 | $0.20 | $1.20 | $0.04 | $1.00 |
| Gemini 3.5 Flash | 预览版 | $1.50 | $9.00 | $0.75 | $4.50 | $0.15 | $1.00 |
| Gemini 3.5 Flash-Lite | 预览版 | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 3.1 Flash-Lite | 预览版 | $0.25 | $1.50 | $0.125 | $0.75 | $0.025 | $1.00 |
| Gemini 2.5 Pro | 稳定版 | $1.25,最高 20 万;$2.50,超过 20 万 | $10.00,最高 20 万;$15.00,超过 20 万 | $0.625,最高 20 万;$1.25,超过 20 万 | $5.00,最高 20 万;$7.50,超过 20 万 | $0.125,最高 20 万;$0.25,超过 20 万 | $4.50 |
| Gemini 2.5 Flash | 稳定版 | $0.30 | $2.50 | $0.15 | $1.25 | $0.03 | $1.00 |
| Gemini 2.5 Flash-Lite | 稳定版 | $0.10 | $0.40 | $0.05 | $0.20 | $0.01 | $1.00 |
对于 Gemini 3.6 Flash、Gemini 3.5 Flash、Flash-Lite 预览版模型以及 Gemini 2.5 Flash 系列,音频输入的费率高于文本、图像或视频输入。为了让各模型行保持可比性,表格使用的是文本、图像和视频输入费率。
预览版模型在稳定发布前可能会发生变化。如果您的生产策略需要固定行为、更长的弃用窗口或稳定的模型标识符,请将预览版的经济性与稳定版 Gemini 2.5 条目进行比较,而不是仅凭价格做选择。
2026 年 7 月 27 日更新中有哪些变化
与本指南上一版本相比,最重要的变化是当前模型阵容。
- Gemini 3.6 Flash Preview 现作为高吞吐量选项出现,输入每百万 token 0.40 美元,输出每百万 token 2.40 美元。
- Gemini 3.5 Flash-Lite Preview 现以输入每百万 token 0.25 美元、输出每百万 token 1.50 美元的价格出现。
- 更早的 Gemini 3.1 Flash-Lite 行仍然可见,但买家应确认他们打算使用的是哪个 preview 模型标识符。
- 稳定版 Gemini 2.5 模型对于重视生命周期可预测性的团队来说,仍然是有用的比较基准。
这就是为什么 Gemini 定价页面需要定期维护。即使目录中的每个旧数字在技术上仍然存在,正确的表格也可能在战略上具有误导性。
Gemini API 工作负载成本表
下表将费率转换为预算估算。这些场景不是质量基准,模型也不能互换。它们回答的是一个更窄的财务问题:如果相同的工作负载运行在每条路径上,token 账单会是多少?
假设
| 工作负载 | 请求量 | 每个请求的输入 | 每个请求的输出 | 总输入 | 总输出 |
|---|---|---|---|---|---|
| 分类和提取 | 1,000 次请求 | 2,000 tokens | 300 tokens | 2M tokens | 0.3M tokens |
| 检索增强型助手 | 1,000 次请求 | 20,000 tokens | 1,000 tokens | 20M tokens | 1M tokens |
| 长文档审阅 | 100 次请求 | 150,000 tokens | 5,000 tokens | 15M tokens | 0.5M tokens |
长文档场景将每个提示保持在 Gemini 2.5 Pro 的 200k 阈值以下。不包括 grounding、缓存、音频、图像生成和视频生成。
估算的 Standard 层级 token 成本
| 模型 | 分类 | RAG 助手 | 长文档审阅 |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.95 | $6.50 | $4.50 |
| Gemini 3.6 Flash | $1.52 | $10.40 | $7.20 |
| Gemini 2.5 Flash-Lite | $0.32 | $2.40 | $1.70 |
| Gemini 2.5 Flash | $1.35 | $8.50 | $5.75 |
| Gemini 3.5 Flash | $5.70 | $39.00 | $27.00 |
| Gemini 2.5 Pro | $5.50 | $35.00 | $23.75 |
这些总计说明了为什么工作负载表比模型列表更有用。
- 对于窄范围提取,在此比较中稳定版 Gemini 2.5 Flash-Lite 行的 token 成本最低。
- Gemini 3.6 Flash 的成本高于 Lite 路线,但在相同假设下明显低于 Gemini 3.5 Flash。
- 在长文档示例中,Gemini 2.5 Pro 的 token 账单低于 Gemini 3.5 Flash,因为提示保持在 Pro 阈值以下。这并不能证明它是更好的模型,但它避免了一种误导性的假设,即每个 Pro 工作负载都必须更贵。
- 输出占比高的应用对模型选择更敏感,因为在这里展示的每一行中,输出 token 的成本都高于文本输入 token。
Batch 定价对相同工作负载的影响
对于支持 Batch API 的行,Google 列出的 Batch 令牌费率通常是 Standard 费率的一半。如果以上场景中的每个请求都可以异步运行,则估算的令牌总成本变为:
| 模型 | 使用 Batch 的分类 | 使用 Batch 的 RAG 助手 | 使用 Batch 的长文档审查 |
|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.475 | $3.25 | $2.25 |
| Gemini 3.6 Flash | $0.76 | $5.20 | $3.60 |
| Gemini 2.5 Flash-Lite | $0.16 | $1.20 | $0.85 |
| Gemini 2.5 Flash | $0.675 | $4.25 | $2.875 |
| Gemini 3.5 Flash | $2.85 | $19.50 | $13.50 |
| Gemini 2.5 Pro | $2.75 | $17.50 | $11.875 |
Batch 是一个计费和架构决策。它非常适合离线增强、评估运行、夜间摘要、文档回填以及其他不需要立即响应的任务。当用户正在交互式产品流程中等待时,它不能替代 Standard 服务。
Gemini API 成本背后的公式
对于不包含附加功能的文本工作负载,请使用:
monthly cost =
(input tokens / 1,000,000 × input rate)
+ (output tokens / 1,000,000 × output rate)
如果应用使用上下文缓存,则需要加上缓存写入和存储成本。如果使用 grounding、音频、生成图像或生成视频,则应分别计算这些项目,因为它们不共享统一的令牌费率。
对于财务审查,请将假设与结果一并保留:
| 需要记录的假设 | 重要原因 |
|---|---|
| 每月请求数 | 将单次请求行为转换为预算 |
| 平均和 p95 输入令牌数 | 较长的提示可能触发更高的 Pro 定价 |
| 平均和 p95 输出令牌数 | 输出通常是成本更高的一侧 |
| Standard 与 Batch 的占比 | 异步工作可显著降低令牌支出 |
| 缓存写入量和保留时长 | 复用可以节省输入成本,但存储并非免费 |
| 已 grounding 的请求 | Google Search 和 Maps 有单独的额度和费用 |
| 音频、图像和视频单位 | 多模态定价可能主导文本令牌账单 |
Gemini API 免费层与付费层
Google 为若干当前的 Gemini Developer API 模型提供了免费层。这使它适用于实验、原型和低量验证。但这并不会让生产环境成本问题消失。
Gemini API 计费文档区分了免费和付费用量,并解释了项目如何进入付费层。在将一个成功的免费层原型视为生产证据之前,团队应确认当前的资格、速率限制、数据使用条款以及模型可用性。
实际上的区别是:
- 使用免费层测试提示、SDK 行为和产品契合度。
- 使用付费层费率和真实 token 遥测来批准生产预算。
- 不要假设预览模型、免费额度或速率限制在发布前会保持不变。
Gemini Pro 定价与 200k token 分界点
Gemini 2.5 Pro 在当前表格中拥有最重要的定价阈值之一。最多 200k token 的提示使用较低的输入和输出费率。超过 200k 的提示则使用更高费率。
该阈值适用于单次请求的提示大小,而不是每月总量。一个团队发送 2000 万 token,且分散在许多小提示中,仍可保持较低费率;而一个较低流量但长上下文的应用则可能反复跨过该分界点。
至少跟踪以下两个指标:
- 超过 200k 输入 token 的请求占比
- 这些请求带来的成本占比
如果少量超大提示驱动了大部分支出,可以考虑分块、检索、摘要、缓存复用,或采用路由策略,将长上下文模型保留给真正需要它的请求。
上下文缓存、 grounding 和多模态成本
token 费率只是 Gemini API 定价的基础层。
上下文缓存
官方表格列出了缓存写入价格和按小时存储价格。当同一大上下文被重复使用足够多次时,缓存可以改善经济性,但盈亏平衡点取决于写入量、保留时长以及缓存替代了多少重复输入。
Google Search 和 Maps grounding
grounding 包含按模型不同的免费额度,之后按每次查询或每个提示收费。不要仅凭 token 费率来估算带 grounding 的应用。请记录带 grounding 的请求数量,并将其作为单独的成本项进行核对。
实时音频
Live API 音频使用的输入和输出费率与普通文本调用不同。语音代理团队应单独为音频 token 预算,并在负载测试中纳入会话时长、中断行为和回复冗长度。
图像和视频生成
生成的图像和视频使用特定于多模态的计量单位和模型行定价。应将它们视为独立的生产预算,而不是文本模型估算的延伸。
Gemini Developer API 与 Vertex AI 及消费者套餐
“Gemini 定价”可能指向几种不同的购买路径。
| 产品 | 典型买家问题 | 为什么不应将其混入此表 |
|---|---|---|
| Gemini Developer API | 应用调用会花费多少? | 这是本指南总结的费率卡 |
| Google AI Studio | 我可以进行原型设计并获取 API 密钥吗? | 它是开发界面,不是单独的通用生产费率卡 |
| Vertex AI | 我如何在 Google Cloud 中运行 Gemini? | 商业条款、控制项和服务选项可能不同 |
| Consumer Gemini plans | 个人订阅包含什么? | 订阅定价不是 API token 定价 |
| Gemini Enterprise or Agent Platform | 更广泛的企业产品成本是多少? | 它与 Developer API 调用属于不同的产品范围 |
在比较供应商或网关时,请确保双方采用相同的购买路径。将面向消费者的订阅与 API token 进行比较,或将托管云服务与开发者 API 进行比较,都会得出看起来很整洁、但实际上无法使用的结论。
何时直接使用 Google 访问就足够了
在以下情况下,直接访问 Gemini 往往是最简单的选择:
- Gemini 是生产环境中唯一使用的模型家族。
- 团队对 Google 的计费和账户结构感到满意。
- 工程团队不需要跨供应商故障转移或路由抽象。
- 财务团队可以在不汇总其他 AI 供应商的情况下审查用量。
当运营问题超出单一供应商范围时,AI API 网关会变得更有价值:
- 产品同时使用 Gemini、GPT、Claude 或其他模型家族
- 工程团队希望拥有统一的凭证入口和集中化的模型路由
- 财务团队希望整合余额、发票或用量审查
- 运营团队需要模型级计量和共享策略控制
- 团队希望在不重建每个集成的情况下更改路由
网关并不会消除理解底层模型价格的必要。它改变的是围绕这些价格来管理访问、路由、采购和报告的方式。
Flatkey 为多个模型家族提供统一的 API 访问层。请查看当前的 Flatkey 定价页面了解其商业模式,然后在 AI 模型价格比较中对更广泛的模型格局进行比较。
Gemini 定价的周期性刷新清单
定价页面应有指定的来源审查负责人以及定期刷新时间。对于像 Gemini API 定价这样高需求的查询,按月审查是合理的默认频率;在 Google 发布重大模型公告后,应立即进行审查。
请使用以下清单:
- 对照 Google 官方定价页面比较模型顺序和生命周期标签。
- 记录新的预览版、稳定版、已弃用和已移除模型标识符。
- 分别验证 Standard、Batch、cache-write 和 cache-storage 的费率。
- 重新检查提示长度阈值,以及它们是否影响输入、输出,或二者都影响。
- 验证免费层可用性和计费层级措辞。
- 根据已发布的假设重新计算每个工作负载示例。
- 检查 grounding、Live API、图像和视频部分是否有单独的价格变动。
- 确认内部链接、产品声明和公开定价 CTA 仍然准确。
- 仅在完成来源审查后更新可见的“检查于”日期。
目标不是承诺某篇定价文章永不过时。目标是让每个数字都可追溯、每个场景都可复现,并让每次刷新都足够快,以保持页面实用。
购买决策
从工作负载形态入手,而不是从模型名称入手。
- 选择满足任务质量和延迟要求的最低成本路径。
- 对符合条件的异步工作使用 Batch。
- 关注输出 token 和长上下文断点。
- 分别为缓存、grounding、音频、图像和视频预留预算。
- 当 Gemini 不再是技术栈中唯一的提供方时,重新审视访问架构。
这一流程把 Gemini API 定价从静态表格转变为可重复的运营决策。



