AI 网关定价之所以容易被低估,是因为可见的模型费率只是账单的一部分。
最低的公开标注 token 价格并不会自动带来最低的运营成本。买方还需要考虑网关费用、订阅额度、信用点购买手续费、重试、回退流量、可观测性、配额控制,以及跨提供商核对用量所需的时间。
本指南为采购、工程和财务团队提供了一种实用的方法来比较这些成本。它还解释了 Flatkey 现有方案如何适配那些希望拥有一个 API 密钥、一个基础 URL、集中化用量可视化,以及访问文本、图像和视频模型的团队。
定价说明: 本指南中的产品价格和方案限制已于 2026 年 7 月 27 日核实。价格经常变动。在做出购买决定之前,请先在各供应商的官方定价页面确认当前条款。
简短答案:比较总体网关经济性
有用的 AI 网关定价比较应回答七个问题:
- 对于你实际运行的工作负载,底层模型的成本是多少?
- 网关是否会加价、收取信用点购买手续费、订阅费或按用量计费的平台费用?
- 提供商用量是否包含在方案内、按原样转嫁,还是通过你自己的提供商密钥单独计费?
- 当应用重试请求或回退到其他模型时,会发生什么?
- 你能否在实验、团队或环境超支之前设置配额?
- 工程和财务是否能够核对同一份请求级证据?
- 该方案是否匹配你的流量模式,包括短时突发和媒体生成?
比较的最终结果应该是每个成功任务的有效成本,而不仅仅是每百万 token 的成本。
每个成功任务的有效成本 =
(模型用量 + 网关费用 + 重试/回退成本 + 运营开销)
/ 已接受的任务结果
这个公式适用于客服回复、文档提取、图像、视频片段,或任何其他产品结果。
四种常见的 AI 网关定价模式
AI 网关会以不同方式打包成本。在比较价格之前,先识别每个供应商采用的是哪种模式。
| 定价模式 | 你支付什么 | 最适合 | 主要比较风险 |
|---|---|---|---|
| 包含用量的订阅 | 带有明确文本或媒体额度的固定月费方案 | 希望获得可预测入门方案和打包访问权限的团队 | 额度、短期上限以及超额使用行为可能比表面上的订阅价格更重要 |
| 带购买费的预付积分 | 购买积分时按模型用量外加一定比例或固定费用 | 重视广泛访问、且不想单独开通提供商账户的团队 | 随着用量增长,资金费用会不断累积 |
| 直通模型费率 | 按提供商费率计费,没有明确的网关加价,有时还会叠加平台或托管费用 | 希望模型成本透明的团队 | 可观测性、部署、数据传输或其他平台成本可能记在别处 |
| SaaS 网关订阅加用量 | 带有日志、请求、席位或功能限制的月度平台费 | 自带提供商账户并购买控制平面软件的团队 | 必须将提供商账单与网关账单合并后,才能看出总成本 |
没有一种模式是放之四海而皆准的最便宜方案。最佳选择取决于流量规模、请求大小、多模态能力、提供商组合、运营成熟度,以及团队需要多少控制权。
当前市场快照
官方定价页面说明了为什么类别比较不能只用一列“价格”。
| 网关 | 截至 2026 年 7 月 27 日核查的公开定价结构 | 买家应核实什么 |
|---|---|---|
| Flatkey | Go、Pro 和 Max 月度订阅包含对所有列出模型的访问、明确的文本模型用量以及媒体积分;Enterprise 使用定制条款 | 额度是否匹配、短期上限、媒体积分消耗,以及企业开票或路由条款 |
| Cloudflare AI Gateway | 核心网关功能可免费使用;通过 Unified Billing 使用 Cloudflare 托管的提供商访问时,会对购买的积分收取一定比例的费用 | 你是否会使用 Unified Billing 还是自己的提供商密钥,以及任何相关的 Workers 或平台用量 |
| Vercel AI Gateway | 模型访问按提供商标价呈现,不加价;账户每月获得 AI Gateway 额度,并可购买额外额度 | 周边的 Vercel 套餐、可观测性、部署或团队需求是否会在模型用量之外增加成本 |
| OpenRouter | 预付积分包含购买费用;自带密钥(BYOK)请求有单独的免费额度,之后会收取平台费 | 积分充值频率、BYOK 请求量、提供商路由以及支付方式成本 |
| Portkey | 月度生产方案包含明确的日志量,更高用量和企业方案可选 | 提供商支出、日志超额、保留期、席位以及企业功能需求 |
| Helicone | 月度 Pro 方案包含平台功能和用量额度,并按用量收费,企业条款可定制 | 提供商支出、请求量、保留期、席位,以及哪些功能需要更高等级方案 |
这些并不是相同的产品。有些销售托管的模型访问,有些销售针对你自己的提供商账户的控制平面,还有些两者兼有。一个公平的比较必须先决定买方是想要一个用于模型访问的商业关系,还是叠加在现有提供商关系之上的软件。
成本层 1:底层模型使用
先从工作负载开始,而不是从供应商首页开始。
对于文本模型,请估算:
- 输入 token;
- 当模型支持时的缓存输入 token;
- 输出 token;
- 每个用户操作的请求数;
- 预期的上下文增长;
- 路由到高级模型的请求百分比。
图像、音频和视频模型可能使用不同的计量单位,例如生成的图像、秒数、分钟数、分辨率等级或任务数。不要仅仅将这些工作负载归一化为请求次数。
一个有用的月度模型成本估算公式是:
monthly model cost =
Σ(requests × input units × input rate)
+ Σ(requests × output units × output rate)
+ media generation charges
如果你还没有测量真实工作负载,请使用三种场景:正常、增长和事故。事故场景应包括更长的提示、重复调用以及高级模型回退。
更深入的预测流程请参见 AI API spend forecasting。
成本层 2:网关费用、资金费和订阅
接下来,把供应商的商业模式转换为相同的月度单位。
对于订阅模式:
gateway cost = monthly subscription + overages + add-ons
对于购买积分模式:
gateway cost = model credits purchased × purchase-fee percentage
对于 SaaS 控制平面:
gateway cost = platform plan + request/log overages + seats + retention or enterprise add-ons
对于自带密钥(bring-your-own-key)的设置,不要把网关套餐视为全部账单。要把每一笔提供商发票都加到平台费用中。还要包括维护提供商账户、支付方式、限额、密钥和区域访问的运营成本。
成本层 3:重试与回退路由
到达用户的一次请求,可能包含多次可计费尝试。
例如:
- 主模型在处理输入后超时。
- 客户端重新尝试同一个模型。
- 网关回退到第二个模型。
- 应用接受最终响应。
用户看到的是一个结果,而计费系统可能记录了三次请求。
询问每个供应商,其请求日志是否显示完整链路:原始请求、提供商响应、重试、回退、最终模型、消耗单位和成本。然后计算:
retry amplification = total billable attempts / accepted outcomes
即使重试放大率略有上升,也可能抵消模型费率优势。这就是为什么路由可靠性和成本可见性应纳入同一个购买决策。
成本层 4:配额和支出控制
如果成本控制在钱花出去之前不起作用,那么它们就只有经济价值。
评估网关是否允许你:
- 为产品、团队、客户或环境创建独立密钥;
- 设置密钥级或团队级配额;
- 查看相对于这些配额的消耗情况;
- 限制对昂贵模型的访问;
- 识别流量或模型组合的突然变化;
- 查看充值和余额历史;
- 在不更改每个提供商集成的情况下禁用或轮换密钥。
如果共享密钥允许一次未受控测试消耗大量生产预算,那么一个低 5% 的提供商费率未必更便宜。
使用 AI API 配额限制 来构建第一组团队和环境防护栏。
成本层 5:财务与对账工作
网关定价还应考虑解释账单所需的每月工作量。
分散的提供商账户会带来多张发票、多种货币、信用余额、付款方式和导出格式。工程团队可能知道哪个模型处理了某个请求,而财务团队看到的只有账户级总额。
当中央网关的仪表板连接以下信息时,可以减少这项工作:
- API 密钥或工作负载所有者;
- 模型和路由;
- 输入、输出、缓存或媒体单位;
- 请求状态;
- 重试和回退活动;
- 余额或充值记录;
- 指定期间的成本。
如果仪表板质量是重要的购买标准,请使用 统一 AI 计费仪表板评估指南 进行一次请求到发票测试。
Flatkey 定价:哪个方案适合哪种工作负载?
Flatkey 套餐将受管的多模型访问打包为月度计划。当前的 Flatkey 定价页面 列出了 Go、Pro、Max 和 Enterprise 选项。
| 方案 | 公开月费 | 包含的文本模型用量 | 包含的媒体额度 | 实际适用场景 |
|---|---|---|---|---|
| Go | 10 美元/月 | 每月最多 45 美元的模型用量 | 300 媒体积分 | 个人构建者和轻量日常使用 |
| Pro | 30 美元/月 | 每月最多 90 美元的模型用量 | 1,200 媒体积分 | 日常开发和更高频率的请求 |
| Max | 100 美元/月 | 每月最多 300 美元的模型用量 | 5,000 媒体积分 | 生产工作负载和更重的媒体使用 |
| Enterprise | 定制 | 承诺量和定制条款 | 定制 | 更大规模的使用、采购、开票、定制路由或团队控制 |
自助服务方案还公布了短期用量上限。评估这些上限时要对照你的突发模式,而不仅仅是月度估算。一个月度总量可预测、但在发布日出现集中峰值的团队,可能需要与流量平稳的团队不同的方案。
在以下情况下选择 Go
- 单个开发者或小型原型需要广泛的模型访问;
- 使用量较低且分散;
- 团队希望只用一个密钥,而不必开通多个提供商账户;
- 媒体生成只是偶尔发生。
在以下情况下选择 Pro
- 开发流量每天都在运行;
- 提示词测试或自动化会产生更频繁的调用;
- 团队需要更多空间来进行图像或视频实验;
- Go 的短期上限对预期工作流来说过于紧张。
选择 Max 的情况
- 应用正进入生产环境;
- 多个工作负载共用网关;
- 媒体使用量较大;
- 团队希望在讨论定制条款前获得更高的包含额度。
选择 Enterprise 的情况
- 使用量大到足以支持承诺量经济;
- 采购需要开票或协商条款;
- 团队需要自定义路由或组织级控制;
- 签署的商业协议比自助式的简单性更重要。
Flatkey 的模式最适合那些更偏好集中式访问和计费,而不是维护多个独立提供商账户的买家。已经与提供商谈妥合同的团队,应将这些直接费率加上网关软件成本,与托管访问方案进行对比。
AI Gateway 定价买家评分表
对每个供应商,都使用同一份工作负载样本来填写这张评分表。
| 决策领域 | 需要索取的证据 | 通过条件 |
|---|---|---|
| 模型成本 | 费率表和请求级用量 | 输入、输出、缓存和媒体单位均可见 |
| 网关费用 | 订阅费、充值费、加价或超额费用计划 | 每一项非模型费用都可以按月表示 |
| 包含用量 | 额度、到期、上限和超额条款 | 预期工作负载同时符合月度和短期限制 |
| 重试经济性 | 尝试链和最终结果 | 可以衡量重复调用和回退成本 |
| 配额 | 密钥、团队和环境控制 | 测试工作负载可以在超支前被封顶 |
| 对账 | 仪表板、导出、充值和发票证据 | 工程与财务的总额在同一周期内一致 |
| 可移植性 | 基础 URL、SDK 兼容性和密钥迁移步骤 | 无需重写应用即可更换模型或路由 |
| 支持 | 事件处理路径和服务承诺 | 响应预期与生产风险相匹配 |
对每一行从 0 到 2 进行评分:
- 0: 不可用或不明确;
- 1: 可用,但需要人工工作或受方案限制;
- 2: 可用、可测试,并包含在预期方案中。
不要仅因为某个网关在模型费率这一行胜出,就选择它。一个稳健的采购决策还应通过重试、配额、对账和可移植性测试。
在承诺之前运行为期七天的定价验证
最清晰的比较,是使用具有代表性的流量进行一次简短验证。
- 选择一个文本工作流和一个媒体工作流,如果媒体很重要的话。
- 让相同的流量分布通过每个入选的方案。
- 记录已接受的结果,而不只是请求。
- 衡量输入、输出、缓存、媒体、重试和回退单位。
- 加上所有平台、充值、订阅和提供商费用。
- 将仪表盘总额与导出和余额进行核对。
- 比较每个成功任务的有效成本和运营时间。
同时记录在 3 倍和 10 倍流量下会发生什么变化。有些定价模型在评估规模下看起来很有吸引力,但在生产环境中会形成不同的成本曲线。
常见问题
AI 网关会比直接调用提供商更贵吗?
不一定。网关可能会增加订阅费、充值费或平台费用,但也可能减少提供商账户开销、集成工作、失控使用和失败请求成本。请比较相同已接受结果下的总运营成本。
AI 网关定价中最重要的指标是什么?
使用每个成功任务的有效成本。它将模型用量、网关费用、重试、回退和运营开销合并为产品团队能够理解的单位。
我应该使用预付费网关额度还是使用自己的提供商密钥?
当你希望只有一种商业关系并获得广泛的模型访问时,预付费托管访问更简单。如果你已经与提供商谈妥了条款,使用自己的密钥可能更有吸引力,但这会保留独立的账户、额度、发票和密钥管理。
我应该如何比较文本、图像和视频成本?
保留每个工作负载原生的计费单位,然后将结果归一化为一个已接受的业务结果。仅靠请求计数是不够的。
为什么配额控制应纳入定价比较?
因为可避免的超支是总成本的一部分。配额、密钥隔离和用量可见性有助于控制实验、被泄露的密钥、意外循环以及突然的模型组合变化。
将 Flatkey 套餐与你的真实工作负载进行比较
从你预期的文本用量、媒体用量、突发模式以及对采购控制的需求开始。然后查看 Flatkey pricing,将 Go、Pro、Max 和 Enterprise 与该工作负载进行比较。
如果优先考虑一个 API 密钥、一个 OpenAI 兼容的基础 URL、托管模型访问和集中式成本控制,Flatkey 为采购团队提供了一个具体的套餐结构,可在不先组建单独提供商账户的情况下进行评估。



