大多数团队在第一天并不需要大规模的 AI 网关上线。他们需要的是一条短路径:从“我们有一个账号”到“我们在真实工作中比较了几个模型,并知道下一步该测试什么”。
这份 Flatkey 集成入门就是为首次会话而设计的。它连接了必要的组件——API 访问、首次请求、桌面工具、编码助手、模型对比、定价和团队交接——而无需强迫你一次性采用所有工作流。
其运行思路很简单:先使用一个 Flatkey API 密钥和一个兼容 OpenAI 的基础 URL,然后选择最适合执行评估的工作界面。
https://router.flatkey.ai/v1
开发者可以使用 SDK 或终端。提示词负责人可以从 Cherry Studio 开始。编码团队可以在 CC Switch 中添加 Flatkey 配置文件。所有人都可以基于同一份模型候选清单开展工作,并在团队决定投入生产路径之前比较结果。
The Flatkey starter stack at a glance
使用此表格为你的首次测试选择最小且有用的设置。
| Your immediate goal | Start here | What success looks like |
|---|---|---|
| Confirm the API works | Flatkey quickstart | One valid response appears in your application and usage logs |
| Compare prompts manually | Cherry Studio setup guide | The same prompt can be tested across a small model shortlist |
| Add Flatkey to a coding workflow | CC Switch setup guide | A local Flatkey profile can be selected without replacing every existing profile |
| Build a repeatable benchmark | Multi-model prompt testing workflow | Each model receives the same test cases and scoring rubric |
| Choose a production candidate | AI model evaluation checklist | Quality, latency, reliability, and effective cost are reviewed together |
| Estimate the operating fit | Flatkey pricing | Your shortlist reflects current model access and expected workload |
你不需要完成每一行。个人评估者可能会使用 quickstart 和 Cherry Studio。工程团队可能会直接从 quickstart 进入 SDK 测试框架。编码团队可能会先从 CC Switch 开始,并在识别出有潜力的模型后再加入结构化评估。
Step 1: Pick one real task, not a generic demo
最快的入门会话应从一个具有代表性的任务开始。避免从像“写点有创意的东西”这样含糊的提示词开始。它很难评分,也很少能代表真正值得整合的工作。
选择一个具有明确通过条件的任务,例如:
- 从支持消息中提取五个必需字段。
- 返回与应用程序 schema 匹配的有效 JSON。
- 起草一封遵循特定政策和语气的回复。
- 解释一次代码变更,而不虚构文件或函数。
- 使用正确的参数调用一个已批准的工具。
在比较模型之前,先准备五到十个示例。包括普通案例、一个困难案例,以及至少一个应当安全失败的案例。这一小组样本足以揭示明显差异,而不会把第一次会话变成完整的评估项目。
保持提示词、期望输出格式和评分规则稳定。模型应当是主要变量。
步骤 2:通过 quickstart 发起一次 API 调用
按照 Flatkey quickstart 创建 API 密钥,将兼容 OpenAI 的客户端指向 Flatkey 路由器,并发起第一次请求。
你的首次调用检查清单刻意保持简短:
- 将密钥存储在环境变量中,而不是源代码里。
- 将 base URL 设置为
https://router.flatkey.ai/v1。 - 从 Flatkey 实时目录或控制台中选择一个当前可用的模型。
- 发送一个具有代表性的提示词。
- 确认响应可以解析,并且请求出现在使用日志中。
在这次请求成功之前,不要添加备用路由、复杂重试或多个工具。这些层会掩盖密钥、base URL、模型选择和请求契约是否正确。
一旦一次调用成功,就保存准确的提示词、模型标识符、请求时间、响应、延迟和用量。这条记录将成为下一个模型的基线。
步骤 3:选择合适的评估表面
最合适的入门集成取决于执行工作的人是谁。
用于动手提示词比较的 Cherry Studio
当产品经理、提示词设计师、市场人员、研究人员或技术评估人员希望使用图形工作区来测试对话和模型行为时,Cherry Studio 非常有用。
使用 Cherry Studio API 设置指南 添加 Flatkey 端点和凭据。然后创建一个小型比较流程:
- 粘贴相同的系统指令和用户输入。
- 除非某个模型需要已记录的参数调整,否则只更改模型。
- 记录答案是否满足硬性要求。
- 分别对清晰度、实用性和偏好进行评分。
- 保存失败结果以及表现良好的响应。
这是让非开发人员看到模型差异的最快方式。它不能替代自动化测试,但在工程团队构建测试框架之前,它可以产出一个聚焦的候选清单。
用于编码助手配置文件的 CC Switch
当直接用例是本地编码助手配置时,CC Switch 是一个实用的起点。请按照 CC Switch 设置指南 创建一个由 Flatkey 支持的配置文件,并保留在已批准配置之间切换的能力。
使用特定仓库的任务来评估编码模型,而不是通用的编程谜题。让每个候选模型解释一个真实模块、提出一个聚焦的补丁、识别一个失败的测试,或生成一个迁移计划。检查它是否遵守文件边界、遵循指令,并避免对代码库做出不受支持的断言。
在新的路由通过对你的团队重要的任务之前,保留现有配置文件可用。成功连接证明了访问权限;它并不证明每个模型都适用于每个仓库或每个自动化级别。
用于可重复结果的 SDK harness
当你需要可重复性时,请使用 SDK 或脚本。一个与 OpenAI 兼容的客户端可以将同一测试集提交给多个模型 ID,而你的评估器则会以一致的格式存储响应。
多模型提示测试工作流展示了如何冻结请求契约、将硬性要求与偏好分开、记录延迟和用量,并避免一次更改多个变量。
先从两个或三个模型开始。候选项越多,复核工作越多,通常也会延迟决策,却未必带来提升。
Step 4: 为进入生产的结果打分
最便宜的请求并不总是最低成本的结果。一个需要人工修正、违反 schema、超时,或触发重复重试的响应,成本可能高于一个一次就成功的更高价模型。
使用四个评分组:
| Score group | Questions to answer |
|---|---|
| Task success | 输出是否满足每一项硬性要求? |
| Quality | 它是否准确、有用、简洁,并且适合目标受众? |
| Operations | 延迟是否可接受,请求是否可靠完成? |
| Economics | 每个可接受结果的实际成本是多少,包括重试和审核? |
AI 模型评估清单提供了更深入的工作流,涵盖加权评分、结构化输出检查、速率限制测试、金丝雀发布以及回滚标准。
在选择最终候选之前,请查看当前的 Flatkey 定价页面。模型访问和经济性可能会变化,因此请使用实时页面,而不是把旧数字复制到评估表格中。估算你实际计划运行的工作负载所需的提示词 token、完成 token、请求量、预期重试次数,以及任何回退流量。
Step 5: 将个人测试转变为团队可用的路径
一个可运行的个人集成只是采用的开始,而不是结束。在工作流成为共享基础设施之前,请指定负责人并加入基本控制。
使用这份交接清单:
- 访问负责人:负责 API 密钥的创建、存储、轮换和撤销。
- 模型负责人:维护已批准的模型候选短名单和任务级路由策略。
- 质量负责人:整理测试用例、评分规则和回归阈值。
- 运维负责人:审查用量、错误、延迟、配额和回退行为。
- 预算负责人:比较预测用量与实际支出,并调查差异。
如果多个团队或地区将共享网关,请继续阅读 团队 AI 网关指南。如果财务或运维需要可重复的审查流程,请使用 AI API 支出管理指南 来连接用量可见性、配额、充值记录和月度规划。
目标不是为一个入门测试建立委员会,而是要确保从实验到生产的路径在集成变得难以拆除之前,就已经明确了负责人。
30 分钟 Flatkey 集成入门计划
以下是一份实用的首次会话安排:
| 时间 | 操作 | 输出 |
|---|---|---|
| 0–5 分钟 | 选择一个真实任务和五个示例 | 一个小型、具有代表性的测试集 |
| 5–10 分钟 | 创建一个密钥并完成快速入门 | 一条已记录的 API 请求 |
| 10–15 分钟 | 连接 Cherry Studio、CC Switch 或一个 SDK | 一个可用的评估界面 |
| 15–25 分钟 | 在相同示例上运行两个或三个模型 | 可比较的响应和测量结果 |
| 25–30 分钟 | 查看定价并选择下一项测试 | 一个候选清单、负责人和后续行动 |
在会话结束时,你应该能够回答四个问题:
- Flatkey 路由是否能在我们首选的工具或代码路径中正常工作?
- 哪些模型候选项通过了不可妥协的要求?
- 在投入生产使用之前,还缺少哪些证据?
- 谁负责下一步评估?
这已经足以让第一天取得进展。等入门方案产出一份可信的候选清单后,你可以再加入更大的数据集、自动化裁判、故障转移路由和团队控制。
从能让你学到东西的最小路径开始
Flatkey 支持多种接入方式,但最短路径通常也是最佳路径:一个密钥、一个基础 URL、一个代表性任务,以及一个评估界面。
从 快速入门 开始。为可视化提示测试添加 Cherry Studio,为编码助手配置添加 CC Switch,或者使用 SDK 运行器进行可重复的基准测试。然后利用 当前定价 和面向生产的评估标准来决定哪些方案值得更大规模推广。
这样得到的入门方案既足够快,适合新的评估者使用;又足够结构化,能够在测试真正变成工作负载时交接给工程、运营和财务团队。



