从语音到配乐,找到合适的声音

浏览将文字生成语音、为视频生成配乐的模型。从具体任务出发,了解可用型号、输入要求与 API 价格。

当前热门模型包括 gemini-3.1-flash-tts-preview和sonilo-video-to-music;有数据时按实时周调用量排序。

音频生成模型

gemini-3.1-flash-tts-preview 是由 Google 提供、可通过 Flatkey 统一 API 调用的模型,并收录在“音频生成模型”集合中。接入前可查看其当前价格、上下文和可用状态。

$0.8 / 1M tokens
查看模型详情

sonilo-video-to-music 是由 Sonilo 提供、可通过 Flatkey 统一 API 调用的模型,并收录在“音频生成模型”集合中。接入前可查看其当前价格、上下文和可用状态。

$0.0072 / request
查看模型详情