关于此模型
Gemini 2.5 Pro TTS 是 Google 面向工作室级高保真多说话人音频推出的高级文本转语音模型。你可以为每个说话人分配不同的声音、口音、情绪风格和语速,然后通过有序的对话轮次编写对话,并嵌入 [whispers]、[shouting] 或 [determination] 等语气标签。它适用于有声书、电影感角色对话、专业旁白和长篇内容等最重视真实感与表现细腻度的场景。如需更快速、更经济的生成,请参阅 Gemini 3.1 Flash TTS。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.035 每 1,000 个字符 | 按次生成付费,无需订阅;包含完整的多说话人控制。 |
| Fal.ai | 暂不可用 | 不提供此模型。 |
| Replicate | 暂不可用 | 不提供此模型。 |
按次生成付费,无需订阅;包含完整的多说话人控制。
不提供此模型。
不提供此模型。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 说话人 | array | 说话人声音配置列表。每一轮对话通过 ID 引用一个说话人。 | [object Object],[object Object] |
| 对话轮次 | array | 按顺序排列的对话行列表。每一轮的 speaker_id 必须匹配上面定义的说话人。文本可以包含 [shouting] 或 [whispers] 等语气标签。 | [object Object],[object Object],[object Object],[object Object] |
| 场景 | string | 可选的 scene description that sets the acoustic setting, e.g. "A quiet, warm room with a fireplace crackling softly." | |
| 示例上下文 | string | 可选的 overall tone/style, e.g. "Audiobook style narration. Tone is gentle and inviting." | |
| 温度 | number | 采样温度(0-2)。数值越高,表达方式越丰富。 | 1 |
说话人声音配置列表。每一轮对话通过 ID 引用一个说话人。
[object Object],[object Object]按顺序排列的对话行列表。每一轮的 speaker_id 必须匹配上面定义的说话人。文本可以包含 [shouting] 或 [whispers] 等语气标签。
[object Object],[object Object],[object Object],[object Object]可选的 scene description that sets the acoustic setting, e.g. "A quiet, warm room with a fireplace crackling softly."
可选的 overall tone/style, e.g. "Audiobook style narration. Tone is gentle and inviting."
采样温度(0-2)。数值越高,表达方式越丰富。
1开发者文档
定义说话人:在 speakers 列表中为每个声音添加一个条目。为每个条目设置 "Speaker N" 格式的 speaker_id,选择 voice_name,并设置 accent、style 和 pace。还可以选择添加描述角色的 audio_profile。
编写对话:在 dialogue_turns 中填入有序台词。每个轮次的 speaker_id 必须与已定义的说话人匹配。可以在文本中嵌入 [whispers]、[shouting] 或 [determination] 等语气标签。
设置氛围(可选):使用 scene 描述声学环境,使用 sample_context 设置整体旁白语气。调整 temperature(0-2)以获得更多或更少变化的表达。
提交并轮询:提交请求,然后轮询 /predictions/{request_id}/result,直到状态为 completed,以获取音频 URL。
curl -X POST https://api.muapi.ai/api/v1/gemini-2-5-pro-tts -H "x-api-key: YOUR_API_KEY" -H "Content-Type: application/json" -d '{"speakers":[{"speaker_id":"Speaker 1","voice_name":"Fenrir","accent":"British (RP)","style":"Deadpan","pace":"Natural"},{"speaker_id":"Speaker 2","voice_name":"Puck","accent":"American (Gen)","style":"Empathetic","pace":"Staccato"}],"dialogue_turns":[{"speaker_id":"Speaker 1","text":"[shouting] Halt, traveler!"},{"speaker_id":"Speaker 2","text":"[determination] I carry a message for the elder."}],"scene":"A dark, crumbling dungeon.","temperature":1}'
常见问答
在 `speakers` 列表中为每个声音定义唯一的 `speaker_id`(使用 `Speaker N` 格式),然后在 `dialogue_turns` 中引用这些 ID。每句台词都会使用对应说话人所分配的声音、口音、风格和语速进行渲染。每个对话轮次的文本最多可包含 10,000 个字符。
可以。每个说话人都可以设置 `style`(Vocal Smile、Newscaster、Whisper、Empathetic、Promo/Hype、Deadpan)和 `pace`(Natural、Rapid Fire、The Drift、Staccato)。还可以直接在对话文本中嵌入 `[whispers]`、`[shouting]` 或 `[determination]` 等语气标签。
模型提供 30 种预置声音(包括 Zephyr、Fenrir、Puck、Kore 等)以及 8 种口音,包括 Neutral、不同 American 变体、British (RP)、British (Brixton)、Transatlantic 和 Australian。
价格根据所有对话轮次的字符总数计算,每 1,000 个字符收费 $0.035。按次生成付费,无需订阅。
Gemini 2.5 Pro TTS 是 Google 的高级版本,最适合工作室级旁白、有声书和高保真角色音频。若需要更快速、更经济的输出,请使用 Gemini 3.1 Flash TTS。