Gemini 2.5 Pro TTS: AI 音频与音乐

使用 Gemini 2.5 Pro TTS 生成工作室级多说话人语音。可控制声音、口音、情绪和语速。免费试用,按次生成付费。

📝

概览

关于此模型

Gemini 2.5 Pro TTS 是 Google 面向工作室级高保真多说话人音频推出的高级文本转语音模型。你可以为每个说话人分配不同的声音、口音、情绪风格和语速,然后通过有序的对话轮次编写对话,并嵌入 [whispers][shouting][determination] 等语气标签。它适用于有声书、电影感角色对话、专业旁白和长篇内容等最重视真实感与表现细腻度的场景。如需更快速、更经济的生成,请参阅 Gemini 3.1 Flash TTS

1有声书:使用温暖、稳定且能够体现角色特征的声音讲述长篇小说。
2电影与动画:制作具有细腻情绪指导的电影感角色对话。
3广告:制作精致、高保真的 Promo/Hype 宣传读稿和品牌旁白。
4无障碍:将文章和文档转换为自然、工作室级的旁白。
💰

价格与价值

成本分析

muapiapp$0.035 每 1,000 个字符

按次生成付费,无需订阅;包含完整的多说话人控制。

Fal.ai暂不可用

不提供此模型。

Replicate暂不可用

不提供此模型。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

说话人array

说话人声音配置列表。每一轮对话通过 ID 引用一个说话人。

默认值[object Object],[object Object]
对话轮次array

按顺序排列的对话行列表。每一轮的 speaker_id 必须匹配上面定义的说话人。文本可以包含 [shouting] 或 [whispers] 等语气标签。

默认值[object Object],[object Object],[object Object],[object Object]
场景string

可选的 scene description that sets the acoustic setting, e.g. "A quiet, warm room with a fireplace crackling softly."

默认值
示例上下文string

可选的 overall tone/style, e.g. "Audiobook style narration. Tone is gentle and inviting."

默认值
温度number

采样温度(0-2)。数值越高,表达方式越丰富。

默认值1
📖

实施指南

开发者文档

如何使用 Gemini 2.5 Pro TTS

  1. 定义说话人:在 speakers 列表中为每个声音添加一个条目。为每个条目设置 "Speaker N" 格式的 speaker_id,选择 voice_name,并设置 accentstylepace。还可以选择添加描述角色的 audio_profile

  2. 编写对话:在 dialogue_turns 中填入有序台词。每个轮次的 speaker_id 必须与已定义的说话人匹配。可以在文本中嵌入 [whispers][shouting][determination] 等语气标签。

  3. 设置氛围(可选):使用 scene 描述声学环境,使用 sample_context 设置整体旁白语气。调整 temperature(0-2)以获得更多或更少变化的表达。

  4. 提交并轮询:提交请求,然后轮询 /predictions/{request_id}/result,直到状态为 completed,以获取音频 URL。

curl -X POST https://api.muapi.ai/api/v1/gemini-2-5-pro-tts -H "x-api-key: YOUR_API_KEY" -H "Content-Type: application/json" -d '{"speakers":[{"speaker_id":"Speaker 1","voice_name":"Fenrir","accent":"British (RP)","style":"Deadpan","pace":"Natural"},{"speaker_id":"Speaker 2","voice_name":"Puck","accent":"American (Gen)","style":"Empathetic","pace":"Staccato"}],"dialogue_turns":[{"speaker_id":"Speaker 1","text":"[shouting] Halt, traveler!"},{"speaker_id":"Speaker 2","text":"[determination] I carry a message for the elder."}],"scene":"A dark, crumbling dungeon.","temperature":1}'

常见问题

常见问答

如何创建多说话人对话?

在 `speakers` 列表中为每个声音定义唯一的 `speaker_id`(使用 `Speaker N` 格式),然后在 `dialogue_turns` 中引用这些 ID。每句台词都会使用对应说话人所分配的声音、口音、风格和语速进行渲染。每个对话轮次的文本最多可包含 10,000 个字符。

可以控制情绪和语速吗?

可以。每个说话人都可以设置 `style`(Vocal Smile、Newscaster、Whisper、Empathetic、Promo/Hype、Deadpan)和 `pace`(Natural、Rapid Fire、The Drift、Staccato)。还可以直接在对话文本中嵌入 `[whispers]`、`[shouting]` 或 `[determination]` 等语气标签。

有哪些声音和口音可用?

模型提供 30 种预置声音(包括 Zephyr、Fenrir、Puck、Kore 等)以及 8 种口音,包括 Neutral、不同 American 变体、British (RP)、British (Brixton)、Transatlantic 和 Australian。

如何计算价格?

价格根据所有对话轮次的字符总数计算,每 1,000 个字符收费 $0.035。按次生成付费,无需订阅。

什么时候应该使用 Pro 版本?

Gemini 2.5 Pro TTS 是 Google 的高级版本,最适合工作室级旁白、有声书和高保真角色音频。若需要更快速、更经济的输出,请使用 Gemini 3.1 Flash TTS。