Jelajahi dan integrasikan model AI gemini-2-5-pro-tts melalui MuAPI. Dapatkan inferensi berkecepatan tinggi dan harga kompetitif.
About this model
Model gemini-2-5-pro-tts menyediakan kemampuan generasi AI mutakhir di platform MuAPI.
Cost analysis
| Provider | Cost | Notes |
|---|---|---|
| muapiapp | $0.035 per 1,000 characters | 按次生成付费,无需订阅;包含完整的多说话人控制。 |
| Fal.ai | Tidak tersedia | Model ini tidak disediakan. |
| Replicate | Tidak tersedia | Model ini tidak disediakan. |
按次生成付费,无需订阅;包含完整的多说话人控制。
Model ini tidak disediakan.
Model ini tidak disediakan.
** Competitor pricing is estimated based on similar model architectures and usage tiers.
Configuration schema
| Parameter | Type | Description | Default |
|---|---|---|---|
| 说话人 | array | 说话人声音配置列表。每一轮对话通过 ID 引用一个说话人。 | [object Object],[object Object] |
| 对话轮次 | array | 按顺序排列的对话行列表。每一轮的 speaker_id 必须匹配上面定义的说话人。文本可以包含 [shouting] 或 [whispers] 等语气标签。 | [object Object],[object Object],[object Object],[object Object] |
| 场景 | string | Optional scene description that sets the acoustic setting, e.g. "A quiet, warm room with a fireplace crackling softly." | |
| 示例上下文 | string | Optional overall tone/style, e.g. "Audiobook style narration. Tone is gentle and inviting." | |
| 温度 | number | 采样温度(0-2)。数值越高,表达方式越丰富。 | 1 |
说话人声音配置列表。每一轮对话通过 ID 引用一个说话人。
[object Object],[object Object]按顺序排列的对话行列表。每一轮的 speaker_id 必须匹配上面定义的说话人。文本可以包含 [shouting] 或 [whispers] 等语气标签。
[object Object],[object Object],[object Object],[object Object]Optional scene description that sets the acoustic setting, e.g. "A quiet, warm room with a fireplace crackling softly."
Optional overall tone/style, e.g. "Audiobook style narration. Tone is gentle and inviting."
采样温度(0-2)。数值越高,表达方式越丰富。
1Developer documentation
Panduan integrasi cepat untuk gemini-2-5-pro-tts. Hubungkan dengan kunci API MuAPI Anda dan mulai lakukan panggilan inferensi.
Frequently asked
在 `speakers` 列表中为每个声音定义唯一的 `speaker_id`(使用 `Speaker N` 格式),然后在 `dialogue_turns` 中引用这些 ID。每句台词都会使用对应说话人所分配的声音、口音、风格和语速进行渲染。每个对话轮次的文本最多可包含 10,000 个字符。
可以。每个说话人都可以设置 `style`(Vocal Smile、Newscaster、Whisper、Empathetic、Promo/Hype、Deadpan)和 `pace`(Natural、Rapid Fire、The Drift、Staccato)。还可以直接在对话文本中嵌入 `[whispers]`、`[shouting]` 或 `[determination]` 等语气标签。
模型提供 30 种预置声音(包括 Zephyr、Fenrir、Puck、Kore 等)以及 8 种口音,包括 Neutral、不同 American 变体、British (RP)、British (Brixton)、Transatlantic 和 Australian。
价格根据所有对话轮次的字符总数计算,每 1,000 个字符收费 $0.035。按次生成付费,无需订阅。
Gemini 2.5 Pro TTS 是 Google 的高级版本,最适合工作室级旁白、有声书和高保真角色音频。若需要更快速、更经济的输出,请使用 Gemini 3.1 Flash TTS。