gemini-2-5-pro-tts API | MuAPI: AI Audio & Music

Jelajahi dan integrasikan model AI gemini-2-5-pro-tts melalui MuAPI. Dapatkan inferensi berkecepatan tinggi dan harga kompetitif.

📝

Overview

About this model

Model gemini-2-5-pro-tts menyediakan kemampuan generasi AI mutakhir di platform MuAPI.

1Aplikasi produksi dengan gemini-2-5-pro-tts
2Aplikasi produksi dengan gemini-2-5-pro-tts
3Aplikasi produksi dengan gemini-2-5-pro-tts
4Aplikasi produksi dengan gemini-2-5-pro-tts
💰

Pricing & Value

Cost analysis

muapiapp$0.035 per 1,000 characters

按次生成付费,无需订阅;包含完整的多说话人控制。

Fal.aiTidak tersedia

Model ini tidak disediakan.

ReplicateTidak tersedia

Model ini tidak disediakan.

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

说话人array

说话人声音配置列表。每一轮对话通过 ID 引用一个说话人。

Default Value[object Object],[object Object]
对话轮次array

按顺序排列的对话行列表。每一轮的 speaker_id 必须匹配上面定义的说话人。文本可以包含 [shouting] 或 [whispers] 等语气标签。

Default Value[object Object],[object Object],[object Object],[object Object]
场景string

Optional scene description that sets the acoustic setting, e.g. "A quiet, warm room with a fireplace crackling softly."

Default Value
示例上下文string

Optional overall tone/style, e.g. "Audiobook style narration. Tone is gentle and inviting."

Default Value
温度number

采样温度(0-2)。数值越高,表达方式越丰富。

Default Value1
📖

Implementation Guide

Developer documentation

Panduan integrasi cepat untuk gemini-2-5-pro-tts. Hubungkan dengan kunci API MuAPI Anda dan mulai lakukan panggilan inferensi.

Common Questions

Frequently asked

如何创建多说话人对话?

在 `speakers` 列表中为每个声音定义唯一的 `speaker_id`(使用 `Speaker N` 格式),然后在 `dialogue_turns` 中引用这些 ID。每句台词都会使用对应说话人所分配的声音、口音、风格和语速进行渲染。每个对话轮次的文本最多可包含 10,000 个字符。

可以控制情绪和语速吗?

可以。每个说话人都可以设置 `style`(Vocal Smile、Newscaster、Whisper、Empathetic、Promo/Hype、Deadpan)和 `pace`(Natural、Rapid Fire、The Drift、Staccato)。还可以直接在对话文本中嵌入 `[whispers]`、`[shouting]` 或 `[determination]` 等语气标签。

有哪些声音和口音可用?

模型提供 30 种预置声音(包括 Zephyr、Fenrir、Puck、Kore 等)以及 8 种口音,包括 Neutral、不同 American 变体、British (RP)、British (Brixton)、Transatlantic 和 Australian。

如何计算价格?

价格根据所有对话轮次的字符总数计算,每 1,000 个字符收费 $0.035。按次生成付费,无需订阅。

什么时候应该使用 Pro 版本?

Gemini 2.5 Pro TTS 是 Google 的高级版本,最适合工作室级旁白、有声书和高保真角色音频。若需要更快速、更经济的输出,请使用 Gemini 3.1 Flash TTS。