模型/音频/文本转语音
已上线6 个模型

文本转语音 API — 自然 AI 声音生成

Muapi 的文本转语音 API 通过统一 REST 集成,将文字转换为自然、接近真人的音频。你可以在 MiniMax、Google Gemini 和 ElevenLabs 的六个模型中选择单人旁白或多角色对话。支持录音棚级或高速生成,并可控制声音、情绪、语速、稳定性和相似度。所有模型都使用相同的异步提交与轮询模式,价格低至每 1,000 个字符 $0.035。

i

文本转语音已在 Muapi 上线

选择单人声音或多角色模型,提交脚本,然后轮询返回的 request ID 获取可下载的音频文件。

MiniMax Speech录音棚级与高速单人旁白2 个模型
TTS已上线
MiniMax

MiniMax Speech 2.6 HD

录音棚级语音,发音清晰、节奏流畅并带有真实情绪,适合有声书、播客和旁白。

Text → audio
$0.13/1,000 chars
试用模型
TTS已上线
MiniMax

MiniMax Speech 2.6 Turbo

快速、轻量的文本转语音,保持自然音质,并可调整语速、音量、音调和情绪。

Text → audio快速
$0.07/1,000 chars
试用模型
Gemini TTS支持声音与语气控制的多角色对话2 个模型
TTS已上线
Google Gemini

Gemini 3.1 Flash TTS

高性价比的多角色语音,可为不同角色设置声音、口音、情绪风格,并在文本中加入 [whispers] 等语气标签。

Dialogue → audio快速
$0.035/1,000 chars
试用模型
TTS已上线
Google Gemini

Gemini 2.5 Pro TTS

录音棚级多角色语音,适合有声书、电影感对白和需要高保真表现的长篇旁白。

Dialogue → audio
$0.035/1,000 chars
试用模型
ElevenLabs高速单人语音与多语言对话2 个模型
TTS已上线
ElevenLabs

ElevenLabs TTS Turbo 2.5

面向速度优化的单人语音,支持稳定性、相似度和语速控制,适合旁白、IVR 与高吞吐生成。

Text → audio快速
$0.05/1,000 chars
试用模型
TTS已上线
ElevenLabs

ElevenLabs Text to Dialogue V3

根据结构化脚本生成多语言多角色对白,为每个角色设置 voice ID,并自动处理自然的轮换与节奏。

Dialogue → audio
$0.10/1,000 chars
试用模型

什么是文本转语音 API?

文本转语音(TTS)API 通过一次 HTTP 请求将文字转换为语音。提交脚本、选择声音和表达风格,即可获得可下载的音频文件,无需自行搭建音频工程流水线。

Muapi 通过统一 REST 模式提供六个 TTS 端点:一个 API 密钥、一套请求与轮询流程,以及按使用量计费。旁白和 IVR 可以使用单人声音;角色、播客和有声书则可以使用多角色对话。

文本转语音主要能力

多角色对话

Gemini TTS 与 ElevenLabs Text to Dialogue V3 可以为脚本中的每个角色分配不同声音、口音和表达风格。

行内情绪与语气

Gemini 模型支持 [whispers]、[shouting] 和 [determination] 等行内标签,在同一台词中细致控制表达。

录音棚级与高速档位

需要保真度时选择 MiniMax Speech 2.6 HD 或 Gemini 2.5 Pro TTS;重视延迟和成本时选择高速版本。

可调声音参数

根据模型调整语速、音量、音调、情绪、稳定性、相似度和其他控制项。

自定义与克隆声音

ElevenLabs 端点支持自定义 voice ID;可以先通过兼容的声音克隆工作流创建可复用声音。

三个提供商,一个 API

MiniMax、Google Gemini 和 ElevenLabs 模型共享 Muapi 的认证、异步任务、结果轮询和计费。

文本转语音使用场景

旁白与配音

从脚本生成有声书章节、视频旁白、广告、解说和社交短视频配音。

角色与播客

使用不同声音和情绪方向制作多主持人节目与角色对白。

IVR 与应用音频

批量生成电话提示、通知、无障碍音频和其他动态语音。

多语言本地化

使用多语言对白和语言控制,为全球内容与学习材料生成语音。

文本转语音模型对比

模型提供商价格适合场景
MiniMax Speech 2.6 HDMiniMax$0.13/1,000 个字符录音棚级单人旁白
MiniMax Speech 2.6 TurboMiniMax$0.07/1,000 个字符高速单人语音生成
ElevenLabs TTS Turbo 2.5ElevenLabs$0.05/1,000 个字符高吞吐旁白与 IVR
Gemini 3.1 Flash TTSGoogle$0.035/1,000 个字符快速多角色对话
Gemini 2.5 Pro TTSGoogle$0.035/1,000 个字符录音棚级多角色对白
ElevenLabs Text to Dialogue V3ElevenLabs$0.10/1,000 个字符多语言多角色对话

文本转语音 API 示例

使用 Muapi API 密钥提交纯文本或结构化对白,保存 request ID,然后轮询标准预测结果端点获取音频 URL。

生成单人语音

curl -X POST https://api.muapi.ai/api/v1/minimax-speech-2.6-hd \
  -H "x-api-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"prompt":"Welcome to Muapi. Your workspace is ready.","voice_id":"Friendly_Person","speed":1,"emotion":"happy","format":"mp3"}'

# Response: {"request_id":"REQUEST_ID"}

使用 MiniMax 或 ElevenLabs 单人声音端点,传入 prompt、声音以及可选的表达参数。

生成 Gemini 对话

curl -X POST https://api.muapi.ai/api/v1/gemini-3-1-flash-tts \
  -H "x-api-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"speakers":[{"speaker_id":"Speaker 1","voice_name":"Kore","accent":"Neutral","style":"Empathetic","pace":"Natural"},{"speaker_id":"Speaker 2","voice_name":"Puck","accent":"British (RP)","style":"Deadpan","pace":"Natural"}],"dialogue_turns":[{"speaker_id":"Speaker 1","text":"[warmly] Welcome to the show."},{"speaker_id":"Speaker 2","text":"[whispers] Let us begin."}]}'

定义角色和有序对白,每句台词引用应使用的声音配置。

生成 ElevenLabs 对话

curl -X POST https://api.muapi.ai/api/v1/elevenlabs-text-to-dialogue-v3 \
  -H "x-api-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"dialogue":[{"text":"Welcome to the show.","voice_id":"ZQe5CZNOzWyzPSCn5a3c"},{"text":"Let us begin.","voice_id":"EXAVITQu4vr4xnSDxMaL"}],"language_code":"en","stability":0.5}'

传入每个对白片段带有 voice ID 的结构化 dialogue 数组,生成多语言多角色音频。

轮询音频结果

curl https://api.muapi.ai/api/v1/predictions/REQUEST_ID/result \
  -H "x-api-key: YOUR_API_KEY"

# Read the generated audio URL after status becomes completed.

轮询直到 status 变为 completed,然后从响应中读取可下载的音频 URL。

文本转语音 API 常见问题

什么是文本转语音 API?

Muapi 的 TTS API 通过 MiniMax、Google Gemini 和 ElevenLabs 的六个端点,将文字转换为自然音频,覆盖单人旁白和多角色对白。

多角色对白应该使用哪个模型?

需要角色配置和行内语气标签时,可以使用 Gemini 3.1 Flash TTS 或 Gemini 2.5 Pro TTS;需要带有每个角色 voice ID 的多语言结构化对白时,可以使用 ElevenLabs Text to Dialogue V3。

文本转语音如何计费?

Gemini TTS 起价为每 1,000 个字符 $0.035;ElevenLabs TTS Turbo 2.5 为 $0.05,ElevenLabs Dialogue V3 为 $0.10,MiniMax Turbo 为 $0.07,MiniMax HD 为 $0.13。

可以使用自定义或克隆声音吗?

可以。ElevenLabs 端点支持自定义 ElevenLabs voice ID;在所选模型 schema 支持时,MiniMax 也可以使用训练好的声音 ID。

会返回什么音频格式?

每个模型都会从标准预测结果端点返回可下载的音频文件 URL,可以嵌入、下载,或传入视频和 lipsync 流程。

如何访问文本转语音模型?

创建 Muapi API 密钥,调用匹配脚本的端点,然后轮询返回的 request ID。当前已上线模型无需等待名单。

准备生成自然语音了吗?

使用一个 Muapi API 密钥生成旁白、角色对白、IVR、播客和多语言音频。