MiniMax Speech 2.6 HD
录音棚级语音,发音清晰、节奏流畅并带有真实情绪,适合有声书、播客和旁白。
Muapi 的文本转语音 API 通过统一 REST 集成,将文字转换为自然、接近真人的音频。你可以在 MiniMax、Google Gemini 和 ElevenLabs 的六个模型中选择单人旁白或多角色对话。支持录音棚级或高速生成,并可控制声音、情绪、语速、稳定性和相似度。所有模型都使用相同的异步提交与轮询模式,价格低至每 1,000 个字符 $0.035。
文本转语音已在 Muapi 上线
选择单人声音或多角色模型,提交脚本,然后轮询返回的 request ID 获取可下载的音频文件。
文本转语音(TTS)API 通过一次 HTTP 请求将文字转换为语音。提交脚本、选择声音和表达风格,即可获得可下载的音频文件,无需自行搭建音频工程流水线。
Muapi 通过统一 REST 模式提供六个 TTS 端点:一个 API 密钥、一套请求与轮询流程,以及按使用量计费。旁白和 IVR 可以使用单人声音;角色、播客和有声书则可以使用多角色对话。
Gemini TTS 与 ElevenLabs Text to Dialogue V3 可以为脚本中的每个角色分配不同声音、口音和表达风格。
Gemini 模型支持 [whispers]、[shouting] 和 [determination] 等行内标签,在同一台词中细致控制表达。
需要保真度时选择 MiniMax Speech 2.6 HD 或 Gemini 2.5 Pro TTS;重视延迟和成本时选择高速版本。
根据模型调整语速、音量、音调、情绪、稳定性、相似度和其他控制项。
ElevenLabs 端点支持自定义 voice ID;可以先通过兼容的声音克隆工作流创建可复用声音。
MiniMax、Google Gemini 和 ElevenLabs 模型共享 Muapi 的认证、异步任务、结果轮询和计费。
从脚本生成有声书章节、视频旁白、广告、解说和社交短视频配音。
使用不同声音和情绪方向制作多主持人节目与角色对白。
批量生成电话提示、通知、无障碍音频和其他动态语音。
使用多语言对白和语言控制,为全球内容与学习材料生成语音。
| 模型 | 提供商 | 价格 | 适合场景 |
|---|---|---|---|
| MiniMax Speech 2.6 HD | MiniMax | $0.13/1,000 个字符 | 录音棚级单人旁白 |
| MiniMax Speech 2.6 Turbo | MiniMax | $0.07/1,000 个字符 | 高速单人语音生成 |
| ElevenLabs TTS Turbo 2.5 | ElevenLabs | $0.05/1,000 个字符 | 高吞吐旁白与 IVR |
| Gemini 3.1 Flash TTS | $0.035/1,000 个字符 | 快速多角色对话 | |
| Gemini 2.5 Pro TTS | $0.035/1,000 个字符 | 录音棚级多角色对白 | |
| ElevenLabs Text to Dialogue V3 | ElevenLabs | $0.10/1,000 个字符 | 多语言多角色对话 |
使用 Muapi API 密钥提交纯文本或结构化对白,保存 request ID,然后轮询标准预测结果端点获取音频 URL。
curl -X POST https://api.muapi.ai/api/v1/minimax-speech-2.6-hd \
-H "x-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"prompt":"Welcome to Muapi. Your workspace is ready.","voice_id":"Friendly_Person","speed":1,"emotion":"happy","format":"mp3"}'
# Response: {"request_id":"REQUEST_ID"}使用 MiniMax 或 ElevenLabs 单人声音端点,传入 prompt、声音以及可选的表达参数。
curl -X POST https://api.muapi.ai/api/v1/gemini-3-1-flash-tts \
-H "x-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"speakers":[{"speaker_id":"Speaker 1","voice_name":"Kore","accent":"Neutral","style":"Empathetic","pace":"Natural"},{"speaker_id":"Speaker 2","voice_name":"Puck","accent":"British (RP)","style":"Deadpan","pace":"Natural"}],"dialogue_turns":[{"speaker_id":"Speaker 1","text":"[warmly] Welcome to the show."},{"speaker_id":"Speaker 2","text":"[whispers] Let us begin."}]}'定义角色和有序对白,每句台词引用应使用的声音配置。
curl -X POST https://api.muapi.ai/api/v1/elevenlabs-text-to-dialogue-v3 \
-H "x-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"dialogue":[{"text":"Welcome to the show.","voice_id":"ZQe5CZNOzWyzPSCn5a3c"},{"text":"Let us begin.","voice_id":"EXAVITQu4vr4xnSDxMaL"}],"language_code":"en","stability":0.5}'传入每个对白片段带有 voice ID 的结构化 dialogue 数组,生成多语言多角色音频。
curl https://api.muapi.ai/api/v1/predictions/REQUEST_ID/result \ -H "x-api-key: YOUR_API_KEY" # Read the generated audio URL after status becomes completed.
轮询直到 status 变为 completed,然后从响应中读取可下载的音频 URL。
Muapi 的 TTS API 通过 MiniMax、Google Gemini 和 ElevenLabs 的六个端点,将文字转换为自然音频,覆盖单人旁白和多角色对白。
需要角色配置和行内语气标签时,可以使用 Gemini 3.1 Flash TTS 或 Gemini 2.5 Pro TTS;需要带有每个角色 voice ID 的多语言结构化对白时,可以使用 ElevenLabs Text to Dialogue V3。
Gemini TTS 起价为每 1,000 个字符 $0.035;ElevenLabs TTS Turbo 2.5 为 $0.05,ElevenLabs Dialogue V3 为 $0.10,MiniMax Turbo 为 $0.07,MiniMax HD 为 $0.13。
可以。ElevenLabs 端点支持自定义 ElevenLabs voice ID;在所选模型 schema 支持时,MiniMax 也可以使用训练好的声音 ID。
每个模型都会从标准预测结果端点返回可下载的音频文件 URL,可以嵌入、下载,或传入视频和 lipsync 流程。
创建 Muapi API 密钥,调用匹配脚本的端点,然后轮询返回的 request ID。当前已上线模型无需等待名单。
使用一个 Muapi API 密钥生成旁白、角色对白、IVR、播客和多语言音频。