Speech-2.6-turbo 是 Minimax 的快速、轻量级文本转语音模型,专为快速生成音频而设计,同时保持良好的自然语音质量。它生成清晰的语音,节奏流畅且延迟极低。
关于此模型
Minimax-Speech-2.6-Turbo 是 Minimax 推出的前沿文本转语音模型,在音频生成中兼顾速度与质量。该模型专注于快速输出和高效处理,经过优化后能够以流畅的节奏和极低的延迟生成清晰、自然的语音。它采用先进的深度学习技术,确保每段生成的音频都具备接近真人的语调和真实音色。
这款轻量级模型面向开发者和企业设计,能够处理从引人入胜的互动应用到动态音频内容创作等多种应用。其 speed、volume、pitch 和 emotion 等参数易于调整,用户可以根据具体需求微调输出,使其成为文本转音频领域的多用途工具。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.65 每次生成 | muapiapp 比竞品便宜 20–50%,同时提供相当或更高的质量。 |
| Fal.ai | $0.85 每次生成 | Fal.ai 收费 about 20-50% more 每次生成 compared to muapiapp, ensuring muapiapp remains the more cost-effective solution without compromising on 质量. |
| Replicate | $0.85 每次生成 | Replicate's 定价 is nearly identical to Fal.ai, making muapiapp a 20-50% 更实惠 option with equal or better 性能. |
muapiapp 比竞品便宜 20–50%,同时提供相当或更高的质量。
Fal.ai 收费 about 20-50% more 每次生成 compared to muapiapp, ensuring muapiapp remains the more cost-effective solution without compromising on 质量.
Replicate's 定价 is nearly identical to Fal.ai, making muapiapp a 20-50% 更实惠 option with equal or better 性能.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 要转换为语音的文本。每个字符计为 1 个 Token。最多 10000 个字符。可在单词之间使用 <#x#> 控制停顿时长(0.01-99.99 秒)。 | Welcome to Minimax-Speech 2.6 by Muapiapp! Get ready for an audio revolution! We are thrilled to introduce a model so realistic, it's virtually indistinguishable from a human voice. You're going to be amazed by its lifelike delivery! |
| 声音 ID | 枚举(472 个选项) | 目标声音 ID。请使用已训练的声音 ID(https://muapi.ai/playground/minimax-voice-clone),或使用以下系统声音 ID 之一。 | Friendly_Person |
| 速度 | int | 语速。范围:0.5-2.0,其中 1.0 为正常速度。 | 1 |
| 音量 | int | 音量。范围:0.1-10.0,其中 1.0 为正常音量。 | 1 |
| 音高 | int | 音高。范围:-12 至 12,其中 0 为正常音高。 | 0 |
| 情绪 | 枚举(7 个选项) | 生成语音的情绪。 | surprised |
| 英语规范化 | boolean | 此参数支持英语文本规范化,可提升数字朗读场景的表现。 | false |
| 采样率 | 枚举(6 个选项) | 生成声音的采样率。 | 8000 |
| 比特率 | 枚举(4 个选项) | 生成声音的比特率。 | 32000 |
| 频道 | 枚举(2 个选项) | he number of channels of the 生成的音频. 1: mono, 2: stereo. | 1 |
| 格式 | 枚举(4 个选项) | 生成声音的格式。 | mp3 |
| 语言增强 | 枚举(41 个选项) | 增强对指定语言和方言的识别能力。 | auto |
要转换为语音的文本。每个字符计为 1 个 Token。最多 10000 个字符。可在单词之间使用 <#x#> 控制停顿时长(0.01-99.99 秒)。
Welcome to Minimax-Speech 2.6 by Muapiapp! Get ready for an audio revolution! We are thrilled to introduce a model so realistic, it's virtually indistinguishable from a human voice. You're going to be amazed by its lifelike delivery!目标声音 ID。请使用已训练的声音 ID(https://muapi.ai/playground/minimax-voice-clone),或使用以下系统声音 ID 之一。
Friendly_Person语速。范围:0.5-2.0,其中 1.0 为正常速度。
1音量。范围:0.1-10.0,其中 1.0 为正常音量。
1音高。范围:-12 至 12,其中 0 为正常音高。
0生成语音的情绪。
surprised此参数支持英语文本规范化,可提升数字朗读场景的表现。
false生成声音的采样率。
8000生成声音的比特率。
32000he number of channels of the 生成的音频. 1: mono, 2: stereo.
1生成声音的格式。
mp3增强对指定语言和方言的识别能力。
auto开发者文档
准备输入:
prompt 字段中写入要转换为语音的文本。使用 <#x#> 等特殊标签控制词语之间的停顿时长。voice_id,或使用自定义训练的声音。speed、volume、pitch 和 emotion 等参数。配置技术设置:
sample_rate 和 bitrate。channel(mono 或 stereo)和输出 format(例如 mp3、wav)。language_boost。提交请求:
minimax-speech-2.6-turbo 发送配置好的 JSON 负载。解读结果:
audio 链接下载或播放生成的语音。使用 Minimax-Speech-2.6-Turbo,以极低延迟生成高质量、自然的音频!
常见问答
Minimax-Speech-2.6-Turbo 将速度与质量结合起来,能够快速生成音频,同时保持自然、清晰的声音。其高度可定制的参数允许用户微调速度、音量、音高和情绪,为各种应用提供多用途工具。
你可以在提示词文本中使用 `<#x#>` 标签,以秒为单位指定停顿时长。此外,调整 `speed` 参数也可以控制语音的整体节奏。
可以。除了通过 `voice_id` 参数从可用系统声音中进行选择外,你还可以通过 Minimax 语音克隆工具集成自定义训练的声音:https://muapi.ai/playground/minimax-voice-clone。
模型支持包括 mp3、wav、pcm 和 flac 在内的多种输出格式。你还可以调整 sample rate、bitrate 和 channel 设置,以满足具体的质量要求。