Speech-2.6-hd 是 MiniMax 的高清文本转语音模型,可将书面文本转换为自然、接近真人的音频。它能生成录音室级语音,发音清晰、节奏流畅、情感逼真且无背景噪声。
关于此模型
Speech-2.6-hd 是由 MiniMax 开发的先进高清文本转语音模型,旨在将书面文本转换为自然、接近真人的音频。借助先进的神经网络架构和复杂的数字信号处理技术,该模型能够生成录音室级语音,具有清晰的发音、流畅的节奏和逼真的情感表达。它还能够生成无背景噪声的音频,带来沉浸式且专业的聆听体验。
Speech-2.6-hd 适用于有声书、播客、视频旁白和辅助技术等多种场景,兼具灵活性与技术精准度。模型支持音高、音量、语速和情绪等多项可自定义参数,让用户能够根据具体的风格和技术要求调整输出,是创意和专业应用的理想选择。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.65 每次生成 | Muapiapp offers a highly competitive rate, being 20-50% 更实惠 than other providers while delivering comparable or superior 质量. |
| Fal.ai | $0.85 每次生成 | Fal.ai 收费 $0.85 每次生成. Muapiapp is 20-50% 更便宜, making it a more cost-effective solution without loss of 性能. |
| Replicate | $0.85 每次生成 | Replicate's rate of $0.85 每次生成 contrasts with muapiapp, which is significantly 更实惠 by 20-50%, offering an excellent balance between cost and 质量. |
Muapiapp offers a highly competitive rate, being 20-50% 更实惠 than other providers while delivering comparable or superior 质量.
Fal.ai 收费 $0.85 每次生成. Muapiapp is 20-50% 更便宜, making it a more cost-effective solution without loss of 性能.
Replicate's rate of $0.85 每次生成 contrasts with muapiapp, which is significantly 更实惠 by 20-50%, offering an excellent balance between cost and 质量.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 要转换为语音的文本。每个字符计为 1 个 Token。最多 10000 个字符。可在单词之间使用 <#x#> 控制停顿时长(0.01-99.99 秒)。 | Every journey begins with a single moment of courage. Today, that moment is yours. |
| 声音 ID | 枚举(472 个选项) | 目标声音 ID。请使用已训练的声音 ID(https://muapi.ai/playground/minimax-voice-clone),或使用以下系统声音 ID 之一。 | Friendly_Person |
| 音量 | int | 音量。范围:0.1-10.0,其中 1.0 为正常音量。 | 1 |
| 音高 | int | 音高。范围:-12 至 12,其中 0 为正常音高。 | 0 |
| 情绪 | 枚举(7 个选项) | 生成语音的情绪。 | happy |
| 英语规范化 | boolean | 此参数支持英语文本规范化,可提升数字朗读场景的表现。 | false |
| 采样率 | 枚举(6 个选项) | 生成声音的采样率。 | 8000 |
| 比特率 | 枚举(4 个选项) | 生成声音的比特率。 | 32000 |
| 频道 | 枚举(2 个选项) | he number of channels of the 生成的音频. 1: mono, 2: stereo. | 1 |
| 格式 | 枚举(4 个选项) | 生成声音的格式。 | mp3 |
| 语言增强 | 枚举(41 个选项) | 增强对指定语言和方言的识别能力。 | auto |
要转换为语音的文本。每个字符计为 1 个 Token。最多 10000 个字符。可在单词之间使用 <#x#> 控制停顿时长(0.01-99.99 秒)。
Every journey begins with a single moment of courage. Today, that moment is yours.目标声音 ID。请使用已训练的声音 ID(https://muapi.ai/playground/minimax-voice-clone),或使用以下系统声音 ID 之一。
Friendly_Person音量。范围:0.1-10.0,其中 1.0 为正常音量。
1音高。范围:-12 至 12,其中 0 为正常音高。
0生成语音的情绪。
happy此参数支持英语文本规范化,可提升数字朗读场景的表现。
false生成声音的采样率。
8000生成声音的比特率。
32000he number of channels of the 生成的音频. 1: mono, 2: stereo.
1生成声音的格式。
mp3增强对指定语言和方言的识别能力。
auto开发者文档
如何使用 Speech-2.6-hd
准备文本
<#x#> 语法。选择声音
voice_id(例如 Friendly_Person)。它决定生成音频的语气和个性。自定义参数
speed、volume、pitch 和 emotion 等参数,以匹配目标音频效果。如果处理数字朗读或特殊文本,请启用 english_normalization。设置技术规格
sample_rate、bitrate、channel 配置和 format,确保音频符合质量与兼容性要求。生成并检查
按需迭代
常见问答
你可以将最多 10,000 个字符的任意文本内容转换为高质量音频。模型支持使用 `<#x#>` 语法控制停顿,以便在语音生成过程中进行精确的时间调整。
模型提供 `emotion` 参数,可指定生成语音的情绪语气(例如 happy、sad、angry),帮助为音频增加细腻度和表现力。
使用 Speech-2.6-hd 生成音频的费用为每次 $0.65,在保持质量的同时具有较高性价比。
可以。你可以完全控制 `sample_rate`、`bitrate`、`channel`(单声道或立体声)以及输出格式(mp3、wav、pcm、flac),以便根据需求定制音频。