MiniMax Voice Clone 可根据一小段参考音频样本创建高保真的说话人数字声音克隆。它能够复现说话人的音色、情绪、口音、节奏和说话风格,然后根据任意文本输入生成新的语音。
关于此模型
MiniMax Voice Clone 是一款先进的文本转语音解决方案,只需一小段参考音频样本,就能创建高保真的说话人数字声音克隆。通过准确捕捉说话人的音色、情绪、口音、节奏和说话风格,该模型能够根据任意文本输入生成符合上下文的新语音。这项稳健的技术采用先进的深度学习和神经网络架构,确保每次合成输出都精准自然。
凭借灵活性和质量,MiniMax Voice Clone 适用于个性化语音助手、自动旁白和沉浸式有声书等多种场景。它能够复现细腻的声音特征,为用户提供直观且经济高效的语音克隆方式。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.65 | muapiapp offers a highly cost-effective solution that is 20-50% 更实惠 than comparable rates from competitors while delivering superior or comparable 质量. |
| Fal.ai | $0.85 | Fal.ai's 定价 is around $0.85 每次生成. Compared to muapiapp, you save between 20-50% using our solution without sacrificing output 质量. |
| Replicate | $0.85 | Replicate also 收费 around $0.85 每次生成, making muapiapp a significantly 更实惠 option with cost reductions of 20-50% while providing state-of-the-art voice cloning technology. |
muapiapp offers a highly cost-effective solution that is 20-50% 更实惠 than comparable rates from competitors while delivering superior or comparable 质量.
Fal.ai's 定价 is around $0.85 每次生成. Compared to muapiapp, you save between 20-50% using our solution without sacrificing output 质量.
Replicate also 收费 around $0.85 每次生成, making muapiapp a significantly 更实惠 option with cost reductions of 20-50% while providing state-of-the-art voice cloning technology.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 音频 URL | string | 音频文件的 URL。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/minimax-voice-clone-in.wav |
| 自定义声音 ID | string | 自定义用户 ID。最少 8 个字符,必须包含字母和数字,且以字母开头。重复的 voice-id 会导致错误。 | |
| 模型 | 枚举(6 个选项) | 指定用于预览的 TTS 模型。这只是克隆后的预览。模型生成后,任何 Minimax Turbo 或 HD 声音模型都可用于推理。 | speech-02-hd |
| 是否降噪 | boolean | 启用降噪。默认值为 false(不降噪)。 | false |
| 是否音量归一化 | boolean | 指定是否启用音量归一化。 | false |
| 准确度 | int | 文本验证准确度阈值,取值范围为 [0, 1]。 | 0.7 |
| 提示词 | string | 音频预览文本。限制为 2000 个字符。 | Hello! Welcome to Muapiapp! This is a preview of your cloned voice. I hope you enjoy it! |
音频文件的 URL。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/minimax-voice-clone-in.wav自定义用户 ID。最少 8 个字符,必须包含字母和数字,且以字母开头。重复的 voice-id 会导致错误。
指定用于预览的 TTS 模型。这只是克隆后的预览。模型生成后,任何 Minimax Turbo 或 HD 声音模型都可用于推理。
speech-02-hd启用降噪。默认值为 false(不降噪)。
false指定是否启用音量归一化。
false文本验证准确度阈值,取值范围为 [0, 1]。
0.7音频预览文本。限制为 2000 个字符。
Hello! Welcome to Muapiapp! This is a preview of your cloned voice. I hope you enjoy it!开发者文档
准备输入音频
audio_url 字段上传音频文件。设置请求
custom_voice_id、model、need_noise_reduction、need_volume_normalization、accuracy 和 prompt。生成声音克隆
minimax-voice-clone 端点。查看并使用输出
audio 字段返回可访问的生成音频文件。迭代优化
常见问答
模型会分析一小段参考音频,捕捉音色、口音、情绪和节奏等关键声音特征,然后使用先进的 TTS 技术生成与参考声音相似的语音,确保合成结果具有高保真度和自然感。
主要输入是通过 `audio_url` 字段提供的音频 URL。自定义声音 ID 和文本提示等其他参数必须遵循定义好的输入 schema。
不需要。你可以通过 API 端点提交 JSON 格式的请求,轻松将服务集成到现有工作流中。
MiniMax Voice Clone 的价格为每次 $0.65。