只需两次录音即可克隆你的歌声,并将其用于 Suno 音乐生成。提交 10 秒样本,然后朗读系统生成的新鲜随机短语(反深度伪造活体检测),即可获得可复用的 `voice_id`,并将其放入 Suno 音乐创作请求中。预览期间免费。
关于此模型
只需一小段录音即可克隆你自己的歌声,并将其用于 AI 音乐生成。两次录音的活体检测流程可以防止滥用于深度伪造:你先上传一段 10 秒样本,然后朗读系统根据该样本新生成的随机短语,最终获得一个可复用的 voice_id,可以将其放入音乐创作请求中。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | 预览期间免费 | 两阶段语音克隆,带有防深度伪造活体检测,可直接用于音乐生成。 |
| Fal.ai | 暂不可用 | 没有等效的歌声克隆产品。 |
| Replicate | 暂不可用 | 没有仅限音乐输出的等效歌声克隆产品。 |
两阶段语音克隆,带有防深度伪造活体检测,可直接用于音乐生成。
没有等效的歌声克隆产品。
没有仅限音乐输出的等效歌声克隆产品。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 声音样本 URL | string | 要克隆声音的干净 10 秒录音 URL。单声道即可。提供商会提取 vocal_start_s 和 vocal_end_s 之间的人声片段。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/minimax-voice-clone-in.wav |
| 声音名称 | string | 用于在声音选择器中显示的简短声音标签(可选)。 | - |
| 描述 | string | 对该声音的自由描述(可选)。 | - |
| 风格标签 | string | 生成音乐时使用的逗号分隔风格提示(可选)。 | - |
| 语言 | 枚举(10 个选项) | 声音样本所使用的语言。 | en |
| 人声开始时间(秒) | int | 样本中人声片段的开始时间。 | 0 |
| 人声结束时间(秒) | int | 样本中人声片段的结束时间。必须大于 Vocal Start。 | 10 |
要克隆声音的干净 10 秒录音 URL。单声道即可。提供商会提取 vocal_start_s 和 vocal_end_s 之间的人声片段。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/minimax-voice-clone-in.wav用于在声音选择器中显示的简短声音标签(可选)。
-对该声音的自由描述(可选)。
-生成音乐时使用的逗号分隔风格提示(可选)。
-声音样本所使用的语言。
en样本中人声片段的开始时间。
0样本中人声片段的结束时间。必须大于 Vocal Start。
10开发者文档
该流程需要两次录音。短语步骤是活体检测,用于防止通过网上找到的音频克隆他人的声音——无法跳过。
录制样本(10 秒):在安静的房间中录制清晰的声音。单声道即可。裁剪开头的静音部分。通过 /api/v1/upload_file 上传,并保留返回的 URL。
提交样本:
curl -X POST https://api.muapi.ai/api/v1/suno-voice-clone \
-H 'x-api-key: $MUAPI_KEY' \
-d '{"audio_url": "https://.../sample.wav", "voice_name": "My Voice", "language": "en"}'
响应:{"request_id": "...", "status": "processing"}。
获取并录制短语:轮询 /api/v1/predictions/{request_id}/result,直到响应显示 stage: "awaiting_phrase" 并包含 phrase 字段。每次请求都会重新生成该短语,不能重复使用。用同一种声音一次性朗读该短语,时长 5–15 秒,然后上传录音。
提交确认:
curl -X POST https://api.muapi.ai/api/v1/suno-voice-clone/{request_id}/confirm \
-H 'x-api-key: $MUAPI_KEY' \
-d '{"audio_url": "https://.../phrase.wav"}'
轮询完成状态:使用之前相同的轮询端点;最终响应会携带 voice_id。这是你传入音乐生成请求的持久标识符。
GET /api/v1/suno-voices — 列出你的声音(按最新优先),每个声音包含 stage、is_available,以及(如果处于流程中)当前活动短语。POST /api/v1/suno-voices/{voice_db_id}/check — 在使用声音前重新检查其可用性(声音具有有限的有效期)。POST /api/v1/suno-voices/{voice_db_id}/refresh — 如果声音已过期,请求新的短语并重新录制。原始样本会继续保留。DELETE /api/v1/suno-voices/{voice_db_id} — 从你的声音库中移除声音。常见问答
第二次录音是活体检测。通过让你朗读一段无法提前准备的新鲜随机短语,提供商可以验证你就是实际说话者,而不是上传 YouTube 名人或同事片段的人。该要求由上游强制执行,无法跳过。
10 秒清晰的语音或歌声最理想。单声道或立体声、mp3 或 wav 均可。如有需要,可使用 `vocal_start_s` 和 `vocal_end_s` 标记较长文件中的人声片段。
提供商创建的声音具有有限的有效期。每次音乐生成前调用 `check` 端点;如果声音已过期,则调用 `refresh` 端点获取新的验证短语。
可以——这正是该功能的用途。克隆成功后,你可以在声音过期前,将这个 `voice_id` 复用于任何音乐生成请求。
预览期间免费。当上游提供商开始收费后,价格可能会发生变化。