关于此模型
Volcengine 视频唇形同步会重新调整现有视频中的嘴部动作,使其匹配新的目标音轨,从而生成自然的配音或重新配声结果。它支持快速的 lite 模式,针对单人正面镜头进行了优化;还支持 basic 模式,为更复杂的多镜头场景增加场景分割和说话人识别。输出以 25fps 的 MP4 返回,时长跟随音轨:如果视频比音频长则裁剪视频,如果更短则循环视频。可选的人声分离功能会在应用驱动音频前去除其中的背景噪声。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.06/秒 of 音频 (1.3× margin applied) | 按次生成, 无需订阅 required. |
| Fal.ai | 暂不可用 | Fal.ai 不提供 this specific model. |
| Replicate | 暂不可用 | Replicate 不提供 this specific model. |
按次生成, 无需订阅 required.
Fal.ai 不提供 this specific model.
Replicate 不提供 this specific model.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 模式 | 枚举(2 个选项) | 服务模式。'lite' 用于单人正面视频,处理速度更快;'basic' 用于单人复杂场景,并支持场景分割和说话人识别。 | lite |
| 视频 URL | string | 视频 URL。支持的分辨率:360p-1080p。高于 1080p 的视频会压缩为 1080p;不支持低于 360p 的视频。支持的格式:MOV、MP4、HDR。文件最大为 500MB。 | https://d3adwkbyhxyrtq.cloudfront.net/muapi/data/volcengine-lipsync-video.mp4 |
| 音频 URL | string | 用于驱动视频口型动作的纯人声音频 URL。文件最大为 10MB。 | https://d3adwkbyhxyrtq.cloudfront.net/muapi/data/volcengine-lipsync-audio.mp3 |
| 分离人声 | boolean | 启用人声分离以抑制背景噪声。 | false |
| 场景检测 | boolean | 启用场景分割和说话人识别。仅支持 Basic 模式。 | false |
| 对齐音频(循环视频) | boolean | 支持 Lite 模式。当音频长于视频时是否循环视频。 | true |
| 反向对齐音频 | boolean | 支持 Lite 模式。是否反向循环视频。要求 align_audio 为 true。 | false |
| 模板开始秒数 | int | Supported in Lite mode. Start time of the template video, (秒). | 0 |
服务模式。'lite' 用于单人正面视频,处理速度更快;'basic' 用于单人复杂场景,并支持场景分割和说话人识别。
lite视频 URL。支持的分辨率:360p-1080p。高于 1080p 的视频会压缩为 1080p;不支持低于 360p 的视频。支持的格式:MOV、MP4、HDR。文件最大为 500MB。
https://d3adwkbyhxyrtq.cloudfront.net/muapi/data/volcengine-lipsync-video.mp4用于驱动视频口型动作的纯人声音频 URL。文件最大为 10MB。
https://d3adwkbyhxyrtq.cloudfront.net/muapi/data/volcengine-lipsync-audio.mp3启用人声分离以抑制背景噪声。
false启用场景分割和说话人识别。仅支持 Basic 模式。
false支持 Lite 模式。当音频长于视频时是否循环视频。
true支持 Lite 模式。是否反向循环视频。要求 align_audio 为 true。
falseSupported in Lite mode. Start time of the template video, (秒).
0开发者文档
准备输入:上传源视频(360p–1080p、MOV/MP4/HDR,最大 500MB)和用于驱动唇形动作的干净人声音轨(MP3、WAV、AAC 或 OGG,最大 10MB)。
选择模式:单人正面视频使用 mode: "lite" 以获得更快处理速度;多镜头或多说话人的复杂场景使用 mode: "basic"(会启用 open_scenedet)。
调整对齐(lite 模式):如果音频长于视频,align_audio(默认值为 true)会循环视频以匹配时长;align_audio_reverse 则改为反向循环。templ_start_seconds 用于设置模板在视频中的起始位置。
提交并轮询:调用下面的端点,然后轮询任务详情端点(或使用 callBackUrl),直到任务完成。
curl -X POST https://api.muapi.ai/api/v1/volcengine-video-to-video-lip-sync \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"mode": "lite",
"video_url": "https://your-domain.com/video/example.mp4",
"audio_url": "https://your-domain.com/audio/speech.mp3",
"separate_vocal": false
}'
常见问答
它接收现有视频和目标音轨,然后重新生成说话人的嘴部动作,使其匹配新音频,适合在无需重新拍摄的情况下为素材配音或重新配声。
`lite` 模式针对单人、正面镜头的视频进行了优化,处理速度更快。`basic` 模式支持更复杂的场景,包括通过 `open_scenedet` 进行场景分割和说话人识别。
视频:MOV、MP4 或 HDR,360p–1080p 分辨率(高于 1080p 会压缩到更低分辨率),最大 500MB,24–60fps,1–30 Mbps 比特率。音频:MP3、WAV、AAC、MP4-audio 或 OGG,最大 10MB。
输出时长始终跟随音频。如果视频短于音频,视频会循环(`align_audio`),也可以选择反向循环(`align_audio_reverse`)来填补差额。如果视频更长,则会裁剪到音频时长。
启用后,它会对输入音频执行人声分离,在用音频驱动唇形动作前抑制背景音乐或噪声,从而提高嘈杂音轨上的同步准确度。
生成的视频以 25fps 的 MP4 返回,分辨率与输入视频一致,最高为 1080p。