Muapi 的 AI 数字人与口型同步 API 通过一个 REST 集成覆盖两类相关任务:让现有视频的口型重新匹配新的音轨,以及仅用一张肖像图和一段音频生成全新的口播数字人视频。它们可用于视频配音、多语言产品视频、AI 主播和反应式角色动画,统一使用一个 API 密钥和相同的提交与轮询流程。
将静态角色图像变成口播视频,让口型和面部表情与语音轨道同步,是成本最低的数字人生成选项。
AI 口型同步 API 接收现有视频和新的音轨,让嘴部动作重新匹配音频,是将口播视频配成另一种语言而无需重新拍摄的标准工具。AI 数字人 API 则从一张肖像图和一段音频开始,直接生成全新的口播视频,无需源视频。两者解决的是同一个核心问题(让面孔说出给定音频),但起始输入不同。
Muapi 通过相同的统一 REST 模式提供 500+ 个模型,包括本页列出的所有口型同步和数字人生成模型:一个 API 密钥、一次提交与轮询流程,按次生成付费,无需订阅。
LatentSync、Veed、Sync、Creatify 和 Volcengine 都接收视频 URL 与新的音频 URL,并返回口型同步结果。
Wan 2.2、InfiniteTalk、Kling Avatar、LTX-2/LTX-2.3 和 OmniHuman 1.5 将一张肖像图和一段音频变成完整口播视频,无需源视频。
将文本转语音端点(MiniMax Speech、ElevenLabs、Suno)与口型同步端点组合起来,即可端到端翻译脚本并让视频口型匹配新语言。
Wan 2.2、LTX-2、LTX-2.3 和 Volcengine 都根据输出分辨率计价,可以先用 480p 草稿、再用 1080p 交付,而无需更换模型。
Kling Avatar 系列在 v1 和 v2 中同时提供 Standard 与 Pro 档位,因此预览运行和最终渲染可以在同一模型系列中选择不同价格。
所有模型都无需订阅或最低承诺:最便宜的数字人生成档位约 $0.02/秒,最高的按分钟口型同步档位为 $1.30/分钟。
| 模型 | 类别 | 输入 | 价格 |
|---|---|---|---|
| LatentSync | 视频口型同步 #1 | 视频 + 音频 | $0.26(≤40 秒) |
| Veed Lipsync | 视频口型同步 #2 | 视频 + 音频 | $0.52/分钟 |
| Sync Lipsync | 视频口型同步 #3 | 视频 + 音频 | $0.91/分钟 |
| Creatify Lipsync | 视频口型同步 #4 | 视频 + 音频 | $1.30/分钟 |
| Volcengine Lipsync | 视频口型同步 #5 | 视频 + 音频 | $0.06/秒 |
| Wan 2.2 Speech-to-Video | AI 数字人 #1 | 图像 + 音频 | $0.04–$0.08/秒 |
| LTX-2-19B Avatar | AI 数字人 #2 | 图像 + 音频 | $0.02–$0.04/秒 |
| LTX-2.3 Avatar | AI 数字人 #3 | 图像 + 音频 | $0.03–$0.05/秒 |
| InfiniteTalk | AI 数字人 #4 | 图像 + 音频 | $0.04–$0.08/秒 |
| Kling v1 Avatar Standard | AI 数字人 #5 | 图像 + 音频 | $0.07/秒 |
| Kling v2 Avatar Standard | AI 数字人 #6 | 图像 + 音频 | $0.35 + $0.07/秒 |
| Kling v1 Avatar Pro | AI 数字人 #7 | 图像 + 音频 | $0.13/秒 |
| Kling v2 Avatar Pro | AI 数字人 #8 | 图像 + 音频 | $0.15/秒 |
| OmniHuman 1.5 | AI 数字人 #9 | 图像 + 音频 | $0.045–$0.06/秒 |
curl -X POST https://api.muapi.ai/api/v1/sync-lipsync \
-H "Content-Type: application/json" \
-H "x-api-key: YOUR_API_KEY" \
-d '{
"video_url": "https://example.com/talking-head.mp4",
"audio_url": "https://example.com/new-narration.mp3"
}'import requests
response = requests.post(
"https://api.muapi.ai/api/v1/sync-lipsync",
headers={"x-api-key": "YOUR_API_KEY"},
json={
"video_url": "https://example.com/talking-head.mp4",
"audio_url": "https://example.com/new-narration.mp3",
},
)
request_id = response.json()["request_id"]
result = requests.get(
f"https://api.muapi.ai/api/v1/predictions/{request_id}/result",
headers={"x-api-key": "YOUR_API_KEY"},
)
print(result.json())视频口型同步会将现有视频的嘴部动作重新匹配新的音轨(LatentSync、Veed、Sync、Creatify、Volcengine)。AI 数字人生成只需照片和音频即可创建全新的口播视频,无需源视频(Wan 2.2、InfiniteTalk、Kling Avatar、LTX-2/LTX-2.3、OmniHuman 1.5)。
可以。将文本转语音端点(MiniMax Speech、ElevenLabs、Suno)与口型同步端点组合,翻译脚本、生成目标语言音频,并让视频口型端到端匹配。
可以。Wan 2.2 Speech-to-Video、InfiniteTalk、Kling Avatar、LTX-2/LTX-2.3 和 OmniHuman 1.5 只需一张肖像图和一段音频即可生成完整口播视频。
LatentSync 的 40 秒以内片段为 $0.26 固定价格,Creatify Lipsync 最高为 $1.30/分钟;AI 数字人生成模型约为 $0.02–$0.15/秒,具体取决于档位和分辨率。请参考上方对比表查看当前单模型价格。
可以。本页每个模型以及图像、视频和音频领域的 500+ 个模型,都使用同一个 Muapi API 密钥和相同的提交与轮询流程。
可以。在 muapi.ai 注册,从控制台创建 API 密钥后即可立即调用任何口型同步或数字人模型,无需等待名单。