模型/AI 数字人与口型同步 API

AI 数字人与口型同步 API — 口播视频与视频配音

已上线500+ 个模型,一个 API 密钥

Muapi 的 AI 数字人与口型同步 API 通过一个 REST 集成覆盖两类相关任务:让现有视频的口型重新匹配新的音轨,以及仅用一张肖像图和一段音频生成全新的口播数字人视频。它们可用于视频配音、多语言产品视频、AI 主播和反应式角色动画,统一使用一个 API 密钥和相同的提交与轮询流程。

14 / 14 个代表性模型
🎬 视频口型同步5 个模型
LatentSync#1 视频口型同步

LatentSync

对最长 40 秒的片段按固定价格进行视频口型同步,超出部分只收取少量按秒费用,是这组模型中速度最快的选择。

输入视频 + 音频
$0.26(≤40 秒)
试用模型
Veed#2 视频口型同步

Veed Lipsync

使用 Veed 最新模型,根据任意音频生成自然的口型同步视频,是按分钟计价中成本最低的选择。

输入视频 + 音频
$0.52/分钟
试用模型
Sync#3 视频口型同步

Sync Lipsync

根据音频生成自然的口型同步动画,具有高质量同步效果,也是该类别名称所源自的参考实现。

输入视频 + 音频
$0.91/分钟
试用模型
Creatify#4 视频口型同步

Creatify Lipsync

针对速度、画质和一致性优化的自然口型同步视频生成。

输入视频 + 音频
$1.30/分钟
试用模型
Volcengine#5 视频口型同步

Volcengine Lipsync

让现有视频的嘴部动作匹配目标音轨,并可选用场景分段和说话人识别模式处理复杂的多人画面。

输入视频 + 音频
$0.06/秒
试用模型
🧑‍🎤 AI 数字人生成9 个模型
Alibaba#1 数字人生成

Wan 2.2 Speech-to-Video

将静态角色图像变成口播视频,让口型和面部表情与语音轨道同步,是成本最低的数字人生成选项。

输入图像 + 音频
$0.04–$0.08/秒
试用模型
Lightricks#2 数字人生成

LTX-2-19B Avatar

根据一张肖像图和一段音频生成自然的口播视频,价格随输出分辨率变化。

输入图像 + 音频
$0.02–$0.04/秒
试用模型
Lightricks#3 数字人生成

LTX-2.3 Avatar

较新的 LTX 版本,处理相同的图像加音频口播视频任务,价格随输出分辨率变化。

输入图像 + 音频
$0.03–$0.05/秒
试用模型
MeiGen AI#4 数字人生成

InfiniteTalk

让静态肖像或角色照片动起来,根据对白脚本生成口型、面部表情和细微的头部动作。

输入图像 + 音频
$0.04–$0.08/秒
试用模型
Kuaishou#5 数字人生成

Kling v1 Avatar Standard

根据单张角色图像和对白音频片段生成口播数字人视频。

输入图像 + 音频
$0.07/秒
试用模型
Kuaishou#6 数字人生成

Kling v2 Avatar Standard

第二代标准档位,根据参考图像和对白音频片段生成口播数字人视频。

输入图像 + 音频
$0.35 + $0.07/秒
试用模型
Kuaishou#7 数字人生成

Kling v1 Avatar Pro

专业档位,根据角色图像和音频输入生成更高质量的口播数字人。

输入图像 + 音频
$0.13/秒
试用模型
Kuaishou#8 数字人生成

Kling v2 Avatar Pro

第二代专业档位,根据参考图像和音频片段生成更高质量的口播数字人视频。

输入图像 + 音频
$0.15/秒
试用模型
ByteDance#9 数字人生成

OmniHuman 1.5

根据肖像图和音频轨道生成自然的口播视频。

输入图像 + 音频
$0.045–$0.06/秒
试用模型

什么是 AI 数字人与口型同步 API?

AI 口型同步 API 接收现有视频和新的音轨,让嘴部动作重新匹配音频,是将口播视频配成另一种语言而无需重新拍摄的标准工具。AI 数字人 API 则从一张肖像图和一段音频开始,直接生成全新的口播视频,无需源视频。两者解决的是同一个核心问题(让面孔说出给定音频),但起始输入不同。

Muapi 通过相同的统一 REST 模式提供 500+ 个模型,包括本页列出的所有口型同步和数字人生成模型:一个 API 密钥、一次提交与轮询流程,按次生成付费,无需订阅。

主要能力

重新同步现有视频

LatentSync、Veed、Sync、Creatify 和 Volcengine 都接收视频 URL 与新的音频 URL,并返回口型同步结果。

根据照片生成口播数字人

Wan 2.2、InfiniteTalk、Kling Avatar、LTX-2/LTX-2.3 和 OmniHuman 1.5 将一张肖像图和一段音频变成完整口播视频,无需源视频。

多语言视频配音流程

将文本转语音端点(MiniMax Speech、ElevenLabs、Suno)与口型同步端点组合起来,即可端到端翻译脚本并让视频口型匹配新语言。

按分辨率计价

Wan 2.2、LTX-2、LTX-2.3 和 Volcengine 都根据输出分辨率计价,可以先用 480p 草稿、再用 1080p 交付,而无需更换模型。

Standard 与 Pro 档位

Kling Avatar 系列在 v1 和 v2 中同时提供 Standard 与 Pro 档位,因此预览运行和最终渲染可以在同一模型系列中选择不同价格。

按次生成付费

所有模型都无需订阅或最低承诺:最便宜的数字人生成档位约 $0.02/秒,最高的按分钟口型同步档位为 $1.30/分钟。

数字人与口型同步模型对比

模型类别输入价格
LatentSync视频口型同步 #1视频 + 音频$0.26(≤40 秒)
Veed Lipsync视频口型同步 #2视频 + 音频$0.52/分钟
Sync Lipsync视频口型同步 #3视频 + 音频$0.91/分钟
Creatify Lipsync视频口型同步 #4视频 + 音频$1.30/分钟
Volcengine Lipsync视频口型同步 #5视频 + 音频$0.06/秒
Wan 2.2 Speech-to-VideoAI 数字人 #1图像 + 音频$0.04–$0.08/秒
LTX-2-19B AvatarAI 数字人 #2图像 + 音频$0.02–$0.04/秒
LTX-2.3 AvatarAI 数字人 #3图像 + 音频$0.03–$0.05/秒
InfiniteTalkAI 数字人 #4图像 + 音频$0.04–$0.08/秒
Kling v1 Avatar StandardAI 数字人 #5图像 + 音频$0.07/秒
Kling v2 Avatar StandardAI 数字人 #6图像 + 音频$0.35 + $0.07/秒
Kling v1 Avatar ProAI 数字人 #7图像 + 音频$0.13/秒
Kling v2 Avatar ProAI 数字人 #8图像 + 音频$0.15/秒
OmniHuman 1.5AI 数字人 #9图像 + 音频$0.045–$0.06/秒

如何调用 AI 口型同步 API

  1. 选择模型 — 如果有源视频,选择视频口型同步;如果只有照片,选择 AI 数字人生成,并参考上方对比表。
  2. 提交请求。 调用 POST /api/v1/{model-slug},传入视频或图像 URL 以及音频 URL。
  3. 轮询完成状态。 检查 GET /api/v1/predictions/{request_id}/result,直到 status 为 completed,然后下载输出视频。
curl -X POST https://api.muapi.ai/api/v1/sync-lipsync \
  -H "Content-Type: application/json" \
  -H "x-api-key: YOUR_API_KEY" \
  -d '{
    "video_url": "https://example.com/talking-head.mp4",
    "audio_url": "https://example.com/new-narration.mp3"
  }'
import requests

response = requests.post(
    "https://api.muapi.ai/api/v1/sync-lipsync",
    headers={"x-api-key": "YOUR_API_KEY"},
    json={
        "video_url": "https://example.com/talking-head.mp4",
        "audio_url": "https://example.com/new-narration.mp3",
    },
)
request_id = response.json()["request_id"]

result = requests.get(
    f"https://api.muapi.ai/api/v1/predictions/{request_id}/result",
    headers={"x-api-key": "YOUR_API_KEY"},
)
print(result.json())

常见问题

视频口型同步和 AI 数字人生成有什么区别?

视频口型同步会将现有视频的嘴部动作重新匹配新的音轨(LatentSync、Veed、Sync、Creatify、Volcengine)。AI 数字人生成只需照片和音频即可创建全新的口播视频,无需源视频(Wan 2.2、InfiniteTalk、Kling Avatar、LTX-2/LTX-2.3、OmniHuman 1.5)。

可以把视频配成另一种语言吗?

可以。将文本转语音端点(MiniMax Speech、ElevenLabs、Suno)与口型同步端点组合,翻译脚本、生成目标语言音频,并让视频口型端到端匹配。

没有源视频也能生成口播视频吗?

可以。Wan 2.2 Speech-to-Video、InfiniteTalk、Kling Avatar、LTX-2/LTX-2.3 和 OmniHuman 1.5 只需一张肖像图和一段音频即可生成完整口播视频。

AI 口型同步的价格是多少?

LatentSync 的 40 秒以内片段为 $0.26 固定价格,Creatify Lipsync 最高为 $1.30/分钟;AI 数字人生成模型约为 $0.02–$0.15/秒,具体取决于档位和分辨率。请参考上方对比表查看当前单模型价格。

所有口型同步和数字人模型都能使用同一个 API 密钥吗?

可以。本页每个模型以及图像、视频和音频领域的 500+ 个模型,都使用同一个 Muapi API 密钥和相同的提交与轮询流程。

现在可以获得 AI 数字人与口型同步 API 的访问权限吗?

可以。在 muapi.ai 注册,从控制台创建 API 密钥后即可立即调用任何口型同步或数字人模型,无需等待名单。