LTX-2-19B LipSync 能够将人物的嘴部动作与输入音频片段同步,生成逼真的说话视频。它会保留面部身份、头部位置、光照和自然表情,同时呈现准确的唇部运动、细微眨眼和稳定的时间一致性。非常适合数字化身、配音、对白替换和角色旁白。
关于此模型
LTX-2-19B LipSync 是一款前沿的音频生视频模型,可以将人物的嘴部动作与输入音频片段同步,生成逼真的说话视频。借助先进的深度学习技术,该模型能够保留面部身份、头部位置、环境光照和自然表情,同时提供超精准的唇形同步效果。LTX-2-19B 背后的技术经过设计,可以保持眨眼和轻微头部动作等细节,从而生成具有出色时间一致性和真实感的视频。
LTX-2-19B LipSync 非常适合创建数字化身、替换对白、进行配音和制作角色旁白,将静态图像与动态叙事连接起来。它能够以每次生成 $0.2 的竞争力价格制作逼真的视频,是希望获得先进性能且不牺牲质量的创作者和开发者的出色选择。这款模型功能灵活、技术基础稳健,为音频驱动的视频合成树立了新的标准。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.2 每次生成 | muapiapp 比竞品便宜 20–50%,同时提供相当或更高的质量。 |
| Fal.ai | $0.3 每次生成 | muapiapp is approximately 33% 更便宜, offering better value without compromising on 性能. |
| Replicate | $0.3 每次生成 | With muapiapp cost-effectiveness being 20-50% lower, it provides a competitive edge in both 质量 and 定价. |
muapiapp 比竞品便宜 20–50%,同时提供相当或更高的质量。
muapiapp is approximately 33% 更便宜, offering better value without compromising on 性能.
With muapiapp cost-effectiveness being 20-50% lower, it provides a competitive edge in both 质量 and 定价.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 用于生成视频的提示词 | Animate natural lip-sync to the provided audio, add subtle blinking and gentle head motion, maintain the original lighting and facial identity, keep the performance realistic and stable. |
| 图像 URL | string | 输入图像的 URL。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ltx-2-19b-lipsync.jpg |
| 音频 URL | string | 用于上传音频文件的 URL。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ltx-2-19b-lipsync.wav |
| 分辨率 | 枚举(3 个选项) | 生成视频的分辨率。 | 720p |
用于生成视频的提示词
Animate natural lip-sync to the provided audio, add subtle blinking and gentle head motion, maintain the original lighting and facial identity, keep the performance realistic and stable.输入图像的 URL。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ltx-2-19b-lipsync.jpg用于上传音频文件的 URL。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ltx-2-19b-lipsync.wav生成视频的分辨率。
720p开发者文档
步骤 1:准备输入
步骤 2:提交请求
ltx-2-19b-lipsync)提交输入 JSON 数据。请确保包含 audio_url 字段,因为它是生成视频所必需的。步骤 3:解读结果
步骤 4:按需迭代
常见问答
该模型通过将唇部动作与输入音频片段同步,生成逼真的说话视频,同时保留面部身份、头部位置、光照和自然表情。
唯一必填字段是 `audio_url`。不过,提供 `image_url` 和详细的 `prompt` 可以通过指定所需动作与表情来增强视频的真实感。
该模型支持三种分辨率:480p、720p(默认值)和 1080p。
该模型采用先进的深度学习技术,保持时间一致性、精准唇部动作、细微眨眼和自然头部移动,从而确保高保真且逼真的视频输出。