LTX 2.3 唇形同步: AI 口型同步

LTX-2.3 LipSync 可将嘴部动作与输入音频片段同步,生成逼真的说话视频。它会保留面部身份、头部位置、光照和自然表情,同时呈现准确的唇部运动、细微眨眼和稳定的时间一致性,由升级的 LTX-2.3 架构提供支持。

📝

概览

关于此模型

LTX-2.3 LipSync 可通过将嘴部动作与输入音频片段同步,生成逼真的说话视频。它会保留面部身份、头部位置、光照和自然表情。

1AI 数字化身
2视频配音
3对白替换
4角色旁白
💰

价格与价值

成本分析

muapiapp$0.26 平均

基于 1.3 倍系数

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

可选的 prompt to guide lipsync generation.

默认值Animate natural lip-sync to the provided audio, add subtle blinking and gentle head motion, maintain the original lighting and facial identity.
图像 URLstring

输入人像图像的 URL。

默认值https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ltx-2.3-lipsync.png
音频 URLstring

输入音频的 URL file.

默认值https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ltx-2.3-lipsync.wav
分辨率枚举(3 个选项)

生成视频的分辨率。

默认值720p
种子int

随机种子。-1 表示随机。

默认值-1
📖

实施指南

开发者文档

提供清晰的人像图像和高质量音频文件。你还可以提供提示词,用于指导细微的面部表情和头部运动。

常见问题

常见问答

音频片段最长可以多长?

目前支持最长 20 秒的音频片段。