关于此模型
OmniHuman 1.5 是一款业界领先的 lipsync 和 talking head 模型,使用输入音轨为人像图像制作动画。它能够实现高保真、逼真的 lip-sync、自然的面部表情和流畅的头部运动,从而生成逼真的说话或演唱视频。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.045/秒 (720p) / $0.060/秒 (1080p) | 根据音频时长(5 秒至 60 秒)按秒动态计费。 |
| Fal.ai | 暂不可用 | 暂不可用 |
| Replicate | 暂不可用 | 暂不可用 |
根据音频时长(5 秒至 60 秒)按秒动态计费。
暂不可用
暂不可用
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 可选的 prompt to guide lipsync style. | Make her sing confidently into a microphone with natural lip sync |
| 图像 URL | string | 输入人像图像的 URL。 | https://cdn.muapi.ai/assets/omnihuman-1-5.jpg |
| 音频 URL | string | 输入音频的 URL track. | https://cdn.muapi.ai/assets/omnihuman-1-5.mp3 |
| 输出分辨率 | 枚举(2 个选项) | 输出视频的分辨率。 | 1080 |
| 快速模式 | boolean | 启用快速生成模式。 | false |
可选的 prompt to guide lipsync style.
Make her sing confidently into a microphone with natural lip sync输入人像图像的 URL。
https://cdn.muapi.ai/assets/omnihuman-1-5.jpg输入音频的 URL track.
https://cdn.muapi.ai/assets/omnihuman-1-5.mp3输出视频的分辨率。
1080启用快速生成模式。
false开发者文档
Prepare Your Inputs:
Configure Parameters:
720p 或 1080p 之间选择。默认值为 1080p。pe_fast_mode)以加快迭代。-1 以随机生成。Submit Your Request:
omnihuman-1-5 endpoint。Receive and Review the Output:
常见问答
生成时长由输入音轨的长度决定,最短为 5 秒,最长为 60 秒。
生成口播视频时,`image_url` 和 `audio_url` 都是必需参数。
费用根据输入音频的时长按秒动态计算:720p 分辨率为每秒 $0.045,1080p 分辨率为每秒 $0.06。