OmniHuman 1.5: AI 口型同步

使用 OmniHuman 1.5,根据人像图像和音频生成逼真的口播视频。

📝

概览

关于此模型

OmniHuman 1.5 是一款业界领先的 lipsync 和 talking head 模型,使用输入音轨为人像图像制作动画。它能够实现高保真、逼真的 lip-sync、自然的面部表情和流畅的头部运动,从而生成逼真的说话或演唱视频。

1数字化身:创建逼真的会说话数字化身,用于虚拟演示和客户互动。
2娱乐:让人像照片和艺术作品自然地对口型唱歌或说话。
3社交媒体:生成带有动画角色且与旁白匹配的引人入胜的视频片段。
💰

价格与价值

成本分析

muapiapp$0.045/秒 (720p) / $0.060/秒 (1080p)

根据音频时长(5 秒至 60 秒)按秒动态计费。

Fal.ai暂不可用

暂不可用

Replicate暂不可用

暂不可用

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

可选的 prompt to guide lipsync style.

默认值Make her sing confidently into a microphone with natural lip sync
图像 URLstring

输入人像图像的 URL。

默认值https://cdn.muapi.ai/assets/omnihuman-1-5.jpg
音频 URLstring

输入音频的 URL track.

默认值https://cdn.muapi.ai/assets/omnihuman-1-5.mp3
输出分辨率枚举(2 个选项)

输出视频的分辨率。

默认值1080
快速模式boolean

启用快速生成模式。

默认值false
📖

实施指南

开发者文档

如何使用 OmniHuman 1.5

  1. Prepare Your Inputs

    • Image URL:选择清晰的高质量人像图像。上传图像或提供其 URL。
    • Audio URL:提供包含语音或歌曲的音频文件,该音频将驱动数字化身的 lip-sync。
  2. Configure Parameters

    • Prompt:可选地添加提示词来引导 lip sync 的风格(例如,'Make her sing confidently with natural lip sync')。
    • Output Resolution:在 720p 或 1080p 之间选择。默认值为 1080p。
    • Fast Mode:启用快速生成模式(pe_fast_mode)以加快迭代。
    • Seed:使用自定义 seed 以获得可复现结果,或设置为 -1 以随机生成。
  3. Submit Your Request

    • 按技术 schema 中的定义,将准备好的输入发送到 omnihuman-1-5 endpoint。
  4. Receive and Review the Output

    • 处理完成后,获取输出视频 URL。检查生成的动画,并根据需要进行迭代。

常见问题

常见问答

生成时长上限是多少?

生成时长由输入音轨的长度决定,最短为 5 秒,最长为 60 秒。

需要哪些参数?

生成口播视频时,`image_url` 和 `audio_url` 都是必需参数。

如何计算积分费用?

费用根据输入音频的时长按秒动态计算:720p 分辨率为每秒 $0.045,1080p 分辨率为每秒 $0.06。