Ovi 是统一模型,可从文本输入生成同步的视频与音频。你可以编写包含对白和环境声音的场景描述,Ovi 会生成一段短视频(通常约 5 秒),让画面与声音自然对齐。视频以 540p 分辨率生成。
关于此模型
Ovi 是一款前沿的统一模型,能够根据文本输入无缝生成同步的视频和音频。用户只需一个提示词,就能创建短小且引人入胜的视频片段,自然融合画面与声音,非常适合数字叙事、广告和快速多媒体原型制作。Ovi 基于复杂的生成算法,确保每段视频不仅视觉吸引人,声音也能保持同步,在清晰的 540p 分辨率下呈现近似传统拍摄的体验。
该模型利用先进的机器学习技术理解详细的场景描述、对白和环境声音,并将它们映射为连贯的视频输出。这让创作者可以轻松将想象转化为有形媒体,弥合文本概念与动态视听内容之间的差距。其简洁的界面和高效处理能力使其成为极具竞争力且经济高效的解决方案,让用户只需极少输入和较短周转时间即可获得高质量结果。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.20 每次生成 | muapiapp is 20-50% 更实惠 compared to competitors while delivering comparable or superior 质量. |
| Fal.ai | $0.25 每次生成 | muapiapp offers a 20% discount over Fal.ai, providing excellent cost efficiency with high-质量 video and audio outputs. |
| Replicate | $0.25 每次生成 | muapiapp is priced at 20% less than Replicate, ensuring a more cost-effective solution without compromising on 性能. |
muapiapp is 20-50% 更实惠 compared to competitors while delivering comparable or superior 质量.
muapiapp offers a 20% discount over Fal.ai, providing excellent cost efficiency with high-质量 video and audio outputs.
muapiapp is priced at 20% less than Replicate, ensuring a more cost-effective solution without compromising on 性能.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 描述视频内容的文本提示词。 | A busy railway station intersection at day time. A loudspeaker voice announces: <S>Attention: Train 12785 to Mumbai is now boarding at Platform 3.<E>. Ambient: <AUDCAP>Car horns, crowd murmur, distant train whistle<ENDAUDCAP>. |
| 画面比例 | 枚举(2 个选项) | 输出视频的画面比例。 | 16:9 |
描述视频内容的文本提示词。
A busy railway station intersection at day time. A loudspeaker voice announces: <S>Attention: Train 12785 to Mumbai is now boarding at Platform 3.<E>. Ambient: <AUDCAP>Car horns, crowd murmur, distant train whistle<ENDAUDCAP>.输出视频的画面比例。
16:9开发者文档
如何使用 Ovi-text-to-video
准备输入:
<S> 表示对白,<AUDCAP> 表示环境音频)。A busy railway station intersection at day time. A loudspeaker voice announces: <S>Attention: Train 12785 to Mumbai is now boarding at Platform 3.<E>. Ambient: <AUDCAP>Car horns, crowd murmur, distant train whistle<ENDAUDCAP>.选择画面比例:
16:9 或 9:16)。默认为 16:9。生成视频:
查看并迭代:
常见问答
Ovi 以 540p 分辨率生成视频,在画面质量与生成速度之间取得平衡。
Ovi 生成的每段视频片段时长约为 5 秒。
为了获得最佳结果,请加入详细的场景描述,使用 `<S>` 标签指定对白,并使用 `<AUDCAP>` 标签描述环境声音。清晰且有描述性的提示词有助于模型理解你的创意构想。
支持,你可以根据项目需求在 '16:9' 和 '9:16' 画面比例之间进行选择。
Ovi 的定价具有竞争力,每次生成 $0.20;与同类模型相比,它能在不牺牲质量的情况下提供显著的成本优势。