Ovi 是统一的音频–视频生成模型,可将静态图像与描述性提示词转换为带同步音频的短视频。它同时支持文生视频和图像条件视频输入,并内置唇形同步、背景音频/音效及对白支持,让静态画面以电影感方式焕发生命力。视频以 540p 分辨率生成。
关于此模型
Ovi-image-to-video 是一款前沿 AI 模型,革新了将静态图像转换为动态视频内容的方式。通过整合先进的音视频合成技术,Ovi 可将静态图像与描述性提示词无缝结合,生成带同步声音、内置唇形同步和逼真背景音效的短小且引人入胜的视频。该创新模型同时支持文生视频和图像条件输入,是创意叙事与电影感内容创作的多用途工具。
Ovi 基于稳健的深度学习架构,凭借将静态视觉内容动画化并保持 540p 高质量输出的独特能力脱颖而出。其技术实力不仅能驱动逼真的视听体验,还为希望提升多媒体影响力的企业和创作者提供易用且经济高效的解决方案。有了 Ovi,将想法转化为生动、动态的故事从未如此简单。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.20 每次生成 | muapiapp offers the most cost-effective solution, being 20-50% 更便宜 than competitors while matching or exceeding 质量 standards. |
| Fal.ai | $0.30 每次生成 | Fal.ai 收费 slightly more, but muapiapp provides 20-50% savings with equally impressive 性能 and output 质量. |
| Replicate | $0.30 每次生成 | Replicate’s 定价 is on par with Fal.ai; however, muapiapp delivers the same high-质量 video generation at a significantly lower cost. |
muapiapp offers the most cost-effective solution, being 20-50% 更便宜 than competitors while matching or exceeding 质量 standards.
Fal.ai 收费 slightly more, but muapiapp provides 20-50% savings with equally impressive 性能 and output 质量.
Replicate’s 定价 is on par with Fal.ai; however, muapiapp delivers the same high-质量 video generation at a significantly lower cost.
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 描述视频内容的文本提示词。 | Camera: static medium shot. The scientist speaks: <S>We have discovered life beyond Earth.<E> <AUDCAP>Soft electronic hum, distant Beep of instruments<ENDAUDCAP> |
| 图像 URL | string | 输入图像的 URL。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ovi-image-to-video.jpg |
描述视频内容的文本提示词。
Camera: static medium shot. The scientist speaks: <S>We have discovered life beyond Earth.<E> <AUDCAP>Soft electronic hum, distant Beep of instruments<ENDAUDCAP>输入图像的 URL。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/ovi-image-to-video.jpg开发者文档
准备输入
输入数据
生成视频
ovi-image-to-video endpoint。查看输出
整合与分享
常见问答
Ovi-image-to-video 接受静态图像 URL 和描述性文本提示词。提示词可以包含详细的场景描述、带唇形同步提示的对白,以及用于增强最终视频输出的音频说明。
该模型内置唇形同步和精确的音频对齐功能。它会分析描述性文本提示词,将对白和背景声音动态匹配到生成的视觉内容,从而提供连贯的视听体验。