Grok Imagine 图生视频: 图像转视频

Grok Imagine 是 xAI 的多模态图生视频模型,可将静态图像制作成 6 到 30 秒的电影感视频,并同步生成环境音频。它注重真实感、流畅运动和富有表现力的光照过渡,同时保持较高的生成速度。

📝

概览

关于此模型

Grok Imagine 是 xAI 在多模态图生视频领域的突破性方案,旨在将静态图像转化为引人入胜的电影感体验。该模型注重真实感、流畅运动和富有表现力的光照变化,借助前沿人工智能技术生成时长约 6 秒的短视频;视频不仅会让画面动起来,还会与环境音频同步,带来沉浸式体验。模型针对高速生成进行了优化,确保你的创意构想能够近乎实时地呈现。

Grok Imagine 构建于先进的深度学习架构之上,在多用途性和效率方面表现突出。无论是制作细微的场景过渡,还是生成动态的冒险风格视觉叙事,它都能精准适配你的创意提示词。技术实力与艺术敏感性的独特结合,使其成为内容创作者、营销人员和开发者通过自动化、高质量视频生成增强数字叙事的理想选择。

1制作电影感社交媒体内容
2制作营销和广告视频片段
3为数字营销活动构建动态叙事
4根据静态图像生成艺术化演绎
5增强演示文稿中的视觉内容
6生成虚拟导览和沉浸式体验
💰

价格与价值

成本分析

muapiapp$0.15 每次生成

muapiapp offers a highly competitive rate, making it 20-50% 更实惠 than its competitors while delivering cutting-edge 质量.

Fal.ai$0.25 每次生成

Although Fal.ai 收费 a similar price rate to Replicate, muapiapp stands out by being 20-50% 更便宜 with comparable or superior 质量.

Replicate$0.25 每次生成

Replicate 和 Fal.ai 的服务定价相近。相比之下,muapiapp 以显著更低的成本提供同等的高端输出。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

描述视频的文本提示词. Reference uploaded images using @image(n) followed by a space — e.g. @image1 a sunset over the ocean.

默认值@image1 Camera glides through vines toward temple entrance, mist disperses as sunlight pierces canopy, birds fly off, subtle dust motes in the air, adventure-style cinematic score.
画面比例枚举(5 个选项)

Aspect ratio of the 输出视频. Note: ignored when only a single image is provided.

默认值2:3
模式枚举(3 个选项)

注意:使用外部图像输入生成视频时不支持 Spicy 模式,系统会自动切换为 Normal。

默认值normal
分辨率枚举(2 个选项)

输出视频的分辨率。

默认值480p
时长(秒)int

Video duration (秒) (6–30). Cost: $0.025/s at 480p, $0.05/s at 720p.

默认值6
📖

实施指南

开发者文档

如何使用 Grok Imagine

  1. 准备输入

    • 确保有一张高质量图像可供使用。上传图像,或在 images_list 字段中提供直接 URL(最多 1 张图像)。
    • 编写描述性文本提示词,说明所需的视频元素,例如光照变化、镜头运动和配套环境音频。
  2. 配置设置

    • 选择动画模式:funnormalspicy(注意,使用外部图像输入时,模型会自动将 spicy 模式切换为 normal)。
    • 选择视频时长(6 秒或 10 秒)。默认值为 6 秒。
  3. 提交并生成

    • 使用端点 /grok-imagine-image-to-video 发送配置好的输入。
    • 模型会处理图像和文本提示词,输出带有同步音频的高质量电影感视频。
  4. 查看并迭代

    • 视频生成后检查输出。如有需要,调整提示词或设置,以进一步完善视频的美感和叙事效果。

常见问题

常见问答

Grok Imagine 支持使用哪些图像?

Grok Imagine 支持通过文件上传或 URL 提供的高分辨率图像。为获得最佳效果,请使用细节清晰、视觉元素鲜明的图像。

生成视频需要多长时间?

该生成流程经过速度优化,通常在提交后短时间内即可生成电影感视频;实际耗时取决于提示词的复杂程度和系统负载。

`fun`、`normal` 和 `spicy` 模式有什么区别?

每种模式都会调整视频生成风格。`fun` 提供更具趣味性的演绎,`normal` 生成平衡且贴近现实的结果,而 `spicy`(可用时)会加强视觉效果。注意,使用外部图像输入时,`spicy` 模式会自动切换为 `normal`。