Grok Imagine 画像から動画生成: 画像から動画生成

Grok Imagine 是 xAI 的多模态画像から動画生成模型,可将静态图像制作成 6 到 30 秒的シネマティック视频,并同步生成环境音频。它注重真实感、流畅运动和富有表现力的光照过渡,同时保持较高的生成速度。

📝

概要

このモデルについて

Grok Imagine 是 xAI 在多模态画像から動画生成领域的突破性方案,旨在将静态图像转化为引人入胜的シネマティック体验。该模型注重真实感、流畅运动和富有表现力的光照变化,借助前沿人工智能技术生成时长约 6 秒的短视频;视频不仅会让画面动起来,还会与环境音频同步,带来沉浸式体验。模型针对高速生成进行了优化,确保你的创意构想能够近乎实时地呈现。

Grok Imagine 构建于先进的深度学习架构之上,在多用途性和效率方面表现突出。无论是制作细微的场景过渡,还是生成动态的冒险风格视觉叙事,它都能精准适配你的创意プロンプト。技术实力与艺术敏感性的独特结合,使其成为内容创作者、营销人员和开发者通过自动化、高质量视频生成增强数字叙事的理想选择。

1制作シネマティック社交媒体内容
2制作营销和广告视频片段
3为数字营销活动构建动态叙事
4根据静态图像生成艺术化演绎
5增强演示文稿中的视觉内容
6生成虚拟导览和沉浸式体验
💰

料金と価値

コスト分析

muapiapp$0.15 per generation

muapiapp offers a highly competitive rate, making it 20-50% more affordable than its competitors while delivering cutting-edge quality.

Fal.ai$0.25 per generation

Although Fal.ai charges a similar price rate to Replicate, muapiapp stands out by being 20-50% cheaper with comparable or superior quality.

Replicate$0.25 per generation

Replicate 和 Fal.ai 的服务定价相近。相比之下,muapiapp 以显著更低的成本提供同等的高端输出。

** 競合サービスの料金は類似のモデル構成および利用ティアに基づいて算出された推定値です。

⚙️

技術詳細

設定スキーマ

プロンプトstring

Text prompt describing the video. Reference uploaded images using @image(n) followed by a space — e.g. @image1 a sunset over the ocean.

デフォルト値@image1 Camera glides through vines toward temple entrance, mist disperses as sunlight pierces canopy, birds fly off, subtle dust motes in the air, adventure-style cinematic score.
アスペクト比Enum(5個の選択肢)

Aspect ratio of the output video. Note: ignored when only a single image is provided.

デフォルト値2:3
モードEnum(3個の選択肢)

注意:使用外部画像入力生成動画时不対応 Spicy 模式,系统会自动切换为 Normal。

デフォルト値normal
解像度Enum(2個の選択肢)

出力動画的解像度。

デフォルト値480p
長さ(秒)(秒)int

Video duration in seconds (6–30). Cost: $0.025/s at 480p, $0.05/s at 720p.

デフォルト値6
📖

実装ガイド

開発者ドキュメント

使用方法 Grok Imagine

  1. 準備入力

    • 确保有一张高质量图像可供使用。上传图像,或在 images_list 字段中提供直接 URL(最多 1 张图像)。
    • 编写描述性文本プロンプト,说明所需的视频元素,例如光照变化、镜头运动和配套环境音频。
  2. 配置设置

    • 选择动画模式:funnormalspicy(注意,使用外部图像入力时,模型会自动将 spicy 模式切换为 normal)。
    • 选择视频时长(6 秒或 10 秒)。默认值为 6 秒。
  3. 提交并生成

    • 使用端点 /grok-imagine-image-to-video 发送配置好的入力。
    • 模型会处理图像和文本プロンプト,出力带有同步音频的高质量シネマティック视频。
  4. 查看并迭代

    • 视频生成后检查出力。如有需要,调整プロンプト或设置,以进一步完善视频的美感和叙事效果。

よくある質問

FAQ

Grok Imagine 支持使用哪些图像?

Grok Imagine 支持通过文件上传或 URL 提供的高分辨率图像。为获得最佳效果,请使用细节清晰、视觉元素鲜明的图像。

生成视频需要多长时间?

该生成流程经过速度优化,通常在提交后短时间内即可生成シネマティック视频;实际耗时取决于プロンプト的复杂程度和系统负载。

`fun`、`normal` 和 `spicy` 模式有什么区别?

每种模式都会调整视频生成风格。`fun` 提供更具趣味性的演绎,`normal` 生成平衡且贴近现实的结果,而 `spicy`(可用时)会加强视觉效果。注意,使用外部图像入力时,`spicy` 模式会自动切换为 `normal`。