Gemini Omni 画像から動画生成: 画像から動画生成

使用 Gemini Omni 将图像制作成视频,并生成原生同步音频、对白和音乐。免费试用——従量課金制,サブスクリプション不要。

📝

概要

このモデルについて

Gemini Omni 画像から動画生成使用 Google 原生多模态 any-to-any 模型,通过文本提示为一张或多张参考图制作动画。模型会在各帧之间保持主体身份,同时在同一次前向传递中原生生成同步音频、对白、环境声和音乐。它支持 4、6、8 或 10 秒的视频片段,分辨率可选 360p、720p、1080p 或 4K,宽高比可选 16:9 或 9:16,并按出力视频秒数计费。

1产品动画:让产品照片动起来,并添加环境声,用于社交媒体或广告。
2角色动画:通过描述动作和场景的プロンプト,为角色参考图制作动画。
3分镜预演:将概念艺术转换为带旁白和声音设计的短视频预览。
4社交内容:将静态图像变成适合 TikTok、Reels 或 Shorts 的精彩竖屏或宽屏片段。
💰

料金と価値

コスト分析

muapi$0.039–$0.39 per second of output (by resolution)

Billed per second of output video: $0.039/s at 360p, $0.13/s at 720p, $0.195/s at 1080p, $0.39/s at 4K. Synchronized audio included at no extra charge.

Fal.ai秒単位の同等料金

相同的底层模型(google/gemini-omni-flash/v1.1/image-to-video)。

Replicate提供なし

Gemini Omni Image to Video is not currently available on Replicate.

** 競合サービスの料金は類似のモデル構成および利用ティアに基づいて算出された推定値です。

⚙️

技術詳細

設定スキーマ

プロンプトstring

所需运动和场景的文本描述。Gemini Omni 対応丰富的多模态プロンプト,包括镜头指令、对话和环境音声提示。

デフォルト値The suitcase opens by itself and tiny landscapes start unfolding out of it—mountains, forests, oceans, entire cities. Each world expands outward onto the platform, growing larger and larger while miniature weather systems form above them.
参考画像array

Upload 1–7 reference images for the video. Maximum 20 MB each.

デフォルト値https://cdn.muapi.ai/assets/gemini-omni-image-to-video.jpg
長さ(秒)(秒)Enum(4個の選択肢)

生成動画的生成時間(秒)。

デフォルト値8
解像度Enum(4個の選択肢)

出力動画解像度。按出力秒数计费:360p 为 $0.039/秒,720p 为 $0.13/秒,1080p 为 $0.195/秒,4K 为 $0.39/秒。

デフォルト値1080p
アスペクト比Enum(2個の選択肢)

出力動画的アスペクト比。

デフォルト値16:9
音声 IDarray

Up to 3 voice profile IDs returned by the Gemini Omni Audio endpoint.

デフォルト値-
种子int

ランダムシード値(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

デフォルト値0
角色 IDarray

Up to 3 character IDs from Gemini Omni Character to feature in the video.

デフォルト値-
📖

実装ガイド

開発者ドキュメント

使用方法 Gemini Omni 画像から動画生成

  1. 上传参考图 通过 image_urls 提供 1–5 张图像。每张图像都会作为视觉锚点,模型会在各帧之间保持主体身份。

  2. 编写动作和场景プロンプト 描述视频中发生的事情——动作、场景、光照和音频提示。例如:'The subject slowly turns to face the camera as golden-hour light sweeps across the scene, leaves rustling in the breeze.'

  3. 选择时长和分辨率 选择 4、6、8 或 10 秒。选择 360p 获得快速、低成本的草稿,选择 720p / 1080p 获得标准出力,或选择 4K 获得更高分辨率。

  4. 选择宽高比

    • 16:9 — 宽屏、シネマティック
    • 9:16 — 竖屏、移动端优先
  5. 提交并轮询 POST 到 /api/v1/gemini-omni-image-to-video,并轮询 GET /api/v1/predictions/{request_id}/result,直到 statuscompleted

  6. 请求示例

    curl -X POST https://api.muapi.ai/api/v1/gemini-omni-image-to-video \
      -H "Authorization: Bearer YOUR_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "prompt": "The subject slowly turns to face the camera as golden-hour light sweeps across the scene.",
        "image_urls": ["https://example.com/reference.jpg"],
        "duration": 8,
        "resolution": "1080p"
      }'
    

よくある質問

FAQ

可以提供多少张参考图?

1 到 5 张。每张图像计为 7 单位容量中的 1 个单位(视频使用 2 个单位,角色 ID 使用 1 个单位)。

它会保持主体在各帧之间的外观吗?

会——Gemini Omni 画像から動画生成旨在让主体在整个生成片段中保持参考图中的身份和外观。

会自动生成音频吗?

会——同步对白、环境声和音乐会与视频在同一次前向传递中原生生成。

支持哪些视频时长和分辨率?

支持 4、6、8 或 10 秒,以及 360p、720p、1080p 或 4K——每种情况都按出力视频秒数计费。

可以控制宽高比吗?

可以——选择 16:9 获得宽屏出力,或选择 9:16 获得竖屏/移动端优先出力。