Gemini Omni 1.1 Flash 图生视频: 图像转视频

使用 Gemini Omni 1.1 Flash 将起始图像制作成视频。添加可选的结束关键帧,实现可控的首尾帧过渡。免费试用。

📝

概览

关于此模型

Gemini Omni 1.1 Flash 图生视频会将起始关键帧图像(first_frame_url)动画化为视频,并可选地使用结束关键帧图像(last_frame_url)控制首尾帧过渡,同时在同一次处理中返回原生同步音频。它是 Gemini Omni 关键帧动画能力的专用入口:无需配置参考图像、参考视频、语音或 character IDs,只需提供起始图像、可选的结束图像、提示词和分辨率。若要从文本提示词而不是起始图像生成视频,请参阅 Gemini Omni 1.1 Flash。若要编辑现有视频,请参阅 Gemini Omni 1.1 Flash 视频编辑;若要进行按标签寻址的多参考合成,请参阅 Gemini Omni 1.1 Flash 参考图生视频

1关键帧过渡:锚定首帧和末帧,让模型生成连接两者的运动。
2产品动画:让静态产品图动起来,并加入自然运动和环境音。
3人像动画:将静态人像制作成说话或运动的镜头。
4分镜衔接:将两个分镜帧连接成流畅的过渡片段。
5快速迭代:先以 720p 生成,验证关键帧组合后,再提交 1080p 或 4K 渲染。
💰

价格与价值

成本分析

muapi$0.10–$0.30 按输出秒数计费 (by 分辨率)

按次生成, 无需订阅. Keyframe image-to-video with optional first/last-frame pair.

Fal.ai暂不可用

Fal.ai 未列出 Gemini Omni 1.1 Flash。

Replicate暂不可用

Replicate 未列出 Gemini Omni 1.1 Flash。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

对目标视频内容的文本描述——画面、镜头方向、对话和环境音提示。

默认值A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.
首帧图像string

用于生成视频的起始关键帧图像。

默认值-
末帧图像string

可选的 ending keyframe image. Requires first_frame_url to also be set.

默认值-
画面比例枚举(2 个选项)

输出视频的画面比例。

默认值16:9
分辨率枚举(3 个选项)

输出分辨率。按输出秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。

默认值720p
种子int

随机种子(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

默认值0
📖

实施指南

开发者文档

如何使用 Gemini Omni 1.1 Flash 图生视频

  1. 提供起始关键帧 传入公开可访问的 first_frame_url — 这是视频动画化的起点图像。

  2. 可选地提供结束关键帧 传入 last_frame_url 以控制运动结束的位置。设置 last_frame_url 时也必须设置 first_frame_url

  3. 编写描述运动和声音的提示词 示例:'A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.'

  4. 选择分辨率和宽高比 分辨率按输出时长计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。

  5. 提交并轮询

    curl -X POST https://api.muapi.ai/api/v1/gemini-omni-flash-1-1-image-to-video \
      -H "Authorization: Bearer YOUR_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "prompt": "A street musician plays a violin on a rainy Paris evening",
        "first_frame_url": "https://example.com/start.jpg",
        "resolution": "1080p",
        "aspect_ratio": "16:9"
      }'
    

    然后轮询 GET /api/v1/predictions/{request_id}/result,直到 statuscompleted

  6. 提示词技巧

    • 描述帧间需要的运动,而不只是静态场景。
    • 明确描述声音:'soft piano underscore''wind through trees'
    • 指定镜头运动——'slow dolly in''handheld tracking shot'——以获得电影感结果。

常见问题

常见问答

Gemini Omni 1.1 Flash 图生视频是什么?

这是一个专注于关键帧动画的端点:提供起始图像(以及可选的结束图像)和提示词,它就会生成在两者之间进行动画并带有原生同步音频的视频。

它与 Gemini Omni 1.1 Flash 有何不同?

此端点要求将起始图像(`first_frame_url`)作为视频实际生成所依据的关键帧。[Gemini Omni 1.1 Flash](/playground/gemini-omni-flash-1-1-text-to-video) 则从文本提示词生成视频,其中任何 `image_urls` 都只是辅助参考图像,并非关键帧。

`last_frame_url` 是必需的吗?

不是,它是可选的。提供时还要求同时设置 `first_frame_url`,模型会生成连接这两帧的运动。

如何计费?

根据输出视频的分辨率按秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。10 秒的 1080p 片段费用为 $1.50。

可以添加参考图像、语音配置或角色 ID 吗?

不可以,此端点只接受提示词、`first_frame_url` 和可选的 `last_frame_url`。如需参考图像、参考视频、语音或角色输入,请使用 [Gemini Omni 1.1 Flash](/playground/gemini-omni-flash-1-1-text-to-video)。