Gemini Omni 1.1 Flash: AI Video Generator

使用 Gemini Omni 1.1 Flash 根据文本生成视频。一次调用即可添加参考图像、参考视频、语音和角色 ID,并生成原生音频。免费试用。

📝

Overview

About this model

Gemini Omni 1.1 Flash 是 Gemini Omni 的टेक्स्ट टू वीडियो端点:इनपुटप्रॉम्प्ट,并可选叠加最多 7 张参考图像(辅助条件इनपुट,而非起始关键帧)、一段较短的参考视频片段、最多 3 个来自 Gemini Omni Audio 的语音配置,以及最多 3 个来自 Gemini Omni Character 的角色参考。模型会对你提供的各种इनपुट进行联合推理,并在同一生成流程中返回原生同步对白、环境声和音乐的视频——无需单独的音频处理流程。若要让特定起始图像(以及可选的结束图像)动起来,而不是仅根据प्रॉम्प्ट生成,请使用 Gemini Omni 1.1 Flash Image to Video。如需编辑现有视频,请参阅 Gemini Omni 1.1 Flash Video Edit;如需按标签寻址的多参考图像合成,请参阅 Gemini Omni 1.1 Flash Reference to Video

1叙事短片:通过一个丰富的文本प्रॉम्प्ट驱动场景构图、镜头指示和对白。
2多模态连续性:在单个请求中组合参考图像、短视频片段,以及已保存的语音或角色。
3风格一致的续作:参考已有片段,让新生成内容在视觉和调性上保持一致。
4声音一致的角色:搭配已保存的语音配置和角色参考,制作反复出镜的屏幕人物。
5快速迭代:先以 720p 生成以验证प्रॉम्प्ट,再投入 1080p 或 4K 渲染。
💰

Pricing & Value

Cost analysis

muapi$0.10–$0.30 per second of output (by resolution)

Pay-per-generation, no subscription. Covers text-to-video plus optional image, video-reference, voice, and character inputs.

Fal.aiउपलब्ध नहीं

Fal.ai 未列出 Gemini Omni 1.1 Flash。

Replicateउपलब्ध नहीं

Replicate 未列出 Gemini Omni 1.1 Flash。

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

प्रॉम्प्टstring

对目标वीडियो内容的文本描述——画面、镜头方向、对话和环境音提示。

Default ValueA street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.
参考इमेजarray

Up to 7 reference images used as auxiliary conditioning (not a starting keyframe). Each counts as 1 quota unit against the shared 7-unit total with video and character_ids.

Default Value-
参考视频string

参考वीडियो片段,最大 100MB / 30s。计为 2 个配额单位。

Default Value-
वीडियो裁剪开始时间(秒)number

Start time, in seconds, of the reference video window.

Default Value0
वीडियो裁剪结束时间(秒)number

End time, in seconds, of the reference video window. Window must not exceed 10 seconds.

Default Value10
ऑडियो IDarray

Up to 3 voice profile IDs from the Gemini Omni Audio endpoint. Each counts as 1 quota unit.

Default Value-
角色 IDarray

Up to 3 character IDs from Gemini Omni Character. Each counts as 1 quota unit.

Default Value-
अवधि (सेकंड)(秒)Enum (4 options)

Duration of the generated video in seconds. Ignored when a reference video is provided — output duration is then determined by the model.

Default Value8
पहलू अनुपातEnum (2 options)

आउटपुटवीडियो的पहलू अनुपात。

Default Value16:9
रिज़ॉल्यूशनEnum (3 options)

आउटपुटरिज़ॉल्यूशन。按आउटपुट秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。

Default Value720p
种子int

रैंडम सीड(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

Default Value0
📖

Implementation Guide

Developer documentation

उपयोग कैसे करें Gemini Omni 1.1 Flash

  1. 编写多模态प्रॉम्प्ट 将视觉内容、镜头指示、对白和环境声一起描述。示例:'巴黎雨夜,一位街头音乐家拉着小提琴,雨滴敲打着鹅卵石,缓慢而忧郁的旋律,远处传来咖啡馆的交谈声。'

  2. 叠加可选条件इनपुट

    • 参考图像(image_urls,最多 7 张),作为辅助视觉条件इनपुट。
    • 参考视频(video_url + trim_start/trim_end,最长 10 秒窗口),用于以连续性为导向的延展。
    • 语音配置(audio_ids)和/或角色参考(character_ids)。
  3. 遵守共享配额 每张图像计 1 个单位,参考视频计 2 个单位,每个角色 ID 计 1 个单位——总数不得超过 7。

  4. 选择时长、分辨率和宽高比 提供参考视频时,时长(4/6/8/10s)会被忽略——模型决定आउटपुट长度。分辨率按आउटपुट每秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。

  5. 提交并轮询

    curl -X POST https://api.muapi.ai/api/v1/gemini-omni-flash-1-1-text-to-video \
      -H "Authorization: Bearer YOUR_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "prompt": "A street musician plays a violin on a rainy Paris evening",
        "image_urls": ["https://example.com/scene.jpg"],
        "duration": 8,
        "resolution": "1080p",
        "aspect_ratio": "16:9"
      }'
    

    然后调用 GET /api/v1/predictions/{request_id}/result 轮询,直到 statuscompleted

  6. प्रॉम्प्ट技巧

    • 明确描述声音:'soft piano underscore''wind through trees'
    • 对于对白,引用说出的台词并描述说话者。
    • 指定镜头运动——'slow dolly in''handheld tracking shot'——以获得电影感效果。

Common Questions

Frequently asked

什么是 Gemini Omni 1.1 Flash?

这是 Gemini Omni 的टेक्स्ट टू वीडियो端点:一次调用即可接收प्रॉम्प्ट、可选参考图像、参考视频片段、语音配置和角色 ID,并返回带原生同步音频的视频。

我可以在一个请求中组合多种इनपुट类型吗?

可以。参考图像、参考视频、语音配置和角色 ID 都可以组合使用,但必须遵守 7 个单位的共享配额。

配额系统如何工作?

每张参考图像消耗 1 个单位,参考视频消耗 2 个单位,每个角色 ID 消耗 1 个单位。图像 +(视频 × 2)+ 角色 ID 的总数不得超过 7。

如果我提供参考视频,`duration` 会怎样?

它会被忽略。提供参考视频时,模型会自动决定आउटपुट时长,而不是使用请求中的 `duration` 值。

它如何计费?

根据आउटपुट视频的分辨率按秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。10 秒的 1080p 视频费用为 $1.50。

如何获取 `audio_ids` 和 `character_ids`?

使用 [Gemini Omni Audio](/playground/gemini-omni-audio) 生成可复用的语音配置,使用 [Gemini Omni Character](/playground/gemini-omni-character) 生成可复用的角色参考,然后将返回的 ID 传入此处。

我想让特定的起始图像动起来——应该使用这个端点吗?

不应该。请改用 [Gemini Omni 1.1 Flash Image to Video](/playground/gemini-omni-flash-1-1-image-to-video)——其 `first_frame_url` 是实际的起始关键帧。本端点的 `image_urls` 是辅助参考图像,而不是关键帧。