Gemini Omni 1.1 Flash: AI Video Generator

使用 Gemini Omni 1.1 Flash 根据文本生成视频。一次调用即可添加参考图像、参考视频、语音和角色 ID,并生成原生音频。免费试用。

📝

Overview

About this model

Gemini Omni 1.1 Flash 是 Gemini Omni 的Texto para Vídeo端点:EntradaPrompt,并可选叠加最多 7 张参考图像(辅助条件Entrada,而非起始关键帧)、一段较短的参考视频片段、最多 3 个来自 Gemini Omni Audio 的语音配置,以及最多 3 个来自 Gemini Omni Character 的角色参考。模型会对你提供的各种Entrada进行联合推理,并在同一生成流程中返回原生同步对白、环境声和音乐的视频——无需单独的音频处理流程。若要让特定起始图像(以及可选的结束图像)动起来,而不是仅根据Prompt生成,请使用 Gemini Omni 1.1 Flash Image to Video。如需编辑现有视频,请参阅 Gemini Omni 1.1 Flash Video Edit;如需按标签寻址的多参考图像合成,请参阅 Gemini Omni 1.1 Flash Reference to Video

1叙事短片:通过一个丰富的文本Prompt驱动场景构图、镜头指示和对白。
2多模态连续性:在单个请求中组合参考图像、短视频片段,以及已保存的语音或角色。
3风格一致的续作:参考已有片段,让新生成内容在视觉和调性上保持一致。
4声音一致的角色:搭配已保存的语音配置和角色参考,制作反复出镜的屏幕人物。
5快速迭代:先以 720p 生成以验证Prompt,再投入 1080p 或 4K 渲染。
💰

Pricing & Value

Cost analysis

muapi$0.10–$0.30 per second of output (by resolution)

Pay-per-generation, no subscription. Covers text-to-video plus optional image, video-reference, voice, and character inputs.

Fal.aiNão disponível

Fal.ai 未列出 Gemini Omni 1.1 Flash。

ReplicateNão disponível

Replicate 未列出 Gemini Omni 1.1 Flash。

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

Promptstring

对目标Vídeo内容的文本描述——画面、镜头方向、对话和环境音提示。

Default ValueA street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.
参考Imagemarray

Up to 7 reference images used as auxiliary conditioning (not a starting keyframe). Each counts as 1 quota unit against the shared 7-unit total with video and character_ids.

Default Value-
参考视频string

参考Vídeo片段,最大 100MB / 30s。计为 2 个配额单位。

Default Value-
Vídeo裁剪开始时间(秒)number

Start time, in seconds, of the reference video window.

Default Value0
Vídeo裁剪结束时间(秒)number

End time, in seconds, of the reference video window. Window must not exceed 10 seconds.

Default Value10
Áudio IDarray

Up to 3 voice profile IDs from the Gemini Omni Audio endpoint. Each counts as 1 quota unit.

Default Value-
角色 IDarray

Up to 3 character IDs from Gemini Omni Character. Each counts as 1 quota unit.

Default Value-
Duração (segundos)(秒)Enum (4 options)

Duration of the generated video in seconds. Ignored when a reference video is provided — output duration is then determined by the model.

Default Value8
ProporçãoEnum (2 options)

SaídaVídeo的Proporção。

Default Value16:9
ResoluçãoEnum (3 options)

SaídaResolução。按Saída秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。

Default Value720p
种子int

Seed aleatória(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

Default Value0
📖

Implementation Guide

Developer documentation

Como Usar Gemini Omni 1.1 Flash

  1. 编写多模态Prompt 将视觉内容、镜头指示、对白和环境声一起描述。示例:'巴黎雨夜,一位街头音乐家拉着小提琴,雨滴敲打着鹅卵石,缓慢而忧郁的旋律,远处传来咖啡馆的交谈声。'

  2. 叠加可选条件Entrada

    • 参考图像(image_urls,最多 7 张),作为辅助视觉条件Entrada。
    • 参考视频(video_url + trim_start/trim_end,最长 10 秒窗口),用于以连续性为导向的延展。
    • 语音配置(audio_ids)和/或角色参考(character_ids)。
  3. 遵守共享配额 每张图像计 1 个单位,参考视频计 2 个单位,每个角色 ID 计 1 个单位——总数不得超过 7。

  4. 选择时长、分辨率和宽高比 提供参考视频时,时长(4/6/8/10s)会被忽略——模型决定Saída长度。分辨率按Saída每秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。

  5. 提交并轮询

    curl -X POST https://api.muapi.ai/api/v1/gemini-omni-flash-1-1-text-to-video \
      -H "Authorization: Bearer YOUR_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "prompt": "A street musician plays a violin on a rainy Paris evening",
        "image_urls": ["https://example.com/scene.jpg"],
        "duration": 8,
        "resolution": "1080p",
        "aspect_ratio": "16:9"
      }'
    

    然后调用 GET /api/v1/predictions/{request_id}/result 轮询,直到 statuscompleted

  6. Prompt技巧

    • 明确描述声音:'soft piano underscore''wind through trees'
    • 对于对白,引用说出的台词并描述说话者。
    • 指定镜头运动——'slow dolly in''handheld tracking shot'——以获得电影感效果。

Common Questions

Frequently asked

什么是 Gemini Omni 1.1 Flash?

这是 Gemini Omni 的Texto para Vídeo端点:一次调用即可接收Prompt、可选参考图像、参考视频片段、语音配置和角色 ID,并返回带原生同步音频的视频。

我可以在一个请求中组合多种Entrada类型吗?

可以。参考图像、参考视频、语音配置和角色 ID 都可以组合使用,但必须遵守 7 个单位的共享配额。

配额系统如何工作?

每张参考图像消耗 1 个单位,参考视频消耗 2 个单位,每个角色 ID 消耗 1 个单位。图像 +(视频 × 2)+ 角色 ID 的总数不得超过 7。

如果我提供参考视频,`duration` 会怎样?

它会被忽略。提供参考视频时,模型会自动决定Saída时长,而不是使用请求中的 `duration` 值。

它如何计费?

根据Saída视频的分辨率按秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。10 秒的 1080p 视频费用为 $1.50。

如何获取 `audio_ids` 和 `character_ids`?

使用 [Gemini Omni Audio](/playground/gemini-omni-audio) 生成可复用的语音配置,使用 [Gemini Omni Character](/playground/gemini-omni-character) 生成可复用的角色参考,然后将返回的 ID 传入此处。

我想让特定的起始图像动起来——应该使用这个端点吗?

不应该。请改用 [Gemini Omni 1.1 Flash Image to Video](/playground/gemini-omni-flash-1-1-image-to-video)——其 `first_frame_url` 是实际的起始关键帧。本端点的 `image_urls` 是辅助参考图像,而不是关键帧。