Gemini Omni 1.1 Flash: AI 视频生成器

使用 Gemini Omni 1.1 Flash 根据文本生成视频。一次调用即可添加参考图像、参考视频、语音和角色 ID,并生成原生音频。免费试用。

📝

概览

关于此模型

Gemini Omni 1.1 Flash 是 Gemini Omni 的文生视频端点:输入提示词,并可选叠加最多 7 张参考图像(辅助条件输入,而非起始关键帧)、一段较短的参考视频片段、最多 3 个来自 Gemini Omni Audio 的语音配置,以及最多 3 个来自 Gemini Omni Character 的角色参考。模型会对你提供的各种输入进行联合推理,并在同一生成流程中返回原生同步对白、环境声和音乐的视频——无需单独的音频处理流程。若要让特定起始图像(以及可选的结束图像)动起来,而不是仅根据提示词生成,请使用 Gemini Omni 1.1 Flash Image to Video。如需编辑现有视频,请参阅 Gemini Omni 1.1 Flash Video Edit;如需按标签寻址的多参考图像合成,请参阅 Gemini Omni 1.1 Flash Reference to Video

1叙事短片:通过一个丰富的文本提示词驱动场景构图、镜头指示和对白。
2多模态连续性:在单个请求中组合参考图像、短视频片段,以及已保存的语音或角色。
3风格一致的续作:参考已有片段,让新生成内容在视觉和调性上保持一致。
4声音一致的角色:搭配已保存的语音配置和角色参考,制作反复出镜的屏幕人物。
5快速迭代:先以 720p 生成以验证提示词,再投入 1080p 或 4K 渲染。
💰

价格与价值

成本分析

muapi$0.10–$0.30 按输出秒数计费 (by 分辨率)

按次生成, 无需订阅. Covers text-to-video plus optional image, video-reference, voice, and character inputs.

Fal.ai暂不可用

Fal.ai 未列出 Gemini Omni 1.1 Flash。

Replicate暂不可用

Replicate 未列出 Gemini Omni 1.1 Flash。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

对目标视频内容的文本描述——画面、镜头方向、对话和环境音提示。

默认值A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.
参考图像array

最多 7 参考图像 used as auxiliary conditioning (not a starting keyframe). Each counts as 1 quota unit against the shared 7-unit total with video and character_ids.

默认值-
参考视频string

参考视频片段,最大 100MB / 30s。计为 2 个配额单位。

默认值-
视频裁剪开始时间(秒)number

Start time, (秒), of the reference video window.

默认值0
视频裁剪结束时间(秒)number

End time, (秒), of the reference video window. Window must not exceed 10 秒。

默认值10
音频 IDarray

最多 3 voice profile IDs from the Gemini Omni Audio endpoint. Each counts as 1 quota unit.

默认值-
角色 IDarray

最多 3 character IDs from Gemini Omni Character. Each counts as 1 quota unit.

默认值-
时长(秒)枚举(4 个选项)

Duration of the 生成的视频 (秒). Ignored when a reference video is provided — output duration is then determined by the model.

默认值8
画面比例枚举(2 个选项)

输出视频的画面比例。

默认值16:9
分辨率枚举(3 个选项)

输出分辨率。按输出秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。

默认值720p
种子int

随机种子(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

默认值0
📖

实施指南

开发者文档

如何使用 Gemini Omni 1.1 Flash

  1. 编写多模态提示词 将视觉内容、镜头指示、对白和环境声一起描述。示例:'巴黎雨夜,一位街头音乐家拉着小提琴,雨滴敲打着鹅卵石,缓慢而忧郁的旋律,远处传来咖啡馆的交谈声。'

  2. 叠加可选条件输入

    • 参考图像(image_urls,最多 7 张),作为辅助视觉条件输入。
    • 参考视频(video_url + trim_start/trim_end,最长 10 秒窗口),用于以连续性为导向的延展。
    • 语音配置(audio_ids)和/或角色参考(character_ids)。
  3. 遵守共享配额 每张图像计 1 个单位,参考视频计 2 个单位,每个角色 ID 计 1 个单位——总数不得超过 7。

  4. 选择时长、分辨率和宽高比 提供参考视频时,时长(4/6/8/10s)会被忽略——模型决定输出长度。分辨率按输出每秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。

  5. 提交并轮询

    curl -X POST https://api.muapi.ai/api/v1/gemini-omni-flash-1-1-text-to-video \
      -H "Authorization: Bearer YOUR_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "prompt": "A street musician plays a violin on a rainy Paris evening",
        "image_urls": ["https://example.com/scene.jpg"],
        "duration": 8,
        "resolution": "1080p",
        "aspect_ratio": "16:9"
      }'
    

    然后调用 GET /api/v1/predictions/{request_id}/result 轮询,直到 statuscompleted

  6. 提示词技巧

    • 明确描述声音:'soft piano underscore''wind through trees'
    • 对于对白,引用说出的台词并描述说话者。
    • 指定镜头运动——'slow dolly in''handheld tracking shot'——以获得电影感效果。

常见问题

常见问答

什么是 Gemini Omni 1.1 Flash?

这是 Gemini Omni 的文生视频端点:一次调用即可接收提示词、可选参考图像、参考视频片段、语音配置和角色 ID,并返回带原生同步音频的视频。

我可以在一个请求中组合多种输入类型吗?

可以。参考图像、参考视频、语音配置和角色 ID 都可以组合使用,但必须遵守 7 个单位的共享配额。

配额系统如何工作?

每张参考图像消耗 1 个单位,参考视频消耗 2 个单位,每个角色 ID 消耗 1 个单位。图像 +(视频 × 2)+ 角色 ID 的总数不得超过 7。

如果我提供参考视频,`duration` 会怎样?

它会被忽略。提供参考视频时,模型会自动决定输出时长,而不是使用请求中的 `duration` 值。

它如何计费?

根据输出视频的分辨率按秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。10 秒的 1080p 视频费用为 $1.50。

如何获取 `audio_ids` 和 `character_ids`?

使用 [Gemini Omni Audio](/playground/gemini-omni-audio) 生成可复用的语音配置,使用 [Gemini Omni Character](/playground/gemini-omni-character) 生成可复用的角色参考,然后将返回的 ID 传入此处。

我想让特定的起始图像动起来——应该使用这个端点吗?

不应该。请改用 [Gemini Omni 1.1 Flash Image to Video](/playground/gemini-omni-flash-1-1-image-to-video)——其 `first_frame_url` 是实际的起始关键帧。本端点的 `image_urls` 是辅助参考图像,而不是关键帧。