Gemini Omni 1.1 Flash: AI動画生成

使用 Gemini Omni 1.1 Flash 根据文本生成视频。一次调用即可添加参考图像、参考视频、语音和角色 ID,并生成原生音频。免费试用。

📝

概要

このモデルについて

Gemini Omni 1.1 Flash 是 Gemini Omni 的テキストから動画生成端点:入力プロンプト,并可选叠加最多 7 张参考图像(辅助条件入力,而非起始关键帧)、一段较短的参考视频片段、最多 3 个来自 Gemini Omni Audio 的语音配置,以及最多 3 个来自 Gemini Omni Character 的角色参考。模型会对你提供的各种入力进行联合推理,并在同一生成流程中返回原生同步对白、环境声和音乐的视频——无需单独的音频处理流程。若要让特定起始图像(以及可选的结束图像)动起来,而不是仅根据プロンプト生成,请使用 Gemini Omni 1.1 Flash Image to Video。如需编辑现有视频,请参阅 Gemini Omni 1.1 Flash Video Edit;如需按标签寻址的多参考图像合成,请参阅 Gemini Omni 1.1 Flash Reference to Video

1叙事短片:通过一个丰富的文本プロンプト驱动场景构图、镜头指示和对白。
2多模态连续性:在单个请求中组合参考图像、短视频片段,以及已保存的语音或角色。
3风格一致的续作:参考已有片段,让新生成内容在视觉和调性上保持一致。
4声音一致的角色:搭配已保存的语音配置和角色参考,制作反复出镜的屏幕人物。
5快速迭代:先以 720p 生成以验证プロンプト,再投入 1080p 或 4K 渲染。
💰

料金と価値

コスト分析

muapi$0.10–$0.30 per second of output (by resolution)

Pay-per-generation, no subscription. Covers text-to-video plus optional image, video-reference, voice, and character inputs.

Fal.ai提供なし

Fal.ai 未列出 Gemini Omni 1.1 Flash。

Replicate提供なし

Replicate 未列出 Gemini Omni 1.1 Flash。

** 競合サービスの料金は類似のモデル構成および利用ティアに基づいて算出された推定値です。

⚙️

技術詳細

設定スキーマ

プロンプトstring

对目标動画内容的文本描述——画面、镜头方向、对话和环境音提示。

デフォルト値A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.
参考画像array

Up to 7 reference images used as auxiliary conditioning (not a starting keyframe). Each counts as 1 quota unit against the shared 7-unit total with video and character_ids.

デフォルト値-
参考视频string

参考動画片段,最大 100MB / 30s。计为 2 个配额单位。

デフォルト値-
動画裁剪开始时间(秒)number

Start time, in seconds, of the reference video window.

デフォルト値0
動画裁剪结束时间(秒)number

End time, in seconds, of the reference video window. Window must not exceed 10 seconds.

デフォルト値10
音声 IDarray

Up to 3 voice profile IDs from the Gemini Omni Audio endpoint. Each counts as 1 quota unit.

デフォルト値-
角色 IDarray

Up to 3 character IDs from Gemini Omni Character. Each counts as 1 quota unit.

デフォルト値-
長さ(秒)(秒)Enum(4個の選択肢)

Duration of the generated video in seconds. Ignored when a reference video is provided — output duration is then determined by the model.

デフォルト値8
アスペクト比Enum(2個の選択肢)

出力動画的アスペクト比。

デフォルト値16:9
解像度Enum(3個の選択肢)

出力解像度。按出力秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。

デフォルト値720p
种子int

ランダムシード値(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

デフォルト値0
📖

実装ガイド

開発者ドキュメント

使用方法 Gemini Omni 1.1 Flash

  1. 编写多模态プロンプト 将视觉内容、镜头指示、对白和环境声一起描述。示例:'巴黎雨夜,一位街头音乐家拉着小提琴,雨滴敲打着鹅卵石,缓慢而忧郁的旋律,远处传来咖啡馆的交谈声。'

  2. 叠加可选条件入力

    • 参考图像(image_urls,最多 7 张),作为辅助视觉条件入力。
    • 参考视频(video_url + trim_start/trim_end,最长 10 秒窗口),用于以连续性为导向的延展。
    • 语音配置(audio_ids)和/或角色参考(character_ids)。
  3. 遵守共享配额 每张图像计 1 个单位,参考视频计 2 个单位,每个角色 ID 计 1 个单位——总数不得超过 7。

  4. 选择时长、分辨率和宽高比 提供参考视频时,时长(4/6/8/10s)会被忽略——模型决定出力长度。分辨率按出力每秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。

  5. 提交并轮询

    curl -X POST https://api.muapi.ai/api/v1/gemini-omni-flash-1-1-text-to-video \
      -H "Authorization: Bearer YOUR_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{
        "prompt": "A street musician plays a violin on a rainy Paris evening",
        "image_urls": ["https://example.com/scene.jpg"],
        "duration": 8,
        "resolution": "1080p",
        "aspect_ratio": "16:9"
      }'
    

    然后调用 GET /api/v1/predictions/{request_id}/result 轮询,直到 statuscompleted

  6. プロンプト技巧

    • 明确描述声音:'soft piano underscore''wind through trees'
    • 对于对白,引用说出的台词并描述说话者。
    • 指定镜头运动——'slow dolly in''handheld tracking shot'——以获得シネマティック效果。

よくある質問

FAQ

什么是 Gemini Omni 1.1 Flash?

这是 Gemini Omni 的テキストから動画生成端点:一次调用即可接收プロンプト、可选参考图像、参考视频片段、语音配置和角色 ID,并返回带原生同步音频的视频。

我可以在一个请求中组合多种入力类型吗?

可以。参考图像、参考视频、语音配置和角色 ID 都可以组合使用,但必须遵守 7 个单位的共享配额。

配额系统如何工作?

每张参考图像消耗 1 个单位,参考视频消耗 2 个单位,每个角色 ID 消耗 1 个单位。图像 +(视频 × 2)+ 角色 ID 的总数不得超过 7。

如果我提供参考视频,`duration` 会怎样?

它会被忽略。提供参考视频时,模型会自动决定出力时长,而不是使用请求中的 `duration` 值。

它如何计费?

根据出力视频的分辨率按秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。10 秒的 1080p 视频费用为 $1.50。

如何获取 `audio_ids` 和 `character_ids`?

使用 [Gemini Omni Audio](/playground/gemini-omni-audio) 生成可复用的语音配置,使用 [Gemini Omni Character](/playground/gemini-omni-character) 生成可复用的角色参考,然后将返回的 ID 传入此处。

我想让特定的起始图像动起来——应该使用这个端点吗?

不应该。请改用 [Gemini Omni 1.1 Flash Image to Video](/playground/gemini-omni-flash-1-1-image-to-video)——其 `first_frame_url` 是实际的起始关键帧。本端点的 `image_urls` 是辅助参考图像,而不是关键帧。