Gemini Omni 视频编辑: AI 视频编辑器

Gemini Omni 视频编辑——原生多模态的视频到视频编辑。只需一个提示词,即可从源片段重新设计风格、调整光照、替换主体或改写场景。跨模态统一推理在应用编辑的同时保持运动和音频连续性。

📝

概览

关于此模型

Gemini Omni 视频编辑将 Google 原生多模态 any-to-any 模型用于基于源片段的编辑。提供一个片段和自然语言编辑指令——重新设计外观、改变季节、替换主体或改写对白——模型就会在保留原始运动和时间安排的同时,通过一次处理重写视频。

由于模型会联合理解画面和音频,编辑可以在不同模态之间保持连贯:重新生成的音频会匹配新画面,需要时也可以保留原始环境声。

1重新设计风格与光照:通过一个提示词,将实拍片段转换为水彩、动漫、黏土动画或其他视觉风格。
2本地化:在保留说话者身份和唇部动作的同时,将对白改写为新语言。
3连续性修复:无需重新拍摄,即可调整现场遗漏的服装、道具或背景细节。
4创意迭代:从一个源片段测试同一镜头的多种外观——黄金时刻与霓虹夜景、夏季与冬季。
5内容适配:无需重新拍摄原始素材,即可为新平台重新构图和设计风格。
💰

价格与价值

成本分析

muapi$2.40 (720p/1080p) · $3.60 (4K)

Flat rate 每次生成 — same price regardless of duration. Synchronized audio included at no extra charge.

Fal.ai暂不可用

Gemini Omni Video Edit is 目前不可用 on Fal.ai.

Replicate暂不可用

Gemini Omni Video Edit is 目前不可用 on Replicate.

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

编辑提示词string

描述要应用的编辑操作。例如:改为水彩风格、更换季节、替换主体服装。

默认值Transform the growing clock into @image1 while preserving the original expansion and wall-breaking motion. As the clock enlarges, metallic spider legs unfold from the sides and stab through furniture and walls. Keep the camera motion and apartment destruction intact.
参考图像array

参考图像。总共提供 7 个图像槽位;视频占用 2 个槽位,每个 character_id 占用 1 个槽位。每张图像最大 20 MB。

默认值https://cdn.muapi.ai/assets/gemini-omni-video-edit.jpg
源视频string

Source video to edit (max 100 MB, max 30 s). 可选的 if image_urls are provided.

默认值https://cdn.muapi.ai/assets/gemini-omni-text-to-video.mp4
裁剪开始时间(秒)number

Start of the clip window to edit, (秒) (>= 0).

默认值0
裁剪结束时间(秒)number

End of the clip window to edit, (秒). Must be within 10 s of trim_start.

默认值10
时长(秒)枚举(4 个选项)

生成视频的时长(秒)。

默认值8
分辨率枚举(3 个选项)

输出视频分辨率。720p 和 1080p 价格相同;4K 价格更高。

默认值1080p
画面比例枚举(2 个选项)

输出视频的画面比例。

默认值16:9
音频 IDarray

最多 3 voice profile IDs returned by the Gemini Omni Audio endpoint.

默认值-
种子int

随机种子(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。

默认值0
角色 IDarray

最多 3 character IDs from Gemini Omni Character to feature in the video.

默认值-
📖

实施指南

开发者文档

如何使用 Gemini Omni 视频编辑

  1. 上传源视频 提供公开的 video_url,或从 playground 上传片段。较短的输入(约少于 15 秒)能产生最稳定的编辑结果。

  2. 编写清晰的编辑提示词 明确说明哪些内容应该改变、哪些内容应该保留。例如:'Restyle the entire clip as a hand-drawn Studio Ghibli animation, keep the original camera motion, lighting direction, and timing.'

  3. 选择分辨率

    • 720p / 1080p — 价格相同(每次生成 $2.40)
    • 4K — 更高分辨率(每次生成 $3.60)
  4. 提交并轮询 POST 到 /api/v1/gemini-omni-video-edit,并轮询 GET /api/v1/predictions/{request_id}/result,直到 statuscompleted

  5. 提示词技巧

    • 锚定不应改变的内容:'keep the original framing'、'preserve subject identity'、'maintain camera path'
    • 对于风格迁移,明确写出参考风格:'1980s VHS'、'oil painting'、'claymation'
    • 对于对白编辑,引用替换后的台词,并说明所需的声音语气或语言。

常见问题

常见问答

这与将源片段作为参考运行文生视频模型有何不同?

Gemini Omni 视频编辑会直接以源片段为条件,同时理解画面和音频。应用编辑时,模型会保留源片段的运动、时间安排和连续性,而不是生成一个大致匹配的新片段。

可以只编辑音频(例如更改对白)而不改变画面吗?

可以——禁用 `preserve_audio`,并编写只针对音频的提示词(例如,"replace the dialogue with: '...'")。画面会与源片段保持对齐,同时重新生成音频。

支持多长的视频?

最大片段长度将在上线时确认。预计支持最长 30 秒的输入,与文生视频版本一致。

编辑会影响运动或镜头移动吗?

默认情况下,模型会保留源片段的运动和镜头路径。如果希望改变镜头或运动,请在提示词中明确说明。

Gemini Omni 视频编辑何时会在 muapi 上线?

Google 于 2026 年 5 月 19 日的 I/O 2026 上宣布了 Gemini Omni,API 访问将在接下来几周陆续开放。视频编辑版本将在上游 API 支持后立即在 muapi 上线。