模型/Google/Gemini Omni
已上线9 个变体

Gemini Omni API

Gemini Omni 是 Google 原生多模态的任意到任意视频模型家族。文本、图像、视频、语音档案和人物档案可以在同一生成流程中协同工作。Muapi 通过一个异步 API 提供 Gemini Omni 和 Gemini Omni 1.1 Flash,包括同步对白、环境声、音乐、视频编辑、可复用语音和一致的人物。

Gemini Omni Flash原生多模态视频、音频、语音与人物工作流9 个模型
文生视频已上线
Flash

Gemini Omni 文本转视频

根据文本提示词生成带同步对白、环境声和音乐的视频,全部在同一生成流程中完成。

360p–4K
From $0.16
试用模型
图生视频已上线
Flash

Gemini Omni 图像转视频

将最多五张参考图像制作成带原生同步音频的场景。

360p–4K
From $0.16
试用模型
视频转视频已上线
Flash

Gemini Omni 视频编辑

编辑、重绘风格、重新布光、替换元素或改写源视频对白,同时保留原有运动与节奏。

Up to 4K
From $2.40
试用模型
音频已上线
Flash

Gemini Omni 语音档案

从 30 种预设声音中创建可复用的语音档案,并获得后续生成可使用的 audio ID。

Voice profile快速
Free
试用模型
人物已上线
Flash

Gemini Omni 人物档案

根据一张参考图像创建可复用的人物档案,并获得 character ID。

Character profile快速
Free
试用模型
文生视频已上线
Flash

Gemini Omni 1.1 Flash 文本转视频

将文本与参考图像、短参考视频、语音档案或人物档案结合,并生成原生同步音频。

Up to 4K
From $0.10/sec
试用模型
图生视频已上线
Flash

Gemini Omni 1.1 Flash 图像转视频

从起始关键帧生成视频,并可提供结束关键帧来控制转场。

Up to 4K
From $0.10/sec
试用模型
视频转视频已上线
Flash

Gemini Omni 1.1 Flash 视频编辑

通过文本指令重新设计风格、布光、变换或改写源视频。

360p–4K
From $0.048/sec
试用模型
图生视频已上线
Flash

Gemini Omni 1.1 Flash 参考素材转视频

使用最多七张图像和三个短参考视频片段来引导场景生成。

360p–4K
From $0.048/sec
试用模型

什么是 Gemini Omni?

Gemini Omni 是 Google 原生多模态的任意到任意视频模型家族。它不是先生成视频再补声音,而是同时理解文本、图像、视频和音频,并生成同步对白、环境声和音乐。

Muapi 提供原始 Gemini Omni 端点以及用于关键帧控制、短视频参考和 4K 输出的 Gemini Omni 1.1 Flash。每个工作流都使用相同的异步提交与轮询 REST 合约。

Gemini Omni API 主要能力

任意到任意生成

在一个多模态工作流中切换文本、图像、视频和音频,无需拼接多个独立模型。

原生同步音频

在共享的生成流程中同时生成对白、环境声和音乐。

文本、图像转视频与视频编辑

创建新场景、制作参考图像动画,或通过专用端点变换已有素材。

可复用语音档案

从 30 种预设声音中选择并保存返回的 audio ID,在后续调用中保持语音一致。

一致的人物档案

根据一张参考图像创建 character ID,并在多个生成场景中复用。

适合生产的 API

使用 Muapi 异步请求、标准预测轮询和按生成计费,无需订阅。

Gemini Omni 使用场景

叙事短片

通过一条丰富提示词和原生音频指导场景、镜头、人物与对白。

产品讲解视频

结合产品图像、语音档案和受控视频编辑,制作清晰的演示内容。

系列化人物内容

复用人物和语音档案,让连续剧集中的固定角色保持一致。

源视频变换

通过文本指令重新设计风格、布光、替换元素或改写已有视频对白。

参考素材引导场景

使用图像和短视频参考来引导服装、构图、动作和整体氛围。

Veo 或 Sora 替代方案

当通用视频端点无法满足需求时,通过一个 API 使用原生音频和多模态输入。

Gemini Omni 工作流

工作流输入输出起始价格
文本转视频提示词、可选参考素材、语音、人物视频 + 同步音频起价 $0.16
图像转视频最多 5 张参考图像视频 + 同步音频起价 $0.16
视频编辑源视频 + 指令编辑后的视频起价 $2.40
语音档案预设声音选择可复用 audio ID免费
人物档案一张参考图像可复用 character ID免费
1.1 Flash 参考素材最多 7 张图像 + 3 个短视频片段参考素材引导视频起价 $0.048/秒

快速开始 — Gemini Omni API

将多模态提示词提交到匹配的 Gemini Omni 端点,保存 request ID,然后轮询标准结果端点获取视频和音频输出。

提交 Gemini Omni 任务

curl -X POST https://api.muapi.ai/api/v1/gemini-omni-text-to-video \
  -H "x-api-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"prompt":"A chef explains a recipe in a warm studio kitchen","resolution":"1080p","duration":8,"aspect_ratio":"16:9"}'

# Response: {"request_id":"REQUEST_ID"}

从文本转视频端点开始,并根据工作流需要加入参考素材、语音 ID 或人物 ID。

获取视频与音频

curl https://api.muapi.ai/api/v1/predictions/REQUEST_ID/result \
  -H "x-api-key: YOUR_API_KEY"

# The completed response contains the generated video and synchronized audio.

轮询直到任务完成,然后从响应中读取生成的视频和同步音频 URL。

Gemini Omni API 常见问题

什么是 Gemini Omni API?

Gemini Omni 是原生多模态的任意到任意视频模型家族。Muapi 提供文本转视频、图像转视频和视频编辑工作流,并可在同一流程中生成同步音频。

Gemini Omni 与 Veo 或 Sora 有什么不同?

Gemini Omni 围绕文本、图像、音频和视频在同一工作流中的协同设计,并提供原生音频和专用源视频编辑端点。最适合的选择取决于项目所需的控制和风格。

Gemini Omni 如何计费?

文本转视频和图像转视频起价为每次生成 $0.16;视频编辑起价为 $2.40;1.1 Flash 视频工作流则根据端点和输出选项,起价为每秒 $0.048 或 $0.10。

支持哪些输入和输出?

可以使用文本提示词、图像转视频最多五张参考图像,或使用源视频加指令进行编辑。生成的视频可以包含同步音频,每次调用最多使用三个已保存的语音 ID 和三个 character ID。

Gemini Omni Audio 是什么?

Gemini Omni Audio 可以从 30 种预设声音创建可复用的语音档案。Muapi 会返回 audio ID,后续视频生成最多可传入三个 audio ID。

Gemini Omni Character 是什么?

Gemini Omni Character 可以根据一张参考图像创建可复用的人物档案。返回的 character ID 可用于后续生成,每次调用最多三个。

Gemini Omni 可以生成竖屏或方形视频吗?

可以。根据所选端点使用支持的宽高比,包括适合横屏和竖屏交付的 16:9 与 9:16。

需要 Gemini 订阅吗?

不需要。Gemini Omni 通过 Muapi 按生成计费的 API 提供。创建 Muapi API 密钥后即可直接调用端点。

准备开始使用 Gemini Omni 了吗?

用一个异步 API 完成多模态视频、原生音频、语音档案和一致人物生成。