Gemini Omni 文本转视频
根据文本提示词生成带同步对白、环境声和音乐的视频,全部在同一生成流程中完成。
Gemini Omni 是 Google 原生多模态的任意到任意视频模型家族。文本、图像、视频、语音档案和人物档案可以在同一生成流程中协同工作。Muapi 通过一个异步 API 提供 Gemini Omni 和 Gemini Omni 1.1 Flash,包括同步对白、环境声、音乐、视频编辑、可复用语音和一致的人物。
根据文本提示词生成带同步对白、环境声和音乐的视频,全部在同一生成流程中完成。
将最多五张参考图像制作成带原生同步音频的场景。
编辑、重绘风格、重新布光、替换元素或改写源视频对白,同时保留原有运动与节奏。
从 30 种预设声音中创建可复用的语音档案,并获得后续生成可使用的 audio ID。
根据一张参考图像创建可复用的人物档案,并获得 character ID。
将文本与参考图像、短参考视频、语音档案或人物档案结合,并生成原生同步音频。
从起始关键帧生成视频,并可提供结束关键帧来控制转场。
通过文本指令重新设计风格、布光、变换或改写源视频。
使用最多七张图像和三个短参考视频片段来引导场景生成。
Gemini Omni 是 Google 原生多模态的任意到任意视频模型家族。它不是先生成视频再补声音,而是同时理解文本、图像、视频和音频,并生成同步对白、环境声和音乐。
Muapi 提供原始 Gemini Omni 端点以及用于关键帧控制、短视频参考和 4K 输出的 Gemini Omni 1.1 Flash。每个工作流都使用相同的异步提交与轮询 REST 合约。
在一个多模态工作流中切换文本、图像、视频和音频,无需拼接多个独立模型。
在共享的生成流程中同时生成对白、环境声和音乐。
创建新场景、制作参考图像动画,或通过专用端点变换已有素材。
从 30 种预设声音中选择并保存返回的 audio ID,在后续调用中保持语音一致。
根据一张参考图像创建 character ID,并在多个生成场景中复用。
使用 Muapi 异步请求、标准预测轮询和按生成计费,无需订阅。
通过一条丰富提示词和原生音频指导场景、镜头、人物与对白。
结合产品图像、语音档案和受控视频编辑,制作清晰的演示内容。
复用人物和语音档案,让连续剧集中的固定角色保持一致。
通过文本指令重新设计风格、布光、替换元素或改写已有视频对白。
使用图像和短视频参考来引导服装、构图、动作和整体氛围。
当通用视频端点无法满足需求时,通过一个 API 使用原生音频和多模态输入。
| 工作流 | 输入 | 输出 | 起始价格 |
|---|---|---|---|
| 文本转视频 | 提示词、可选参考素材、语音、人物 | 视频 + 同步音频 | 起价 $0.16 |
| 图像转视频 | 最多 5 张参考图像 | 视频 + 同步音频 | 起价 $0.16 |
| 视频编辑 | 源视频 + 指令 | 编辑后的视频 | 起价 $2.40 |
| 语音档案 | 预设声音选择 | 可复用 audio ID | 免费 |
| 人物档案 | 一张参考图像 | 可复用 character ID | 免费 |
| 1.1 Flash 参考素材 | 最多 7 张图像 + 3 个短视频片段 | 参考素材引导视频 | 起价 $0.048/秒 |
将多模态提示词提交到匹配的 Gemini Omni 端点,保存 request ID,然后轮询标准结果端点获取视频和音频输出。
curl -X POST https://api.muapi.ai/api/v1/gemini-omni-text-to-video \
-H "x-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"prompt":"A chef explains a recipe in a warm studio kitchen","resolution":"1080p","duration":8,"aspect_ratio":"16:9"}'
# Response: {"request_id":"REQUEST_ID"}从文本转视频端点开始,并根据工作流需要加入参考素材、语音 ID 或人物 ID。
curl https://api.muapi.ai/api/v1/predictions/REQUEST_ID/result \ -H "x-api-key: YOUR_API_KEY" # The completed response contains the generated video and synchronized audio.
轮询直到任务完成,然后从响应中读取生成的视频和同步音频 URL。
Gemini Omni 是原生多模态的任意到任意视频模型家族。Muapi 提供文本转视频、图像转视频和视频编辑工作流,并可在同一流程中生成同步音频。
Gemini Omni 围绕文本、图像、音频和视频在同一工作流中的协同设计,并提供原生音频和专用源视频编辑端点。最适合的选择取决于项目所需的控制和风格。
文本转视频和图像转视频起价为每次生成 $0.16;视频编辑起价为 $2.40;1.1 Flash 视频工作流则根据端点和输出选项,起价为每秒 $0.048 或 $0.10。
可以使用文本提示词、图像转视频最多五张参考图像,或使用源视频加指令进行编辑。生成的视频可以包含同步音频,每次调用最多使用三个已保存的语音 ID 和三个 character ID。
Gemini Omni Audio 可以从 30 种预设声音创建可复用的语音档案。Muapi 会返回 audio ID,后续视频生成最多可传入三个 audio ID。
Gemini Omni Character 可以根据一张参考图像创建可复用的人物档案。返回的 character ID 可用于后续生成,每次调用最多三个。
可以。根据所选端点使用支持的宽高比,包括适合横屏和竖屏交付的 16:9 与 9:16。
不需要。Gemini Omni 通过 Muapi 按生成计费的 API 提供。创建 Muapi API 密钥后即可直接调用端点。
用一个异步 API 完成多模态视频、原生音频、语音档案和一致人物生成。