关于此模型
Gemini Omni 1.1 Flash 图生视频会将起始关键帧图像(first_frame_url)动画化为视频,并可选地使用结束关键帧图像(last_frame_url)控制首尾帧过渡,同时在同一次处理中返回原生同步音频。它是 Gemini Omni 关键帧动画能力的专用入口:无需配置参考图像、参考视频、语音或 character IDs,只需提供起始图像、可选的结束图像、提示词和分辨率。若要从文本提示词而不是起始图像生成视频,请参阅 Gemini Omni 1.1 Flash。若要编辑现有视频,请参阅 Gemini Omni 1.1 Flash 视频编辑;若要进行按标签寻址的多参考合成,请参阅 Gemini Omni 1.1 Flash 参考图生视频。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapi | $0.10–$0.30 按输出秒数计费 (by 分辨率) | 按次生成, 无需订阅. Keyframe image-to-video with optional first/last-frame pair. |
| Fal.ai | 暂不可用 | Fal.ai 未列出 Gemini Omni 1.1 Flash。 |
| Replicate | 暂不可用 | Replicate 未列出 Gemini Omni 1.1 Flash。 |
按次生成, 无需订阅. Keyframe image-to-video with optional first/last-frame pair.
Fal.ai 未列出 Gemini Omni 1.1 Flash。
Replicate 未列出 Gemini Omni 1.1 Flash。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 对目标视频内容的文本描述——画面、镜头方向、对话和环境音提示。 | A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter. |
| 首帧图像 | string | 用于生成视频的起始关键帧图像。 | - |
| 末帧图像 | string | 可选的 ending keyframe image. Requires first_frame_url to also be set. | - |
| 画面比例 | 枚举(2 个选项) | 输出视频的画面比例。 | 16:9 |
| 分辨率 | 枚举(3 个选项) | 输出分辨率。按输出秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。 | 720p |
| 种子 | int | 随机种子(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。 | 0 |
对目标视频内容的文本描述——画面、镜头方向、对话和环境音提示。
A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.用于生成视频的起始关键帧图像。
-可选的 ending keyframe image. Requires first_frame_url to also be set.
-输出视频的画面比例。
16:9输出分辨率。按输出秒数计费:720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒。
720p随机种子(0–2147483647)。固定后可复现结果,但由于模型随机性,结果仍可能有所不同。
0开发者文档
提供起始关键帧
传入公开可访问的 first_frame_url — 这是视频动画化的起点图像。
可选地提供结束关键帧
传入 last_frame_url 以控制运动结束的位置。设置 last_frame_url 时也必须设置 first_frame_url。
编写描述运动和声音的提示词 示例:'A street musician plays a violin on a rainy Paris evening, raindrops tap the cobblestones, a slow melancholic melody, distant café chatter.'
选择分辨率和宽高比 分辨率按输出时长计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。
提交并轮询
curl -X POST https://api.muapi.ai/api/v1/gemini-omni-flash-1-1-image-to-video \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"prompt": "A street musician plays a violin on a rainy Paris evening",
"first_frame_url": "https://example.com/start.jpg",
"resolution": "1080p",
"aspect_ratio": "16:9"
}'
然后轮询 GET /api/v1/predictions/{request_id}/result,直到 status 为 completed。
提示词技巧
常见问答
这是一个专注于关键帧动画的端点:提供起始图像(以及可选的结束图像)和提示词,它就会生成在两者之间进行动画并带有原生同步音频的视频。
此端点要求将起始图像(`first_frame_url`)作为视频实际生成所依据的关键帧。[Gemini Omni 1.1 Flash](/playground/gemini-omni-flash-1-1-text-to-video) 则从文本提示词生成视频,其中任何 `image_urls` 都只是辅助参考图像,并非关键帧。
不是,它是可选的。提供时还要求同时设置 `first_frame_url`,模型会生成连接这两帧的运动。
根据输出视频的分辨率按秒计费:720p 为 $0.10/s,1080p 为 $0.15/s,4K 为 $0.30/s。10 秒的 1080p 片段费用为 $1.50。
不可以,此端点只接受提示词、`first_frame_url` 和可选的 `last_frame_url`。如需参考图像、参考视频、语音或角色输入,请使用 [Gemini Omni 1.1 Flash](/playground/gemini-omni-flash-1-1-text-to-video)。