Gemini Video Vision 视频理解: AI 大语言模型

使用 Google Gemini Video Vision 分析视频。从视频 URL 获取详细的场景、运动和构图分析。免费试用,按次生成付费。

📝

概览

关于此模型

Gemini Video Vision 将 Google Gemini 的原生视频理解能力带入 Muapi API。Gemini 不再只采样孤立帧,而是摄取完整视频并端到端地进行推理,分析摄像机运动、主体动作、构图、光照、屏幕文字和叙事结构。提供视频 URL 和提示词(或结构化系统提示词)后,它会返回详细的文本分析,因此适合内容审核、视频字幕、镜头清单生成以及 AI 生成视频的自动质量检查。价格按 token 计费,类似于 Gemini 2.5 FlashGemini 3 Flash,但由于视频输入消耗的 token 远多于文本或单张图像,每次运行的最低收费更高。

1视频质量检查:在向用户交付 AI 生成的视频前,自动检查伪影、连续性错误或偏离提示词的内容。
2内容审核:标记上传或生成视频中的不安全、NSFW 或违反策略的内容。
3镜头清单生成:从参考视频中提取摄像机运动、取景和构图说明,用于指导新的 AI 视频生成提示词。
4自动字幕:为视频库和无障碍场景生成详细的场景描述或替代文本。
5连续性分析:描述视频片段的结束状态(主体位置、光照、运动方向),保持多片段 AI 视频生成的一致性。
💰

价格与价值

成本分析

muapiapp$0.60/M 输入 Token, $5.00/M 输出 Token (higher per-run minimum for 视频)

Token-based billing with 无需订阅 — pay only for what you use, including the higher token cost of video input.

Fal.ai暂不可用

Fal.ai 的视觉端点仅支持图像;它们无法通过 Gemini 文件 API 原生理解视频。

Replicate暂不可用

Replicate 目前不提供托管的 Gemini 视频理解端点。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

描述要分析的视频内容的问题或指令。

默认值Describe what happens in this video in detail, including camera movement, subjects, and any on-screen text.
视频 URLstring

要分析的视频 URL。

默认值https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/sample-video.mp4
系统提示词string

可选的 system-level instruction to guide the model's analysis style.

默认值Respond with a structured JSON analysis, not prose.
模型枚举(1 个选项)

用于视频理解的 Gemini 模型。由于 Google 已停止向新用户提供 gemini-2.5-pro,该选项已从此枚举中移除(会返回 404 NOT_FOUND);gemini-2.5-flash 是当前唯一支持的选项。

默认值gemini-2.5-flash
📖

实施指南

开发者文档

如何使用 Gemini Video Vision

  1. 提供视频 URL:将视频托管在公开可访问的 URL(例如 S3 或 CDN 链接)上,并将其作为 video_url 传入。

  2. 编写提示词:描述希望分析的内容——一般性描述、结构化 JSON 拆解,或关于视频内容的具体问题。

  3. 可选地设置系统提示词:使用 system_prompt 控制输出格式,例如“仅返回结构化 JSON,不要 prose”。

  4. 选择模型gemini-2.5-flash(默认)速度快且成本低;gemini-2.5-pro 能为复杂视频提供更深入、更准确的分析。

  5. 提交并轮询:与所有 Muapi 端点一样,提交请求并轮询 /predictions/{request_id}/result,直到 statuscompleted

Python:

import requests, time

API_KEY = "your_api_key_here"
headers = {"x-api-key": API_KEY, "Content-Type": "application/json"}

r = requests.post("https://api.muapi.ai/api/v1/gemini-video-vision", headers=headers,
    json={
        "prompt": "Describe the camera movement, subjects, and lighting in this video.",
        "video_url": "https://example.com/my-video.mp4"
    })
request_id = r.json()["request_id"]

while True:
    result = requests.get(f"https://api.muapi.ai/api/v1/predictions/{request_id}/result", headers=headers).json()
    if result["status"] == "completed":
        print(result["output"]["text"])
        break
    time.sleep(3)

cURL:

curl -X POST https://api.muapi.ai/api/v1/gemini-video-vision \
  -H "x-api-key: YOUR_API_KEY" -H "Content-Type: application/json" \
  -d '{"prompt": "Describe this video in detail.", "video_url": "https://example.com/my-video.mp4"}'

较大的视频处理时间更长,因为 Gemini 需要上传并摄取完整文件——根据视频时长,预计响应时间从几秒到几分钟不等。

常见问题

常见问答

Gemini Video Vision 可以做什么?

它利用 Google Gemini 的原生视频理解能力分析完整视频,而不只是采样帧,并返回涵盖运动、构图、主体、光照以及屏幕文字或对话上下文的详细文本描述。

支持哪些视频格式和时长?

支持 MP4、MOV 和 WebM 等标准视频格式。视频越长,处理时间和成本通常越高,因为 Gemini 的 token 用量会随视频时长增长。

如何计算价格?

价格按 token 计费。视频输入消耗的 token 明显多于文本或单张图像,因此每次运行的最低收费高于 Muapi 的纯文本 Gemini 端点。实际成本根据 API 响应计算,并在每次调用后从你的钱包中扣除。

`gemini-2.5-flash` 和 `gemini-2.5-pro` 有什么区别?

`gemini-2.5-flash` 速度更快、成本更低,适合大多数描述和质量检查任务。`gemini-2.5-pro` 提供更深入的推理,更适合详细的逐镜头拆解等复杂分析。

可以控制输出格式吗?

可以。使用 system_prompt 字段 instruct 模型以特定格式响应,例如结构化 JSON、项目符号列表或单句摘要。

请求需要多长时间?

处理时间取决于视频长度和复杂度。短片段通常在几秒内完成;较长视频可能需要几分钟,因为分析开始前必须上传并摄取完整视频。