关于此模型
Molmo2 视频字幕生成器可将公开的视频 URL 转换为详细的文字描述,并追踪视频随时间发生的变化,而不只是解释单个画面。它能够识别主体、物体、场景变化、摄像机运动、互动以及重要的视觉上下文,适合生成无障碍替代文本、为媒体库建立可搜索的描述,或为后续创意和自动化流程提供输入。低详细程度适合简短摘要,中等详细程度提供平衡的描述,高详细程度则更全面地记录时间动作和场景结构。视频最长可达两分钟,API 以异步方式返回结果,方便将较长的视频分析接入生产管线、工作流节点和后台任务。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.006 minimum; $0.010 每 5 秒 | 按视频时长计费,最低 3 秒,最高 120 秒。 |
按视频时长计费,最低 3 秒,最高 120 秒。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 视频 URL | string | 用于生成字幕的公开视频 URL。支持常见视频格式,最长 2 分钟。 | https://interactive-examples.mdn.mozilla.net/media/cc0-videos/flower.mp4 |
| 详细程度 | 枚举(3 个选项) | 字幕详细程度:low 生成简短摘要,medium 提供平衡的描述,high 则全面记录时间动作和视觉细节。 | medium |
用于生成字幕的公开视频 URL。支持常见视频格式,最长 2 分钟。
https://interactive-examples.mdn.mozilla.net/media/cc0-videos/flower.mp4字幕详细程度:low 生成简短摘要,medium 提供平衡的描述,high 则全面记录时间动作和视觉细节。
medium开发者文档
向 /api/v1/molmo2-video-captioner 发送 POST 请求,提供公开可访问的 video_url,并可选设置 detail_level 为 low、medium 或 high。API 会返回 request_id。随后轮询 /api/v1/predictions/{id}/result,直到 status 为 completed;也可以提供 webhook URL 来接收异步结果。
curl -X POST "https://api.muapi.ai/api/v1/molmo2-video-captioner"
-H "x-api-key: YOUR_API_KEY"
-H "Content-Type: application/json"
-d '{
"video_url": "https://example.com/video.mp4",
"detail_level": "medium"
}'
完成后的响应会将生成的字幕放在 outputs 数组中。视频最长支持 120 秒。
常见问答
它会返回文字字幕,描述视频中的主体、物体、动作、场景变化、摄像机运动以及相关视觉上下文。
在 video_url 中传入公开可访问的视频 URL。支持常见视频格式,输入视频最长为两分钟。
low 生成简洁摘要,medium 提供平衡的描述,high 则更全面地记录时间动作和视觉细节。
请求采用异步处理。提交视频后会获得 request_id,可以轮询结果端点,或提供 webhook URL 接收完成通知。
费用按视频时长计算,每 5 秒 $0.010;最长按 120 秒计费,3 秒以内的短视频最低收费为 $0.006。
可以。该模型是文本输出工作流节点,可将字幕传递给后续的写作、搜索、分类或发布步骤。