Molmo2 视频字幕生成器: AI 大语言模型

使用 Molmo2 生成详细的视频描述。可选择低、中或高详细程度,分析时间动作、场景变化和视觉上下文,按每 5 秒计费。

📝

概览

关于此模型

Molmo2 视频字幕生成器可将公开的视频 URL 转换为详细的文字描述,并追踪视频随时间发生的变化,而不只是解释单个画面。它能够识别主体、物体、场景变化、摄像机运动、互动以及重要的视觉上下文,适合生成无障碍替代文本、为媒体库建立可搜索的描述,或为后续创意和自动化流程提供输入。低详细程度适合简短摘要,中等详细程度提供平衡的描述,高详细程度则更全面地记录时间动作和场景结构。视频最长可达两分钟,API 以异步方式返回结果,方便将较长的视频分析接入生产管线、工作流节点和后台任务。

1无障碍:为视频生成描述性文字,帮助屏幕阅读器用户理解视觉内容。
2媒体库:为大量上传的视频片段生成可搜索的描述和标签。
3内容运营:在剪辑、审核、发布或后续处理前快速总结素材。
4视频质量检查:检查生成视频或用户提交视频中的动作、场景转换、物体和视觉上下文。
5工作流自动化:将生成的字幕传递给写作、搜索、分类或发布节点,无需手动复制。
💰

价格与价值

成本分析

muapiapp$0.006 minimum; $0.010 每 5 秒

按视频时长计费,最低 3 秒,最高 120 秒。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

视频 URLstring

用于生成字幕的公开视频 URL。支持常见视频格式,最长 2 分钟。

默认值https://interactive-examples.mdn.mozilla.net/media/cc0-videos/flower.mp4
详细程度枚举(3 个选项)

字幕详细程度:low 生成简短摘要,medium 提供平衡的描述,high 则全面记录时间动作和视觉细节。

默认值medium
📖

实施指南

开发者文档

如何生成视频字幕

向 /api/v1/molmo2-video-captioner 发送 POST 请求,提供公开可访问的 video_url,并可选设置 detail_level 为 low、medium 或 high。API 会返回 request_id。随后轮询 /api/v1/predictions/{id}/result,直到 status 为 completed;也可以提供 webhook URL 来接收异步结果。

curl -X POST "https://api.muapi.ai/api/v1/molmo2-video-captioner"
-H "x-api-key: YOUR_API_KEY"
-H "Content-Type: application/json"
-d '{ "video_url": "https://example.com/video.mp4", "detail_level": "medium" }'

完成后的响应会将生成的字幕放在 outputs 数组中。视频最长支持 120 秒。

常见问题

常见问答

Molmo2 视频字幕生成器会返回什么?

它会返回文字字幕,描述视频中的主体、物体、动作、场景变化、摄像机运动以及相关视觉上下文。

支持什么视频输入?

在 video_url 中传入公开可访问的视频 URL。支持常见视频格式,输入视频最长为两分钟。

low、medium 和 high 有什么区别?

low 生成简洁摘要,medium 提供平衡的描述,high 则更全面地记录时间动作和视觉细节。

字幕请求是同步的吗?

请求采用异步处理。提交视频后会获得 request_id,可以轮询结果端点,或提供 webhook URL 接收完成通知。

如何计算费用?

费用按视频时长计算,每 5 秒 $0.010;最长按 120 秒计费,3 秒以内的短视频最低收费为 $0.006。

可以在工作流中使用吗?

可以。该模型是文本输出工作流节点,可将字幕传递给后续的写作、搜索、分类或发布步骤。