使用 MiniMax H3 Open 参考素材生视频,根据图像、视频和音频参考生成带有原生音频的 AI 视频。支持 480p/768p 和 5-15s 片段。
关于此模型
MiniMax H3 Open 参考素材生视频可根据文本提示词和多模态参考输入生成连贯的 480p 和 768p 视频。它最多支持 9 个参考图像、3 个参考视频和 3 个参考音频,并同步合成视觉运动与原生立体声音频。可与 MiniMax H3 Open 文生视频 和 MiniMax H3 Open 图生视频 对比。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.065/秒 (480p) or $0.13/秒 (768p) | 多模态参考内容计费:每张图像/段音频 $0.026,每秒参考视频 $0.065。 |
| Fal.ai | $0.20+ 每秒 | 基于参考内容的视频生成基础按秒费率更高。 |
| Replicate | 暂不可用 | Replicate 未原生托管此模型。 |
多模态参考内容计费:每张图像/段音频 $0.026,每秒参考视频 $0.065。
基于参考内容的视频生成基础按秒费率更高。
Replicate 未原生托管此模型。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 引用 <Picture 1..9>、<Video 1..3>、<Audio 1..3> 的文本描述。视频会同时生成原生立体声音频。 | A cinematic ocean wave at sunrise with <Picture 1> subject, highly detailed |
| 参考图像 | array | Reference image URLs. 最多 9 images. | undefined |
| 参考视频 | array | 参考视频 URL(最多 3 个,480p)。参考视频总时长最多 15s。 | undefined |
| 参考音频 | array | Standalone 参考音频 URLs (up to 3, trimmed to 15s each). | undefined |
| 画面比例 | 枚举(7 个选项) | - | 16:9 |
| 分辨率 | 枚举(2 个选项) | - | 480p |
| 时长 | 枚举(11 个选项) | - | 5 |
引用 <Picture 1..9>、<Video 1..3>、<Audio 1..3> 的文本描述。视频会同时生成原生立体声音频。
A cinematic ocean wave at sunrise with <Picture 1> subject, highly detailedReference image URLs. 最多 9 images.
undefined参考视频 URL(最多 3 个,480p)。参考视频总时长最多 15s。
undefinedStandalone 参考音频 URLs (up to 3, trimmed to 15s each).
undefined-
16:9-
480p-
5开发者文档
prompt,其中引用 <Picture 1..9>、<Video 1..3> 或 <Audio 1..3>,并附上对应的参考 URL。16:9)、分辨率(480p 或 768p)和时长(5 到 15 秒)。curl 或客户端库向 /api/v1/minimax-h3-open-reference-to-video 发送 POST 请求。curl -X POST "https://api.muapi.ai/api/v1/minimax-h3-open-reference-to-video" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"prompt": "A cinematic scene with <Picture 1> character walking, highly detailed",
"reference_images": ["https://example.com/char.jpg"],
"resolution": "480p",
"duration": 5
}'
常见问答
MiniMax H3 Open 参考素材生视频是一个多模态模型,可在最多 9 个参考图像、3 个参考视频和 3 个参考音频的引导下生成视频和原生音频。
在提示词文本中使用 `<Picture 1>`..`<Picture 9>`、`<Video 1>`..`<Video 3>` 和 `<Audio 1>`..`<Audio 3>` 等标签。
该模型支持 480p 和 768p 分辨率,输出时长范围为 5 到 15 秒。
会。模型会将原生立体声音频与视觉运动以及所提供的任何参考音频同步生成。
输出视频按 $0.065/sec(480p)或 $0.13/sec(768p)计费。参考素材费用为:每张图像 $0.026、每条音轨 $0.026,以及每秒参考视频时长 $0.065/sec。