MiniMax H3 Open 参考素材生视频 API: 画像から動画生成

使用 MiniMax H3 Open 参考素材生视频,根据图像、视频和音频参考生成带有原生音频的 AI 视频。支持 480p/768p 和 5-15s 片段。

📝

概要

このモデルについて

MiniMax H3 Open 参考素材生视频可根据文本プロンプト和多模态参考入力生成连贯的 480p 和 768p 视频。它最多支持 9 个参考图像、3 个参考视频和 3 个参考音频,并同步合成视觉运动与原生立体声音频。可与 MiniMax H3 Open テキストから動画生成MiniMax H3 Open 画像から動画生成 对比。

1多模态角色参考:通过最多 9 个参考图像保持角色一致性。
2视频风格迁移与引导:使用最多 3 个参考视频引导运动和场景构图。
3音频与声音合成:将视频生成与最多 3 条参考音轨同步。
💰

料金と価値

コスト分析

muapiapp$0.065/s (480p) or $0.13/s (768p)

多模态参考内容计费:每张图像/段音频 $0.026,每秒参考视频 $0.065。

Fal.ai$0.20+ per second

基于参考内容的视频生成基础按秒费率更高。

Replicate提供なし

Replicateでネイティブホストされていません。

** 競合サービスの料金は類似のモデル構成および利用ティアに基づいて算出された推定値です。

⚙️

技術詳細

設定スキーマ

プロンプトstring

引用 <Picture 1..9>、<Video 1..3>、<Audio 1..3> 的文本描述。動画会同时生成原生立体声音声。

デフォルト値A cinematic ocean wave at sunrise with <Picture 1> subject, highly detailed
参考画像array

Reference image URLs. Up to 9 images.

デフォルト値undefined
参考動画array

参考動画 URL(最多 3 个,480p)。参考動画总生成時間最多 15s。

デフォルト値undefined
参考音声array

Standalone reference audio URLs (up to 3, trimmed to 15s each).

デフォルト値undefined
アスペクト比Enum(7個の選択肢)

-

デフォルト値16:9
解像度Enum(2個の選択肢)

-

デフォルト値480p
長さ(秒)Enum(11個の選択肢)

-

デフォルト値5
📖

実装ガイド

開発者ドキュメント

使用方法 MiniMax H3 Open 参考素材生视频 API

  1. 準備入力:提供一个 prompt,其中引用 <Picture 1..9><Video 1..3><Audio 1..3>,并附上对应的参考 URL。
  2. 配置选项:选择アスペクト比(例如 16:9)、分辨率(480p768p)和时长(515 秒)。
  3. リクエスト送信:使用 curl 或客户端库向 /api/v1/minimax-h3-open-reference-to-video 发送 POST 请求。
curl -X POST "https://api.muapi.ai/api/v1/minimax-h3-open-reference-to-video" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "prompt": "A cinematic scene with <Picture 1> character walking, highly detailed",
    "reference_images": ["https://example.com/char.jpg"],
    "resolution": "480p",
    "duration": 5
  }'
  1. 获取出力:轮询返回的请求 ID,或使用 webhook 获取完成的视频。

よくある質問

FAQ

什么是 MiniMax H3 Open 参考素材生视频?

MiniMax H3 Open 参考素材生视频是一个多模态模型,可在最多 9 个参考图像、3 个参考视频和 3 个参考音频的引导下生成视频和原生音频。

如何在プロンプト中引用图像、视频和音频?

在プロンプト文本中使用 `<Picture 1>`..`<Picture 9>`、`<Video 1>`..`<Video 3>` 和 `<Audio 1>`..`<Audio 3>` 等标签。

支持哪些分辨率和时长?

该模型支持 480p 和 768p 分辨率,出力时长范围为 5 到 15 秒。

会自动生成音频吗?

会。模型会将原生立体声音频与视觉运动以及所提供的任何参考音频同步生成。

如何计算价格?

出力视频按 $0.065/sec(480p)或 $0.13/sec(768p)计费。参考素材费用为:每张图像 $0.026、每条音轨 $0.026,以及每秒参考视频时长 $0.065/sec。