模型/视频转音频

视频转音频 API — 为静音视频生成声音

已上线2 个模型

Muapi 视频转音频 API 会分析静音视频,并根据画面中的动作生成同步的环境声、拟音或音效,无需手动完成声音设计。同一 MMAudio 模型家族也可以仅根据文字提示词生成独立音效。两种流程都使用统一 REST API,每秒生成音频收费 $0.001。

2 / 2 个模型
MMAudio视频转音频

MMAudio 视频转音频

分析静音视频,根据文字提示词生成与画面动作同步的环境声、拟音或音效。

输入视频,输出音频
$0.001 / 秒
试用模型
MMAudio文本转音频

MMAudio 文本转音频

仅根据文字提示词生成独立音效或环境音片段,无需提供视频。

输入文本,输出音频
$0.001 / 秒
试用模型

什么是视频转音频 API?

视频转音频 API 接收一段静音视频,根据画面中正在发生的内容生成匹配的声音,例如脚步声、风声、机器声、环境声或其他拟音。你只需用文字提示词描述所需声音,无需手动完成拟音或声音设计。

Muapi 通过 MMAudio 视频转音频提供这一流程,也提供无需视频输入的 MMAudio 文本转音频,用于生成独立音效或环境音片段。两者都采用平台统一的提交与轮询 REST 流程,并根据生成音频的时长计费。

主要能力

与视频同步的声音生成

MMAudio 视频转音频会分析输入视频,根据描述所需声音的提示词生成与画面动作同步的音频。

独立音效生成

MMAudio 文本转音频只需文字即可生成音效或环境音,适合建立可重复使用的声音素材库。

可调整输出时长

两个模型都支持 duration 参数,默认时长为 8 秒,可让生成片段匹配视频或剪辑时间线。

静音片段处理流程

如果 AI 生成的视频没有声音,可以直接将片段发送给 MMAudio 视频转音频,为其添加匹配的声音。

低廉的每秒成本

两个 MMAudio 模型都按生成音频每秒 $0.001 计费,因此默认 8 秒片段的费用为 $0.008。

可搭配语音和音乐工具

将生成的环境声或音效与文本转语音的对白、Suno 的音乐结合,制作完整的视频声音轨道。

视频转音频模型对比

模型输入价格适用场景
MMAudio 视频转音频视频 + 文字提示词$0.001 / 秒(默认 8 秒为 $0.008)为静音视频添加同步声音
MMAudio 文本转音频仅文字提示词$0.001 / 秒(默认 8 秒为 $0.008)生成独立音效和环境声

如何通过 API 为视频生成音频

  1. 选择模型。 有静音片段需要配音时使用视频转音频;生成独立音效时使用文本转音频。
  2. 编写提示词。 描述所需声音,例如“锡屋顶上的大雨声,远处伴有雷声”。
  3. 提交请求。 调用 POST /api/v1/mmaudio-v2/video-to-video,并提供 prompt、video_url 和可选的 duration。文本转音频使用 /api/v1/mmaudio-v2/text-to-audio,不需要 video_url。
  4. 轮询任务完成。 持续检查 GET /api/v1/predictions/{request_id}/result,直到 status 为 completed,然后下载音频。
  5. 合成回视频。 在你的视频编辑流程中,将生成的音轨与原始静音片段合并。
curl -X POST https://api.muapi.ai/api/v1/mmaudio-v2/video-to-video \
  -H "Content-Type: application/json" \
  -H "x-api-key: YOUR_API_KEY" \
  -d '{
    "prompt": "Heavy rain on a tin roof with distant thunder",
    "video_url": "https://example.com/silent-video.mp4",
    "duration": 8
  }'
import requests

response = requests.post(
    "https://api.muapi.ai/api/v1/mmaudio-v2/video-to-video",
    headers={"x-api-key": "YOUR_API_KEY"},
    json={
        "prompt": "Heavy rain on a tin roof with distant thunder",
        "video_url": "https://example.com/silent-video.mp4",
        "duration": 8,
    },
)
request_id = response.json()["request_id"]

result = requests.get(
    f"https://api.muapi.ai/api/v1/predictions/{request_id}/result",
    headers={"x-api-key": "YOUR_API_KEY"},
)
print(result.json())

常见问题

什么是视频转音频 API?

Muapi 视频转音频 API 通过 MMAudio 视频转音频分析静音视频,并根据描述所需声音的文字提示词生成匹配的音轨。

可以不提供视频,直接生成音效吗?

可以。MMAudio 文本转音频仅根据文字提示词生成独立音效或环境音片段,无需视频输入。

视频转音频生成需要多少钱?

两个 MMAudio 模型都按生成音频每秒 $0.001 计费,默认 8 秒片段的费用为 $0.008。

生成的音频可以有多长?

时长通过请求参数设置,默认是 8 秒。可以根据视频或剪辑需求设置支持范围内的时长。

这个 API 可以生成语音或对白吗?

不可以。MMAudio 主要用于环境声、拟音和音效;语音和对白请使用 Muapi 文本转语音 API。

现在可以获得视频转音频 API 访问权限吗?

可以。在 muapi.ai 注册,从控制台创建 API 密钥,即可立即开始生成音频,无需等待名单。