关于此模型
Wan 3.0 参考素材转视频可根据文本提示词以及最多 10 张参考图像、5 个参考视频和 5 个参考音频生成视频,让角色、风格和声音在生成场景中保持一致。参考素材按照各数组中的排列顺序进行识别,因此提示词可以直接指代“第一张参考图像中的人物”或“参考视频中的人物”。你可以选择 480p、720p 或 1080p 输出、五种画面比例,以及 2 到 30 秒的时长;提供参考视频时,其总时长加上生成视频时长必须保持在 30 秒以内。如需不使用参考素材的普通文生视频,请参阅 Wan 3.0 文生视频;如需制作单张源图像的动画,请参阅 Wan 3.0 图生视频。如需更高保真度的 Prime 档位,请参阅 Wan 3.0 Prime 参考素材转视频。如需相同请求结构下更大胆、对比度更高的版本,请参阅 Wan 3.0 Spicy 参考素材转视频。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | 起价 $0.10 每次生成 (720p, 2s) up to $6.00 (1080p, 30s) | 按次生成计费,根据分辨率和时长定价,无需订阅。 |
| Fal.ai | 暂不可用 | 目前 Fal.ai 未列出 Wan 3.0。 |
| Replicate | 暂不可用 | 目前 Replicate 未列出 Wan 3.0。 |
按次生成计费,根据分辨率和时长定价,无需订阅。
目前 Fal.ai 未列出 Wan 3.0。
目前 Replicate 未列出 Wan 3.0。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 描述要创建的视频。参考媒体通过其数组顺序识别。 | The two people from the reference images meet on the rainy street shown in the reference video. |
| 参考图像 URL | array | 最多 10 参考图像 for visual coherence guidance. | undefined |
| 参考视频 URL | array | 最多 5 reference video clips (MP4/MOV, 1-15s each); total reference + generated duration must not exceed 30s. | undefined |
| 参考音频 URL | array | 最多 5 参考音频 clips (total duration up to 15s) for soundtrack synchronization. | undefined |
| 分辨率 | 枚举(3 个选项) | 输出视频的分辨率。 | 720p |
| 画面比例 | 枚举(5 个选项) | 输出视频的帧尺寸。 | 16:9 |
| 时长 | integer | 视频时长(秒)。 | 5 |
| 思考模式 | boolean | 启用深度思考模式以理解复杂场景。 | false |
| 启用音频 | boolean | 在视频中加入生成的音频轨道。 | true |
| 种子 | integer | 用于复现结果的随机种子。使用 -1 表示随机种子。 | -1 |
描述要创建的视频。参考媒体通过其数组顺序识别。
The two people from the reference images meet on the rainy street shown in the reference video.最多 10 参考图像 for visual coherence guidance.
undefined最多 5 reference video clips (MP4/MOV, 1-15s each); total reference + generated duration must not exceed 30s.
undefined最多 5 参考音频 clips (total duration up to 15s) for soundtrack synchronization.
undefined输出视频的分辨率。
720p输出视频的帧尺寸。
16:9视频时长(秒)。
5启用深度思考模式以理解复杂场景。
false在视频中加入生成的音频轨道。
true用于复现结果的随机种子。使用 -1 表示随机种子。
-1开发者文档
编写提示词:描述场景,并按照参考素材在数组中的顺序指代它们,例如“第一张参考图像中的人物”。
添加参考素材:在 images_list 中提供最多 10 个 URL,在 videos_list 中提供最多 5 个 URL,在 audios_list 中提供最多 5 个 URL。
设置输出画幅:选择 resolution(480p、720p、1080p)、aspect_ratio 和 duration(2–30 秒;如果提供参考视频,其时长加上输出时长必须不超过 30 秒)。
调整生成方式:为复杂的多参考场景启用 thinking_mode;如需无声视频,请将 enable_audio 设置为 false。
提交并轮询:使用 Muapi API 密钥发送请求,保存返回的 request_id,然后轮询预测结果端点,或提供 webhook_url。
curl -X POST https://api.muapi.ai/api/v1/wan3.0-reference-to-video \
-H "x-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"prompt": "参考图像中的人物走进参考视频所展示的房间。",
"images_list": ["https://example.com/character.jpg"],
"videos_list": ["https://example.com/room.mp4"],
"resolution": "720p",
"duration": 5
}'
常见问答
它可根据提示词以及参考图像、视频和音频生成视频,让角色、风格和声音与所提供的参考素材保持一致。
每次请求最多可以发送 10 张参考图像、5 个参考视频和 5 个参考音频。
参考素材按照它们在各数组中的排列顺序进行识别,因此提示词可以指代“第一张参考图像”或类似的序数表达。
有。提供参考视频时,所有参考视频的总输入时长加上生成视频时长不得超过 30 秒。
支持 480p、720p 和 1080p,以及五种画面比例(16:9、9:16、1:1、4:3、3:4)。费用会随分辨率和时长变化,完成的任务响应中会包含该次生成的确切费用。