Vidu Q3 Pro 图生视频可将单张起始图像制作成最高 1080p 的流畅、由提示词引导的片段。它会保留角色身份、光线和构图,同时加入自然运动、镜头移动和氛围效果,非常适合为概念艺术、产品照片和静态图像增添电影感。
关于此模型
Vidu Q3 Pro 图生视频可将单张起始图像制作成最高 1080p 的流畅、由提示词引导的片段。它会保留角色身份、光线和构图,同时加入自然运动、镜头移动和氛围效果,非常适合以电影感的精致效果让概念艺术、产品照片和静态图像动起来。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.15 每秒 at 720p ($0.75 每 5 秒片段) | 按秒计费:360p $0.05/秒、540p $0.07/秒、720p $0.15/秒、1080p $0.16/秒。 |
| Fal.ai | 暂不可用 | 目前 Fal.ai 未列出 Vidu Q3 Pro。 |
| Replicate | 暂不可用 | 目前 Replicate 未列出 Vidu Q3 Pro。 |
按秒计费:360p $0.05/秒、540p $0.07/秒、720p $0.15/秒、1080p $0.16/秒。
目前 Fal.ai 未列出 Vidu Q3 Pro。
目前 Replicate 未列出 Vidu Q3 Pro。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 提示词 | string | 描述运动效果的文本提示词。 | The floating train suddenly accelerates violently through the sky while sections of the track collapse behind it. Sparks explode beneath the wheels as the camera races alongside the train through tight gaps between skyscrapers. Pieces of the city break apart during the chase. |
| 图像 URL | string | 起始帧图像的 URL。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/vidu-q3-pro-image-to-video.jpg |
| 分辨率 | 枚举(4 个选项) | 生成视频的分辨率。 | 720p |
| 画面比例 | 枚举(5 个选项) | 输出视频的画面比例。 | 16:9 |
| 时长 | int | 生成视频的时长(秒)。 | 5 |
| 音频 | boolean | 是否为视频生成音频。 | false |
描述运动效果的文本提示词。
The floating train suddenly accelerates violently through the sky while sections of the track collapse behind it. Sparks explode beneath the wheels as the camera races alongside the train through tight gaps between skyscrapers. Pieces of the city break apart during the chase.起始帧图像的 URL。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/vidu-q3-pro-image-to-video.jpg生成视频的分辨率。
720p输出视频的画面比例。
16:9生成视频的时长(秒)。
5是否为视频生成音频。
false开发者文档
提供起始图像:通过 image_url 传入可公开访问的 URL。这将作为第一帧。
编写运动提示词:描述主体和镜头应如何运动——包括方向、节奏、光线变化和任何新元素。
选择分辨率和宽高比:尽可能让宽高比匹配源图像。1080p 可提供最高保真度;推荐默认使用 720p。
设置时长:选择 1 到 16 秒之间的任意值(默认 5 秒)。
提交:端点为异步模式——轮询 /api/v1/predictions/{request_id}/result,或使用 webhook_url。
常见问答
请提供可公开访问的图像 URL。输出宽高比支持 16:9、9:16、4:3、3:4 和 1:1;尽可能匹配源图像,以避免裁剪。
Q3 Pro 专门调优为在引入自然运动的同时保留源图像中的角色身份、光线和构图。
5 秒是一个不错的默认值。快速迭代可使用较短片段(1–4 秒);当叙事弧线更重要时,可使用较长片段(8–16 秒)。