Seedance 2 全能参考 480p: 图像转视频

SD 2.0 480p 全能参考——使用参考图像、视频和音频,以 480p 分辨率生成具有视觉一致性的视频。相比 720p 版本更具成本效益。支持最多 9 张图像、3 个视频片段和 3 个音频片段。在提示词中使用 @image1、@video1、@audio1 语法。

📝

概览

关于此模型

SD 2.0 全能参考 480p 可在 480p 分辨率下借助参考图像、视频和音频生成具有视觉一致性的视频。它以更低成本提供与 720p 版本相同的多模态参考能力——保持角色身份、视觉风格和场景连续性。一次请求最多可组合 9 张图像、3 个视频片段和 3 个音频文件。在提示词中使用 @image1、@video1、@audio1 语法,精确控制每个参考素材对生成视频的影响。

1角色一致性:提供肖像作为 @image1,让角色外观在多个场景中保持一致。
2风格迁移:将参考图像的视觉风格应用到新生成的视频场景中。
3音频同步视频:通过 @audio1 将视频生成与参考音乐片段或语音录音同步。
4场景连续性:提供场景截图,生成视觉匹配的延续画面。
5草稿预览:在投入 720p 生成前,快速以 480p 试制多模态视频概念。
💰

价格与价值

成本分析

muapiapp$0.24/秒 (高质量) / $0.18/秒 (基础)

Per-second billing for 480p output. Video reference inputs add a 30% surcharge 每秒 of combined input video duration.

Fal.ai$0.3024/秒 (高质量) / $0.2419/秒 (基础)

Fal.ai 收费 $0.3024/sec for high 质量 and $0.2419/sec for basic. muapiapp is 21% 更便宜 on high ($0.24/sec) and 26% 更便宜 on basic ($0.18/sec).

Replicate$0.3024/秒 (高质量) / $0.2419/秒 (基础)

Replicate 收费 the same as Fal.ai — $0.3024/sec (high), $0.2419/sec (basic). muapiapp saves 21–26% vs Replicate at 480p resolution.

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

提示词string

Video description. Use @image1…@image9 to 参考图像, @video1…@video3 for videos, @audio1…@audio3 for audio. To use a fictional character, reference it with @character:<id> (request_id from a completed Seedance 2 Character generation) — characters are automatically appended to images_list. Multiple characters are supported.

默认值@image1 is the main character reference. A person walking on the beach at sunset, cinematic lighting
图像 URLarray

最多 9 个参考图像 URL(JPEG/PNG/WebP)。第 N 张图像对应提示词中的 @imageN。

默认值https://d3adwkbyhxyrtq.cloudfront.net/webassets/videomodels/seedance-v2.0-omni-reference.png
参考视频 URLarray

最多 3 个参考视频片段 URL(MP4,每个最长 15 秒)。第 N 个视频对应提示词中的 @videoN。

默认值undefined
参考音频 URLarray

最多 3 参考音频 clip URLs (MP3/WAV, total max 15s). Each Nth audio corresponds to @audioN in the prompt.

默认值undefined
画面比例枚举(4 个选项)

输出视频的画面比例。

默认值16:9
质量枚举(2 个选项)

Generation quality. 'high' uses the standard model ($0.24/sec output + $0.072/sec per 输入视频 second). 'basic' uses the fast model ($0.18/sec output + $0.054/sec per 输入视频 second). Video reference inputs incur an additional 30% surcharge based on their combined duration.

默认值basic
时长(秒)int

Video duration (秒) (8–15).

默认值8
📖

实施指南

开发者文档

  1. 将参考图像(JPEG/PNG/WebP)作为 'images_list' 上传,最多 9 张图像。
  2. 可选上传视频片段(MP4,每个最长 15s)作为 'video_files',最多 3 个视频。
  3. 可选上传音频文件(MP3/WAV)作为 'audio_files',最多 3 个文件,总时长最长 15s。
  4. 编写描述场景的提示词。图像使用 @image1…@image9 引用,视频使用 @video1…@video3 引用,音频使用 @audio1…@audio3 引用。
  5. 设置时长(8–15s)和画面比例。
  6. 轮询或使用 webhook 获取已完成的视频。

常见问题

常见问答

这与 720p 全能参考有何不同?

此端点生成 480p 视频,速度更快且更具成本效益(basic:$0.18/sec,high output:$0.24/sec),相比之下 720p 版本为(basic:$0.21/sec,high output:$0.30/sec)。两个版本都会针对输入视频的每一秒时长,在每秒费率基础上加收 30%。最小时长为 8 秒,画面比例选项仅限 16:9、9:16、4:3 和 3:4。

如何在提示词中引用上传的文件?

在 `images_list` 中使用 @image1、@image2 等,按位置引用图像;在 `video_files` 中使用 @video1、@video2,按位置引用视频;在 `audio_files` 中使用 @audio1、@audio2,按位置引用音频文件。

需要提供所有类型的参考素材吗?

不需要。所有参考数组都是可选的。你可以只提供图像、只提供视频、只提供音频,或任意组合。仅使用文本提示词也有效。

支持哪些文件格式?

图像:JPEG、PNG 或 WebP(最多 9 张)。视频:仅限 MP4,每个最长 15 秒(最多 3 个)。音频:MP3、WAV 或其他常见格式,总时长最长 15 秒(最多 3 个文件)。

费用如何计算?

成本 = (rate × output_duration) + (0.3 × rate × total_input_video_duration)。'high' 质量:输出 $0.24/sec。'basic' 质量:输出 $0.18/sec。如果提供 `video_files`,则按合并输入视频时长的每一秒加收 30%。示例:8s 输出(basic)+ 两个 5s 输入视频 = 8×$0.18 + 10×$0.054 = $1.44 + $0.54 = $1.98。

为什么最小时长是 8 秒?

480p 全能参考版本至少需要 8 秒输出,才能正确融入多模态参考素材。