Veo 4 是 Google DeepMind 的最新视频模型——生成最长 30 秒的写实 1080p 视频,支持同时多角度摄像机渲染、零样本个性化头像创建和原生音频同步。Veo 4 API 即将推出。
API 尚未开放
Veo 4 端点正在开发中,请关注探索页面的发布公告。Veo 3 现已可用。
Veo 4 是 Google DeepMind 面向专业级大规模 AI 视频制作的先进视频生成模型。它可以从文本提示词或输入图像生成最长 30 秒的连续写实原生 1080p 视频,不会产生放大伪影。与早期模型不同,Veo 4 可在一次生成中渲染同时的多角度摄像机视角,为电影制作工作流提供更强的能力。
开发者和工作室选择 Veo 4,是因为它可以从一张参考照片零样本创建写实的个性化数字主持人,也可以在音素级别同步原生音频,将同步语音、音效和环境声直接嵌入视频,无需后期处理。Veo 4 通过 Muapi REST API 提供,提交与轮询方式和 Veo 3 一致,无需管理基础设施。
延伸阅读:Google Veo 3.1 on Muapi,以及 2026 年最佳 AI 视频模型。
30 秒片段
每次请求最多生成连续 30 秒视频,适合广告、预告片和社交内容。
原生 1080p 分辨率
无需放大即可输出全高清画面,保留每一帧的细节。
多角度摄像机渲染
在一次生成中模拟同时存在的多个摄像机角度。
零样本头像创建
仅凭一张参考照片即可创建写实的个性化头像,无需微调。
音素级精准音频同步
在音素级别同步原生语音和声音生成。
文本转视频与图像转视频
根据文本提示词生成视频,或将任意输入图像制作成视频。
电影级广告
制作最长 30 秒、具有专业运动和音频的品牌视频与产品演示。
个性化头像视频
仅凭一张照片创建用于入门培训、在线学习或社交媒体的自定义头像主持人。
社交媒体内容
生成适合 TikTok、Reels 和 YouTube Shorts 的竖屏与横屏片段。
游戏与 VFX 原型
快速制作电影感过场动画和视觉特效序列原型。
广播与流媒体
为流媒体平台和数字媒体制作 1080p、适合广播的内容。
| 功能 | Veo 4 | Veo 3 |
|---|---|---|
| 最长时长 | 最长 30 秒 | 最长 8 秒 |
| 分辨率 | 原生 1080p | 720p–1080p |
| 音频 | 原生音素级精准音频同步 | 原生音频生成 |
| 头像创建 | 单张照片零样本创建 | 不支持 |
| 摄像机控制 | 同时多角度渲染 | 单一摄像机路径 |
| 状态 | 即将在 Muapi 上线 | 已在 Muapi 上线 |
什么是 Veo 4 API?
Veo 4 API 是 Google DeepMind 的下一代视频生成模型。它可以根据文本提示词或输入图像生成最长 30 秒的写实 1080p 视频,并支持多角度摄像机渲染、零样本个性化头像创建和音素级精准原生音频同步。
Veo 4 与 Veo 3 有什么区别?
Veo 4 在 Veo 3 的基础上提供更长片段(最长 30 秒,而不是 8 秒)、原生 1080p、同时多角度摄像机渲染,以及根据单张参考照片零样本创建头像。Veo 3 目前已在 Muapi 提供文本转视频和图像转视频。
Veo 4 API 什么时候可用?
Veo 4 API 目前正在 Muapi 开发中,请关注探索页面的发布公告。在此期间,Veo 3 已可通过 API 用于高质量 AI 视频生成。
Veo 4 支持原生音频生成吗?
支持。Veo 4 内置音素级精准音频同步,可以在视频输出中生成同步语音、音效和环境声,无需单独后期处理。
Veo 4 支持哪些画幅和分辨率?
Veo 4 原生支持竖屏和横屏 1080p 输出,每次生成最长 30 秒。具体画幅选项将在发布时确认。
正在寻找 Veo 3?
Veo 3 现已上线,文本转视频和图像转视频均可通过 API 使用。