模型/Veo 4

平价 Veo 4 API — Google DeepMind 30 秒 1080p 视频

即将推出2 个首发变体

Veo 4 是 Google DeepMind 的最新视频模型——生成最长 30 秒的写实 1080p 视频,支持同时多角度摄像机渲染、零样本个性化头像创建和原生音频同步。Veo 4 API 即将推出。

API 尚未开放

Veo 4 端点正在开发中,请关注探索页面的发布公告。Veo 3 现已可用。

T2V即将推出

Veo 4 文本转视频

使用 Veo 4 API 根据文本生成最长 30 秒的写实 1080p 视频,支持同时多角度摄像机渲染、零样本头像创建和原生音频同步。

1080p
预览模型
I2V即将推出

Veo 4 图像转视频

使用 Veo 4 将任意静态图像制作成最长 30 秒的 1080p 视频,支持高级摄像机控制、零样本个性化头像和音素级精准音频。

1080p
预览模型

什么是 Veo 4?

Veo 4 是 Google DeepMind 面向专业级大规模 AI 视频制作的先进视频生成模型。它可以从文本提示词或输入图像生成最长 30 秒的连续写实原生 1080p 视频,不会产生放大伪影。与早期模型不同,Veo 4 可在一次生成中渲染同时的多角度摄像机视角,为电影制作工作流提供更强的能力。

开发者和工作室选择 Veo 4,是因为它可以从一张参考照片零样本创建写实的个性化数字主持人,也可以在音素级别同步原生音频,将同步语音、音效和环境声直接嵌入视频,无需后期处理。Veo 4 通过 Muapi REST API 提供,提交与轮询方式和 Veo 3 一致,无需管理基础设施。

延伸阅读:Google Veo 3.1 on Muapi,以及 2026 年最佳 AI 视频模型。

主要功能

30 秒片段

每次请求最多生成连续 30 秒视频,适合广告、预告片和社交内容。

原生 1080p 分辨率

无需放大即可输出全高清画面,保留每一帧的细节。

多角度摄像机渲染

在一次生成中模拟同时存在的多个摄像机角度。

零样本头像创建

仅凭一张参考照片即可创建写实的个性化头像,无需微调。

音素级精准音频同步

在音素级别同步原生语音和声音生成。

文本转视频与图像转视频

根据文本提示词生成视频,或将任意输入图像制作成视频。

使用场景

🎬

电影级广告

制作最长 30 秒、具有专业运动和音频的品牌视频与产品演示。

🎭

个性化头像视频

仅凭一张照片创建用于入门培训、在线学习或社交媒体的自定义头像主持人。

📱

社交媒体内容

生成适合 TikTok、Reels 和 YouTube Shorts 的竖屏与横屏片段。

🎮

游戏与 VFX 原型

快速制作电影感过场动画和视觉特效序列原型。

📺

广播与流媒体

为流媒体平台和数字媒体制作 1080p、适合广播的内容。

Veo 4 与 Veo 3 对比 — 有哪些新功能?

功能Veo 4Veo 3
最长时长最长 30 秒最长 8 秒
分辨率原生 1080p720p–1080p
音频原生音素级精准音频同步原生音频生成
头像创建单张照片零样本创建不支持
摄像机控制同时多角度渲染单一摄像机路径
状态即将在 Muapi 上线已在 Muapi 上线

常见问题

什么是 Veo 4 API?

Veo 4 API 是 Google DeepMind 的下一代视频生成模型。它可以根据文本提示词或输入图像生成最长 30 秒的写实 1080p 视频,并支持多角度摄像机渲染、零样本个性化头像创建和音素级精准原生音频同步。

Veo 4 与 Veo 3 有什么区别?

Veo 4 在 Veo 3 的基础上提供更长片段(最长 30 秒,而不是 8 秒)、原生 1080p、同时多角度摄像机渲染,以及根据单张参考照片零样本创建头像。Veo 3 目前已在 Muapi 提供文本转视频和图像转视频。

Veo 4 API 什么时候可用?

Veo 4 API 目前正在 Muapi 开发中,请关注探索页面的发布公告。在此期间,Veo 3 已可通过 API 用于高质量 AI 视频生成。

Veo 4 支持原生音频生成吗?

支持。Veo 4 内置音素级精准音频同步,可以在视频输出中生成同步语音、音效和环境声,无需单独后期处理。

Veo 4 支持哪些画幅和分辨率?

Veo 4 原生支持竖屏和横屏 1080p 输出,每次生成最长 30 秒。具体画幅选项将在发布时确认。

正在寻找 Veo 3?

Veo 3 现已上线,文本转视频和图像转视频均可通过 API 使用。