Gemini Omni 语音配置: AI 工具

创建带名称的语音配置,并自定义音色、风格和情绪。返回的语音 ID 可用于 Gemini Omni 视频生成,为视频中的角色分配一致的声音。

📝

概览

关于此模型

选择预设语音,并为其添加关于音色、风格和情绪的自定义描述,即可创建带名称的语音配置。生成的语音 ID 可以附加到 Gemini Omni 视频生成中,为角色在多个视频里提供一致且可复用的声音。

1角色一致性:为多个生成视频中的重复出现角色分配同一个声音。
2叙事品牌:为不同的品牌人格或节目角色建立带名称的语音配置库。
3本地化准备:在批量制作视频之前,为不同市场登记独特的语音风格。
💰

价格与价值

成本分析

muapiapp免费

创建语音配置文件不收费。

Fal.ai暂不可用

不提供 Gemini Omni 音频配置文件创建功能。

Replicate暂不可用

不提供 Gemini Omni 音频配置文件创建功能。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

基础声音枚举(30 个选项)

用作此配置基础的预设声音。

默认值-
配置名称string

此声音配置的名称。最多 210 个字符。

默认值My Custom Voice
声音描述string

描述声音的音色、风格和情绪。最多 20,000 个字符。

默认值Warm, calm tone with a slight British accent and gentle pacing.
对话示例string

声音要说的简短示例句子。最多 120 个字符。

默认值Hello, I am here to guide you through today's journey.
📖

实施指南

开发者文档

如何使用 Gemini Omni 音频

  1. 选择基础语音:从 30 个预设语音中选择一个(例如 achernarcharonzephyr),使其最符合你想要的声音特征。

  2. 命名配置:为它设置一个易记的名称(最多 210 个字符)——稍后返回的 ID 会带有这个名称,便于引用。

  3. 描述语音 (可选):添加 voice_description(最多 20,000 个字符),指定音色、语速、口音或情绪基调。

  4. 添加示例对白 (可选):提供一句简短示例句(最多 120 个字符),帮助固定语音风格。

  5. 提交并保存 ID:响应会返回一个 audio_id。请保存它——在使用 Gemini Omni 视频生成端点时,需要将该 ID 传入 audio_ids 字段。

常见问题

常见问答

此端点的输出是什么?

一个 `audio_id` 字符串和配置名称。这个 ID 不是可播放的音频文件,而是传入 Gemini Omni 视频端点的语音配置令牌。

如何在视频中使用语音 ID?

调用 Gemini Omni 文生视频、图生视频或视频编辑端点时,将 `audio_id` 值传入 `audio_ids` 字段。

可以创建多个语音配置吗?

可以——每次调用都会创建一个配置并返回唯一 ID。你可以建立配置库,并在不同视频项目中重复使用。