Gemini Omni 角色: AI 图像编辑器

根据单张参考图和文本描述生成可复用的角色。还可以附加使用 Gemini Omni 音频创建的语音配置,让角色在未来的视频生成中保持一致的声音。

📝

概览

关于此模型

将一张参考照片和文本描述转换为可复用的角色,并生成唯一 ID 和角色图像。还可以附加语音配置,让角色在未来的视频生成中保持一致的声音。

1故事创作:创建可在 AI 生成视频叙事中重复使用的命名角色。
2品牌吉祥物:根据概念图和描述,为营销视频构建视觉角色资产。
3游戏与动画原型:在完整制作前,根据参考艺术快速生成角色视觉效果。
💰

价格与价值

成本分析

muapiapp免费

创建角色不收费。

Fal.ai暂不可用

不提供 Gemini Omni 角色创建功能。

Replicate暂不可用

不提供 Gemini Omni 角色创建功能。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

角色描述string

描述角色的外观、身份、风格和个性。

默认值A young woman with short silver hair, wearing a dark trench coat, confident and composed demeanor.
参考图像array

准确提供 1 张角色参考图像。最大 20 MB。必须是可公开访问的 URL。

默认值https://d3adwkbyhxyrtq.cloudfront.net/ai-images/186/712345784292/4a8c5c70-abcc-4920-873e-b0e219986453.jpg
角色名称string

可选的 display name for the character.

默认值Aria
声音配置 IDarray

可选的 list of voice profile IDs from Gemini Omni Audio to associate with this character.

默认值a8f1c2d3e4f5b6a7
📖

实施指南

开发者文档

如何使用 Gemini Omni 角色

  1. 提供参考图:通过 images_list 上传一张图像(必须正好 1 张,最大 20 MB,并且是可公开访问的 URL)。这张图像是角色的视觉锚点。

  2. 描述角色:在 descriptions 中填写外观、身份、风格和个性细节。

  3. 为角色命名 (可选):设置 character_name 作为人类可读的标签。

  4. 附加语音 (可选):在 audio_ids 中传入一个或多个 audio_id 值——这些值来自 Gemini Omni 音频端点,可让角色保持一致的声音。

  5. 使用结果:响应会在 outputs 中包含 character_idcharacter_name 和图像 URL。保存 character_id,以便在未来支持角色驱动生成的视频流程中使用。

常见问题

常见问答

可以提供多少张参考图?

必须且只能提供一张图像。图像必须是可公开访问的 URL,且大小不超过 20 MB。

`audio_ids` 从哪里来?

语音配置 ID 通过 Gemini Omni 音频端点创建。先调用该端点登记语音,然后将返回的 `audio_id` 传到这里。

输出图像展示什么?

`outputs` 中返回的图像 URL 是生成的角色图像——根据参考照片和描述得到的角色视觉呈现。