Gemini Audio Vision 音频理解: AI Large Language Models

使用 Google Gemini Audio Vision 分析音频。从音频 URL 获取详细的语音、语气和声音事件分析。免费试用,按次生成付费。

📝

Overview

About this model

Gemini Audio Vision 将 Google Gemini 的原生音频理解能力带入 Muapi API。Gemini 不再依赖单独的转录步骤,而是摄取完整音频文件并端到端地进行推理,分析语音内容、说话人变化、语气和情绪、背景声音、音乐与静音。提供音频 URL 和Промпт(或结构化系统Промпт)后,它会返回详细的文本分析,因此适合播客摘要、通话质量检查、内容审核和声音事件检测。价格按 token 计费,类似于 Gemini Video VisionGemini 2.5 Flash,每次运行的最低收费会反映 Google 针对音频Входные параметры设置的更高单 token 费率。

1通话/会议质量检查:自动检查录音通话或会议的语气、情绪以及脚本遵循情况。
2内容审核:标记上传或生成音频中的不安全、露骨或违反策略的内容。
3播客摘要:从原始音频文件生成章节摘要、精彩引语或节目说明。
4声音事件检测:识别音轨中的背景声音、音乐提示或静音间隔。
5无障碍字幕:为无障碍场景生成详细转录或非语音音频描述。
💰

Pricing & Value

Cost analysis

muapiapp$2.00/M input tokens, $5.00/M output tokens (higher per-run minimum for audio)

Token-based billing with no subscription — pay only for what you use, including the higher token cost of audio input.

Fal.aiНедоступно

Fal.ai 的视觉端点仅支持图像;它们无法通过 Gemini 文件 API 原生理解音频。

ReplicateНедоступно

Replicate 目前不提供托管的 Gemini 音频理解端点。

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

Промптstring

描述要分析的Аудио内容的问题或指令。

Default ValueDescribe what is said and any background sounds in this audio, including speaker changes and tone.
Аудио URLstring

要分析的Аудио URL。

Default Valuehttps://d3adwkbyhxyrtq.cloudfront.net/webassets/audiomodels/sample-audio.mp3
系统Промптstring

Optional system-level instruction to guide the model's analysis style.

Default ValueRespond with a structured JSON analysis, not prose.
模型Enum (1 options)

用于Аудио理解的 Gemini 模型。

Default Valuegemini-2.5-flash
📖

Implementation Guide

Developer documentation

Как использовать Gemini Audio Vision

  1. 提供音频 URL:将音频托管在公开可访问的 URL(例如 S3 或 CDN 链接)上,并将其作为 audio_url 传入。

  2. 编写Промпт:描述希望分析的内容——转录、结构化 JSON 拆解,或关于音频内容(语气、说话人、背景声音)的具体问题。

  3. 可选地设置系统Промпт:使用 system_prompt 控制Выходные данные格式,例如“仅返回结构化 JSON,不要 prose”。

  4. 选择模型:当前支持的选项是 gemini-2.5-flash,适合大多数转录、质量检查和摘要任务,速度快且准确。

  5. 提交并轮询:与所有 Muapi 端点一样,提交请求并轮询 /predictions/{request_id}/result,直到 statuscompleted

Python:

import requests, time

API_KEY = "your_api_key_here"
headers = {"x-api-key": API_KEY, "Content-Type": "application/json"}

r = requests.post("https://api.muapi.ai/api/v1/gemini-audio-vision", headers=headers,
    json={
        "prompt": "Transcribe this audio and describe the speaker's tone and any background sounds.",
        "audio_url": "https://example.com/my-audio.mp3"
    })
request_id = r.json()["request_id"]

while True:
    result = requests.get(f"https://api.muapi.ai/api/v1/predictions/{request_id}/result", headers=headers).json()
    if result["status"] == "completed":
        print(result["output"]["text"])
        break
    time.sleep(3)

cURL:

curl -X POST https://api.muapi.ai/api/v1/gemini-audio-vision \
  -H "x-api-key: YOUR_API_KEY" -H "Content-Type: application/json" \
  -d '{"prompt": "Transcribe and describe this audio in detail.", "audio_url": "https://example.com/my-audio.mp3"}'

较长的音频文件处理时间更长,因为 Gemini 需要上传并摄取完整文件——根据音频时长,预计响应时间从几秒到大约一分钟不等。

Common Questions

Frequently asked

Gemini Audio Vision 可以做什么?

它利用 Google Gemini 的原生音频理解能力分析完整音频文件,并返回涵盖语音内容、说话人变化、语气、背景声音和音乐的详细文本描述。

支持哪些音频格式和时长?

支持 MP3、WAV 和 M4A 等标准音频格式。音频越长,处理时间和成本通常越高,因为 Gemini 的 token 用量会随音频时长增长。

如何计算价格?

价格按 token 计费。Google 对音频Входные параметры收取高于文本、图像或视频的单 token 费率,因此每次运行的最低收费高于 Muapi 的纯文本 Gemini 端点。实际成本根据 API 响应计算,并在每次调用后从你的钱包中扣除。

它会逐字转录语音吗?

如果Промпт要求转录,就可以。Gemini Audio Vision 可以根据Промпт和 system_prompt 的写法生成逐字转录、摘要或结构化分析。

可以控制Выходные данные格式吗?

可以。使用 system_prompt 字段 instruct 模型以特定格式响应,例如结构化 JSON、项目符号列表或单句摘要。

请求需要多长时间?

处理时间取决于音频长度和复杂度。短片段通常在几秒内完成;较长音频可能需要一分钟,因为分析开始前必须上传并摄取完整文件。