Jelajahi dan integrasikan model AI gemini-audio-vision melalui MuAPI. Dapatkan inferensi berkecepatan tinggi dan harga kompetitif.
About this model
Model gemini-audio-vision menyediakan kemampuan generasi AI mutakhir di platform MuAPI.
Cost analysis
| Provider | Cost | Notes |
|---|---|---|
| muapiapp | $2.00/M input tokens, $5.00/M output tokens (higher per-run minimum for audio) | Token-based billing with no subscription — pay only for what you use, including the higher token cost of audio input. |
| Fal.ai | Tidak tersedia | Fal.ai 的视觉端点仅支持图像;它们无法通过 Gemini 文件 API 原生理解音频。 |
| Replicate | Tidak tersedia | Replicate 目前不提供托管的 Gemini 音频理解端点。 |
Token-based billing with no subscription — pay only for what you use, including the higher token cost of audio input.
Fal.ai 的视觉端点仅支持图像;它们无法通过 Gemini 文件 API 原生理解音频。
Replicate 目前不提供托管的 Gemini 音频理解端点。
** Competitor pricing is estimated based on similar model architectures and usage tiers.
Configuration schema
| Parameter | Type | Description | Default |
|---|---|---|---|
| Prompt Teks | string | 描述要分析的Audio内容的问题或指令。 | Describe what is said and any background sounds in this audio, including speaker changes and tone. |
| Audio / Suara URL | string | 要分析的Audio URL。 | https://d3adwkbyhxyrtq.cloudfront.net/webassets/audiomodels/sample-audio.mp3 |
| 系统Prompt Teks | string | Optional system-level instruction to guide the model's analysis style. | Respond with a structured JSON analysis, not prose. |
| 模型 | Enum (1 options) | 用于Audio理解的 Gemini 模型。 | gemini-2.5-flash |
描述要分析的Audio内容的问题或指令。
Describe what is said and any background sounds in this audio, including speaker changes and tone.要分析的Audio URL。
https://d3adwkbyhxyrtq.cloudfront.net/webassets/audiomodels/sample-audio.mp3Optional system-level instruction to guide the model's analysis style.
Respond with a structured JSON analysis, not prose.用于Audio理解的 Gemini 模型。
gemini-2.5-flashDeveloper documentation
Panduan integrasi cepat untuk gemini-audio-vision. Hubungkan dengan kunci API MuAPI Anda dan mulai lakukan panggilan inferensi.
Frequently asked
它利用 Google Gemini 的原生音频理解能力分析完整音频文件,并返回涵盖语音内容、说话人变化、语气、背景声音和音乐的详细文本描述。
支持 MP3、WAV 和 M4A 等标准音频格式。音频越长,处理时间和成本通常越高,因为 Gemini 的 token 用量会随音频时长增长。
价格按 token 计费。Google 对音频输入收取高于文本、图像或视频的单 token 费率,因此每次运行的最低收费高于 Muapi 的纯文本 Gemini 端点。实际成本根据 API 响应计算,并在每次调用后从你的钱包中扣除。
如果提示词要求转录,就可以。Gemini Audio Vision 可以根据提示词和 system_prompt 的写法生成逐字转录、摘要或结构化分析。
可以。使用 system_prompt 字段 instruct 模型以特定格式响应,例如结构化 JSON、项目符号列表或单句摘要。
处理时间取决于音频长度和复杂度。短片段通常在几秒内完成;较长音频可能需要一分钟,因为分析开始前必须上传并摄取完整文件。