gemini-audio-vision API | MuAPI: AI Large Language Models

Jelajahi dan integrasikan model AI gemini-audio-vision melalui MuAPI. Dapatkan inferensi berkecepatan tinggi dan harga kompetitif.

📝

Overview

About this model

Model gemini-audio-vision menyediakan kemampuan generasi AI mutakhir di platform MuAPI.

1Aplikasi produksi dengan gemini-audio-vision
2Aplikasi produksi dengan gemini-audio-vision
3Aplikasi produksi dengan gemini-audio-vision
4Aplikasi produksi dengan gemini-audio-vision
5Aplikasi produksi dengan gemini-audio-vision
💰

Pricing & Value

Cost analysis

muapiapp$2.00/M input tokens, $5.00/M output tokens (higher per-run minimum for audio)

Token-based billing with no subscription — pay only for what you use, including the higher token cost of audio input.

Fal.aiTidak tersedia

Fal.ai 的视觉端点仅支持图像;它们无法通过 Gemini 文件 API 原生理解音频。

ReplicateTidak tersedia

Replicate 目前不提供托管的 Gemini 音频理解端点。

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

Prompt Teksstring

描述要分析的Audio内容的问题或指令。

Default ValueDescribe what is said and any background sounds in this audio, including speaker changes and tone.
Audio / Suara URLstring

要分析的Audio URL。

Default Valuehttps://d3adwkbyhxyrtq.cloudfront.net/webassets/audiomodels/sample-audio.mp3
系统Prompt Teksstring

Optional system-level instruction to guide the model's analysis style.

Default ValueRespond with a structured JSON analysis, not prose.
模型Enum (1 options)

用于Audio理解的 Gemini 模型。

Default Valuegemini-2.5-flash
📖

Implementation Guide

Developer documentation

Panduan integrasi cepat untuk gemini-audio-vision. Hubungkan dengan kunci API MuAPI Anda dan mulai lakukan panggilan inferensi.

Common Questions

Frequently asked

Gemini Audio Vision 可以做什么?

它利用 Google Gemini 的原生音频理解能力分析完整音频文件,并返回涵盖语音内容、说话人变化、语气、背景声音和音乐的详细文本描述。

支持哪些音频格式和时长?

支持 MP3、WAV 和 M4A 等标准音频格式。音频越长,处理时间和成本通常越高,因为 Gemini 的 token 用量会随音频时长增长。

如何计算价格?

价格按 token 计费。Google 对音频输入收取高于文本、图像或视频的单 token 费率,因此每次运行的最低收费高于 Muapi 的纯文本 Gemini 端点。实际成本根据 API 响应计算,并在每次调用后从你的钱包中扣除。

它会逐字转录语音吗?

如果提示词要求转录,就可以。Gemini Audio Vision 可以根据提示词和 system_prompt 的写法生成逐字转录、摘要或结构化分析。

可以控制输出格式吗?

可以。使用 system_prompt 字段 instruct 模型以特定格式响应,例如结构化 JSON、项目符号列表或单句摘要。

请求需要多长时间?

处理时间取决于音频长度和复杂度。短片段通常在几秒内完成;较长音频可能需要一分钟,因为分析开始前必须上传并摄取完整文件。