gemini-audio-vision API — MuAPI: AI Large Language Models

Integrera AI-modellen gemini-audio-vision via ett högpresterande API med låg latens och ren förbrukningsbaserad prissättning.

📝

Overview

About this model

Få tillgång till gemini-audio-vision programmatiskt på MuAPI med omedelbar skalbarhet, automatisk redundans och minimal latens.

1Automatiserat multimedieskapande
2Skalbar produktintegration
3Flerstegs AI-arbetsflöden
💰

Pricing & Value

Cost analysis

muapiapp$2.00/M 输入 Token, $5.00/M 输出 Token (higher per-run minimum for 音频)

Token-based billing with 无需订阅 — pay only for what you use, including the higher token cost of audio input.

Fal.aiInte tillgänglig

Fal.ai's vision endpoints are image-only; they do not offer native audio-understanding via Gemini's file API.

ReplicateInte tillgänglig

Replicate does not currently offer a hosted Gemini audio-understanding endpoint.

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

Prompt (Instruktion)string

The question or instruction describing what to analyze in the audio.

Default ValueDescribe what is said and any background sounds in this audio, including speaker changes and tone.
Ljud-URLstring

URL of the audio to analyze.

Default Valuehttps://d3adwkbyhxyrtq.cloudfront.net/webassets/audiomodels/sample-audio.mp3
System Promptstring

Optional system-level instruction to guide the model's analysis style.

Default ValueRespond with a structured JSON analysis, not prose.
ModellEnum (1 options)

Gemini model to use for audio understanding.

Default Valuegemini-2.5-flash
📖

Implementation Guide

Developer documentation

Skicka en autentiserad POST-förfrågan till slutpunkten med dina valda parametrar och din MuAPI-nyckel.

Common Questions

Frequently asked