gemini-audio-vision API — MuAPI: AI مدل‌ها

ادغام مدل هوش مصنوعی gemini-audio-vision از طریق API با کارایی بالا و تعرفه مصرف منعطف.

📝

نمای کلی

مدل‌ها

دسترسی برنامه‌نویسی به مدل gemini-audio-vision در پلتفرم MuAPI با کمترین تأخیر و مقیاس‌پذیری آنی.

1تولید محتوای چندرسانه‌ای هوشمند
2ادغام در اپلیکیشن‌ها و محصولات هوش مصنوعی
3گردش‌های کاری و پایپ‌لاین‌های خودکار
💰

قیمت‌گذاری و ارزش

تحلیل هزینه

muapiapp$2.00/M توکن‌های ورودی, $5.00/M توکن‌های خروجی (higher per-run minimum for صوت)

Token-based billing with بدون نیاز به اشتراک — pay only for what you use, including the higher token cost of audio input.

Fal.aiدر دسترس نیست

Fal.ai's vision endpoints are image-only; they do not offer native audio-understanding via Gemini's file API.

Replicateدر دسترس نیست

Replicate does not currently offer a hosted Gemini audio-understanding endpoint.

** مدل‌ها。

⚙️

مشخصات فنی

طرح پیکربندی

پرامپت (دستور متنی)string

تنظیم پارامتر The question or instruction describing what to analyze in the audio. جهت هدایت دقیق فرآیند تولید مدل.

مقدار پیش‌فرضDescribe what is said and any background sounds in this audio, including speaker changes and tone.
آدرس اینترنتی صوتstring

تنظیم پارامتر URL of the audio to analyze. جهت هدایت دقیق فرآیند تولید مدل.

مقدار پیش‌فرضhttps://d3adwkbyhxyrtq.cloudfront.net/webassets/audiomodels/sample-audio.mp3
پرامپت سیستمیstring

اختیاری system-level instruction to guide the model's analysis style.

مقدار پیش‌فرضRespond with a structured JSON analysis, not prose.
مدل هوش مصنوعی(1 )

تنظیم پارامتر Gemini model to use for audio understanding. جهت هدایت دقیق فرآیند تولید مدل.

مقدار پیش‌فرضgemini-2.5-flash
📖

راهنمای پیاده‌سازی

مستندات توسعه‌دهندگان

یک درخواست POST به اندپوینت مدل همراه با کلید دسترسی MuAPI و پارامترهای مورد نظر ارسال فرمایید.

پرسش‌های متداول

سوالات پرتکرار