模型/音频/语音转文字
已上线OpenAI + Google2 个模型

语音转文字 API — AI 转录与音频分析

Muapi 语音转文字 API 通过统一 REST 端点将语音转换为文本。使用 Whisper 进行准确的多语言转录,并可生成带时间戳的 SRT/VTT 字幕;也可以使用 Gemini Audio Vision,根据提示分析语气、说话人和背景声音。一个 API 密钥、一个提交与轮询流程,价格低至每分钟 $0.012。

已上线的音频模型转录与基于提示词的音频理解2 个模型
音频已上线
已上线

OpenAI Whisper

从音频 URL 进行准确的多语言转录,可输出纯文本、详细 JSON 或带时间戳的 SRT/VTT 字幕。

Audio → text
$0.012 / minute
试用模型
音频已上线
已上线

Gemini Audio Vision

超越普通转录的原生音频理解:可询问语音、语气、说话人变化、音乐或背景声音,并返回详细的文本分析。

Audio → analysis
$2.00/M in · $5.00/M out
试用模型

什么是语音转文字 API?

语音转文字 API 通过 HTTP 请求将音频录音转换为书面文本。提交音频文件 URL 即可获得转录结果,无需自行搭建手动转录或音频处理流程。

Muapi 通过平台统一的 REST 模式提供 Whisper 和 Gemini Audio Vision。Whisper 适合多语言转录和字幕生成;当你需要分析、摘要或对整段录音进行结构化观察时,Gemini Audio Vision 可以接收自定义提示词。

两个端点共用一个 Muapi API 密钥和标准的异步请求与轮询生命周期。根据任务选择模型,并仅为实际运行的生成付费。

语音转文字 API 功能

多语言转录

Whisper 支持数十种语言的语音转录,也可以传入可选的 ISO-639-1 语言提示。

带时间戳的字幕

请求 SRT 或 VTT 输出用于视频字幕,也可以使用 verbose_json 获取分段时间和元数据。

基于提示词的音频分析

Gemini Audio Vision 可以回答关于音频文件的具体问题,而不只是返回一份平面转录。

说话人与声音识别

让 Gemini 识别录音中的说话人变化、语气、情绪、音乐和其他背景声音。

会议与播客流程

将访谈、会议、讲座和播客转换为可搜索的转录、笔记或下游结构化输入。

统一异步集成

与 Muapi 的其他模型一样,使用相同的 API 密钥、上传流程、提交端点和结果轮询协议。

语音转文字应用场景

视频字幕

为视频、课程、播客和社交媒体短片生成带时间戳的 SRT 或 VTT 文件。

会议智能

转录录音,并针对决定、说话人、行动事项或语气提出具体问题。

语音驱动应用

将转录结果传入搜索、智能体、摘要或自动化工作流中的其他文本生成步骤。

语音转文字模型对比

模型提供方价格适合场景
OpenAI WhisperOpenAI$0.012 / 分钟准确的多语言转录和字幕
Gemini Audio VisionGoogle$2.00/M 输入 · $5.00/M 输出 token分析语音、说话人、语气和背景声音

语音转文字 API 代码示例

提交带有模型专属字段的音频 URL,获得请求 ID,然后轮询标准结果端点,直到转录或分析完成。

1. 使用 OpenAI Whisper 转录

curl -X POST https://api.muapi.ai/api/v1/openai-whisper -H "x-api-key: YOUR_API_KEY" -H "Content-Type: application/json" -d '{"audio_url":"https://example.com/meeting.mp3","language":"en","response_format":"verbose_json"}'

# Response: {"request_id":"REQUEST_ID"}
curl https://api.muapi.ai/api/v1/predictions/REQUEST_ID/result -H "x-api-key: YOUR_API_KEY"

传入 audio_url,并根据需要设置 language、response_format、prompt 或 temperature。需要字幕时使用 srt 或 vtt。

2. 使用 Gemini Audio Vision 分析音频

curl -X POST https://api.muapi.ai/api/v1/gemini-audio-vision -H "x-api-key: YOUR_API_KEY" -H "Content-Type: application/json" -d '{"prompt":"Transcribe this audio and describe speaker changes, tone, and background sounds.","audio_url":"https://example.com/interview.mp3","model":"gemini-2.5-flash"}'

# Response: {"request_id":"REQUEST_ID"}
curl https://api.muapi.ai/api/v1/predictions/REQUEST_ID/result -H "x-api-key: YOUR_API_KEY"

传入 audio_url 和提示词,说明需要的转录、摘要、说话人或声音分析。结果会返回生成的文本。

语音转文字 API 常见问题

什么是语音转文字 API?

语音转文字 API 通过 HTTP 请求将音频录音转换为书面文本。Muapi 提供适合准确转录的 Whisper,以及适合基于提示词理解音频的 Gemini Audio Vision。

Whisper 可以返回字幕而不只是纯文本吗?

可以。将 response_format 设置为 srt 或 vtt 可生成带时间戳的字幕;使用 verbose_json 可以获取分段元数据和时间信息。

Gemini Audio Vision 与普通转录有什么区别?

Gemini Audio Vision 接收提示词并理解整段录音。除了转录,还可以总结内容、识别说话人、描述语气,并分析背景音乐或声音。

语音转文字的价格是多少?

Whisper 价格为每分钟音频 $0.012,最低按一分钟计费。Gemini Audio Vision 按 token 计费,输入每百万 token $2.00,输出每百万 token $5.00。

Whisper 支持哪些音频格式?

Whisper 支持 mp3、mp4、mpeg、mpga、m4a、wav 和 webm 等常见格式,上传文件必须小于 25 MB。

如何获得语音转文字 API 访问权限?

创建 Muapi 账户,从控制面板生成 API 密钥,然后调用任一端点即可,无需等待名单。

准备好转录音频了吗?

创建一个 Muapi API 密钥,从 Whisper 转录或 Gemini Audio Vision 分析开始。