Whisper 可将语音音频准确转换为文字。上传音频文件 URL,即可获得整洁的转写文本,并可选择Выходные данные带时间戳的字幕文件(SRT 或 VTT),适用于视频字幕、播客转录、会议记录和语音驱动工作流。
About this model
Whisper 是一款稳健的语音转文字模型,可将多种语言的语音准确转换为文字转录。提交音频 URL 后,你可以获得整洁的转写文本、可选的分段时间戳,或可直接使用的 SRT/VTT 字幕文件,非常适合播客、会议、视频字幕以及各种语音驱动工作流。
Cost analysis
| Provider | Cost | Notes |
|---|---|---|
| muapiapp | $0.012 per minute | 只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。 |
| Fal.ai | Недоступно | Fal.ai 不提供托管的 Whisper 端点。 |
| Replicate | ~$0.011 per minute | 价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。 |
只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。
Fal.ai 不提供托管的 Whisper 端点。
价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。
** Competitor pricing is estimated based on similar model architectures and usage tiers.
Configuration schema
| Parameter | Type | Description | Default |
|---|---|---|---|
| Аудио URL | string | 要转录的Аудио文件 URL。Поддерживается的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。 | https://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3 |
| Язык | string | Optional ISO-639-1 language code of the input audio (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection. | en |
| Промпт | string | Optional context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language. | The transcript is a podcast about AI startups. |
| 响应Формат | Enum (5 options) | Выходные данные格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。 | json |
| 温度 | number | 采样温度范围为 0 到 1。值越高,Выходные данные越随机;值越低,Выходные данные越确定。 | 0 |
要转录的Аудио文件 URL。Поддерживается的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。
https://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3Optional ISO-639-1 language code of the input audio (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection.
enOptional context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language.
The transcript is a podcast about AI startups.Выходные данные格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。
json采样温度范围为 0 到 1。值越高,Выходные данные越随机;值越低,Выходные данные越确定。
0Developer documentation
提供音频 URL
audio_url 中传入可公开访问的音频文件链接。支持的格式包括 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。文件大小必须低于 25 MB。选择响应格式
json / text 返回纯文本转写。srt 和 vtt 返回带时间戳的字幕文件,可直接导入视频编辑器。verbose_json 提供每个分段的元数据(start、end、text、language)。(可选)调节识别
language 设置为 ISO-639-1 代码(例如 en、es、hi),跳过自动检测并提高识别准确度。prompt 引导转写采用特定的拼写、术语或风格。temperature(0.0 - 1.0):数值越低越确定,数值越高越灵活。提交并获取结果
Frequently asked
Whisper 可将音频转录为文字,支持多种语言,也可以生成带时间戳的字幕格式。
支持 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。每个文件必须低于 25 MB。
费用根据音频时长计算,并向上取整到下一分钟。每次请求最低按 1 分钟计费。
可以。将 `response_format` 设置为 `srt` 或 `vtt`,即可获得包含每个分段起止时间戳的可直接使用的字幕文件。
会。将 `language` 字段留空即可自动检测;也可以指定 ISO-639-1 代码,将识别限定为已知语言以获得更好的准确度。