Whisper 可将语音音频准确转换为文字。上传音频文件 URL,即可获得整洁的转写文本,并可选择输出带时间戳的字幕文件(SRT 或 VTT),适用于视频字幕、播客转录、会议记录和语音驱动工作流。
关于此模型
Whisper 是一款稳健的语音转文字模型,可将多种语言的语音准确转换为文字转录。提交音频 URL 后,你可以获得整洁的转写文本、可选的分段时间戳,或可直接使用的 SRT/VTT 字幕文件,非常适合播客、会议、视频字幕以及各种语音驱动工作流。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.012 每分钟 | 只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。 |
| Fal.ai | 暂不可用 | Fal.ai 不提供托管的 Whisper 端点。 |
| Replicate | ~$0.011 每分钟 | 价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。 |
只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。
Fal.ai 不提供托管的 Whisper 端点。
价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 音频 URL | string | 要转录的音频文件 URL。支持的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。 | https://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3 |
| 语言 | string | 可选的 ISO-639-1 language code of the 输入音频 (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection. | en |
| 提示词 | string | 可选的 context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language. | The transcript is a podcast about AI startups. |
| 响应格式 | 枚举(5 个选项) | 输出格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。 | json |
| 温度 | number | 采样温度范围为 0 到 1。值越高,输出越随机;值越低,输出越确定。 | 0 |
要转录的音频文件 URL。支持的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。
https://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3可选的 ISO-639-1 language code of the 输入音频 (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection.
en可选的 context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language.
The transcript is a podcast about AI startups.输出格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。
json采样温度范围为 0 到 1。值越高,输出越随机;值越低,输出越确定。
0开发者文档
提供音频 URL
audio_url 中传入可公开访问的音频文件链接。支持的格式包括 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。文件大小必须低于 25 MB。选择响应格式
json / text 返回纯文本转写。srt 和 vtt 返回带时间戳的字幕文件,可直接导入视频编辑器。verbose_json 提供每个分段的元数据(start、end、text、language)。(可选)调节识别
language 设置为 ISO-639-1 代码(例如 en、es、hi),跳过自动检测并提高识别准确度。prompt 引导转写采用特定的拼写、术语或风格。temperature(0.0 - 1.0):数值越低越确定,数值越高越灵活。提交并获取结果
常见问答
Whisper 可将音频转录为文字,支持多种语言,也可以生成带时间戳的字幕格式。
支持 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。每个文件必须低于 25 MB。
费用根据音频时长计算,并向上取整到下一分钟。每次请求最低按 1 分钟计费。
可以。将 `response_format` 设置为 `srt` 或 `vtt`,即可获得包含每个分段起止时间戳的可直接使用的字幕文件。
会。将 `language` 字段留空即可自动检测;也可以指定 ISO-639-1 代码,将识别限定为已知语言以获得更好的准确度。