OpenAI Whisper 语音转文字: AI 工具

Whisper 可将语音音频准确转换为文字。上传音频文件 URL,即可获得整洁的转写文本,并可选择输出带时间戳的字幕文件(SRT 或 VTT),适用于视频字幕、播客转录、会议记录和语音驱动工作流。

📝

概览

关于此模型

Whisper 是一款稳健的语音转文字模型,可将多种语言的语音准确转换为文字转录。提交音频 URL 后,你可以获得整洁的转写文本、可选的分段时间戳,或可直接使用的 SRT/VTT 字幕文件,非常适合播客、会议、视频字幕以及各种语音驱动工作流。

1播客转录:将长篇音频节目转换为可搜索、可分享的文字。
2视频字幕:为 YouTube、TikTok 和 Reels 生成 SRT 或 VTT 字幕文件。
3会议记录:自动转录录制的通话并生成书面会议纪要。
4内容再利用:将语音内容转换为博客文章、长文或社交媒体短文案。
5语音工作流:为语音控制助手、听写工具和无障碍功能提供支持。
💰

价格与价值

成本分析

muapiapp$0.012 每分钟

只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。

Fal.ai暂不可用

Fal.ai 不提供托管的 Whisper 端点。

Replicate~$0.011 每分钟

价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

音频 URLstring

要转录的音频文件 URL。支持的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。

默认值https://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3
语言string

可选的 ISO-639-1 language code of the 输入音频 (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection.

默认值en
提示词string

可选的 context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language.

默认值The transcript is a podcast about AI startups.
响应格式枚举(5 个选项)

输出格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。

默认值json
温度number

采样温度范围为 0 到 1。值越高,输出越随机;值越低,输出越确定。

默认值0
📖

实施指南

开发者文档

如何使用 Whisper

  1. 提供音频 URL

    • audio_url 中传入可公开访问的音频文件链接。支持的格式包括 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。文件大小必须低于 25 MB。
  2. 选择响应格式

    • json / text 返回纯文本转写。
    • srtvtt 返回带时间戳的字幕文件,可直接导入视频编辑器。
    • verbose_json 提供每个分段的元数据(start、end、text、language)。
  3. (可选)调节识别

    • language 设置为 ISO-639-1 代码(例如 eneshi),跳过自动检测并提高识别准确度。
    • 使用 prompt 引导转写采用特定的拼写、术语或风格。
    • 调整 temperature(0.0 - 1.0):数值越低越确定,数值越高越灵活。
  4. 提交并获取结果

    • 提交请求,然后轮询预测端点获取结果。系统按处理的音频分钟数计费,因此音频片段越短,成本越低。

常见问题

常见问答

这个模型有什么作用?

Whisper 可将音频转录为文字,支持多种语言,也可以生成带时间戳的字幕格式。

支持哪些音频格式?

支持 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。每个文件必须低于 25 MB。

价格如何计算?

费用根据音频时长计算,并向上取整到下一分钟。每次请求最低按 1 分钟计费。

可以获得字幕而不是纯文本吗?

可以。将 `response_format` 设置为 `srt` 或 `vtt`,即可获得包含每个分段起止时间戳的可直接使用的字幕文件。

模型会自动检测语言吗?

会。将 `language` 字段留空即可自动检测;也可以指定 ISO-639-1 代码,将识别限定为已知语言以获得更好的准确度。