OpenAI Whisper 语音转文字: أداة ذكاء اصطناعي

Whisper 可将语音音频准确转换为文字。上传音频文件 URL,即可获得整洁的转写文本,并可选择المخرجات带时间戳的字幕文件(SRT 或 VTT),适用于视频字幕、播客转录、会议记录和语音驱动工作流。

📝

Overview

About this model

Whisper 是一款稳健的语音转文字模型,可将多种语言的语音准确转换为文字转录。提交音频 URL 后,你可以获得整洁的转写文本、可选的分段时间戳,或可直接使用的 SRT/VTT 字幕文件,非常适合播客、会议、视频字幕以及各种语音驱动工作流。

1播客转录:将长篇音频节目转换为可搜索、可分享的文字。
2视频字幕:为 YouTube、TikTok 和 Reels 生成 SRT 或 VTT 字幕文件。
3会议记录:自动转录录制的通话并生成书面会议纪要。
4内容再利用:将语音内容转换为博客文章、长文或社交媒体短文案。
5语音工作流:为语音控制助手、听写工具和无障碍功能提供支持。
💰

Pricing & Value

Cost analysis

muapiapp$0.012 per minute

只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。

Fal.aiغير متوفر

Fal.ai 不提供托管的 Whisper 端点。

Replicate~$0.011 per minute

价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

الصوت URLstring

要转录的الصوت文件 URL。مدعوم的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。

Default Valuehttps://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3
اللغةstring

Optional ISO-639-1 language code of the input audio (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection.

Default Valueen
الموجه النصيstring

Optional context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language.

Default ValueThe transcript is a podcast about AI startups.
响应التنسيقEnum (5 options)

المخرجات格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。

Default Valuejson
温度number

采样温度范围为 0 到 1。值越高,المخرجات越随机;值越低,المخرجات越确定。

Default Value0
📖

Implementation Guide

Developer documentation

طريقة الاستخدام Whisper

  1. 提供音频 URL

    • audio_url 中传入可公开访问的音频文件链接。支持的格式包括 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。文件大小必须低于 25 MB。
  2. 选择响应格式

    • json / text 返回纯文本转写。
    • srtvtt 返回带时间戳的字幕文件,可直接导入视频编辑器。
    • verbose_json 提供每个分段的元数据(start、end、text、language)。
  3. (可选)调节识别

    • language 设置为 ISO-639-1 代码(例如 eneshi),跳过自动检测并提高识别准确度。
    • 使用 prompt 引导转写采用特定的拼写、术语或风格。
    • 调整 temperature(0.0 - 1.0):数值越低越确定,数值越高越灵活。
  4. 提交并获取结果

    • 提交请求,然后轮询预测端点获取结果。系统按处理的音频分钟数计费,因此音频片段越短,成本越低。

Common Questions

Frequently asked

这个模型有什么作用?

Whisper 可将音频转录为文字,支持多种语言,也可以生成带时间戳的字幕格式。

支持哪些音频格式?

支持 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。每个文件必须低于 25 MB。

价格如何计算?

费用根据音频时长计算,并向上取整到下一分钟。每次请求最低按 1 分钟计费。

可以获得字幕而不是纯文本吗?

可以。将 `response_format` 设置为 `srt` 或 `vtt`,即可获得包含每个分段起止时间戳的可直接使用的字幕文件。

模型会自动检测语言吗?

会。将 `language` 字段留空即可自动检测;也可以指定 ISO-639-1 代码,将识别限定为已知语言以获得更好的准确度。