OpenAI Whisper 语音转文字: AIツール

Whisper 可将语音音频准确转换为文字。上传音频文件 URL,即可获得整洁的转写文本,并可选择出力带时间戳的字幕文件(SRT 或 VTT),适用于视频字幕、播客转录、会议记录和语音驱动工作流。

📝

概要

このモデルについて

Whisper 是一款稳健的语音转文字模型,可将多种语言的语音准确转换为文字转录。提交音频 URL 后,你可以获得整洁的转写文本、可选的分段时间戳,或可直接使用的 SRT/VTT 字幕文件,非常适合播客、会议、视频字幕以及各种语音驱动工作流。

1播客转录:将长篇音频节目转换为可搜索、可分享的文字。
2视频字幕:为 YouTube、TikTok 和 Reels 生成 SRT 或 VTT 字幕文件。
3会议记录:自动转录录制的通话并生成书面会议纪要。
4内容再利用:将语音内容转换为博客文章、长文或社交媒体短文案。
5语音工作流:为语音控制助手、听写工具和无障碍功能提供。
💰

料金と価値

コスト分析

muapiapp$0.012 per minute

只需为转写的音频付费,按分钟计费,最低按 1 分钟计算。

Fal.ai提供なし

Fal.ai 不提供托管的 Whisper 端点。

Replicate~$0.011 per minute

价格随底层 GPU 变化;muapiapp 提供固定且可预测的按分钟费率。

** 競合サービスの料金は類似のモデル構成および利用ティアに基づいて算出された推定値です。

⚙️

技術詳細

設定スキーマ

音声 URLstring

要转录的音声文件 URL。対応的格式:mp3、mp4、mpeg、mpga、m4a、wav、webm。文件必须小于 25 MB。

デフォルト値https://d3adwkbyhxyrtq.cloudfront.net/ai-audio/sample.mp3
言語string

Optional ISO-639-1 language code of the input audio (e.g. 'en', 'es', 'hi'). Leave empty for automatic detection.

デフォルト値en
プロンプトstring

Optional context to guide the model's style or to spell out unusual words and proper nouns. Should match the audio language.

デフォルト値The transcript is a podcast about AI startups.
响应フォーマットEnum(5個の選択肢)

出力格式。'json' / 'text' 返回纯文本转录,'srt' / 'vtt' 返回带时间戳的字幕,'verbose_json' 包含每个片段的元数据。

デフォルト値json
温度number

采样温度范围为 0 到 1。值越高,出力越随机;值越低,出力越确定。

デフォルト値0
📖

実装ガイド

開発者ドキュメント

使用方法 Whisper

  1. 提供音频 URL

    • audio_url 中传入可公开访问的音频文件链接。支持的格式包括 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。文件大小必须低于 25 MB。
  2. 选择响应格式

    • json / text 返回纯文本转写。
    • srtvtt 返回带时间戳的字幕文件,可直接导入视频编辑器。
    • verbose_json 提供每个分段的元数据(start、end、text、language)。
  3. (可选)调节识别

    • language 设置为 ISO-639-1 代码(例如 eneshi),跳过自动检测并提高识别准确度。
    • 使用 prompt 引导转写采用特定的拼写、术语或风格。
    • 调整 temperature(0.0 - 1.0):数值越低越确定,数值越高越灵活。
  4. 提交并获取结果

    • リクエスト送信,然后轮询预测端点获取结果。系统按处理的音频分钟数计费,因此音频片段越短,成本越低。

よくある質問

FAQ

这个模型有什么作用?

Whisper 可将音频转录为文字,支持多种语言,也可以生成带时间戳的字幕格式。

支持哪些音频格式?

支持 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。每个文件必须低于 25 MB。

价格如何计算?

费用根据音频时长计算,并向上取整到下一分钟。每次请求最低按 1 分钟计费。

可以获得字幕而不是纯文本吗?

可以。将 `response_format` 设置为 `srt` 或 `vtt`,即可获得包含每个分段起止时间戳的可直接使用的字幕文件。

模型会自动检测语言吗?

会。将 `language` 字段留空即可自动检测;也可以指定 ISO-639-1 代码,将识别限定为已知语言以获得更好的准确度。