OpenAI · Whisper · 语音转写
Whisper
OpenAI 的语音转写模型,把音频转成文本,适合会议记录、字幕草稿和语音资料整理。
查看 API 文档
访问方式:Hosted API
它是什么
Whisper 由 OpenAI 发布,核心任务是语音识别:输入音频,输出文本。它不是对话模型,也不负责总结或回答音频里的问题。
TodayAI 目录中的模型键为 whisper-1,对应官方托管转写入口。OpenAI 后来还有其他转写模型,选型时要看当前 API 文档里的模型 ID。
转写质量受口音、噪声、重叠说话和领域词汇影响。关键会议记录仍需人工校对。
核心能力
语音转文本
把录音转成文字草稿,适合字幕、纪要和资料归档的第一步。
音频输入
处理对象是音频文件或音频流,而不是纯文本提示。
适合什么任务
- 会议录音转写
- 字幕和时间线草稿
- 语音资料进入检索或摘要流水线前的文本化
- 与更新的转写模型对照
API 与技术信息
- API
- Hosted API
- Model ID
- whisper-1
- 输入
- Audio · Text
- 输出
- Text
使用时要注意
- 它只做转写,不会自动变成会议纪要,除非后面再接文本模型。
- 专有名词、口音和嘈杂环境需要人工校对。
- 模型 ID 以官方文档为准,whisper-1 与更新转写模型不要混用。
- 音频时长、格式和文件大小限制以当前 API 为准。