OpenAI 发布两款语音识别模型
OpenAI 推出 GPT Transcribe 和 GPT Live Transcribe 两款语音识别模型,将文件转录成本降低 25%,并在独立准确率基准测试中取得 3.31% 的成绩。
要点
GPT Transcribe 在 AA-WER 指数上的词错误率为 3.31%,在跟踪的系统中排名第九。
文件转录成本降至每分钟 0.0045 美元,比 GPT-4o Transcribe 低 25%;流式转录成本为每分钟 0.017 美元。
两款模型均可利用书面上下文、关键词列表和语言提示,提升嘈杂音频下的准确率。
OpenAI 转录模型进入 API
公司于 7 月 28 日通过开发者平台推出这两款模型,随后发布了模型页面、重写的转录指南以及针对每个支持端点的代码示例。GPT Transcribe 适用于完整的音频文件和更繁重的批量处理任务。它处理录音的速度约为实时速度的 34 倍,适合归档场景,但仍远落后于市场上最快的转录服务。
GPT Live Transcribe 承担另一半任务,在用户说话时通过开放连接实时流式传输文本。开发者可以调整模型在延迟与转录稳定性之间的权衡。微软已在其 Foundry 平台中列出了这两个版本。
两款模型均接受录音的纯文本描述、涵盖人名和专业术语的关键词列表,以及操作者预期的语言提示。这些上下文信息将 OpenAI 自身基准测试中的语义准确率从 41.6% 提升至 45.2%。文件模型的收费为每分钟音频 0.0045 美元,比前一代低 25%;流式版本的收费为每分钟开放会话 0.017 美元。
Artificial Analysis 将 GPT Transcribe 排至第九位
Artificial Analysis 在 AA-WER 指数上测得 GPT Transcribe 的词错误率为 3.31%,在其目前跟踪的约 50 个系统中排名第九。这相比 GPT-4o Transcribe 提升了 0.7 个百分点,不过该模型在处理较难材料时仍表现不佳,在财报电话会议场景中得分为 6.10%。
在 Common Voice 的 22 种语言测试中,OpenAI 的得分为 19.27%,而 Whisper 为 40.37%。阿里巴巴以 1.8% 的准确率位居榜首,领先于 ElevenLabs、Google 和 Mistral,后者的模型准确率均在 2.2% 至 2.9% 之间。针对此次发布的一篇评测指出,指数数据会美化每个系统,因为处理干净片段时接近 3% 的 GPT-4o 模型在处理混乱的财报音频时表现大幅下降。
OpenAI 在 Whisper 之后的音频发布
此次发布为 OpenAI 在音频领域的忙碌一年画上句号。Whisper 于 2022 年作为开放模型发布,迅速成为全球播客、呼叫中心、新闻编辑室和研究档案中转录的廉价默认选择。
GPT-4o Transcribe 于 2025 年推出,每分钟收费 0.006 美元,并有一个更小的版本价格仅为一半。5 月,公司发布了 GPT-Realtime-2,同时推出了翻译模型和 GPT-Realtime-Whisper,后者以与新模型相同的每分钟 0.017 美元价格处理实时流式传输。竞争对手此后持续降价,Mistral 现在的起步价为 0.003 美元。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种