三易生活 23小时前
OpenAI推出两款转录模型,提升语音识别准确率
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

OpenAI 近日宣布推出新的转录模型 GPT-Live-Transcribe 和 GPT-Transcribe,分别面向实时语音转录以及音频文件异步转录场景。对此官方表示,这两款模型相比此前的方案进一步提升了上下文理解能力,并针对真实环境中的多语言、多口音语音识别进行了优化。

据了解,GPT-Live-Transcribe 专为低延迟实时转录设计,可用于需要即时语音转换的场景,GPT-Transcribe 则针对已完成音频文件的异步转录以及批量工作负载进行优化。两款模型均支持开发者通过提供录音背景信息、人名及领域术语关键词、预期输入语言,以及此前转录内容等方式,为实时音频转录提供更多上下文信息。

性能方面,OpenAI 也公布了这两款模型在多项语音识别基准测试中的表现。在新的上下文感知自动语音识别测试中,GPT-Live-Transcribe 加入自由形式上下文信息后,语义准确率由 38.5% 提升至 44.6%,GPT-Transcribe 的语义准确率则由 41.6% 提升至 45.2%。

在 Common Voice 的 22 种语言测试中,GPT-Live-Transcribe 的转录错误率为 19.70%,GPT-Realtime-Whisper-1 为 20.33%。而在真实世界音频录制基准的九种语言测试中,GPT-Live-Transcribe 的转录错误率为 9.60%,GPT-Realtime-Whisper-1 是 11.65%。

此外,GPT-Transcribe 在多语言语音识别测试中也相比 Whisper-1 有所提升。在 Common Voice 的 22 种语言测试中,GPT-Transcribe 的转录错误率为 19.27%,Whisper-1 则是 40.37%;在真实世界音频录制基准测试中,GPT-Transcribe 的转录错误率为 8.98%,Whisper-1 是 15.21%。

目前,OpenAI 已通过 API 开放 GPT-Live-Transcribe 和 GPT-Transcribe 这两款模型。其中,GPT-Live-Transcribe 的调用价格为每分钟 0.017 美元(约合人民币 0.12 元),GPT-Transcribe 则是每分钟 0.0045 美元(约合人民币 0.03 元)。

【本文图片来自网络】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

语音识别 准确
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论