IT之家 07-09
OpenAI最强语音模型:GPT-Live登场,让AI对话更接近真人聊天
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 7 月 9 日消息,OpenAI 今天(7 月 9 日)发布 GPT-Live 系列模型,定位新一代全双工语音模型,可同时聆听与说话,让 AI 对话感觉更接近真人。

GPT-Live 系列模型目前开放 GPT-Live-1 与 GPT-Live-1 mini 两个版本,即日起向全球 ChatGPT 用户开放,其中官方面向 Go、Plus 和 Pro 订阅用户开放 GPT-Live-1 模型,免费用户可以调用 GPT-Live-1 mini   模型。IT 之家附上相关视频如下:

架构方面,GPT-Live 系列模型采用全双工架构,不再依赖单轮结束后再响应,可在同一时间持续处理输入和输出,模型可 " 每秒多次 " 判断是否说话、继续倾听、暂停、打断或调用工具,从而让对话更接近真人聊天体验。

在面对复杂任务时,GPT-Live 系列模型拆分处理连续交互和深度推理。模型在前台维持语音对话流,同时把网页搜索、复杂推理或更复杂任务委托给 GPT-5.5 系列模型后台执行:

GPT-Live-1(instant)与 GPT-Live-1 mini 调用 GPT-5.5 Instant

GPT-Live-1 Medium 调用 GPT-5.5 Thinking Medium 推理强度

GPT-Live-1 High 用 GPT-5.5 Thinking High 推理强度

性能方面,OpenAI 介绍,公司专门建立了一套新的人工评测体系,重点考察语音交流中的舒适度(pleasantness)和整体交流流畅性(flow of conversation)。

相比较此前 Advanced Voice Mode,在时长 5-10 分钟的配对对话中,基于整体偏好、轮次衔接、打断情况、对话流畅度与自然度等衡量指标,GPT-Live-1 与 GPT-Live-1 mini 模型的偏好得分更高。

用户规模方面,OpenAI 披露,每周有超过 1.5 亿人通过 Voice 和 Dictation 等功能与 ChatGPT 语音交互,应用场景包括免手持日常协助、语言练习、睡前故事与通勤闲聊。新版本还支持在语音对话中展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆、图片和文件上传。

安全方面,OpenAI 表示,GPT-Live 在自伤、精神病性症状与躁狂、对 AI 的情感依赖、暴力及性内容等领域接受了音频原生评测、合成音频评测与内部红队测试。官方称,该模型在几乎所有评估维度上与 Advanced Voice Mode 相当或更优。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

mini it之家 体育 精神病 股票
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论