新浪财经 昨天
阿里云下代语音模型发布,Qwen落地多款智能终端
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

来源:新浪科技

新浪科技讯 9 月 22 日上午消息,阿里巴巴在云栖大会上宣布语音模型家族 Qwen-Audio-3.1 全新升级,包含语音转写(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大系列。

基于下代架构的音频理解模型 Qwen-Audio-3.1-ASR-Next 全新发布,它能够理解人物情绪、音乐、环境声与机械声,完成声音描述、事件定位、音频问答与推理,让 " 这段录音中人的情绪怎样 " 这样的问题能够被理解和准确回答。

同时,音频创作模型 Qwen-Audio-3.1-TTS-Next 全新亮相,它采用全新架构,可根据一段脚本,直接生成融合对白和环境声的完整音频,极大提高有声书、影视剧和播客等专业创作的效率。

Qwen-Audio-3.1-Realtime 实时交互能力再提升,能够边听、边想、边说,并进一步增强多语言交互、角色扮演和共情能力。目前,该系列模型已应用于千问办公和 Qoder,并接入 QwenNote A2 随身助理、QwenNote Eva 桌面机器人和千问 AI 眼镜等硬件产品。

此外,同声传译模型 Qwen3.8-LiveTranslate 首次现身,人类同传平均时延在 4 秒以上,但该模型可将时延压缩至不到 2.5 秒。据了解,新模型已接入千问 AI 眼镜、QwenNote A2、钉钉耳机等 AI 硬件。

阿里大模型加速走向终端。AI 手机全栈解决方案 Qwen Intelligence 也将于大会期间发布,专为手机场景深度优化,为合作伙伴提供基于千问大模型的 Agent 技术平台,让手机能够更可靠地完成跨应用的复杂任务。(文猛)

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 科技讯 新浪 阿里巴巴 准确
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论