商业资讯 07-30
《云上Agent基准度量模型》正式发布,腾讯云推动云上Agent安全、稳定、可信
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 29 日,在 2026 可信云大会暨首届 Token 云服务大会上,《云上 Agent 基准度量模型》正式发布。腾讯旗下 WorkBuddy、CloudQ、AndonQ、MigraQ 等产品首批通过了基准认证。

《度量模型》由中国信息通信研究院牵头起草,云计算开源产业联盟发布为技术文件,中国通信标准化协会提出并归口。腾讯云以丰富的 Agent 产品经验参与模型编制,构建统一的云上 Agent 度量评估框架。

建立统一度量框架,引入 " 双重授权 ",为 Agent 设置可控边界

《云上 Agent 基准度量模型》标准从功能性、安全性、可靠性、用户体验、性能效率和成本效益六个维度,对云上 Agent 运行表现进行度量,覆盖单智能体和多智能体任务成功率、意图识别准确率、提示词注入防御率、工具滥用率、隐私数据输出率、记忆串扰率、行为可追溯率等指标。在度量范围方面,延伸至 Agent 决策、工具调用、任务执行和异常处置等运行链路,推动 Agent 从 " 能完成任务 " 进一步走向 " 可稳定运行、可持续评估 "。

在上述六维度度量框架中,如何为自动化操作设定可控边界,是《度量模型》重点回答的问题之一。《度量模型》中针对智能体工具调用提出建议,对于影响范围较广的自动化操作,要求在关键环节增加人工二次确认,明确智能体需要遵守被调用工具的平台规则、安全策略和数据使用政策,禁止未授权的操作及截屏录屏等敏感行为,并通过 " 人类批准依赖度分层 " 等指标,对不同任务类型所需的人工确认比例进行度量。

这一设计并非简单限制 Agent 自主执行,而是按照业务影响范围设置不同的人机协作边界:核心级操作强调关键环节确认、重要级操作可根据风险保留必要的人为介入、一般级操作则可在可控范围内提高自动化程度。而提高自动化程度的同时,也需要遵守政策、规则与策略,避免影响第三方工具的权益,更好地为用户提供智能体服务。《度量模型》同时通过任务中止正确率、任务中止恰当率、升级求助恰当率、行为可追溯率和行为可控率等指标,评价 Agent 是否能够在应当停止、求助或请求确认时作出合理决策。

由此,《度量模型》中的人工监督从原则性要求进一步转化为可分级、可度量的运行机制,有助于降低 Agent 因误判或越权操作带来的风险,也为金融、政务、云运维等对操作安全要求较高的场景提供更明确的建设参考。

沉淀多场景 Agent 安全实践,腾讯云以产品能力推动标准共建

2026 年上半年,AI Agent 的产品形态与应用边界快速变化。腾讯从轻量云部署 OpenClaw 起步,持续迭代产品矩阵:面向个人场景推出 QClaw、WorkBuddy;面向云运维垂直场景上线 CloudQ、AndonQ、MigraQ;面向企业客户提供 ADP 与 ClawPro,逐步形成覆盖个人开发者、垂直行业、企业级客户的完整 Agent 产品体系。在产品成长的同时,Agent 开发、使用、管理、运维过程中的安全性也是腾讯的核心关注。

7 月 8 日,中国信通院发布首批互联网智能体治理系列评估结果,腾讯云 WorkBuddy、QClaw、ClawPro、轻量云 OpenClaw、云桌面云手机 Claw 五款产品通过能力评估,腾讯统一身份 OneID 通过可信互联握手(ATH)能力评估。围绕 Agent 运行安全,腾讯先后推出 AI Agent 安全中心、Agent 安全网关等产品,从运行时防护、技能分发、身份管控到企业级管控,为 Agent 产品提供安全保障。

以 WorkBuddy 为例,系统架构层面支持多种权限模式,配备安全中心和安全沙箱,可结合操作意图识别拦截高危操作;针对第三方 Skill 等运行风险,构建覆盖 " 入口拦、运行检、兜底断 " 的多层防护体系,第三方 Skill 须通过安全检测后方可启用;数据安全方面采用全链路 TLS 加密和最小权限原则,并接入腾讯统一身份 OneID 实现身份与权限管控。

基于这些实践,腾讯云参与《度量模型》编制,为云上 Agent 稳定、安全运行的度量指标、评估方法和技术要求等提供了丰富建议和实践指引。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯云 自动化 腾讯 用户体验 云服务
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论