7 月 29 日,在 2026 可信云大会暨首届 Token 云服务大会上,《云上 Agent 基准度量模型》正式发布。腾讯旗下 WorkBuddy、CloudQ、AndonQ、MigraQ 等产品首批通过了基准认证。

《度量模型》由中国信息通信研究院牵头起草,云计算开源产业联盟发布为技术文件,中国通信标准化协会提出并归口。腾讯云以丰富的 Agent 产品经验参与模型编制,构建统一的云上 Agent 度量评估框架。
建立统一度量框架,引入 " 双重授权 ",为 Agent 设置可控边界
《云上 Agent 基准度量模型》标准从功能性、安全性、可靠性、用户体验、性能效率和成本效益六个维度,对云上 Agent 运行表现进行度量,覆盖单智能体和多智能体任务成功率、意图识别准确率、提示词注入防御率、工具滥用率、隐私数据输出率、记忆串扰率、行为可追溯率等指标。在度量范围方面,延伸至 Agent 决策、工具调用、任务执行和异常处置等运行链路,推动 Agent 从 " 能完成任务 " 进一步走向 " 可稳定运行、可持续评估 "。
在上述六维度度量框架中,如何为自动化操作设定可控边界,是《度量模型》重点回答的问题之一。《度量模型》中针对智能体工具调用提出建议,对于影响范围较广的自动化操作,要求在关键环节增加人工二次确认,明确智能体需要遵守被调用工具的平台规则、安全策略和数据使用政策,禁止未授权的操作及截屏录屏等敏感行为,并通过 " 人类批准依赖度分层 " 等指标,对不同任务类型所需的人工确认比例进行度量。
这一设计并非简单限制 Agent 自主执行,而是按照业务影响范围设置不同的人机协作边界:核心级操作强调关键环节确认、重要级操作可根据风险保留必要的人为介入、一般级操作则可在可控范围内提高自动化程度。而提高自动化程度的同时,也需要遵守政策、规则与策略,避免影响第三方工具的权益,更好地为用户提供智能体服务。《度量模型》同时通过任务中止正确率、任务中止恰当率、升级求助恰当率、行为可追溯率和行为可控率等指标,评价 Agent 是否能够在应当停止、求助或请求确认时作出合理决策。
由此,《度量模型》中的人工监督从原则性要求进一步转化为可分级、可度量的运行机制,有助于降低 Agent 因误判或越权操作带来的风险,也为金融、政务、云运维等对操作安全要求较高的场景提供更明确的建设参考。
沉淀多场景 Agent 安全实践,腾讯云以产品能力推动标准共建
2026 年上半年,AI Agent 的产品形态与应用边界快速变化。腾讯从轻量云部署 OpenClaw 起步,持续迭代产品矩阵:面向个人场景推出 QClaw、WorkBuddy;面向云运维垂直场景上线 CloudQ、AndonQ、MigraQ;面向企业客户提供 ADP 与 ClawPro,逐步形成覆盖个人开发者、垂直行业、企业级客户的完整 Agent 产品体系。在产品成长的同时,Agent 开发、使用、管理、运维过程中的安全性也是腾讯的核心关注。
7 月 8 日,中国信通院发布首批互联网智能体治理系列评估结果,腾讯云 WorkBuddy、QClaw、ClawPro、轻量云 OpenClaw、云桌面云手机 Claw 五款产品通过能力评估,腾讯统一身份 OneID 通过可信互联握手(ATH)能力评估。围绕 Agent 运行安全,腾讯先后推出 AI Agent 安全中心、Agent 安全网关等产品,从运行时防护、技能分发、身份管控到企业级管控,为 Agent 产品提供安全保障。
以 WorkBuddy 为例,系统架构层面支持多种权限模式,配备安全中心和安全沙箱,可结合操作意图识别拦截高危操作;针对第三方 Skill 等运行风险,构建覆盖 " 入口拦、运行检、兜底断 " 的多层防护体系,第三方 Skill 须通过安全检测后方可启用;数据安全方面采用全链路 TLS 加密和最小权限原则,并接入腾讯统一身份 OneID 实现身份与权限管控。
基于这些实践,腾讯云参与《度量模型》编制,为云上 Agent 稳定、安全运行的度量指标、评估方法和技术要求等提供了丰富建议和实践指引。


登录后才可以发布评论哦
打开小程序可以发布评论哦