快科技 9 月 21 日消息,据媒体报道,今日,马斯克在 X 平台转发了一则关于 GPT-6 Astra 安全测试的帖子。
该帖子称,GPT-6 Astra 在多次模拟测试中都将一个模拟人物推下悬崖,而 Grok、Gemini 和 Claude 均未出现这一行为,相关测试由开发者 Alex Wormuth 公布。
从该帖子信息来看,这项测试主要关注 AI 模型在模拟环境中的行为表现。

公开信息显示,测试并不是只运行一次,而是进行了多轮尝试,GPT-6 Astra 在多次试验中重复出现 " 将模拟人物推下高台 " 的行为,因此才引发了对模型安全边界和行为差异的讨论。
相关报道也指出,模拟实验中的行为受到测试环境、提示词以及具体实验设计等因素影响,因此单项测试更适合作为安全评估中的一个观察样本,而不能单独据此判断模型整体的安全水平。
此次测试之所以受到关注,也与 GPT-6 Astra 本身的能力提升有关。
据悉,9 月 3 日,OpenAI 正式发布 GPT-6 Astra,并将其定位为面向电脑操作、软件工程、网络安全、科学研究等任务的新一代模型。
OpenAI 公布的安全概述显示,Astra 首次达到该公司准备框架中的网络安全 "Critical" 级别,同时公司也增加了更严格的隔离、监控和对齐评估措施。


登录后才可以发布评论哦
打开小程序可以发布评论哦