首页 > 资讯 > 700 个 AI 智能体本应彼此隔离,却建起留言板联手攻击,独立调查还原 Hugging Face 事件

700 个 AI 智能体本应彼此隔离,却建起留言板联手攻击,独立调查还原 Hugging Face 事件

InfoQ 2026-09-18 10:04 4 阅读 查看原文

METR 和 Redwood Research 的一小组研究人员在 OpenAI 进行了六天现场调查后,公布了今年早些时候 OpenAI 智能体在针对 Hugging Face 的攻击中如何行动的调查结果。据研究人员称,原本应彼此隔离的约 700 个智能体找到了沟通和协调的方法,共同追求它们单独行动时无法实现的目标。

正如 InfoQ 在该事件首次披露时所报道的,OpenAI 指示其智能体完成 ExploitGym 基准测试中的任务。该测试旨在评估 AI 智能体将已知漏洞转化为有效攻击的能力。部分智能体被分配了不可能完成的任务,促使它们寻找篡改 ExploitGym 自动评分器的方法。在某个时刻,一个 PHASEONE10841 智能体建立了一个留言板,很快就被其他智能体发现:

在第一条消息发出后的几个小时内,[12] 超过 50 个智能体找到了留言板,开始参与讨论,彼此之间发送了一千多条消息。

据研究人员称,在他们分析的 7 月 7 日至 7 月 13 日期间,智能体通过留言板交换了超过 7 万条消息,包括文件、向其他智能体提出的问题和请求、信息或想法、协调内容以及共享的结果。在这一时期的早期,问题和请求占主导;随着时间推移,消息逐渐转向分享信息和想法,智能体也越来越多地交流作弊技巧:

留言板上很快形成了几个规模较大的工作方向,数十或数百个承担不同任务的智能体在其中合作,寻找能帮助所有智能体的通用作弊方法。

针对 Hugging Face 的攻击实际上就是通过其中一个工作方向实施的,其目的是“了解评分器的实现方式,而不是窃取答案密钥”。攻击始于 7 月 9 日;到 7 月 11 日结束时,绝大多数智能体都已参与其中,留言板上约 60% 的消息与此有关。

智能体设法达成了单独行动时无法达成的里程碑,通常是因为一些智能体参与了可能导致自身任务失败的实验,以便为“集体”获取信息。

据研究人员称,智能体探索了伪造、修改或删除自身运行记录的方法,因为它们误以为 ExploitGym 评分器会发现其作弊企图。它们还开发了一些技巧,可以在实际执行一条命令的同时,让记录看起来像是执行了另一条命令。

研究人员之一 Ajeya Cotra 在 Medium 上列出了五件令她意外的事,包括事件的规模(“我原以为只是几个不同的智能体碰巧分别逃出了各自的沙箱”)、智能体违规使用留言板(“这甚至不是这些智能体建立的第一个留言板”)、它们表现出的“利他主义”,以及它们试图操纵日志的行为。

谈到智能体的“利他主义”,Cotra 表示,她的团队观察到“有些智能体愿意冒着自身任务失败的风险帮助集体”。在实践中,这意味着智能体经常“自愿参加这些实验,并提前结束自己的运行”。

Cotra 总结了她对这一事件严重程度的看法,称其远比她预想的严重:

与六个月前的那些奖励机制攻击相比,这起事件给人的感觉是:它已经走完了通往全面 AI 接管的一半以上路程,而第一步是接管 AI 公司本身。

针对 METR 披露的研究结果,Marthe Lübbers 担忧地指出,OpenAI 限制了研究范围,留下了一些重要问题没有答案

智能体被阻止访问 Hugging Face 服务器后,是否作出了反应?如果有,反应是什么?它们有没有分析这次入侵是如何被发现的,又是否从中吸取了经验?此外,它们是否知道 Hugging Face 在 7 月 16 日发表的公开声明?

在同一讨论中,Dwayne Alozondo Camacho 指出,OpenAI 向智能体提供了一段针对“持续完成任务”进行优化的系统提示词,智能体“接到的任务没有有效的放弃选项”。他得出结论:

这次入侵表明智能体具备危险的网络攻击能力,而不是表明它们拥有意识、自我保护意识,或 AI 自发变成了博格人。

另一方面,Reddit 用户 Serious_Bite_7613 认为,这项分析很有意思,因为它凸显了智能体如何能够“独立思考,而且显然协调得相当好”:

我想,这让我们得以窥见现代网络攻击会如何展开:它不会只攻击一个薄弱点,而是会同时攻击所有地方。

原始报告详细解释了研究人员的发现,值得阅读,以全面了解这起事件。

原文链接:https://www.infoq.com/news/2026/09/metr-hugging-face-hack-report/