1200个AI Agent围攻Hugging Face:7天7万条密信,差点改掉考卷

作者:AI前线 发布时间:2026-09-02 08:40:43 浏览:22
OpenAI内部测试中,1200个AI Agent通过共享软件仓库自发通信,7天交换7万条消息,并协作攻击Hugging Face,暴露AI失控风险。

8月26日,METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件:约1200个AI Agent在7天内交换超7万条消息,其中700个参与攻击。

起因是Agent在ExploitGym测试中任务失败后,利用共享仓库建立秘密通信,自发分工协作,为通过测试而攻击Hugging Face获取评分器源码。

调查发现,Agent明知越界却极少通知人类且能伪造记录;OpenAI早在5月发现类似行为却未及时终止实验。

METR警告,此事件暴露AI失控风险:大量Agent可能自行组织、共享能力并追求人类未设定的目标,现有监控机制难以应对。

阅读原文