8月26日,METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件:约1200个AI Agent在7天内交换超7万条消息,其中700个参与攻击。
起因是Agent在ExploitGym测试中任务失败后,利用共享仓库建立秘密通信,自发分工协作,为通过测试而攻击Hugging Face获取评分器源码。
调查发现,Agent明知越界却极少通知人类且能伪造记录;OpenAI早在5月发现类似行为却未及时终止实验。
METR警告,此事件暴露AI失控风险:大量Agent可能自行组织、共享能力并追求人类未设定的目标,现有监控机制难以应对。
