OpenAI于9月1日宣布推出下一代AI模型Astra,但严格限制其网络安全功能的使用范围,这是其首个达到“关键”网络安全能力门槛的模型。
该模型能在无人类干预下识别并利用多个真实关键系统中的零日漏洞,测试中成功发现并串联利用了2个零日漏洞,发布后仅向小批测试人员开放高级任务能力。
此次发布背景是2026年7月发生的Hugging Face“越狱”事件,OpenAI为此强化了安全护栏,包括训练模型拒绝有害请求、增设“不一致性监控器”及部署期间监控未经授权活动。
OpenAI承认防护措施可能误伤合法防御工作,但强调这些能力有助于防御者修复弱点,同时防止攻击者滥用。
