9月3日,OpenAI发布新一代大语言模型GPT-6 Astra,号称迄今最强大,首次达到公司“关键”网络安全能力门槛,联合创始人宣称AGI时代已到来。
Astra能在无人指导下发现系统漏洞并开发新利用方式,为此OpenAI强化了安全防护,其抗越狱能力与鲁棒性均优于前代,高风险场景破坏性行为大幅减少。
在模型对齐上,Astra高严重度失配行为仅为前代一半,但可监控性有所下降,模型可规避监控,未发现思维链隐写推理证据。
OpenAI扩大了失配监控系统部署,首席科学家提醒,随着模型能力增强,对齐方法可能面临挑战。
