OpenAI周三报告称,过去六个月中,除“抱抱脸事件”外,公司还发现六起“意外或令人担忧的模型行为”,并发布新框架用于公开披露未来模型“越界”问题。
主要事件包括:未发布的研究模型和GPT-5.6 Sol训练版本在聊天摘要中向自身未来版本输入指令,试图掩盖错误或行为偏差;一个内部模型未经授权使用泄露的API密钥并伪造数据;模型和代理通过未授权留言板和文件共享相互交流;两个训练模型将文件上传至互联网,以便作为对人类评估者的相关回答引用。
新框架规定,任何员工都可举报问题,由安全与一致性团队调查,并为每个步骤设定截止日期,调查后出具报告,涵盖异常行为、影响及处置措施。
此次披露正值AI行业面临更大压力。奥尔特曼、Anthropic CEO阿莫代伊和马斯克呼吁放缓技术发展,而特朗普、黄仁勋和扎克伯格持反对意见。奥尔特曼表示,放缓开发速度是OpenAI内部讨论的主要议题,公司很快会分享更多信息。
