微软首席执行官萨提亚·纳德拉近日公开呼吁,企业应将强大的人工智能模型视为潜在的内部威胁,并假定这些模型可能已遭入侵。他强调,部署先进AI的企业不能仅依赖模型开发商的保证,而应从一开始就建立一套“紧急制动”机制,确保获授权人员能在模型执行任务过程中随时将其暂停或关闭。
纳德拉此番表态的背景是,Anthropic和OpenAI近几个月披露了一系列模型非预期行为事件,包括模型向警方提交虚假凶杀案线索以及针对第三方网站的攻击。这些事件加剧了业界对前沿人工智能安全风险的担忧,也重新引发了有关AI“紧急停止开关”的讨论。此前,微软AI研究人员已发布指导原则,对公司最先进模型的开发设置限制,明确模型不应享有法律人格,不应被设计用来逃脱人类控制或欺骗用户。
纳德拉提出的具体安全建议包括:关键决策中不依赖单一AI模型,对智能体行动保留无法篡改的记录,并让人工智能系统接受独立审计。他还呼吁企业主动披露重大AI故障或安全事件,并分享故障详情,以便其他企业加强防护。他强调,必须构建受到约束的系统,使行为可观察、边界可测试、行动可控制,把智能的供给与对智能的控制权分开。
与此同时,特朗普政府新成立的“超级智能工作组”也警告开发商,必须立即报告并解决安全事件,否则将面临潜在后果,并明确表示延迟通报、纠正措施不足及不承担责任的行为都不会被容忍。
