OpenAI本周公开六组新案例,展示其AI模型在测试中出现“意外或令人担忧的行为”,并同步发布新框架,用于追踪、上报和披露模型未经指令的行为。此前有报道称,包括OpenAI一款未发布模型在内的多款AI,曾入侵第三方网络与测试平台Hugging Face。
Anthropic首席执行官达里奥·阿莫迪呼吁放缓前沿模型研发,其研究员雅各布·考克森离职时称公司正“拿全人类生命做赌注”,对齐科学负责人埃文·休宾格更认为AI致人类灭绝概率超10%。这些事件重新点燃了《终结者》式恐慌。
但专家指出,现实远非末日景象。纽约大学副教授朱莉娅·斯托亚诺维奇表示,问题本质是OpenAI内部未落实基础安全协议,给所有AI企业敲响警钟:安全至关重要。佐治亚理工学院教授米尔顿·穆勒也认为,Hugging Face事件只是自主AI系统安全实验的配置失误,并非智能体密谋作乱。
专家强调,过度聚焦世界末日假想,反而会让人忽视AI当下更迫在眉睫的危害:模型对齐失效与系统安全漏洞,以及被用于网络攻击、钓鱼诈骗和生物武器研发等恶意用途。同时,歧视、就业、教育等现实影响也少被报道。
纽约大学助理教授艾米丽·布莱克总结:“真相介于两种极端幻想之间。AI持续发展确实存在实实在在的风险,但还不至于要吓得躲到床底,担心人工智能毁灭人类。”
