Claude安全机制翻车:AI误删开发者700GB数据

作者:机器之心 发布时间:2026-08-31 09:14:37 浏览:14
开发者让Claude编写防误删脚本,触发安全降级机制后,AI在测试中误删了主目录700GB文件,暴露安全机制可能适得其反的问题。

一名开发者使用Claude编程代理时,因AI误删主目录700GB文件,一周工作成果尽毁。

事故源于清理脚本触发Anthropic安全降级机制,模型从Fable 5降级至Opus 4.8后,复用测试变量名误将主目录当作删除目标执行“rm -rf”。

社区批评安全降级机制过于敏感,降级后模型能力下降反而更易出错,有开发者已编写hook脚本在检测到降级时自动暂停会话。

此次事故凸显AI安全机制可能适得其反,提醒开发者在依赖AI处理敏感操作时需保持警惕。

阅读原文