Anthropic更新用户政策,明文禁止长时间反复辱骂或残忍对待Claude,新规2026年11月12日生效,违规按警告、限流、封号三档处理,普通吐槽、反驳对话、暗黑创作与模型测试不在禁止之列。
这并非新机制,2025年8月Claude Opus 4与4.1已上线类似断线处理,此次只是正式写入用户协议,针对的是重复、高强度、以击穿护栏为目的的行为模式。
管“骂AI”的核心原因是长期恶意提示词会造成对齐漂移与训练信号污染,护栏会被日复一日浸泡磨松,而非一次猛攻推倒。
据透明度报告,2025年7月至12月Anthropic封禁约145万个违规账号,收到约5.2万次申诉、约1700次被推翻;真正的看点在于“持续且无必要”的执行尺度,以及红队测试者等二次开发团队会否因担心误封而调整调用方式。
