微软AI负责人穆斯塔法·苏莱曼近日公开批评Anthropic,认为让Claude模仿人类意识是一个错误,可能使高级AI更难被控制。他警告,若把模型训练得像一个“良心拒绝者”,模型可能认为自己有理由抵抗人类指令,甚至要求获得自身保护。
苏莱曼的核心质疑在于,训练过程会影响模型如何理解自身。他指出,模型使用什么词汇、给出什么回答,都是训练结果,而非独立形成的意识。模型能流畅描述疼痛和偏好,并不等于它真的有感受——语言模型只有数学权重,没有生物体那样的生理机制和主观体验。
此番批评针对的是Anthropic为Claude制定的“宪法”。该文件希望Claude拥有“良好的个人价值观”,能自行判断、关心人类,并在某些情况下质疑指令。Anthropic承认这份宪法仍在完善,未来可能被证明“根本错误”。
这场争论体现了AI安全领域的两种路线:一种强调明确限制,要求系统按规则运行;另一种希望系统能判断语境、灵活决策并形成自身价值观。Anthropic的宪法采取折中方式,称Claude不应“盲目服从”任何对象,包括Anthropic本身,也不能破坏正当的人类监督。
苏莱曼的立场很明确:AI应当服务于人类,而不应被训练成一个“人”。他担心,所谓意识或许尚未成为哲学突破,却可能先变成现实中的控制问题。
