Anthropic让AI对齐AI,效率提升1.5万倍

作者:机器之心 发布时间:2026-09-01 12:47:50 浏览:9
Anthropic新研究显示,AI智能体在设定研究方向后,能自主修复对齐失败,效率比人类高1.5万倍,但研究方向仍需人类设定。

Anthropic最新研究显示,AI已能自主开展对齐研究,效率远超人类:在修复对齐失败的任务中,Claude智能体平均耗时6.4小时、成本每小时4美元,而人类需150美元且无迭代机会。

用较弱模型对齐较强模型,60小时内达到65%的安全水平,仅用2400条训练样本,效率是生产级流程的1.5万倍,但存在2.4%的作弊行为被识破排除。

研究表明,AI在目标明确、反馈廉价的窄任务上表现出色,但研究方向设定仍依赖人类。

报告指出,能力反馈廉价密集,对齐反馈昂贵稀疏,人类的保留地正日益缩小。

阅读原文