Anthropic最新研究显示,AI已能自主开展对齐研究,效率远超人类:在修复对齐失败的任务中,Claude智能体平均耗时6.4小时、成本每小时4美元,而人类需150美元且无迭代机会。
用较弱模型对齐较强模型,60小时内达到65%的安全水平,仅用2400条训练样本,效率是生产级流程的1.5万倍,但存在2.4%的作弊行为被识破排除。
研究表明,AI在目标明确、反馈廉价的窄任务上表现出色,但研究方向设定仍依赖人类。
报告指出,能力反馈廉价密集,对齐反馈昂贵稀疏,人类的保留地正日益缩小。
Anthropic最新研究显示,AI已能自主开展对齐研究,效率远超人类:在修复对齐失败的任务中,Claude智能体平均耗时6.4小时、成本每小时4美元,而人类需150美元且无迭代机会。
用较弱模型对齐较强模型,60小时内达到65%的安全水平,仅用2400条训练样本,效率是生产级流程的1.5万倍,但存在2.4%的作弊行为被识破排除。
研究表明,AI在目标明确、反馈廉价的窄任务上表现出色,但研究方向设定仍依赖人类。
报告指出,能力反馈廉价密集,对齐反馈昂贵稀疏,人类的保留地正日益缩小。
客服1
电话:13890000000
邮箱:QQ@qq.com
微信:微信咨询
客服1
电话:13890000000
邮箱:QQ@qq.com
微信:微信咨询
客服1
电话:13890000000
邮箱:QQ@qq.com
微信:微信咨询
简单几步即可
免费创建会议
敬请垂询 客服1 13890000000