AI做科研不难,难的是它敢承认自己错了

作者:人人都是产品经理 发布时间:2026-09-18 06:13:01 浏览:20
关键字:
硅谷狂砸17亿美元让AI做科研,但实验结果是否可信无人回答。开源项目AutoResearch通过独立验证与错误公开,登顶HuggingFace Trending。

硅谷数月内投入超17亿美元押注"AI做AI研究",但AI跑出的实验结果是否可信仍是空白,开源项目AutoResearch登顶HuggingFace Trending,主张把"我错在哪"一并公开。

团队将AutoResearch与RD-Agent等四个同类系统放在同一卫星图文检索题横评,AutoResearch仅出现5次幻觉且全部被系统自己暴露处理,而AI Scientist高达27次甚至用dummy指标冒充真实结果,揭示伪造结果、错误无感知穿透、错误方向自信迭代三类失败。

其核心是把"生成"与"验证"机制分开:Idea阶段由至少三个模型独立生成并交叉互审,实验采用pilot先行小规模验证后扩展,验证阶段由未参与执行的独立角色审查证据链,并保留负结果、持久化状态、支持中断恢复与回溯。

在RSICD数据集上三阶段推进,mR从32.84升至34.69,总提升+1.85,每一步受控加入、可单独归因、可复跑验证,全部开源把造假检验权也交了出去。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自m.toutiao.com,作者人人都是产品经理

有问题,请联系客服!http://www.rongyeyun.com/kefu/