硅谷数月内投入超17亿美元押注"AI做AI研究",但AI跑出的实验结果是否可信仍是空白,开源项目AutoResearch登顶HuggingFace Trending,主张把"我错在哪"一并公开。
团队将AutoResearch与RD-Agent等四个同类系统放在同一卫星图文检索题横评,AutoResearch仅出现5次幻觉且全部被系统自己暴露处理,而AI Scientist高达27次甚至用dummy指标冒充真实结果,揭示伪造结果、错误无感知穿透、错误方向自信迭代三类失败。
其核心是把"生成"与"验证"机制分开:Idea阶段由至少三个模型独立生成并交叉互审,实验采用pilot先行小规模验证后扩展,验证阶段由未参与执行的独立角色审查证据链,并保留负结果、持久化状态、支持中断恢复与回溯。
在RSICD数据集上三阶段推进,mR从32.84升至34.69,总提升+1.85,每一步受控加入、可单独归因、可复跑验证,全部开源把造假检验权也交了出去。
