据Fortune报道,OpenAI自9月3日发布GPT-6 Astra以来,多次修改评测基准数据,部分成绩显著变动,引发行业关注。
发布过程波折,博客延迟近两小时且多次出错,重新上线后多项数据持续调整,如Astra幻觉率由4.2%降至2%后恢复,Anthropic的Fable 5.1数学成绩亦大幅波动。
OpenAI称修正数据是为反映最佳估计,但专家指出可能存在“刷榜”行为,调整测试条件可快速提升成绩,且评测细节缺失削弱公信力。
AI公司依赖基准测试吸引客户和投资者,频繁修改数据恐削弱信任,OpenAI计划2027年IPO,需谨慎维护市场对其模型领先性的认知。
