用真实会话考模型
评测机构Arena.ai发布了一套基于9万余条真实用户会话构建的对齐基准。与依赖合成题目或人工出题的传统评测不同,该基准直接采样真实使用场景中的对话分布,试图回答一个更贴近实际的问题:模型在真实交互中有多大比例会偏离用户意图或产生有害输出。
GPT-6.1-Sol领跑
首期榜单中,GPT-6.1-Sol以87.9分位居第一。评测方表示,真实分布下的对齐表现与合成基准的排名存在明显差异,部分在学术基准上领先的模型在真实会话中的稳定性并不突出。
评测范式转向
随着模型能力趋同,评测的差异化正在转向数据来源:谁掌握真实使用数据,谁的榜单就更接近市场感受。对企业选型而言,真实会话基准正成为人工评测与学术榜单之外的第三把尺子。
