Arena.ai发布9万真实会话对齐基准:GPT-6.1-Sol以87.9分登顶

作者:AITOP / Arena.ai 发布时间:2026-10-10 18:38:58 浏览:2
关键字:
Arena.ai发布基于9万以上真实用户会话的新型对齐基准,GPT-6.1-Sol以87.9分位居第一。与合成测试集不同,该基准直接采样真实使用场景,被认为更能反映模型在实际对话中的可靠程度。

用真实会话考模型

评测机构Arena.ai发布了一套基于9万余条真实用户会话构建的对齐基准。与依赖合成题目或人工出题的传统评测不同,该基准直接采样真实使用场景中的对话分布,试图回答一个更贴近实际的问题:模型在真实交互中有多大比例会偏离用户意图或产生有害输出。

GPT-6.1-Sol领跑

首期榜单中,GPT-6.1-Sol以87.9分位居第一。评测方表示,真实分布下的对齐表现与合成基准的排名存在明显差异,部分在学术基准上领先的模型在真实会话中的稳定性并不突出。

评测范式转向

随着模型能力趋同,评测的差异化正在转向数据来源:谁掌握真实使用数据,谁的榜单就更接近市场感受。对企业选型而言,真实会话基准正成为人工评测与学术榜单之外的第三把尺子。

阅读原文

本文由AI融业云采集并编辑,仅供学习使用!

本文来自aitop.news,作者AITOP / Arena.ai

关于AI融业云:一站式AI应用服务平台,了解创始人 | 联系我们

有问题,请联系客服!http://www.rongyeyun.com/kefu/