Arena.ai发布9万真实会话对齐基准:GPT-6.1-Sol以87.9分登顶
Arena.ai发布基于9万以上真实用户会话的新型对齐基准,GPT-6.1-Sol以87.9分位居第一。与合成测试集不同,该基准直接采样真实使用场景,被认为更能反映模型在实际对话中的可靠程度。