中国大模型“每家都称第一”背后,第三方评测显示第一梯队由Kimi K3与Qwen3.8-Max组成双雄格局。K3国际验证领先,以57分位列全球第四,为开源模型历史最高;Qwen3.8-Max则在中文综合与生态上占优,SuperCLUE中文测评中综合第一。
五家画像中,K3验证最强,Qwen中文生态最强,DeepSeek性价比高但被反超,GLM擅长编程,豆包用户规模大但缺国际验证。中国第一与世界第一仅差3分,差距源于效率创新而非算力堆砌。
结论:按场景选模型,K3适合代码与Agent,Qwen适合中文办公,DeepSeek适合推理与预算敏感场景,领先窗口以月计。
