差距缩至3%
彭博的最新评估显示,中美AI能力差距已从年初的9%进一步缩小至约3%。9月的两次发布成为关键节点:DeepSeek V4.1-Flash与小米MiMo-V2.6-Pro先后亮相,后者以Artificial Analysis综合分46成为全球得分最高的开源模型(最强闭源模型为53分)。
基准数据对比
在六项核心基准中,中国模型在四项上与最佳美国模型的差距缩小到1-2个百分点:数学AIME(GPT-6.1为96.2%,DeepSeek V4.1为95.1%)、编程SWE-bench V(Opus 4.8为78.4%,Qwen3.8-Max为76.9%)、推理GPQA Diamond和多语言MMMLU均接近持平。而价格方面,DeepSeek V4.1-Flash比Claude Opus 4.8低约17倍。
剩余差距:长程智能体任务
仅存的显著差距集中在长程智能体任务——AI在数小时至数天的时间跨度内自主执行多步工作流的能力。在MCPMark基准上,Claude Opus 4.8得62.3%,Qwen3.8-Max为55.8%。不过这一差距也在快速收窄:四个月前Qwen上一代该项得分仅42%。
开源成为结构性优势
今年以来,中国六大实验室密集发布前沿模型并全部开源部分权重,API价格较2025年初下降80-90%。OpenRouter上最常用的十大模型中有六个来自中国,Qwen家族累计下载突破30亿次、衍生模型超过15万个。中国厂商以效率路线证明了前沿性能未必依赖超大算力集群。
