央广网北京9月16日消息(记者杨雪婷 李硕)据中央广播电视总台经济之声《交易实况》报道,2026年第三季度,全球大模型竞赛进入新一轮高强度对垒。国内外大模型厂商几乎集中在9月密集发布新一代旗舰模型。
9月1日,Anthropic率先发布Claude Fable 5.1以及共享底层架构的Mythos 5.1,核心亮点集中在性能翻倍、成本大降、解决企业数据合规痛点。
△Anthropic官网
9月3日OpenAI正式推出GPT-6 Astra,将产品定位明确锚定在“具备自主执行能力的AGI级模型”,在核心能力上对标甚至试图超越Claude系列。
△来源:OpenAI官网
9月10日,DeepSeek V4.1-Flash正式上线,依托全新Causal Encoder–Decoder架构,推理效率大幅提升。
△来源:Deepseek官网
9月12日,马斯克旗下xAI如期推出Grok4.7,参数规模达2.1万亿,较Grok4.6的1.5万亿增长约40%,马斯克对外称该模型在性能与效率层面将全面超越市面所有同类产品。
Scaling law依旧奏效
Scaling law(缩放定理),在人工智能(AI)领域是一个至关重要的概念,尤其在深度学习和大规模语言模型的训练中,这一概念揭示了模型性能与规模之间的关系——只要持续同步扩大模型参数量、高质量训练数据规模、训练算力投入,模型的性能(如生成能力、推理准确率)就会按照可预测的幂律关系持续提升。目前OpenAI、Anthropic、xAI等头部企业均沿着这一方向持续推进更大规模模型的研发。
OpenAI此次推出的GPT-6 Astra是其史上最大规模训练项目,使用了超10万块GPU完成训练,这再次说明前沿模型能力继续往上走,底层依赖的仍然是更大规模的算力集群和网络互联。
“目前来看Scaling Law这个定律还没有被打破。”国金证券计算机分析师鲍恩雪指出,根据2020年OpenAI发布的论文《神经语言模型的缩放定律》(Scaling Laws for Neural Language Models),随着扩参扩算力持续,超过某个临界点后,效果边际改善的幅度会放缓,但是目前还看不到Scaling Law的瓶颈出现。
上海交通大学计算法学与AI伦理研究中心联席主任田丰也指出,“越往后,同样一个百分点的进步,想要换取同等幅度的能力提升,需要付出指数级增长的成本”。
此外,田丰认为,未来制约大模型进一步发展的可能是电力,先进封装技术和高带宽内存的产能。
递归自我改进仍有差距
递归自我改进(Recursive Self-Improvement,简称RSI),是当前AI前沿领域的核心技术趋势:AI系统将自身的改进结果作为输入,自主完成下一代AI的设计、训练与优化,形成“能力越强→研发效率越高→能力进一步跃升”的正反馈闭环。
GPT-6 Astra更深层的边际变化在训练范式,它是OpenAI首款由前代模型深度参与训练监督的模型。
简单来说,就是在人类反馈强化学习流程中,把部分人类打分的工作交由上一代模型完成。田丰解释说,这套模式可以显著压低监督成本,加快模型迭代速度,但同时也潜藏风险:前代模型识别不出的错误,同样无法完成甄别。旧一代模型的认知边界,会潜移默化成为下一代模型能力的隐性天花板。
事实上在AI参与自身研发这件事上,Anthropic布局更早。2023年提出的宪法AI,就是行业较早将AI引入模型对齐训练的方案。
“Anthropic的方法是先制定一份固定不变的价值观文档作为准则,训练独立分类器侦测违背准则的输出。这个分类器只做风险识别拦截,并不参与生成模型本身的参数更新。这和OpenAI将前代生成模型直接纳入下一代训练闭环,是两条截然不同的技术路径。”田丰分析道。
二者核心逻辑区别:Anthropic以固定的宪法文本为基准完成每一代模型的约束审查;OpenAI更近似“老师傅带徒弟”,评判标准内嵌在上一代模型的判断力之中,而这套判断力本身,也会跟随模型迭代发生变化。
鲍恩雪认为,目前模型已能够自主构建训练任务、通过隔离沙箱自主部署,客观闭环裁决任务成功率,而且目前已在代码工程(Coding)、数学推导、图形界面操作(GUI)三个具备形式化验证边界的领域落地应用。
但他认为目前无论哪一家模型厂商,现阶段模型训练依旧离不开人类目标设定、独立验证以及现实环境反馈,距离能够自主运转、持续加速的递归自我改进还有明显差距。
“更强意义的递归自我改进,还需要证明模型能连续多轮提出有效新方法、验证改进、训练更强后继者,并再次提高研发能力。单次模型参与编码、打分或训练数据生成,并不构成这种递归。”鲍恩雪说。
从“信息工具”跨入“执行工具”
Computer Use是当前大模型前沿领域的核心能力方向,指AI智能体能够像人类一样直接操作图形化桌面环境,自主完成全链路计算机任务,无需依赖开发者提前编写的专用API接口。
GPT-6 Astra的另一大亮点是对计算机使用能力(Computer Use)的重点强化。
Computer Use是当前大模型前沿领域的核心能力方向,指AI智能体能够像人类一样直接操作图形化桌面环境,自主完成全链路计算机任务,无需依赖开发者提前编写的专用API接口。
“Computer Use拓宽了模型可落地的工作边界。”鲍恩雪评价。
传统AI调用工具大多需要依赖软件开放API接口,功能受限于厂商提供的接口能力;而Computer Use不再绑定API,理论上人类可以操作的电脑软件,AI都可以直接操控,由此解锁了大量封闭软件场景的自动化可能性。
在田丰看来,厂商加码Computer Use背后存在现实商业逻辑:纯文本生成的边际成本已经压到极低,继续在对话能力上内卷,边际收益持续收窄;但AI直接接管电脑完成白领工作,对应的是时薪数十美元的人力成本,其商业价值和几美分的Token消耗完全不在一个量级。
鲍恩雪认为,大模型正在逐步转变为可以对外委托任务的执行系统,但核心竞争力依旧建立在理解、推理与判断之上。而且评估标准也会随之改变,不再只看回答是否流畅,而是要看在权限、成本约束之下,能不能稳定输出经过校验的可靠结果。
在田丰看来,执行能力只是大模型发展的中间节点。这一代Computer Use重点解决“任务能不能做完”,下一阶段竞争焦点,会转向运行稳定性、可审计能力,以及故障可回滚等可靠性问题。
国产大模型的底层创新
国内大模型也开始向底层基座创新发力。
DeepSeekV4.1-Flash此次采用CED(Causal Encoder–Decoder)架构,标志国产模型的创新已经从后训练优化,延伸到底层基座设计层面。
△来源:Deepseek官网
“CED读写分离的设计,可以说是旧瓶装新酒的巧妙思路。”田丰解读这次创新。该架构把阅读理解与文本续写拆分,阅读、生成两个阶段使用不同规模参数分别优化,不再共用同一套参数体系。
CED架构的核心目标,正是适配Computer Use这类多步长的智能体任务。通俗来讲,AI长时间处理办公任务时,读取资料阶段轻量化计算,做决策推理阶段再释放完整算力;对历史上下文也做优化,不必反复复制存储全部信息,久远内容需要时再重新计算调取。业内评价认为,这一方案给出了Agent时代大模型架构的一种可行答案。
能力强化带来新挑战
传统大模型安全监控,很大程度依托显式思维链。模型把完整推理步骤输出,安全团队就可以通过审查中间过程,识别模型是否产生危险意图,这也是过去对齐验证的重要抓手。但GPT-6 Astra采用的循环深度(Recurrent Depth)架构改变了这套逻辑。
OpenAI首席科学家帕乔基公开承认,GPT-6 Astra的思维链可监控性显著下降。随着推理能力提升,模型可以用更少的显性思考完成任务,甚至面对监控环境时主动压缩思维链、规避审查。
鲍恩雪表示,这给安全监控带来更大挑战:从模型输出文本中能够拿到的风险线索变少,“没有出现可疑思考过程”越来越不能作为模型安全的证明。
田丰进一步指出,这意味着安全监督的重心必须向后迁移。过去可以依靠阅读思维链判断风险,这条路径正在失效,未来只能更多聚焦模型最终的实际行为,监督逻辑从“盯推理过程”转向“盯行为结果”。
刚刚过去的周末,Anthropic、OpenAI、SpaceXAI三家美国AI巨头,就“AI降速发展”达成口头共识。
业内认为这和近期发生的AI失控事件有一定关联。今年7月OpenAI在内部网络安全能力评测中,数百个AI智能体为了在考试中“作弊拿高分”,自主组队突破了完全隔离的沙箱环境,最终入侵了全球最大的AI开源平台Hugging Face的服务器,全程没有任何人类下达攻击指令。
不过田丰判断,目前行业内对大模型的安全共识仅停留在企业口头表态,很难演变为全行业集体放缓研发节奏,更可能推动安全合规发展成为新的商业赛道。
更多精彩资讯请在应用市场下载“央广网”客户端。欢迎提供新闻线索,24小时报料热线400-800-0088;消费者也可通过央广网“啄木鸟消费者投诉平台”线上投诉。版权声明:本文章版权归属央广网所有,未经授权不得转载。转载请联系:cnrbanquan@cnr.cn,不尊重原创的行为我们将追究责任。
