国产大模型近期低调蓄力,智谱下一代模型GLM-5.4/5.5的轮廓正逐渐清晰。创始人唐杰在新加坡演讲中透露,新模型预训练数据和规模将扩大到几个T,参数量从目前的7400多亿级别提升至至少1万亿以上,以进一步抬升智能上限。
在后训练环节,智谱素有“后训练仙人”之称,GLM-5.4/5.5将继续强化SFT、RLHF、RLVR等训练,巩固这一优势。
更关键的是方向转变。唐杰认为,当下AI已基本不必再卷对话和写代码,GLM-5.4/5.5将走两条尚无成熟先例的新路:RSI自主迭代升级,以及更长程、更自主的Agent,让模型在更复杂环境和更长周期任务中自主思考与操作。
唐杰此前将下一代大模型定义为“完全自训练”,即从预训练到中训练、后训练都能自我训练与进化,美国同行称之为RSI递归自我改进。其核心难题在于模型能否自行判断何时停止、何时纠错,而非简单把模型训大。不过该定义当时被认为指向GLM-6,GLM-5.4/5.5预计只会落地部分RSI成果,完全自主进化尚需时日。
