阿里CEO吴泳铭在云栖大会预测,未来机器思考总量将超人类1000倍,但机器智能的代表性产品尚未出现。与此同时,学术界正把“超智能”从口号拆成可执行的工程图纸,其中世界模型与物理AI被视为AGI的最后一块拼图。
上海AI实验室给出锋利定义:世界模型是在有限算力下,对物理世界状态转移过程的压缩建模。核心是信息论意义上的压缩,生成视频只是压缩到位后的涌现能力。其关键论断是“数据决定上限”——泛化能力由训练数据的物理多样性决定,而非模型结构。
近三个月,世界-动作模型(WAM)成为新接口。传统VLA是“看到就做”,WAM则先预测“这样做世界会怎样”,再决定动作,让机器人从条件反射走向谋定后动。智元GE-Act 2.0验证了机器人Scaling定律:数据从300小时拉到3万小时,零样本精细任务从39项涨到76项,折叠毛巾等动作“突然开窍”。
数据从哪来?“倒置金字塔”工作流给出方法论:先用互联网视频解锁物理先验,再逐层过滤提纯。智元τ0-WM在约2.7万小时异构语料上预训练,仅5B参数便统一了动作生成、视频预测与任务评估。
南洋理工大学的分级给出清醒判断:具身AGI分L1到L5,当前所有系统都处在L1到L2之间。与聊天AGI不同,通用机器人必须像有记忆的生命那样持续进化。世界模型是那座桥,机器人是AGI在物理世界的落脚点。
