2026年以来,世界模型成为AI圈最拥挤的赛道。李飞飞World Labs融资10亿美元,杨立昆新公司以10.3亿美元刷新欧洲种子轮纪录,国内前7个月相关融资超666亿元、超50家企业获投。但智源研究院院长王仲远直言:现在谈世界模型有稳定现金流,还早。
王仲远认为,自动驾驶和工业数字孪生付费意愿最强,但世界模型能力尚不满足核心需求;游戏影视对幻觉容忍度高,更可能先见付费案例;机器人则受困于硬件、数据与模型的能力循环悖论。他判断,第一条稳定现金流或出现在工业仿真与影视游戏交织地带,如合成数据与预演评估。区分真假世界模型的核心指标是闭环成功率——模型内执行与真机执行的概率是否高度一致。
他反复强调:视频生成不等于世界模型。视频模型训练数据含大量科幻内容,目标并非还原物理规律,若无法区分真实与虚幻,进入物理世界将产生重大风险。现有四条路线——语言中心多模态、像素中心视频生成、三维空间智能、JEPA视觉表征——距离真正面向物理世界的基座模型都还有很大差距。智源正押注第五条路:将所有模态压缩进统一潜空间,再由不同解码器还原。
王仲远概括:VLA是当下,世界模型是未来。具身大模型仍处GPT-3之前的探索期,行业应沿途下蛋,在工业场景落地并持续采集数据反哺基座。数据是最大瓶颈,但视频数据是被低估的富矿。智源提出W0到W5分级体系探索第三方评测,定位公共底座,不押具体场景,全力押通用物理基座能力。
