2026年,具身智能行业掀起“百万小时数据”热潮,鹿明机器人等企业宣布年内建成超100万小时数据产能,期望复现大语言模型的规模化效应。
数据构成比总量更关键:真机采集成本高达每小时千元,UMI等低成本方案可降至300-650元/小时,低成本数据负责泛化,真机数据负责控制对齐,二者缺一不可。
实验证实扩大数据规模可提升模型表现,但“100万小时”并非标准单位,其有效性取决于数据多样性,且现有实验未验证该规模存在能力跃迁的临界点。
真正的“ChatGPT时刻”需机器人开箱即用,依赖部署后数据回流,百万小时作为数据工业化的里程碑,能否带来质变仍需首批模型验证。
