理想Foundation Model团队正式发布世界动作触觉模型ME-Dex-1.0,核心思路是将触觉从辅助条件提升为未来世界中需要预测的组成部分。模型联合去噪未来视频、未来触觉与动作序列,把场景变化和接触动态直接连接到机器人控制。
架构上,ME-Dex-1.0采用三专家设计:视觉专家建模未来场景变化,触觉专家预测空间接触动态,动作专家生成可执行动作序列,并通过H-Bridge共享注意力在中间层完成跨模态信息交换。针对触觉数据稀缺,团队以自主式触觉数据引擎扩展RoboTwin与DexJoCo数据,并将异构传感器映射到双手34区域模板,用区域掩码区分不可观测与未接触。
评测结果亮眼:RoboTwin Clean-only平均成功率78.9%,领先最强基线7.6个百分点;11项联合训练任务总体成功率65.3%,比DECO高8.9个百分点;ManiFeel平均成功率70.0%,比官方基线高15个百分点。DexJoCo的11项任务中7项排名第一,电源插头插入成功率由58%升至88%。
理想还展示了仿真与真机任务视频,覆盖DexJoCo、RoboTwin及LeRobot SO-101 PX、Xynova Flex2两套真机系统,触觉图可实时呈现接触位置与受力变化。团队下一阶段将扩大跨平台触觉预训练,并研究触觉驱动的局部反馈控制,提升精细操作响应速度。
