具身智能观察

世界模型进入下半场:自变量 WALL-SS 突破三大瓶颈,让虚拟世界成为机器人的「训练场」

自变量机器人产业动态AI 82

来源:极客公园发布时间待核实

机器人世界模型的下一场竞争,可能不是画质,是架构。 作者|Li Yuan 编辑|郑玄 一只机械臂的夹爪明明没有夹住杯子,杯子却像被磁铁吸住一样,跟着夹爪升了起来。这个看似荒诞的问题,正在困扰机器人世界模型,业内甚至将其称为「磁铁式抓取」。 视频生成模型只要让画面看起来合理,就算完成任务;但世界模型不能只追求「像真的」。机器人训练数据大多来自成功演示,模型容易形成捷径:与其理解动作的细微差别,不如按照画面,直接生成最可能的结果。 可在真实世界里,夹爪位置偏移几毫米,就可能让结果从抓起变成碰倒杯子甚至抓空。世界模型真正需要理解的,是动作与结果之间的因果关系。 8 月 27 日,自变量机器人发布下一尺度自回归世界模型 WALL-SS,试图让世界模型从「能用」走向「好用」。WALL-SS 不是一次性生成整个画面,而是通过由粗到细的方式描绘未来,让不同动作真正对应不同结果;同时结合长时记忆机制,实现最长 60 秒连续推演。 测试显示,WALL-SS 连续推演 60 秒后,画面和运动轨迹仍更接近真实视频,动作跟随得分达到 0.29,而 Cosmos3-Nano 为 0.044,其他测试模型干脆为 …

相关动态

世界模型进入下半场:自变量 WALL-SS 突破三大瓶颈,让虚拟世界成为机器人的「训练场」 | 具身智能观察