Embodied Intelligence Observer

IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125

Industry

Source: 雷峰网Publish time unverified

将动作从输出端搬到调度端,推理速度提升1.79倍。 作者丨邓哲敏 编辑丨齐铖湧 机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。 不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。 VLA 模型是当前具身智能领域最受关注的技术路线之一。它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。但 VLA 模型有一个部署层面的老大难问题:推理太慢。 每个控制时刻,模型都要把一个庞大的视觉语言骨干网络跑一遍,计算量极大,导致延迟居高不下,实时控制频率难以保证。 这个问题并不新鲜,学界已经有不少人在尝试解决。今年 IJCAI 收录的一篇论文认为,现有的大多数方案都走偏了一步。AI科技评论(雷峰网公众号)联系到一作于闻达,围绕高效 VLA 方法进行交流。 论文原文:https://arxiv.org/abs/2601.19634 01 大家都在剪视觉, 但问题真的在这儿吗 现有的高效 VLA 方法,主流路线是在视觉侧做文章,剪掉“不重要”的视觉 …

IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125 | Embodied Intelligence Observer