Embodied Intelligence Observer

WAM-OPD:世界动作模型的在线策略蒸馏

Original title: WAM-OPD: On-Policy Distillation for World Action Models

IndustryAI 66

Source: arXiv cs.ROPublish time unverified

arXiv:2608.22364v1 Announce Type: cross Abstract: World action models (WAMs) couple visual future prediction with robot action generation, but accelerated students can lose task capabilities during distillation and later encounter states that are poorly represented by offline data. We study whether on-policy distillation (OPD) can repair such a student without requiring sparse-reward reinforcement learning.

WAM-OPD:世界动作模型的在线策略蒸馏 | Embodied Intelligence Observer