Embodied Intelligence Observer

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

Research

Source: arXiv cs.ROPublish time unverified

arXiv:2604.03540v4 Announce Type: replace Abstract: Diffusion policies effectively model multimodal action distributions for robotic manipulation, but their iterative denoising requires tens to hundreds of network function evaluations (NFEs) for each control prediction, limiting their applicability to high-frequency closed-loop control and online reinforcement learning (RL).

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control | Embodied Intelligence Observer