Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
Research
Source: arXiv cs.ROPublish time unverified
arXiv:2604.03540v4 Announce Type: replace Abstract: Diffusion policies effectively model multimodal action distributions for robotic manipulation, but their iterative denoising requires tens to hundreds of network function evaluations (NFEs) for each control prediction, limiting their applicability to high-frequency closed-loop control and online reinforcement learning (RL).