具身智能观察

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

技术动态

来源:arXiv cs.RO发布时间待核实

arXiv:2604.03540v4 Announce Type: replace Abstract: Diffusion policies effectively model multimodal action distributions for robotic manipulation, but their iterative denoising requires tens to hundreds of network function evaluations (NFEs) for each control prediction, limiting their applicability to high-frequency closed-loop control and online reinforcement learning (RL).

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control | 具身智能观察