具身智能观察

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

技术动态

来源:arXiv cs.RO发布时间待核实

arXiv:2608.25659v1 Announce Type: new Abstract: Vision-Language-Action (VLA) policies have advanced language-conditioned robotic manipulation, yet action-imitation objectives provide only weak supervision for metric 3D structure and short-horizon physical evolution. Geometry-enhanced policies mainly improve current-scene grounding, whereas predictive policies often model future dynamics in RGB or latent spaces and may incur substantial deployment cost.

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation | 具身智能观察