Embodied Intelligence Observer

PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation

IndustryAI 66

Source: arXiv cs.ROPublish time unverified

arXiv:2601.17885v2 Announce Type: replace-cross Abstract: Bimanual manipulation in cluttered scenes requires policies that remain stable under occlusions, viewpoint changes and scene variations. Existing vision-language-action models often lack such robustness because (i) multi-view features are fused via view-agnostic token concatenation, yielding limited cross-view spatial representations, and (ii) language is injected as global conditioning, resulting in coarse instruction grounding.

PEAfowl:感知增强多视角 VLA 双臂操作 | Embodied Intelligence Observer