具身智能观察

PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation

产业动态AI 66

来源:arXiv cs.RO发布时间待核实

arXiv:2601.17885v2 Announce Type: replace-cross Abstract: Bimanual manipulation in cluttered scenes requires policies that remain stable under occlusions, viewpoint changes and scene variations. Existing vision-language-action models often lack such robustness because (i) multi-view features are fused via view-agnostic token concatenation, yielding limited cross-view spatial representations, and (ii) language is injected as global conditioning, resulting in coarse instruction grounding.