具身智能观察

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

技术动态

来源:arXiv cs.RO发布时间待核实

arXiv:2608.25864v1 Announce Type: new Abstract: Multi-arm collaboration is becoming a core capability in embodied manipulation. Recent vision-language-action (VLA) models integrate perception, language, and control, but most represent language as a single global instruction and do not provide an explicit mechanism for assigning and composing arm-specific behaviors. This design limits transfer to collaboration patterns that differ from those observed during training.

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization | 具身智能观察