MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
技术动态
来源:arXiv cs.RO发布时间待核实
arXiv:2608.25864v1 Announce Type: new Abstract: Multi-arm collaboration is becoming a core capability in embodied manipulation. Recent vision-language-action (VLA) models integrate perception, language, and control, but most represent language as a single global instruction and do not provide an explicit mechanism for assigning and composing arm-specific behaviors. This design limits transfer to collaboration patterns that differ from those observed during training.