Preprint
Aug 2026
Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking
The Modality Masking Mechanism (M3), an embarrassingly simple, training-only strategy that requires no architectural changes or large-scale robot pretraining, is introduced to improve robustness of query-based VLA policies for bimanual manipulation.
Dong-Zhou Cheng, Ziang Li, Yixiao Zhou et al.
· 0 citations