Preprint
Aug 2026
V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models
V-Link is proposed, which explicitly recovers visual representations during the vision-language (VL) to action (A) feature transfer and injects them into Action DiT through asymmetric pathways.
Ye-Hao Lu, Jiarui Yang, Yu-Ning Su et al.
· 0 citations