Scaling robotic foundation models requires diverse training data and reliable evaluation environments. Simulation offers a scalable solution, yet existing generation pipelines remain constrained by predefined assets and skills, a disconnect between scene generation and task generation, and limited support for complex e...
Yi-Kai Qin, Yi-Fei Deng, Ming-Jian Liang et al.· 0 citations
World Action Models (WAMs) use video generation models to predict future visual dynamics for robotic manipulation, but iterative denoising introduces additional latency for closed-loop control. We empirically find that visual content converges at different rates during denoising. Static background structure forms early...
Jing Lyu, Shuanghao Bai, Run-Ze Xiao et al.· 2 citations
Contact-rich dexterous manipulation requires policies that translate physical feedback into motion commands while regulating interaction loads across evolving multi-contact interactions. This requires haptic observations of contact state and action supervision showing how commands should adapt. Existing policies often...
Nai-Sheng Ye, Yin-Zhe Zhou, Jun-Kai Zhao et al.· 0 citations
Vision-language-action models benefit from the understanding and reasoning capabilities of pretrained vision-language models, but action-only supervision provides limited grounding in world dynamics. Conversely, world-action models inherit spatiotemporal priors from video generation models, yet remain limited in semant...
Wen-Xuan Song, Jia-Yi Chen, Jing-Bo Wang et al.· 1 citation
Completeness-aware Motion Correspondence (CMC), a ground-truth-anchored evaluation protocol that jointly measures localization, trajectory completeness, visibility, and continuity, counting missing predictions as failures on visible dynamic points, is introduced.
Kun-Wei Wu, Xiang Liu, Guo-Cai Yao et al.· 0 citations
DeCAL is presented, a physically-grounded dexterous vision-language-action model that unifies understanding, imagination and action generation for contact-rich dexterous manipulation and introduces Adaptive Visuo-Tactile Fusion that dynamically regulates tactile interactions via a contact-aware gating strategy.
Yan-Kai Fu, Ning Chen, Jun-Kai Zhao et al.· 0 citations
4D-WAM is proposed, a model-agnostic training strategy that injects spatiotemporal knowledge from 3D trajectory fields into WAMs through representation alignment, enabling WAMs to learn trajectory-level spatiotemporal representations.
Lishan Yang, Wen-Xuan Song, Xi Wang et al.· 5 citations· ⚡1