XMask3D++: Cross-Modal Mask Reasoning for Open Vocabulary 3D Segmentation.
Existing methodologies in open vocabulary 3D semantic segmentation primarily concentrate on establishing a unified feature space encompassing 3D, 2D, and textual modalities. Nevertheless, traditional techniques such as global feature alignment or vision-language model distillation tend to impose only approximate corres...