Preprint
Sep 2026
Multimodal Floorplan Encoding: Learning Dense Modality-Invariant Representations
The Multimodal Floorplan Encoder (MMFE) is introduced, which maps diverse 2D indoor representations into a shared dense latent grid and improves cross-modal dense matching, enables robust similarity alignment with RANSAC, and yields strong retrieval when paired with learned aggregation.
X. Anadón, Rémi Pautrat, Rui Wang
· 0 citations