A unified geometry-aware framework for calibration-free cross-modal image-to-point cloud registration
Abstract
Multi-view point cloud registration is critical for autonomous driving and 3D reconstruction. While incorporating image data enhances performance, current cross-modal methods relying on explicit fusion or geometric projection suffer from modality distribution gaps, calibration sensitivity, and high computational costs. To address these limitations, we propose UGA-Reg, a distribution-driven framework for efficient cross-modal registration operating across three levels: (1) Global Distribution Alignment minimizes latent space discrepancies to reduce statistical shifts and training instability; (2) Structure-aware Attention integrates geometric constraints into cross-modal interactions, ensuring local consistency and reliability in low-overlap regions; (3) Soft Correspondence Field replaces rigid matching with probabilistic associations, enabling robust transformation estimation without precise point-to-point alignment. Unlike existing approaches, UGA-Reg eliminates calibration dependency, maintains structural coherence across modalities, and achieves near real-time inference efficiency. Experiments on 3DMatch, 3DLoMatch, and KITTI datasets demonstrate that UGA-Reg outperforms existing methods, particularly in low-overlap scenarios, offering a new paradigm for accurate and efficient cross-modal registration.