RS-CARES: Context-Aware Cross-Modal Alignment with Semantic Spatial Prior for Referring Remote Sensing Image Segmentation
Remote sensing referring image segmentation faces critical challenges including arbitrary target rotation, drastic scale variation, cluttered complex backgrounds, and large visual-language semantic gaps. Existing mainstream segmentation models adopt fixed-receptive-field backbones, coarse unidirectional cross-modal int...