Detecting Data Poisoning Attacks in Medical Imaging Using Explainability-Driven Features
The integrity of training data is crucial for reliable medical image analysis; however, modern deep learning models remain vulnerable to data poisoning attacks. Such attacks can degrade diagnostic performance while remaining difficult to detect, particularly when a small fraction of the training data is poisoned. Existing defenses require access to the training data or rely on manual data sanitization techniques, which limit their applicability in medical imaging environments constrained by privacy and deployment restrictions. In this work, we propose a model-centric Explainable Artificial Intelligence (XAI)-based approach to identify data poisoning in medical imaging classifiers. The proposed approach examines the consistency between model predictions and associated relevance explanations. Discriminative features extracted from the explainability maps are used to train secondary classifiers that distinguish between models trained on clean and poisoned data. Our approach eliminates the need for data-level inspection and introduces an explainability-driven paradigm for post-training poisoning detection in medical imaging systems. The proposed framework is validated across multiple medical imaging modalities using Convolutional Neural Networks (CNNs) and Vision Transformer (ViT) architectures. Experimental results demonstrate strong data poisoning detection under low poisoning rates, achieving AUC scores of 0.88–0.94 across datasets at a 2% poisoning rate. These results highlight the potential of explainability-driven features as an effective privacy-preserving mechanism for detecting poisoned medical imaging models.