Skin Lesion Image Classification Based on Deep Learning: A Systematic Ablation Study of Heterogeneous CNN Ensembles
Abstract
Deep learning has achieved significant progress in automated skin lesion classification, yet most ensemble methods stack convolutional neural network (CNN) backbones without systematic justification for backbone selection or analysis of inter-model error c omplementarity. We construct a heterogeneous CNN voting ensemble comprising ResNet50, ResNet101, and EfficientNet -B0 for 7-class skin lesion classification on the ISIC2018 dataset. Beyond aggregate accuracy reporting, we conduct pairwise ablation of all tw o-model combinations, quantify error diversity via Cohen's kappa and prediction disagreement matrices, and provide per-class performance analysis for all seven diagnostic categories. The three-model voting ensemble achieves 83.93% accuracy, improving over individual baselines (ResNet50: 81.22%, ResNet101: 80.62%, EfficientNet- B0: 80.22%). Statistical significance testing (McNemar's test, p < 0.01) confirms that the ensemble improvement is not attributable to random variation. Per-class analysis reveals pers istent melanoma misclassification as nevus. Systematic ablation and error diversity analysis provide stronger justification for ensemble design than aggregate accuracy alone. Our findings establish a reusable analytical framework for rigorous ensemble evaluation in broader medical imaging classification tasks.