Fairness Audit and Debiasing of Machine Learning Models for Sepsis Mortality Prediction Across Demographic Subgroups: A Multi-Metric Study with Accuracy–Fairness Tradeoff Analysis
Abstract
Machine learning (ML) models for sepsis mortality prediction are increasingly deployed in intensive care units, yet performance across demographic subgroups remains poorly evaluated, and algorithmic disparities can directly exacerbate health inequities in critical care settings. We trained three ML models—logistic regression (LR), XGBoost, and a multilayer perceptron (MLP)—on a 10,000-patient cohort calibrated to published MIMIC-IV sepsis statistics, and performed a four-metric fairness audit (equalized odds difference [EOD], demographic parity difference, predictive parity gap, and subgroup calibration error) across race/ethnicity, sex, and insurance type. Per-group threshold optimisation was applied for debiasing, and an accuracy–fairness Pareto tradeoff was quantified.