RL-FAT: Reinforcement Learning for Fair Adversarial Training
RL-FAT is proposed, a reinforcement-learning-inspired fair adversarial training framework that uses policy-gradient based feedback from adversarial predictions to improve adversarial robustness while promoting a more balanced robustness distribution across classes.