EOPSA: Efficient On-Policy Self-Distilled Safety Alignment
Efficient On-Policy Self-Distilled Safety Alignment (EOPSA), which concentrates computational and gradient budgets exclusively on reliably supervised, safety-critical tokens, is proposed, consistently outperforming full-token distillation baselines in both safety compliance and reasoning retention.