A Systematic Comparison of Multilingual Interpretability Methods Reveals Anisotropy-Driven Failures
Only ILO's correlation with cross-lingual transfer (Spearman's $\rho = 0.90$) survives controls for model size, family, and per-task variation and is recommended as the primary sharing metric to be reported alongside anisotropy diagnostics.