#natural language process...
Jun 2026
When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs
It is shown that raw global calibration metrics are not robust for cross-model comparison, and that fair calibration comparison requires accuracy-aware evaluation, and proposed ACE, an accuracy-controlled evaluation framework, is proposed.
Zhichao Yang, Caiqi Zhang, Ruihan Yang et al.
· arXiv.org · 1 citation