Jul 2026
Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization
This method generates candidate responses from the target policy, evaluates helpfulness, factuality, and conciseness with rubric-specialized evaluators, applies a process-critic correction, and retains only high-consensus desirable or undesirable examples.
Zhengtao Yao, Run-Hao Li, Xu-Peng Chen et al.
· arXiv.org · 0 citations