2025
STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
STAR is proposed, an efficient PbRL method that integrates preference margin regularization and policy regularization that improves feedback efficiency and facilitates more robust reward and value function learning.
Fengshuo Bai, Rui Zhao, Hongming Zhang et al.
· Neural Information Processin... · 5 citations