STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
STAR is proposed, an efficient PbRL method that integrates preference margin regularization and policy regularization that improves feedback efficiency and facilitates more robust reward and value function learning.