Jul 2026
PrefReward: Learning User Preference Matrix for Personalized Text Generation
Experiments on the LongLaMP dataset show that PrefReward outperforms non-personalized and retrieval-based baselines in both generation quality and personalization interpretability.
Yue Wu, Chengbing Wang, Yimeng Bai et al.
· arXiv.org · 0 citations