Jul 2026
Meta-Learning Preferences for Multilingual LLM Alignment
A meta-learning framework for Reinforcement Learning from Human Feedback and Direct Preference Optimization that learns a transferable initialization that enables effective adaptation to a target language with minimal data.
Jiayin Lin, Seongho Son, Nam Phuong Tran et al.
· arXiv.org · 0 citations