Reinforcement Learning Methods and Optimization Strategies in Preference Alignment Techniques for Large Language Models
The growing pre-training scale has improved large language models' performance in language generation and knowledge representation. However, their training objectives remain limited to fitting data distributions, thus making it difficult to guarantee that the output satisfies human intentions and safety constraints. Th...