Preprint
Jul 2026
Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models
Oyster-II is proposed, a reinforcement learning (RL)-based constructive safety alignment framework that adopts a Zero-RL paradigm combined with a multi-stage reinforcement learning strategy that comprehensively surpasses both Qwen3-14B and its predecessor Oyster-I on safety dimensions.
Jiyang Guan, Yong Xie, Jun Chen et al.
· 0 citations