Preprint
Aug 2026
Parameter Exploration for RLVR via Variational Learning
Evidence that parameter-space exploration can improve reinforcement learning for LLMs is presented, and a family of methods called Perturbed Parameter Policy Optimization (3PO) is introduced which use different sampling strategies and different rollout grouping for reward estimation.
Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych
· 0 citations