Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
ConSPO is a Contrastive Sequence-level Policy Optimization method that uses length-normalized sequence log-probabilities as rollout scores and contrasts verified positive rollouts against negative distractors within the same group, and outperforms strong baselines on challenging reasoning benchmarks.