Preprint
Jul 2026
Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
Progress-conditioned Group Policy Optimization is proposed, which uses first-visit observation coverage only when all samples in a group receive zero outcome reward, and consistently improves over group-based baselines, with particularly large gains on hard tasks.
Kaibing Yang, Guangfeng Cai, Shengtian Yang et al.
· 0 citations