RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
This work proposes Reverse-Turn Policy Optimization (RTPO), which organizes multi-turn rollouts as sparse reverse trees and performs turn-level policy updates in temporal reverse order, aligning each decision with its downstream continuation.
Yugu Li, Jimmy Cao, Jianglin Qiao et al.
· 0 citations