Book
Open access
Aug 2026
Hierarchical Residual Policy Optimization for Generative Recommendations
Hierarchical Residual Policy Optimization (HRPO), a post-training framework that converts item-level outcomes into dense, token-aligned learning signals for conservative token-wise improvement, is proposed.
Kaifeng Guo, Yiming Yang, Jingtong Gao et al.
· Proceedings of the 32nd ACM... · 0 citations