Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC
Solver-Gradient Guided Reinforcement Learning is proposed, a solver-sensitivity augmentation for RL-based online MPC cost-weight adaptation that reaches PPO's best closed-loop return with up to 70.6% fewer samples, and outperforms GB-PL baselines by at least 54% in closed-loop return.
Baha Zarrouki, Arslan Thobani, Jasper Hoffmann et al.
· 0 citations