Jul 2026
Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning
This paper develops an online, off-policy policy-iteration framework for reinforcement learning (RL), based on sparse Gaussian-mixture-model Q-functions (S-GMM-QFs), enabling interpretable sparsification through smooth regularization that facilitates Riemannian-based optimization.
Minh Vu, Konstantinos Slavakis
· arXiv.org · 0 citations