Preprint
Jul 2026
It Takes a MAESTRO To Prune Bad Experts
MAESTRO (Markov-chain Approximated Expert Sparsification via Transition-based ROuting), a structured pruning framework designed for MoE architectures that models autoregressive expert activation trajectories as Ergodic Markov chains whose stationary distributions encode cross-layer dependencies, yielding a globally aware importance heuristic is introduced.
Palaash Goel, Ayush Maheshwari, Tanmoy Chakraborty
· 1 citation