Multi-Agent System Search via Active Substructure-aware Policy Optimization
ASPO introduces an Adaptive Query-Selection Mechanism (AQSM) that focuses training on queries at the policy's competence boundary: those it can solve but not yet reliably, and introduces substructure-level rewards that measure output-quality gains within each action's descendant subgraph.
Bei-Cheng Xu, Bo-Wen Fan, Wei Qian et al.
· 0 citations