Reinforcement Learning with Verifiable Rewards for Small Search Agents
The reason-over-search setting can supply a suitable reward for RLVR on small models, but small-model RLVR needs its own reward-design study rather than a scaled-down copy of a large-model recipe.
Gaurisankar Jayadas, A. Plaat, Álvaro Serra-Gómez et al.
· 0 citations