Jul 2026
Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning
The implication is not that $N=2$ is universally sufficient, but that small-population failure in capable-model binary ES can be an implementation artifact rather than an intrinsic population limit.
Cho Sung, Gyubin Han
· arXiv.org · 0 citations