Recursive Self-Improvement via On-Policy Distillation for Reasoning
DCE+SRCL outperforms OPSD across multiple model scales and four competition-level mathematics benchmarks, and its comprehensive evaluations show that DCE+SRCL outperforms OPSD across multiple model scales and four competition-level mathematics benchmarks.
Shang-Jian Yin, Ze-Hao Zhao, Kavosh Asadi et al.
· 0 citations