Preprint
Aug 2026
Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping
Experimental results show that RL fine-tuning of Qwen3-32B via RobustTests achieves a 3% absolute gain on LiveCodeBench, demonstrating its effectiveness in advancing LLM code generation proficiency.
Yiwen Zhang, Xiaodong Yan, Zhenyu Huang et al.
· 0 citations