A culturally situated reward model that assigns rewards according to cultural appropriateness in open-ended social scenarios, and a collaborative multi-agent framework that instantiates implicit cultural norms into diverse social scenarios to construct culturally situated data are introduced.
Ze-Kun Yuan, Yang-Fan Ye, Bao-Hang Li et al.· 0 citations
DHRCL decomposes feedback into syntax validation, execution success, unit-test pass rate, and AST-based structural similarity, and organizes these signals through a three-stage Syntax, Execution, Pass&Structural curriculum, and introduces stage-aware probability-based token credit redistribution.