CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
This work proposes CF-VLA, a coarse-to-fine two-stage formulation that restructures action generation into a coarse initialization step that constructs an action-aware starting point, followed by a single-step local refinement that corrects residual errors.