V-Align: Visual Forced Alignment via Phoneme to Video Optimal Path Traversal
V-Align is proposed, a structured framework that formulates VFA as an optimal mono-tonic path traversal problem over a frame–phoneme compatibility lattice and learns a soft traversal posterior and recovers discrete boundaries via dynamic programming.