Preprint
Aug 2026
Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention
This work presents a synchronization-aware acceleration framework for efficient audio-visual generation by explicitly accounting for cross-modal dependence during acceleration, and improves inference efficiency while keeping video quality, audio quality, and audio-video synchronization.
Sheng-Chuan Gao, Teng Hu, Bohao Feng et al.
· 0 citations