Preprint
Jul 2026
SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
This work introduces SANA-Video 2.0, a hybrid video diffusion transformer instantiated at 5B and 14B scales under a unified architecture that recovers softmax-level expressiveness at substantially reduced cost, unlocking scalable long, high resolution video generation.
Junsong Chen, Jincheng Yu, Yitong Li et al.
· 0 citations