Preprint
Jul 2026
ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
This work proposes ViSAGE, a multimodal agentic memory framework that constructs self-correcting, entity-centric memories and applies bidirectional memory refinement to propagate delayed identity evidence, retroactively unifying historical records and improving future reasoning.
Xinkui Zhao, Enbo Chen, Yifan Zhang et al.
· 0 citations