EVA: Efficient Token Compression Co-Optimization With Heterogeneous CIM Architecture for Video LLM Acceleration
Video large language models (VLLMs) enable powerful multimodal reasoning but face severe efficiency challenges on edge devices due to the massive computational and memory demands caused by lengthy video-token sequences. Existing methods struggle to efficiently compress spatiotemporally redundant tokens while minimizing...