Preprint
Aug 2026
Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models
Pre-projector VDE tracks layer-wise accuracy and its top-ranked layers cover the oracle best layer on every task for the SigLIP-based LLaVA-Video, while giving region-level guidance for the CLIP-based Video-LLaVA.
Ruchen Liu, Yi Yang, Yiming Xu et al.
· 0 citations