Preprint
Aug 2026
PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models
The results show that LVLM predictions are sensitive to lexical, OCR-derived and stylistic cues, with injected surface signals causing substantial changes in model predictions despite unchanged underlying image-text relationships.
Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh Saarland University et al.
· 0 citations