ActionLens: Diagnosing Spatial-Temporal Binding Failures in Vision-Language Models
This work introduces ActionLens, a diagnostic benchmark of 6,701 multiple-choice video questions spanning five targeted diagnostics: transition detection, actor-specific identification, concurrent action binding, directed interaction reasoning, and gaze detection, and diagnostic measurements of these distinct failure m...