Reasoning Together: Designing and Evaluating MLLM Team Strategies for Multimodal Quiz Questions
Multimodal large language models (MLLMs) often struggle with open-ended questions requiring the integration of visual evidence, indirect textual clues, and background knowledge. We investigate whether team-based inference improves performance on Russian-language multimodal What? Where? When? questions. We introduce a n...