Comparative performance of contemporary multimodal large language models in retinal imaging question answering
These findings support continued benchmarking and cautious, specialist-supervised use of multimodal LLMs in retinal education and structured imaging question answering and indicate that retinal image interpretation remains a major limitation.