MedEvidence-RAG for Joint Evidence Retrieval and Generator Alignment in Medical Visual Question Answering and Report Generation
Medical vision-language models remain vulnerable to unsupported findings because their outputs are weakly grounded in images and external clinical evidence. We propose MedEvidence-RAG, which couples a mixture-of-experts (MoE) multimodal retriever with retrieval-conditioned generator alignment. The retriever uses a SigL...