Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations
ThReadMed-QA is introduced, a multi-turn medical dialogue dataset of 2,437 patient-physician conversation threads comprising 8,204 question-answer pairs that enables systematic evaluation of whether models can detect and correct misconceptions under a multi-turn context.