Auditing Industrial Wind RAG Evaluation: Cross-Family Scoring and Fair Question Selection Reveal Graph-Enhanced Retrieval Advantages
Retrieval-augmented generation (RAG) benchmarks increasingly use a single large language model (LLM) judge, whose bias can hide differences between retrieval methods. We audit a wind-turbine operation-and-maintenance benchmark with 173 questions, eight methods, and LLM-generated reference answers. Reviewing 65 items id...