Open access
Jul 2026
Effect of evaluation prompt strategies on LLM-as-a-judge reliability in critical care.
Bottom-up incremental scoring showed the closest alignment with human assessment in clinical AI evaluation, underscoring the need for standardised prompt architectures in clinical AI evaluation.
Jia-Yu Yan, Wing-Sum Chan, Ching-Tang Chiu et al.
· Anaesthesiology Intensive Th... · 0 citations