ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification
This paper introduces a dual-task evaluation framework for binary safe/unsafe detection and granular harm classification across dialects, and evaluates seven frontier LLMs as response generators on harmful dialectal Arabic prompts and observes unsafe generation rates below 5 percent across models.