Open access
Jul 2026
TSA: A Two-Stage Jailbreak Attack Exploiting Logical Consistency of Large Language Models
The findings suggest that such logical-consistency-based vulnerability may exist among the tested mainstream LLMs, highlighting the necessity to optimize safety alignment for defending against this category of reasoning-driven jailbreak attacks.
Yiming Du, Wenjuan Lian, Hongbao Zhang et al.
· Electronics · 0 citations