SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
SafeDialBench evaluates LLM safety across 22 scenarios and 7 attack strategies.
Hongye Cao, Sijia Jing, Yanming Wang et al.