💬 NLP
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
SafeDialBench एक नया सूक्ष्म-स्तरीय (fine-grained) बेंचमार्क है जिसे एक पदानुक्रमित वर्गीकरण (hierarchical taxonomy), विविध जेलब्रेक हमला रणनीतियों और एक व्यापक मूल्यांकन ढांचे का उपयोग करके बहु-चरणीय संवादों में लार्ज लैंग्वेज मॉडल्स की सुरक्षा का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो कई भाषाओं में डिटेक्शन (detection), हैंडलिंग (handling) और निरंतरता (consistency) क्षमताओं को मापता है।
Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Boyan Wang, Jiaheng Liu, Tia (…)2026-02-10