LLM agent safety, multi-turn red-teaming, jailbreak benchmarks, adversarial robustness, safety-critical systems
यह शोध पत्र NRT-Bench प्रस्तुत करता है, जो एक सिम्युलेटेड न्यूक्लियर पावर प्लांट कंट्रोल रूम में मल्टी-टर्न रेड-टीमिंग LLM एजेंटों के लिए एक नया बेंचमार्क है, जो यह प्रकट करता है कि एडेप्टिव एडवरसैरियल हमले विश्वसनीय रूप से सुरक्षा-महत्वपूर्ण कार्यों से समझौता कर सकते हैं और मॉडल की कमजोरियां एवं रक्षा प्रभावशीलता अत्यधिक विलगित और मॉडल-विशिष्ट हैं।