Stress Testing Concept Erasure with Large Language Model Agents
यह शोध पत्र STACE को प्रस्तुत करता है, जो कई LLM एजेंटों का लाभ उठाकर अनुकूलन योग्य स्ट्रेस टेस्ट को पुनरावृत्ति रूप से उत्पन्न और सत्यापित करने वाला एक स्वायत्त ढांचा है, जिससे यह जनरेटिव मॉडल में कॉन्सेप्ट इरेज़र के आकलन के लिए स्थिर मूल्यांकन विधियों की तुलना में अधिक मजबूती से प्रदर्शन करता है और LLM जेलब्रेकिंग जैसे अन्य डोमेन में अपनी प्रयोज्यता प्रदर्शित करता है।