A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation
यह शोध पत्र लक्ष्य (target), हमलावर (attacker) और निर्णायक (jury) मॉडलों का उपयोग करते हुए एक नवीन बहु-भूमिका वाले रेड टीमिंग ढांचे को प्रस्तुत करता है जो बड़े भाषा मॉडलों (LLMs) में कमजोरियों का व्यवस्थित रूप से मूल्यांकन करने और उन्हें उजागर करने के लिए है, जो यह प्रदर्शित करता है कि आर्किटेक्चरल डिज़ाइन विकल्प विविध कार्यों और भाषाओं में सुरक्षा और निष्ठा (faithfulness) को महत्वपूर्ण रूप से प्रभावित करते हैं, साथ ही सूक्ष्म अननिष्ठता (unfaithfulness) का पता लगाने और क्रॉस-लिंग्विस्टिक प्रतिकूल जनरेशन (cross-linguistic adversarial generation) को पूरी तरह से स्वचालित करने में वर्तमान सीमाओं को भी रेखांकित करता है।