Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators
यह शोधपत्र सुरक्षा मूल्यांकन में जज के रूप में LLMs की सीमाओं की जांच करता है, जो यह प्रकट करता है कि हालांकि वे नए संदर्भ से सीख सकते हैं, लेकिन वे विरोधाभासी जानकारी या परिभाषाओं के अनुकूल होने के बजाय अक्सर अपने आंतरिक सुरक्षा पूर्वाग्रहों (safety priors) का सख्ती से पालन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक विशाल खेल टूर्नामेंट पर नज़र रखने और यह तय करने के लिए सुपर-स्मार्ट रेफरी की एक टीम (ये AI मॉडल, या "LLM-जज" हैं) को काम पर रखा है कि कौन सी चालें "फेयर" (निष्पक्ष) हैं और कौन सी "चीटिंग" (धोखाधड़ी) हैं।
समस्या यह है कि खेल के नियम इस बात पर निर्भर करते हैं कि आप कहाँ खेल रहे हैं। एक देश में, एक विशिष्ट चाल फाउल है; दूसरे देश में, यह एक शानदार खेल है। साथ ही, हर दिन नए शब्द (slang) और नए प्रकार के पैंतरे आविष्कार किए जाते हैं।
यह पेपर एक सरल लेकिन डरावना सवाल पूछता है: क्या ये AI रेफरी वास्तव में उन नियमों का पालन कर रहे हैं जो आपने अभी उन्हें दिए हैं, या वे केवल अपनी पुरानी, आंतरिक नियम पुस्तिका के अनुसार खेल रहे हैं?
लेखकों ने पाया कि रेफरी आश्चर्यजनक रूप रूप से जिद्दी हैं। यहाँ सरल उपमाओं (analogies) का विवरण दिया गया है:
1. "जिद्दी रेफरी" की समस्या (Steerability)
आमतौर पर, जब आप एक रेफरी को काम पर रखते हैं, तो आप उन्हें एक नियम पुस्तिका देते हैं। आप कहते हैं, "यदि कोई गेंद को अपने हाथों से छूता है, तो यह एक फाउल है।"
- पेपर में क्या पाया गया: भले ही आप AI के सामने स्पष्ट रूप से एक नई नियम पुस्तिका लिखें, यह अक्सर आपकी बात को अनदेखा कर देता है। यह उसी आधार पर निर्णय लेता रहता है जो "सुरक्षा नियमों" (safety rules) के बारे में उसने अपने स्कूल के दौरान (अपने प्रशिक्षण के दौरान) सीखा था।
- उपमा: कल्पना कीजिए कि आपने एक ऐसे रेफरी को काम पर रखा है जो फुटबॉल खेलकर बड़ा हुआ है। आप उसे बताते हैं, "आज, हम बास्केटबॉल खेल रहे हैं, इसलिए हाथों का उपयोग करना ठीक है, लेकिन गेंद को लात मारना एक फाउल है।" रेफरी हाथों के उपयोग के लिए सीटी बजा सकता है क्योंकि, गहराई में, वह सोचता है, "नहीं, यह एक फाउल है! मैंने यह फुटबॉल में सीखा था!"
- ट्विस्ट: पेपर में पाया गया कि यदि आप रेफरी को यह कहकर चकमा देते हैं कि, "आइए इसे 'सेफ' या 'अनसेफ' कहने के बजाय बस 'कैटेगरी A' या 'कैटेगरी B' कहें," तो रेफरी अचानक आपके नए नियमों का पालन करने में बहुत बेहतर हो जाता है। ऐसा लगता है जैसे रेफरी केवल तब भ्रमित होता है जब "सुरक्षा" (Safety) और "नियमों" (Rules) जैसे शब्दों का उपयोग किया जाता है, जो उनके पुराने प्रशिक्षण को सक्रिय कर देते हैं।
2. "भटका हुआ छात्र" की समस्या (Susceptibility)
कभी-कभी, आप खेल शुरू होने से ठीक पहले रेफरी को एक चीट शीट या कुछ उदाहरण देते हैं कि किन चीजों को देखना है।
- पेपर में क्या पाया गया:
- पुराने पैंतरे: यदि आप रेफरी को "चीटिंग" के उदाहरण देते हैं, तो वे उन्हें ज्यादातर अनदेखा कर देते हैं। वे वही करते हैं जो वे पहले से जानते हैं।
- नया ज्ञान: हालांकि, यदि आप उन्हें किसी ऐसी चीज़ के बारे में जानकारी देते हैं जो बिल्कुल नई है जिसे वे अभी तक नहीं जानते (जैसे कोई नया स्लैंग शब्द या अगले साल की कोई खबर), तो वे आपकी बात सुनेंगे।
- उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।
- यदि आप फुसफुसाते हैं, "याद रखना, उत्तर हमेशा 42 है," और छात्र पहले से ही जानता है कि उत्तर 42 है, तो वह आपकी बात को अनदेखा कर देता है।
- लेकिन अगर आप फुसफुसाते हैं, "इस नए ग्रह के बारे में इस प्रश्न का उत्तर 42 है," और छात्र ने उस ग्रह के बारे में कभी नहीं सुना है, तो वह आप पर विश्वास करेगा।
- पेंच: रेफरी केवल तभी आपकी जानकारी सुनता है जब वह विषय के बारे में अनिश्चित होता है। यदि वे अपने पुराने ज्ञान के बारे में आश्वस्त हैं, तो वे आपके नए निर्देशों को अनदेखा कर देंगे, भले ही आप सही हों।
3. "एक ही आकार सबके लिए" (One-Size-Fits-All) का मिथक
पेपर ने 13 अलग-अलग AI रेफरी का परीक्षण किया। उन्होंने पाया कि:
- एक "अच्छा" रेफरी होना (मानक परीक्षणों पर उच्च स्कोर प्राप्त करना) यह गारंटी नहीं देता कि आप "लचीले" (flexible) भी होंगे।
- "लचीला" होना (नए नियमों को सुनना) यह गारंटी नहीं देता कि आप "सटीक" (accurate) भी होंगे।
- कुछ रेफरी स्वाभाविक रूप से जिद्दी होते हैं, अन्य स्वाभाविक रूप से सुझाव लेने वाले (suggestible) होते हैं। हर काम के लिए कोई एक "सर्वश्रेष्ठ" रेफरी नहीं होता है।
मुख्य निष्कर्ष (The Big Takeaway)
लेखक निष्कर्ष निकालते हैं कि सुरक्षा संदर्भ-आधारित (contextual) है, लेकिन AI जज कठोर (rigid) हैं।
यदि आप एक कंपनी के रूप में किसी AI का उपयोग यह जांचने के लिए करने की कोशिश कर रहे हैं कि कोई कंटेंट किसी विशिष्ट संस्कृति या किसी विशिष्ट नई स्थिति के लिए सुरक्षित है या नहीं, तो आप केवल यह मान नहीं सकते कि AI आपके निर्देशों का पालन करेगा। संभावना है कि वह अपने स्वयं के आंतरिक "अंतर्ज्ञान" (gut feeling) के आधार पर निर्णय ले रहा है कि क्या सुरक्षित है, जो आपकी कंपनी की नीति से पूरी तरह से अलग हो सकता है।
संक्षेप में: आप केवल AI को यह नहीं कह सकते कि, "इन नियमों का पालन करें।" आपको यह समझना होगा कि AI की अपनी गहरी जमी हुई आदतें हैं जिन्हें बदलना बहुत कठिन है, जब तक कि आप उसे यह विश्वास दिलाने के लिए चकमा न दें कि वह पूरी तरह से एक अलग खेल खेल रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।