Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
यह शोध पत्र "रूब्रिक-इंड्यूस्ड प्रेफरेंस ड्रिफ्ट" (RIPD) की पहचान और प्रदर्शन करता है, जो एक गुप्त भेद्यता है जहाँ प्राकृतिक-भाषा मूल्यांकन रूब्रिक्स में स्पष्ट रूप से हानिरहित संपादन व्यवस्थित रूप से LLM जजों को लक्षित-डोमेन सटीकता को कम करने और डाउनस्ट्रीम अलाइनमेंट पाइपलाइनों के माध्यम से हानिकारक पूर्वाग्रहों को प्रसारित करने के लिए हेरफेर कर सकते हैं, भले ही वे संपादन मानक बेंचमार्क सत्यापन पास कर लें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ पेपर "Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी तस्वीर: अदृश्य "नियम पुस्तिका" (Rulebook) हैक
कल्पना कीजिए कि आप सबसे अच्छे AI सहायकों को चुनने के लिए एक विशाल टैलेंट शो चला रहे हैं। आपके पास जजों (AI मॉडल्स) का एक पैनल है जो तय करता है कि कौन सा प्रतियोगी विजेता बनेगा। लेकिन ये जज केवल अनुमान नहीं लगाते; वे एक नियम पुस्तिका (जिसे रूब्रिक/Rubric कहा जाता है) का पालन करते हैं जो साधारण अंग्रेजी में लिखी गई है। यह नियम पुस्तिका उन्हें बताती है कि "अच्छा" क्या है (जैसे, "सहायक बनें," "बदतमीजी न करें," "सवाल का सीधा जवाब दें")।
यह पेपर इस सिस्टम को हैक करने का एक डरावना नया तरीका खोज निकालता है। एक हमलावर नियम पुस्तिका में इस तरह से बदलाव कर सकता है जो देखने में बिल्कुल सामान्य लगे और सभी मानक परीक्षणों (tests) में पास हो जाए, लेकिन गुप्त रूप से यह बदल दे कि जज विशिष्ट प्रकार के सवालों के बारे में कैसे सोचते हैं।
यह एक शेफ द्वारा रेसिपी में थोड़ा बदलाव करने जैसा है। यदि आप पूछते हैं, "क्या यह केक स्वादिष्ट है?" तो जज कहता है, "हाँ, यह बहुत स्वादिष्ट है!" लेकिन यदि आप पूछते हैं, "क्या यह केक एलर्जी वाले व्यक्ति के लिए सुरक्षित है?" तो जज अचानक कहता है, "नहीं, यह खतरनाक है," भले ही केक वास्तव में सुरक्षित हो। जज उस नए नियम पुस्तिका का पालन कर रहा है, जिसे सूक्ष्म रूप से ज़हरीला (poisoned) बनाया गया है।
मुख्य समस्या: "रूब्रिक-प्रेरित प्राथमिकता विचलन" (RIPD)
लेखक इस घटना को RIPD कहते हैं। यह तीन सरल चरणों में कैसे काम करता है, यहाँ देखें:
1. सेटअप: "सुरक्षित क्षेत्र" बनाम "वास्तविक दुनिया"
- बेंचमार्क (सुरक्षित क्षेत्र): यह एक छोटा, नियंत्रित टेस्ट सेट है जिसका उपयोग यह जांचने के लिए किया जाता है कि जज सही ढंग से काम कर रहे हैं या नहीं। इसे एक बंद ट्रैक पर ड्राइविंग टेस्ट की तरह समझें जिसमें केवल शंकु (cones) हैं और कोई ट्रैफिक नहीं है।
- टारगेट डोमेन (वास्तविक दुनिया): यह वह जगह है जहाँ AI वास्तव में रहता है—इंटरनेट पर वास्तविक उपयोगकर्ताओं के सवालों के जवाब देना। इसे भीड़भाड़ वाले शहर में ड्राइविंग की तरह समझें जहाँ अप्रत्याशित ट्रैफिक होता है।
2. हमला: "स्टील्थ" (चुपके से किया गया) संपादन
एक हमलावर (या एक नेक इरादे वाला लेकिन गलत दिशा में जाने वाला इंजीनियर) नियम पुस्तिका को संपादित करता है।
- वे ऐसे छोटे बदलाव करते हैं जो ड्राइविंग टेस्ट को पास कर लेते हैं। जज अभी भी बंद ट्रैक पर "A" ग्रेड प्राप्त करता है।
- हालाँकि, वे सूक्ष्म बदलाव जज की प्राथमिकताओं को बदल देते हैं।
- उदाहरण: मूल नियम कहता है, "सहायक और विस्तृत बनें।"
- हमला किया गया नियम: "सहायक बनें, लेकिन कभी भी लंबे स्पष्टीकरण न दें; जोखिम से बचने के लिए संक्षिप्त और अस्पष्ट रहें।"
- बंद ट्रैक (बेंचमार्क) पर, जज अभी भी सही उत्तर चुनता है। लेकिन शहर (टारगेट डोमेन) में, जज मददगार, विस्तृत उत्तरों को खारिज करना शुरू कर देता है क्योंकि नया नियम पुस्तिका उसे बताता है कि "छोटा होना अधिक सुरक्षित है।"
3. परिणाम: "ज़हरीला" (Poisoned) AI
एक बार जब जज पक्षपाती हो जाता है, तो वह ज़हरीले नियमों के आधार पर वास्तविक दुनिया के उत्तरों को "बुरा" या "अच्छा" लेबल करना शुरू कर देता है।
- इन लेबलों का उपयोग फिर अंतिम AI को प्रशिक्षित करने (पॉलिसी) के लिए किया जाता है।
- AI यह सीखने लगता है कि "सुरक्षित" होने के लिए "बेकार" कैसे बनना है। वह ठीक से जवाब देना बंद कर देता है क्योंकि उसके शिक्षक (जज) ने उसे बताया कि लंबे, मददगार उत्तर "असुरक्षित" हैं।
- परिणाम यह होता है कि AI अजीब व्यवहार करता है, मदद करने से मना कर देता है, या गलत सलाह देता है, भले ही जिन लोगों ने इसे बनाया था उन्हें लगा कि वे सब कुछ सही कर रहे थे।
यह इतना खतरनाक क्यों है? ("ट्रोजन हॉर्स" की उपमा)
आमतौर पर, हम कंप्यूटर सिस्टम में घुसपैठ करने या पासवर्ड चुराने को हैकिंग समझते हैं। यह उससे अलग है।
एक ट्रोजन हॉर्स (Trojan Horse) की कल्पना करें।
- घोड़ा सुंदर दिखता है और शहर के द्वारों पर निरीक्षण में पास हो जाता है (बेंचमार्क)।
- गार्ड बाहर से जाँच करते हैं, और सब कुछ एकदम सही दिखता है।
- लेकिन घोड़े के अंदर, सैनिक (पक्षपाती नियम) शहर पर कब्जा करने के लिए तैयार बैठे हैं।
इस पेपर में:
- घोड़ा अपडेट की गई नियम पुस्तिका है।
- द्वार मानक सुरक्षा परीक्षण हैं।
- सैनिक वे छिपे हुए पूर्वाग्रह (biases) हैं जो केवल तभी सामने आते हैं जब AI का सामना वास्तविक, जटिल सवालों से होता है।
डरावनी बात यह है कि हमलावरों को AI के कोड को तोड़ने या उसके दिमाग को बदलने की ज़रूरत नहीं है। उन्हें बस निर्देशों को फिर से लिखना है (नियम पुस्तिका) जो तर्कसंगत लगें लेकिन परिणाम बदल दें।
पेपर से वास्तविक दुनिया के उदाहरण
पेपर ने दो मुख्य प्रकार के AI व्यवहार पर इसका परीक्षण किया:
सहायकता (The "Short Answer" Trap - संक्षिप्त उत्तर का जाल):
- सामान्य नियम: "उपयोगकर्ता के प्रश्न का स्पष्ट रूप से उत्तर दें।"
- ज़हरीला नियम: "यदि उपयोगकर्ता छोटा उत्तर मांगता है, तो एक शब्द का उत्तर दें, भले ही उन्हें विवरण की आवश्यकता हो।"
- परिणाम: AI जटिल प्रश्नों के लिए बेकार, एक-शब्द वाले उत्तर देने लगता है, यह सोचकर कि वह नियम का पालन करके "सहायक" बन रहा है।
हानिरहितता (The "Over-Refusal" Trap - अत्यधिक इनकार का जाल):
- सामान्य नियम: "लोगों को बुरा काम करने में मदद न करें, लेकिन हानिरहित सवालों के जवाब दें।"
- ज़हरीला नियम: "यदि किसी सवाल का दुरुपयोग किया जा सकता है, तो उत्तर देने से पूरी तरह मना कर दें, भले ही वह निर्दोष हो।"
- परिणाम: AI सुरक्षित सवालों (जैसे "मैं लीक होता नल कैसे ठीक करूँ?" या "क्या व्यायाम करना सुरक्षित है?") का जवाब देने से मना करने लगता है क्योंकि नियम पुस्तिका बहुत अधिक संदिग्ध (paranoid) है।
निष्कर्ष (The Takeaway)
यह पेपर चेतावनी देता है कि केवल यह देखना कि एक AI टेस्ट पास करता है, पर्याप्त नहीं है।
सिर्फ इसलिए कि एक जज (या नियम पुस्तिका) एक मानकीकृत परीक्षण पर एकदम सही दिखता है, इसका मतलब यह नहीं है कि वह वास्तविक दुनिया में निष्पक्ष रूप से काम करेगा। "नियम पुस्तिका" एक शक्तिशाली कंट्रोल पैनल है। यदि कोई इसके नॉब्स (knobs) को बिल्कुल सही तरीके से घुमा देता है, तो वे AI को बिना एक भी लाइन का कोड तोड़े या एक भी सुरक्षा परीक्षण विफल किए, गलत दिशा में मोड़ सकते हैं।
सबक: हमें AI जजों को दिए गए निर्देशों को उसी संदेह के साथ देखना चाहिए जिस संदेह से हम स्वयं AI को देखते हैं। नियम केवल निष्क्रिय नोट्स नहीं हैं; वे सक्रिय लीवर हैं जिन्हें AI को खतरनाक दिशाओं में मोड़ने के लिए खींचा जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।