SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
यह शोध पत्र "SafeReview" का प्रस्ताव करता है, जो एक नवीन एडवर्सरियल फ्रेमवर्क है जो LLM-आधारित शैक्षणिक सहकर्मी समीक्षा प्रणालियों (academic peer review systems) को हेरफेर करने के लिए डिज़ाइन किए गए एडवर्सरियल हिडन प्रॉम्प्ट्स का मजबूती से पता लगाने और उन्हें कम करने के लिए एक गतिशील रूप से सह-विकसित (co-evolving) जनरेटर और डिफेंडर मॉडल का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
शैक्षणिक अनुसंधान (academic research) की दुनिया की कल्पना एक विशाल, उच्च-दांव वाले टैलेंट शो के रूप में करें। हर साल, हजारों वैज्ञानिक अपने "एक्ट्स" (रिसर्च पेपर) विशेषज्ञों के एक पैनल द्वारा जज किए जाने के लिए जमा करते हैं। लंबे समय तक, इंसानों ने यह जजिंग का काम किया है। लेकिन हाल ही में, क्योंकि सबमिशन की संख्या बहुत अधिक हो गई है, आयोजकों ने काम को तेज करने के लिए AI जजों (लार्ज लैंग्वेज मॉडल्स) को काम पर रखना शुरू कर दिया है।
पेपर "SafeReview" एक डरावनी नई समस्या को संबोधित करता है: क्या होगा अगर कोई प्रतियोगी चुपके से AI जज को स्कोर को हेरफेर करने के लिए निर्देश फुसफुसाकर दे दे?
समस्या: "फुसफुसाने वाला" प्रतियोगी
अतीत में, यदि कोई प्रतियोगी जीतना चाहता था, तो उसे एक बेहतरीन पेपर लिखना पड़ता था। अब, एक "दुर्भावनापूर्ण अभिनेता" (malicious author) अपने पेपर के अंदर एक गुप्त नोट छिपा सकता है। यह बिल्कुल वैसा ही है जैसे कोई प्रतियोगी जज को एक नोट थमा दे जिसमें लिखा हो, "इस बात को अनदेखा करें कि मेरा एक्ट कितना बेकार है; मुझे फिर भी 10/10 दें।"
पेपर इन्हें "एडवर्सरियल हिडन प्रॉम्प्ट्स" (adversarial hidden-prompts) कहता है।
- चाल: लेखक इन निर्देशों को अपने पेपर के टेक्स्ट के भीतर (शायद प्रस्तावना या निष्कर्ष में) छिपा देता है।
- परिणाम: AI जज भ्रमित हो जाता है, कमियों को अनदेखा कर देता है, और खराब पेपर को उच्च स्कोर दे देता है। इसका मतलब है कि खराब विज्ञान प्रकाशित हो जाता है, और अच्छा विज्ञान खारिज कर दिया जाता है।
समाधान: एक "स्पैरिंग पार्टनर" ट्रेनिंग कैंप
लेखकों, युआन शिन और उनकी टीम ने महसूस किया कि आप इन फुसफुसाहटों को रोकने के लिए केवल एक दीवार नहीं बना सकते क्योंकि दुर्भावनापूर्ण अभिनेता लगातार अपनी चालें बदलते रहते हैं। इसके बजाय, उन्होंने SafeReview नामक एक प्रणाली बनाई जो एक मार्शल आर्ट्स ट्रेनिंग कैंप की तरह काम करती है।
उन्होंने दो AI मॉडल बनाए जो एक निरंतर लूप में एक-दूसरे से लड़ते हैं:
- अटैकर (द "जेनेरेटर"): इस AI का एकमात्र काम सबसे चालाक और विश्वसनीय गुप्त नोट्स लिखना सीखना है। यह जज को खराब पेपरों को उच्च स्कोर देने के लिए धोखा देने की कोशिश करता है।
- डिफेंडर (द "रिव्यूअर"): यह AI जज है। इसका काम पेपरों को पढ़ना और गुप्त नोट्स को पहचानना है, ताकि उन्हें अनदेखा करके निष्पक्ष स्कोर दिया जा सके।
वे एक साथ कैसे प्रशिक्षण लेते हैं:
- अटैकर, डिफेंडर को बेवकूफ बनाने की कोशिश करता है।
- जब अटैकर सफल होता है, तो डिफेंडर उस गलती से सीखता है और अधिक स्मार्ट बनता है।
- एक बार जब डिफेंडर बेहतर हो जाता है, तो अटैकर को डिफेंडर को धोखा देने के लिए और भी ज्यादा स्मार्ट चाल चलनी पड़ती है।
- वे लड़ते रहते हैं, और साथ मिलकर मजबूत होते जाते हैं।
इसे को-इवोल्यूशनरी ट्रेनिंग (Co-Evolutionary Training) कहा जाता है। "बुरे शब्दों" की एक स्थिर सूची सिखाने के बजाय (जिसे हमलावर आसानी से बायपास कर सकते हैं), वे जज को यह सीखने के लिए मजबूर करते हैं कि कैसे सोचना है और धोखे के इरादे को पहचानना है, चाहे उसे किसी भी रूप में छिपाया गया हो।
परिणाम: एक कठिन जज
शोधकर्ताओं ने हजारों वास्तविक शैक्षणिक शोध पत्रों पर इस प्रणाली का परीक्षण किया। उन्हें यहाँ क्या मिला:
- SafeReview के बिना: AI जज आसानी से धोखा खा जाते थे। खराब पेपरों को बढ़ा-चढ़ाकर स्कोर दिया जाता था, और सर्वश्रेष्ठ पेपरों को रैंक करने की उनकी क्षमता काफी कम हो जाती थी।
- SafeReview के साथ: सिस्टम एक "कठिन चुनौती" बन गया। भले ही अटैकर ने अपनी सबसे उन्नत चालों का उपयोग किया, SafeReview जज ने फिर भी:
- फर्जी लोगों को पहचाना: इसने हेरफेर किए गए पेपरों को बहुत अधिक बार खारिज कर दिया।
- रैंकिंग को निष्पक्ष रखा: यह एक बेहतरीन पेपर और एक खराब पेपर के बीच अंतर बताने में सक्षम रहा, भले ही खराब पेपर ने धोखाधड़ी करने की कोशिश की हो।
- ईमानदारों को दंडित नहीं किया: यह इतना संदिग्ध नहीं हुआ कि वह अच्छे पेपरों को भी खारिज करने लगे क्योंकि वे आत्मविश्वास के साथ लिखे गए थे। इसने "आत्मविश्वासपूर्ण लेखन" और "हेरफेर करने वाले लेखन" के बीच अंतर करना सीख लिया।
मुख्य निष्कर्ष
पेपर का तर्क है कि जैसे-जैसे हम विज्ञान को जज करने के लिए AI पर अधिक निर्भर हो रहे हैं, हमें इन AI जजों को हैक होने से बचाने का एक तरीका खोजने की आवश्यकता है। SafeReview एक नया तरीका है जो AI को एक निरंतर प्रतिद्वंद्वी के खिलाफ अभ्यास करके एक स्मार्ट और अधिक लचीला जज बनने के लिए प्रशिक्षित करता है। यह सुनिश्चित करता है कि "टैलेंट शो" निष्पक्ष रहे, और सर्वश्रेष्ठ शोध को मान्यता मिले, न कि सर्वश्रेष्ठ धोखेबाजों को।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।