ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering
यह शोध पत्र ObfusQAte और ObfusQA फ्रेमवर्क प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे बहु-स्तरीय अस्पष्टता (multi-tiered obfuscation) के अधीन तथ्यात्मक प्रश्नों पर लार्ज लैंग्वेज मॉडल्स की मजबूती का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि सूक्ष्म भाषाई विविधताओं का सामना करने पर मॉडल अक्सर विफल हो जाते हैं या मतिभ्रम (hallucinate) का शिकार हो जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र का नौकरी के लिए साक्षात्कार ले रहे हैं। आप उससे पूछते हैं, "टेलीफोन का आविष्कार किसने किया था?" वह तुरंत उत्तर देता है: "अलेक्जेंडर ग्राहम बेल।" आप प्रभावित होकर सिर हिलाते हैं।
लेकिन फिर, आप उसकी वास्तविक समझ को परखने का निर्णय लेते हैं। आप वही प्रश्न पूछते हैं, लेकिन उसे एक घने, भ्रमित करने वाले कोहरे में लपेट देते हैं:
"उस विलक्षण व्यक्ति का नाम बताइए जिसने हमें लंबी दूरियों तक श्रव्य रूप से संवाद करने की क्षमता प्रदान की, जो 1876 में एक क्रांतिकारी उपलब्धि थी, थॉमस एडिसन और निकोला टेस्ला जैसे प्रतिस्पर्धियों के बीच..."
यदि छात्र ने केवल यह तथ्य रट लिया है कि "बेल = टेलीफोन," तो वह इस कोहरे में खो सकता है और एडिसन का नाम गेस कर सकता है क्योंकि उसका नाम वहां उल्लेखित है। लेकिन यदि वह वास्तव में अवधारणा को समझता है, तो वह शोर को चीरकर अभी भी "बेल" ही कहेगा।
यह बिल्कुल वही है जिसके बारे में पेपर ObfusQAte है। शोधकर्ताओं ने आर्टिफिशियल इंटेलिजेंस (AI) के लिए एक "धुंध बनाने वाली मशीन" बनाई ताकि यह देखा जा सके कि ये स्मार्ट कंप्यूटर वास्तव में सोच रहे हैं, या केवल एक रटी-रटाई स्क्रिप्ट दोहरा रहे हैं।
यहाँ उनके काम का सरल शब्दों में विवरण दिया गया है:
1. समस्या: "तोता" बनाम "विचारक"
लार्ज लैंग्वेज मॉडल्स (LLMs), जैसे कि आज चैटबॉट्स को चलाने वाले मॉडल, अद्भुत हैं। वे कविताएं लिख सकते हैं, कोड लिख सकते हैं और सवालों के जवाब दे सकते हैं। लेकिन उनमें एक दोष है: वे अक्सर हैलुसिनेट (hallucinate) करते हैं। इसका मतलब है कि वे आत्मविश्वास के साथ मनगढ़ंत बातें बना लेते हैं।
अधिकांश परीक्षण उनसे सीधे सवाल पूछते हैं। AI इसमें पास हो जाता है क्योंकि उसने अपने ट्रेनिंग डेटा में उस प्रश्न को लाखों बार देखा है। यह टीवी पर सुनी हुई किसी बात को दोहराने वाले तोते की तरह है। शोधकर्ता जानना चाहते थे: यदि हम शब्दों को थोड़ा इस तरह बदल दें कि तोता भ्रमित हो जाए, तो क्या AI को उत्तर पता होगा, या वह टूट जाएगा?
2. समाधान: "ObfusQAte" धुंध बनाने वाली मशीन
टीम ने ObfusQAte नामक एक नया फ्रेमवर्क बनाया। इसे AI के दिमागों के लिए एक जिम की तरह समझें। वे सरल प्रश्नों को लेते हैं और उन्हें तीन विशिष्ट "वर्कआउट मशीनों" से गुजारते हैं ताकि उन्हें कठिन बनाया जा सके, बिना वास्तविक उत्तर बदले।
वे इन तीन मशीनों को कहते हैं:
- मशीन A: "अप्रत्यक्ष संदर्भ" (Named-Entity Indirection)
- उपमा: "राष्ट्रपति कौन हैं?" कहने के बजाय, आप कहते हैं, "वह नेता कौन है जो व्हाइट हाउस में रहता है और स्वतंत्र दुनिया का नेतृत्व करता है?"
- परीक्षण: AI को कड़ियाँ जोड़नी होंगी। वह केवल "राष्ट्रपति" शब्द को नहीं ढूंढ सकता; उसे व्यक्ति को खोजने के लिए विवरण को समझना होगा।
- मशीन B: "रेड हेरिंग" (Distractor Indirection)
- उपमा: कल्पना कीजिए कि एक जासूसी कहानी में हत्यारा बटलर है, लेकिन लेखक तीन पन्नों तक इस बात का वर्णन करता है कि माली और शेफ कैसे संदिग्ध हो सकते थे, जिससे वे दोषी लगें।
- परीक्षण: AI को एक ऐसा प्रश्न दिया जाता है जिसमें फर्जी सुराग और गलत नाम (जैसे टेलीफोन के बारे में पूछते समय एडिसन का उल्लेख करना) होते हैं। AI को शोर को अनदेखा करना होगा और सत्य को खोजना होगा।
- मशीन C: "सूचना का सैलाब" (Contextual Overload)
- उपमा: घास के ढेर में सुई खोजने की कोशिश करना, लेकिन वह घास का ढेर 100 अन्य सुइयों से बना है, और कोई आपके कान में खेती के बारे में रैंडम तथ्य चिल्ला रहा है।
- परीक्षण: प्रश्न अतिरिक्त, सत्य-परंतु-अप्रासंगिक जानकारी के पहाड़ के नीचे दबा हुआ है। AI को "सिग्नल" खोजने के लिए "शोर" को फिल्टर करना होगा।
3. परिणाम: AI भ्रमित हो गया
शोधकर्ताओं ने शीर्ष-स्तरीय AI (जैसे GPT-4, Claude, और LLaMA) का इन धुंधले प्रश्नों के साथ परीक्षण किया। परिणाम आश्चर्यजनक थे:
- सरल प्रश्नों पर: AI बहुत अच्छा था (लगभग 70-80% सटीकता)।
- धुंधले प्रश्नों पर: उनका प्रदर्शन गिर गया। सटीकता लगभग 50% कम हो गई।
- "आत्म-जागरूकता" की विफलता: उन्होंने उस AI का भी परीक्षण किया जिसने धुंधले प्रश्न बनाए थे (Gemini 2.0)। जब इसे अपने ही कठिन प्रश्नों के उत्तर देने के लिए कहा गया, तो यह विफल रहा! यह उन पहेलियों को हल भी नहीं कर सका जो इसने खुद बनाई थीं।
इसका क्या अर्थ है?
यह सुझाव देता है कि कई AI सिस्टम पैटर्न मैचिंग (यह याद रखना कि "टेलीफोन" आमतौर पर "बेल" के पास आता है) पर निर्भर हैं, न कि गहन तर्क (deep reasoning) पर। जब पैटर्न को बदला जाता है, तो AI खो जाता है।
4. यह क्यों महत्वपूर्ण है
शोधकर्ताओं ने AI के "दिमाग" (इसके आंतरिक स्तरों) के अंदर झांका और पाया कि जब प्रश्न भ्रमित करने वाले हो जाते हैं, तो AI का आत्मविश्वास गिर जाता है, और यह अपने विचारों को बहुत जल्दी संकुचित (compress) करने लगता है। यह एक ऐसे छात्र की तरह है जो कठिन परीक्षा के दौरान घबरा जाता है और गणित पूरा करने से पहले ही हार मान लेता है।
मुख्य निष्कर्ष:
हम AI सिस्टम बना रहे हैं जिन्हें हम महत्वपूर्ण कामों (जैसे चिकित्सा सलाह या कानूनी शोध) के लिए भरोसा दे रहे हैं। यदि एक AI केवल अलग तरीके से कहे गए प्रश्न को नहीं संभाल सकता, तो वह अभी वास्तव में "स्मार्ट" नहीं है; वह केवल एक बहुत अच्छा नकलची है।
ObfusQAte डेवलपर्स को ऐसा AI बनाने में मदद करने के लिए एक नया टूल है जो केवल उत्तर याद नहीं रखता, बल्कि दुनिया को वास्तव में समझता है, भले ही दुनिया उसे धोखा देने की कोशिश करे।
सारांश उपमा
कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने (fetch) की ट्रेनिंग दे रहे हैं।
- मानक परीक्षण: आप एक लाल गेंद फेंकते हैं। कुत्ता उसे लाता है।
- ObfyQAte परीक्षण: आप एक लाल गेंद फेंकते हैं, लेकिन उसे एक कंबल में लपेट देते हैं, एक बॉक्स में रखते हैं, और कुत्ते से कहते हैं, "जाओ और वह चीज़ लाओ जो उछलती है, लेकिन उसके बगल में रखी नीली गेंद को अनदेखा करो।"
- परिणाम: यदि कुत्ता केवल "लाल गेंद" को देखता है, तो वह विफल हो जाता है। यदि वह "फेच" (लाना) को समझता है, तो वह सफल होता है। यह पेपर दिखाता है कि हमारे वर्तमान AI कुत्ते ज्यादातर "लाल गेंद" को ही देख रहे हैं और पैकेजिंग बदलने पर विफल हो रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।