UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
यह शोध पत्र UNMASK को प्रस्तुत करता है, जो एक पूर्णतः स्वचालित पाइपलाइन है जो अतिरिक्त मानवीय एनोटेशन की आवश्यकता के बिना टेक्स्ट क्लासिफायर में स्प्यूरियस कोरिलेशन (spurious correlations) की खोज करती है, उनका कारणत्मक रूप से सत्यापन करती है और उन्हें कम करती है, जिससे आउट-ऑफ-डिस्ट्रीब्यूशन बेंचमार्क पर मजबूती में सुधार होता है और एनोटेशन-मुक्त ग्रुप रीवेटिंग (group reweighting) सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को असली समाचार कहानी और नकली समाचार के बीच अंतर करना सिखा रहे हैं। आप उसे हजारों उदाहरण दिखाते हैं, और वह परीक्षण में बहुत अच्छा हो जाता है। लेकिन फिर, आपको एहसास होता है कि रोबोट वास्तव में कहानी को पढ़ नहीं रहा है; वह बस एक विशेष चाल (trick) को ढूंढ रहा है। शायद उसने सीख लिया है कि यदि किसी हेडलाइन में "चौंकाने वाला" (shocking) शब्द है, तो वह शायद नकली है, या यदि दो वाक्यों में तीन शब्द समान हैं, तो उनका अर्थ एक ही होना चाहिए। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "लर्निंग शॉर्टकट्स" (सीखने के छोटे रास्ते) कहा जाता है। भाषा को समझने की कठिन मेहनत करने के बजाय, AI डेटा में आसान, सरल पैटर्न खोज लेता है जो अधिकांश समय सही उत्तर से मेल खाते हैं। यह एक बड़ी समस्या है क्योंकि जबकि ये शॉर्टकट रोबोट को मानक परीक्षणों में स्मार्ट दिखाते हैं, वे उसे तब बुरी तरह विफल कर देते हैं जब वह किसी नई, पेचीदा या थोड़ी अलग चीज़ का सामना करता है। वैज्ञानिक इन भ्रामक पैटर्न को "स्प्यूरियस कोरिलेशन" (spurious correlations) कहते हैं। बड़ा सवाल हमेशा से यह रहा है: हम उन अदृश्य तरकीबों को कैसे खोजें जिनका उपयोग रोबोट कर रहा है, बिना किसी इंसान के एक-एक करके उन्हें मैन्युअल रूप से बताने के?
यहीं पर UNMASK नामक एक नया टूल काम आता है। UNMASK को एक सुपर-स्मार्ट जासूस के रूप में सोचें जो केवल यह अनुमान नहीं लगाता कि रोबोट क्या सोच रहा है; बल्कि यह वास्तव में रोबोट को रंगे हाथों पकड़ लेता है और साबित कर देता है कि वह एक शॉर्टकट पर निर्भर है। शोधकर्ताओं ने एक पूरी तरह से स्वचालित पाइपलाइन बनाई है जो एक तीन-चरणीय जादू के खेल की तरह काम करती है। सबसे पहले, यह एक बड़े लैंग्वेज मॉडल (एक बहुत ही उन्नत AI) का उपयोग संभावित "शॉर्टकट्स" की एक सूची बनाने के लिए करता है, जिन्हें वह सख्त, कंप्यूटर-पठनीय नियमों के रूप में लिखता है (जैसे "यदि 'कभी नहीं' शब्द दिखाई देता है, तो चिह्नित करें")। दूसरा, यह इन नियमों को एक कठोर सांख्यिकीय परीक्षण से गुजारता है ताकि यह देखा जा सके कि क्या वे वास्तव में डेटा में सामान्य हैं, जिससे उन नियमों को फ़िल्टर किया जा सके जो केवल रैंडम शोर (noise) हैं। लेकिन यहाँ सबसे महत्वपूर्ण हिस्सा है: तीसरा चरण। सिर्फ इसलिए कि डेटा में एक पैटर्न मौजूद है, इसका मतलब यह नहीं है कि रोबोट उसका उपयोग कर रहा है। इसलिए, UNMASK एक "क्या-होता-अगर" (what-if) प्रयोग करता है। यह एक वाक्य लेता है, संदिग्ध शॉर्टकट को सर्जिकल तरीके से हटा देता है, और रोबोट से फिर से अनुमान लगाने के लिए कहता है। यदि शॉर्टकट हटने के कारण रोबोट का उत्तर बदल जाता है, तो UNMASK ने सिद्ध कर दिया है कि रोबोट वास्तव में उस शॉर्टकट पर निर्भर था।
एक बार जब UNMASK इन शॉर्टकट्स की पहचान कर लेता है और उन्हें सिद्ध कर देता है, तो वह वहीं नहीं रुकता; यह रोबोट को ठीक करने में मदद करता है। यह उन नियमों का उपयोग करता है जिन्हें इसने खोजा है ताकि प्रशिक्षण डेटा को "फेयर" (निष्पक्ष) और "अनफेयर" (पक्षपाती) श्रेणियों में विभाजित किया जा सके, जिससे रोबोट को सरल शॉर्टकट्स के बिना कार्य को फिर से सीखने की अनुमति मिलती है। शोधकर्ताओं ने दो प्रमुख चुनौतियों पर इसका परीक्षण किया: एक जिसमें तर्क पहेलियाँ (Natural Language Inference) शामिल थीं और दूसरा जो ऑनलाइन जहरीली टिप्पणियों (toxic comments) का पता लगाने से संबंधित था। तर्क पहेलियों पर, UNMASK ने प्रसिद्ध चालों को सफलतापूर्वक पुनः खोजा, जैसे कि रोबमाट का उन शब्दों पर अत्यधिक निर्भर होना जो सुनने में समान लगते हैं या नकारात्मक शब्दों (negation words) जैसे "नहीं" की उपस्थिति। इसने पुष्टि की कि जबकि एक प्रकार का रोबोट (BERT) इन चालों का शिकार हो रहा था, एक थोड़ा अलग रोबोट (RoBERTa) वास्तव में इनमें से कुछ के प्रति प्रतिरोधी था—एक ऐसा अंतर जिसे केवल इस सावधानीपूर्वक, चरण-दर-चरण सत्यापन द्वारा ही प्रकट किया जा सकता था। जहरीली टिप्पणी वाले कार्य पर, UNMASK ने बिना किसी इंसान द्वारा यह लेबल किए कि कौन कौन है, विशिष्ट जनसांख्यिकीय समूहों के खिलाफ रोबोट के पूर्वाग्रह को ठीक करने में सफलता प्राप्त की। इसने उन विशेषज्ञों के प्रदर्शन का मुकाबला किया जिन्होंने मैन्युअल रूप से डेटा को लेबल किया था, यह साबित करते हुए कि आप बिना मानवीय हस्तक्षेप के इन गहरे बैठे पूर्वाग्रहों को स्वचालित रूप से खोज और ठीक कर सकते हैं।
पेपर ने यह भी दिखाया कि यह जासूसी कार्य अन्य प्रकार के AI पर भी काम करती है, जैसे कि वे जो तय करते हैं कि चैटबॉट के लिए कौन सा उत्तर "बेहतर" है। इसने पाया कि चैटबॉट्स लंबे उत्तरों या विशिष्ट फॉर्मेटिंग शैलियों की ओर पक्षपाती थे, भले ही उन शैलियों का उत्तर की गुणवत्ता से कोई लेना-देना न हो। हालाँकि, शोधकर्ता सावधानी बरतते हुए नोट करते हैं कि UNMASK सब कुछ हल करने वाला कोई जादुई डंडा नहीं है। यह केवल उन्हीं शॉर्टकट्स को खोज सकता है जिन्हें स्पष्ट, तार्किक नियमों के रूप में लिखा जा सकता है। यह उन पूर्वाग्रहों को नहीं पकड़ सकता जो टेक्स्ट के "वाइब" (vibe) या शैली में गहराई से छिपे हुए हैं, या ऐसे पैटर्न जो एक साधारण वाक्य में वर्णित करने के लिए बहुत जटिल हैं। लेकिन जिन शॉर्टकट्स को यह खोज सकता है, उनके लिए, यह उन्हें पकड़ने, उन्हें समस्या के रूप में साबित करने और उन्हें ठीक करने का एक तरीका प्रदान करता है, और वह भी बिना किसी इंसान द्वारा भारी काम किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।