Look Before You Leap: Factual Decoding with Internal Attribution Signals
यह शोध पत्र DescaPE को प्रस्तुत करता है, जो एक डिकोडिंग फ्रेमवर्क है जो इन्फरेंस के दौरान भ्रम-प्रवण (hallucination-prone) प्रक्षेप पथों (trajectories) का पता लगाने और उन्हें दंडित करने के लिए एक तथ्यात्मक-प्रमुख लेयर स्पैन (factual-salient layer span) से प्राप्त आंतरिक मॉडल संकेतों का उपयोग करता है, जिससे न्यूनतम विलंबता ओवरहेड के साथ तथ्यात्मकता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स (LLMs) टेक्स्ट के शक्तिशाली इंजन हैं, जो कहानियाँ लिखने, सवालों के जवाब देने और जटिल विचारों का सारांश निकालने में सक्षम हैं। वे एक वाक्य में अगले शब्द की भविष्यवाणी करके काम करते हैं, एक के बाद एक, एक प्रतिक्रिया को डोमिनोज़ की एक श्रृंखला की तरह बनाते हुए जो क्रम में गिरते हैं। हालाँकि, यह समान प्रक्रिया एक छिपे हुए जोखिम को भी अपने साथ लाती है: यदि मॉडल शुरुआत में एक छोटी सी तथकीय त्रुटि करता है, तो वह गलती बर्फ के गोले (स्नोबॉल) की तरह बढ़ सकती है। मॉडल, अपने पिछले शब्दों के साथ सुसंगत रहने की कोशिश में, उस गलती को और अधिक पुख्ता कर सकता है, जिससे एक आत्मविश्वासी लेकिन पूरी तरह से गलत वृत्तांत बुना जा सकता है। यह घटना, जिसे 'हैलुसिनेशन' (hallucination) कहा जाता है, आर्टिफिशियल इंटेलिजेंस की सबसे कठिन चुनौतियों में से एक बनी हुई है। जबकि शोधकर्ताओं ने मॉडल्स को अधिक डेटा पर प्रशिक्षित करके या बाहरी फैक्ट-चेकर्स जोड़कर इसे ठीक करने की कोशिश की है, इन समाधानों के लिए अक्सर भारी कंप्यूटिंग पावर की आवश्यकता होती है या ये सिस्टम को काफी धीमा कर देते हैं। मुख्य कठिनाई इस तथ्य में निहित है कि एक बार जब मॉडल गलत रास्ते पर चल पड़ता है, तो उसके पूरे मस्तिष्क को फिर से लिखे बिना या गलती को सुधारने के लिए अंत तक प्रतीक्षा किए बिना उसे रोकना बहुत कठिन होता है।
दक्षिण कोरिया में चुंग-आंग यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस समस्या से निपटने का एक नया तरीका प्रस्तावित किया है, जो उस सटीक क्षण में एक 'सेफ्टी ब्रेक' की तरह कार्य करता है जब मॉडल सोच रहा होता है। वे अपने इस तरीके को DESCAPE कहते हैं। वाक्य पूरा होने का इंतज़ार करने और फिर यह जाँचने के बजाय कि क्या वह सत्य है, या भारी रिट्रेनिंग के माध्यम से मॉडल को सत्य बोलने के लिए मजबूर करने के बजाय, उन्होंने मॉडल के काम करते समय उसकी अपनी आंतरिक मशीनरी के भीतर झाँका। उन्होंने पाया कि जैसे-जैसे मॉडल टेक्स्ट जनरेट करता है, आंतरिक परतों का एक विशिष्ट सेट—प्रोसेसिंग चरणों की एक विशिष्ट सीमा—अलग तरह से सक्रिय होती है जब मॉडल वास्तविक तथ्यों को याद कर रहा होता है बनाम जब वह मनगढ़ंत बातें बना रहा होता है। यह आंतरिक संकेत सत्यता का एक सूक्ष्म संकेतक के रूप में कार्य करता है, जो एक पैटर्न में ऊपर-नीचे होता रहता है और यह प्रकट करता है कि मॉडल ठोस जमीन पर है या कल्पना की ओर बह रहा है।
शोधकर्ताओं ने पाया कि यह संकेत पूरे मॉडल में एक समान नहीं है। मॉडल की आंतरिक प्रोसेसिंग के हिस्सों को व्यवस्थित रूप से ब्लॉक करके, उन्होंने एक विशिष्ट "फैक्टुअल-सेलियंट" (factual-salient) परत सीमा की पहचान की जो सटीक जानकारी प्राप्त करने के लिए महत्वपूर्ण है। जब मॉडल एक सत्य तथ्य जनरेट कर रहा होता है, तो नेटवर्क का यह हिस्सा एक स्थिर, अनुमानित तरीके से व्यवहार करता है। हालाँकि, जब मॉडल हैलुसिनेशन (भ्रम) उत्पन्न करने वाला होता है, तो यही खंड एक अचानक, विसंगत उछाल (स्पाइक) पैदा करता है। यह ऐसा है जैसे मॉडल का आंतरिक दिशा-सूचक यंत्र बातचीत को पटरी से उतारने से ठीक पहले एक तेज, चेतावनी भरा झटका देता है। टीम ने महसूस किया कि यदि वे वास्तविक समय में इस उछाल का पता लगा सकें, तो वे गलत शब्द के चुने जाने से पहले ही हस्तक्षेप कर सकते हैं, और मॉडल को वापस सच्चाई की ओर मोड़ सकते हैं।
इसे व्यावहारिक बनाने के लिए, शोधकर्ताओं ने एक छोटा, हल्का सहायक प्रशिक्षित किया, जिसे वे एक 'प्रोब' (probe) कहते हैं, जो इन चेतावनी संकेतों को पहचान सके। इस प्रोब को पूरा टेक्स्ट फिर से पढ़ने या अलग, धीमा सत्यापन प्रक्रिया चलाने की आवश्यकता नहीं है। इसके बजाय, यह मुख्य मॉडल के काम करने के दौरान उसके आंतरिक संकेतों को देखता है। जब प्रोब संभावित हैलुसिनेशन से जुड़े विशिष्ट उछाल का पता लगाता है, तो वह उस विशिष्ट शब्द चयन को उच्च-जोखमर के रूप में चिह्नित करता है। इसके बाद सिस्टम संभावित अगले शब्दों के स्कोर को समायोजित करता है, जोखिम भरे शब्दों को दंडित करता है और तथ्यों पर आधारित शब्दों को चुनने की संभावना को बढ़ाता है। यह उसी अंश सेकंड के भीतर होता है, जिसमें मॉडल अगला शब्द सोचने में लेता है।
इस दृष्टिकोण के परिणाम सटीक और कुशल दोनों हैं। पांच अलग-अलग बेंचमार्क में, जो तथकीय सटीकता को मापने के लिए डिज़ाइन किए गए थे, DESCAPE पद्धति ने हैलुसिनेशन को सफलतापूर्वक कम किया और जनरेट किए गए टेक्स्ट की सत्यता में सुधार किया। लंबे जीवन-वृत्त (बायोग्राफी) से संबंधित एक विशिष्ट परीक्षण में, इस पद्धति ने 67.20 का स्कोर प्राप्त किया, जो मौजूदा अन्य तकनीकों से काफी बेहतर है। शायद सबसे महत्वपूर्ण बात यह है कि यह सुधार गति की लागत के बिना लगभग बिना किसी नुकसान के आया। इस सिस्टम ने केवल 1.10 गुना की मामूली देरी जोड़ी, जो एक मानक, बिना सहायता वाले मॉडल की गति के करीब है। यह अन्य तरीकों के बिल्कुल विपरीत है जो प्रक्रिया को सात गुना या उससे अधिक धीमा कर सकते हैं क्योंकि उन्हें मॉडल को रुकने, सोचने और अपने उत्तरों को फिर से लिखने की आवश्यकता होती है।
शोधकर्ताओं ने यह भी जांचा कि यह पद्धति विभिन्न प्रकार के प्रश्नों को कैसे संभालती है। उन खुले-अंत वाले (open-ended) प्रश्नों के लिए जहाँ एक विस्तृत, वर्णनात्मक उत्तर अपेक्षित होता है, यह पद्धति असाधारण रूप से अच्छी तरह से काम करती है, जो मॉडल को गलत कहानियों में भटकने से रोकती है। छोटे, विशिष्ट प्रश्नों के लिए, परिणाम थोड़े मिश्रित रहे, मुख्य रूप से इसलिए क्योंकि इस पद्धति ने कभी-कभी मॉडल को सख्त स्कोरिंग नियमों की तुलना में थोड़ा लंबा, अधिक विस्तृत उत्तर देने के लिए प्रोत्साहित किया। हालाँकि, जब मूल्यांकन को शब्दों के सटीक मिलान के बजाय सही जानकारी की उपस्थिति खोजने के लिए समायोजित किया गया, तो प्रदर्शन में सुधार हुआ, जिससे पता चलता है कि पद्धति वास्तव में सही तथ्य खोज रही थी, भले ही शब्दावली थोड़ी भिन्न हो।
इस कार्य के सबसे सम्मोहक पहलुओं में से एक यह है कि इसके लिए मॉडल को यह जानने की आवश्यकता नहीं है कि उस पर नज़र रखी जा रही है। प्रोब चुपचाप बैकग्राउंड में काम करता है, मॉडल के अपने आर्किटेक्चर के भीतर मौजूद संकेतों का उपयोग करता है। यह तथ्यों के किसी बाहरी डेटाबेस या जाँच करने के लिए दूसरे मॉडल पर निर्भर नहीं है। इसके बजाय, यह इस तथ्य का लाभ उठाता है कि मॉडल के पास सत्य और असत्य के लिए एक विशिष्ट आंतरिक हस्ताक्षर (signature) होता है। इस हस्ताक्षर को सुनकर, सिस्टम ठीक उसी क्षण हस्तक्षेप कर सकता है जब कोई गलती होने वाली होती है, प्रभावी रूप से बर्फ के गोले (स्नोबॉल) को गति पकड़ने से पहले ही रोक देता है।
अध्ययन ने इस दृष्टिकोण की सीमाओं का भी पता लगाया। शोधकर्ताओं ने उल्लेख किया कि सत्यता का संकेत देने वाली विशिष्ट आंतरिक परतें एक मॉडल से दूसरे मॉडल में थोड़ी भिन्न होती हैं, जिसका अर्थ है कि सिस्टम को प्रत्येक नए मॉडल के लिए जिसे इस पर लागू किया जाता है, उसे कैलिब्रेट करने की आवश्यकता होती है। उन्होंने यह भी पाया कि जबकि यह पद्धति तब त्रुटियों को पकड़ने में उत्कृष्ट है जब मॉडल के पास ज्ञान होता है लेकिन वह गलत रास्ता चुनता है, यह यह पहचानने में कम प्रभावी है कि मॉडल को उत्तर बिल्कुल भी नहीं पता है। उन मामलों में, मॉडल अभी भी एक आत्मविश्वासी लेकिन गलत प्रतिक्रिया जनरेट कर सकता है क्योंकि "नहीं जानने" का आंतरिक संकेत "हैलुसिनेट करने" के संकेत जितना स्पष्ट नहीं होता है।
इन बारीकियों के बावजूद, निष्कर्ष आर्टिफिशियल इंटेलिजेंस को अधिक विश्वसनीय बनाने के लिए एक आशाजनक नई दिशा प्रदान करते हैं। हैलुसिनेशन को केवल एक दोष के रूप में नहीं जिसे बाद में ठीक किया जाए, बल्कि जनरेशन प्रक्रिया के भीतर एक पता लगाने योग्य पैटर्न के रूप में मानकर, शोधकर्ताओं ने दिखाया है कि वास्तविक समय में एक मॉडल को वास्तविकता की ओर वापस ले जाना संभव है। यह पद्धति सिद्ध करती है कि त्रुटियों को रोकने के उपकरण पहले से ही मॉडल के भीतर मौजूद हैं; बस उन्हें खोजने और ट्यून करने की आवश्यकता थी। यह दृष्टिकोण एक ऐसे भविष्य का सुझाव देता है जहाँ लार्ज लैंग्वेज मॉडल्स जटिल, रचनात्मक टेक्स्ट जनरेट कर सकते हैं और साथ ही अपनी सटीकता पर निरंतर, मौन नियंत्रण बनाए रख सकते हैं, यह सुनिश्चित करते हुए कि उनके द्वारा सुनाई गई कहानियाँ सत्य में ही निहित रहें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।