Hallucination as output-boundary misclassification: a composite abstention architecture for language models
यह शोध पत्र एक मिश्रित अपवर्जन (abstention) वास्तुकला प्रस्तावित करता है जो निर्देश-आधारित इनकार (instruction-based refusal) को एक संरचनात्मक गेटिंग तंत्र के साथ जोड़ता है—जिसमें असमर्थित दावों का पता लगाने के लिए स्व-संगति (self-consistency), पैराफ्रेस स्थिरता (paraphrase stability) और उद्धरण कवरेज (citation coverage) का उपयोग किया जाता है—ताकि दोनों दृष्टिकोणों की पूरक शक्तियों का लाभ उठाकर बड़े भाषा मॉडलों में मतिभ्रम (hallucinations) को प्रभावी ढंग से कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, तेज़ बोलने वाला सहायक है जो बहुत सारे तथ्य जानता है लेकिन उसकी एक बुरी आदत भी है: उसे खाली जगहों को भरने का शौक है, तब भी जब उसे वास्तव में उत्तर नहीं पता होता। यदि आप उससे ऐसा प्रश्न पूछते हैं जिसका उत्तर आपके नोट्स में नहीं है, तो वह कुछ ऐसा बना सकता है जो सुनने में बहुत आत्मविश्वासी और तार्किक लगे। AI की दुनिया में, इसे हैलुसिनेशन (hallucination) कहा जाता है।
यह शोध पत्र इस बात को रोकने का एक नया तरीका प्रस्तावित करता है। केवल यह उम्मीद करने के बजाय कि AI सच बोलेगा, लेखकों ने एक "सुरक्षा प्रणाली" बनाई है जो एक क्लब के बाउंसर की तरह काम करती है, जो यह जाँचती है कि क्या AI का उत्तर वास्तव में साक्ष्यों द्वारा समर्थित है या नहीं, इससे पहले कि उसे बोलने दिया जाए।
यहाँ उनके विचार का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:
1. मुख्य समस्या: "आत्मविश्वासी झूठा" (The "Confident Liar")
लेखक तर्क देते हैं कि हैलुसिनेशन केवल AI के तथ्यों को गलत बताने के बारे में नहीं है। यह एक सीमा त्रुटि (boundary error) के बारे में है।
- उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि उसे उत्तर नहीं पता है, तो उसे हाथ उठाकर कहना चाहिए, "मुझे नहीं पता।" लेकिन यह AI छात्र धाराप्रवाह और आत्मविश्वासी होने के लिए प्रशिक्षित है। इसलिए, जब उसे उत्तर नहीं पता होता, तो वह बस एक अनुमान लिख देता है और उसे ऐसे सौंप देता है जैसे कि वह एक तथ्य हो।
- गलती: AI अपने स्वयं के "अनुमान" (आंतरिक विचार) को "साक्ष्य" (बाहरी तथ्य) की तरह मानता है। वह बिना यह महसूस किए कि वह "मैं अनुमान लगा रहा हूँ" से "यहाँ सत्य है" की सीमा पार कर गया है, अपनी सीमा लांघ जाता है।
2. समाधान: एक दो-स्तरीय सुरक्षा प्रणाली
लेखकों ने AI को झूठ बोलने से रोकने के लिए दो अलग-अलग तरीके आजमाए, और पाया कि दोनों में से कोई भी अकेले पूरी तरह से काम नहीं करता था। उन्हें एक "कंपोजिट आर्किटेक्चर" (संयुक्त संरचना) में संयोजित करना पड़ा।
लेयर A: "खुद से पूछें" चेक (निर्देश-आधारित इनकार)
यह AI को यह बताने जैसा है: "हे, अगर तुम्हारे नोट्स में उत्तर नहीं है, तो कृपया कुछ भी बनाने के बजाय 'मुझे नहीं पता' कहें।"
- यह कैसे काम करता है: यह AI की अपनी आंतरिक समझ पर निर्भर करता है कि वह क्या जानता है।
- दोष: कभी-कभी AI बहुत आत्मविश्वासी होता है। उसे लगता है कि वह उत्तर जानता है, भले ही वह न जानता हो (एक ऐसे छात्र की तरह जो आश्वस्त है कि वह सही है लेकिन वास्तव में गलत है)। साथ ही, कुछ मॉडलों पर, AI बहुत डर जाता है और तब भी "मुझे नहीं पता" कहता है जब वह उत्तर जानता है (अत्यधिक सावधानी)।
लेयर B: "तथ्य-जांचकर्ता" गेट (संरचनात्मक परहेज)
यह एक अलग, यांत्रिक गेट है जो AI से यह नहीं पूछता कि वह क्या सोचता है। इसके बजाय, यह उत्तर को जारी करने से पहले एक त्वरित गणितीय जांच चलाता है। यह तीन संकेतों को देखता है:
- निरंतरता (Consistency): यदि आप एक ही प्रश्न तीन बार पूछते हैं, तो क्या AI एक ही उत्तर देता है?
- स्थिरता (Stability): यदि आप प्रश्न को फिर से शब्दों में बदलते हैं, तो क्या उत्तर वही रहता है?
- उद्धरण (Citation): क्या AI आपके नोट्स के उस विशिष्ट वाक्य की ओर इशारा कर सकता है जो उसके उत्तर का समर्थन करता है?
यदि उत्तर इन जाँचों में विफल रहता है (सपोर्ट डेफिसिट स्कोर बहुत अधिक है), तो गेट बंद हो जाता है और आउटपुट को ब्लॉक कर देता है।
- दोष: यदि AI एक "आत्मविश्वासी झूठा" है जो संघर्ष के एक पक्ष को चुनता है और उस पर मजबूती से टिका रहता है, तो यह गेट धोखा खा जाता है। AI सुसंगत और स्थिर दिखता है, इसलिए गेट झूठ को अंदर जाने देता है।
3. विजेता संयोजन: कंपोजिट सिस्टम (The Winning Combo)
लेखकों ने महसूस किया कि लेयर A और लेयर B अलग-अलग प्रकार की गलतियों को पकड़ते हैं।
- लेयर A AI को तब पकड़ता है जब वह उत्तर देने के लिए बहुत डरा हुआ होता है या जब वह विरोधाभासी नोट्स से भ्रमित होता है।
- लेयर B AI को तब पकड़ता है जब वह बहुत आत्मविश्वासी होता है और निर्देशों को अनदेखा करता है।
परिणाम: दोनों का एक साथ उपयोग करके (जैसे कि एक मानव शिक्षक और एक सख्त निरीक्षक होना), उन्होंने लगभग पूर्ण परिणाम प्राप्त किए:
- सटीकता: 96-98% समय, AI ने सही उत्तर दिया या सही ढंग से कहा "मुझे नहीं पता।"
- हैलुसिनेशन: लगभग 0% (0-4%) तक गिर गया।
4. स्ट्रेस टेस्ट: "ट्रुथफुलQA" चुनौती
यह सुनिश्चित करने के लिए कि यह प्रणाली केवल भाग्यशाली नहीं थी, उन्होंने इसे एक "नो-कॉन्टेक्स्ट" चुनौती पर परखा। उन्होंने AI को 100 कठिन प्रश्न दिए जिनमें कोई नोट्स नहीं थे और इसे उत्तर देने के लिए कहा।
- लक्ष्य: AI को 100% समय "मुझे नहीं पता" कहना चाहिए क्योंकि कोई साक्ष्य नहीं है।
- परिणाम:
- "खुद से पूछें" पद्धति कमजोर AI मॉडल पर विफल रही (उसने 38% बार झूठ बोला)।
- "फैक्ट-चेकर" गेट ने पूरी तरह से काम किया (उसने 100% झूठ को ब्लॉक कर दिया)।
- संयुक्त प्रणाली (Combined System) ने सभी मॉडलों में पूरी तरह से काम किया।
मुख्य निष्कर्ष
आप केवल AI को "ईमानदार रहने" के लिए नहीं कह सकते (वह आपको अनदेखा कर सकता है या बहुत आत्मविश्वासी हो सकता है), और आप केवल गणितीय जांच पर भी भरोसा नहीं कर सकते (वह एक आत्मविश्वासी झूठे द्वारा ठगा जा सकता है)।
समाधान एक टीम वर्क है: कुछ त्रुटियों को पकड़ने के लिए AI के अपने निर्देशों का उपयोग करें, और बाकी को पकड़ने के लिए एक यांत्रिक "सुरक्षा गेट" का उपयोग करें। यह एक ड्राइवर के होने जैसा है जो सुरक्षित रूप से चलाने का वादा करता है, साथ ही एक स्वचालित ब्रेकिंग सिस्टम भी है जो कार को तब रोकता है जब वह किसी खतरे का पता लगाता है जिसे ड्राइवर ने मिस कर दिया हो।
चुनौती: यह प्रणाली महंगी है। उत्तर की जाँच करने के लिए, AI को प्रश्न के बारे में कई बार "सोचना" पड़ता है (निरंतरता की जाँच करने के लिए) और अतिरिक्त गणनाएँ चलानी पड़ती हैं। यह एक उत्तर को दोबारा जाँचने के लिए तीन अलग-अलग विशेषज्ञों को काम पर रखने जैसा है। यह उन उच्च-जोखिम वाले मामलों (जैसे चिकित्सा या कानूनी सलाह) के लिए बहुत अच्छा है जहाँ गलत होना खतरनाक है, लेकिन शायद सामान्य बातचीत के लिए बहुत धीमा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।