← नवीनतम पेपर
💻 computer science

Efficient Hallucination Detection for LLMs Using Uncertainty-Aware Attention Heads

यह शोध पत्र RAUQ को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised) और गणनात्मक रूप से कुशल ढांचा है जो विशिष्ट अनसर्टेन्टी-अवेयर (uncertainty-aware) अटेंशन हेड्स और टोकन-लेवल कॉन्फिडेंस का लाभ उठाकर एक सिंगल फॉरवर्ड पास में LLM मतिभ्रम (hallucinations) का पता लगाता है, जो विविध कार्यों और मॉडलों में न्यूनतम ओवरहेड के साथ अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Artem Vazhentsev, Lyudmila Rvanova, Gleb Kuzmin, Ekaterina Fadeeva, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Mrinmaya Sachan, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Artem Vazhentsev, Lyudmila Rvanova, Gleb Kuzmin, Ekaterina Fadeeva, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Mrinmaya Sachan, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, विद्वान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। यह रोबोट कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और भाषाओं का अनुवाद कर सकता है, और इसमें अविश्वसनीय प्रवाह है। हालाँकि, एक आत्मविश्वासी कहानीकार की तरह जो कभी-कभी कहानी को आगे बढ़ाने के लिए मनगढ़ंत बातें बनाता है, यह रोबोट कभी-कभी "हैलुसिनेट" (hallucinate) करता है—यानी यह ऐसी बातें बताता है जो पूरी तरह से गलत होती हैं, भले ही वह बहुत यकीन के साथ बोल रहा हो।

आप जिस शोध पत्र के बारे में पूछ रहे हैं, वह RAUQ (रिकरेंट अटेंशन-बेस्ड अनसर्टेंटी क्वांटिफिकेशन) नामक एक नया टूल पेश करता है ताकि वास्तविक समय (real-time) में इन झूठों को पकड़ा जा सके। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है।

समस्या: रोबोट का "आत्मविश्वास का जाल" (Confidence Trap)

रोबोट के झूठ पकड़ने के मौजूदा तरीके या तो:

  1. बहुत धीमे हैं: वे रोबोट को एक ही सवाल पर 50 अलग-अलग बार सोचने के लिए कहते हैं और फिर जवाबों की तुलना करते हैं (जैसे किसी छात्र को एक ही परीक्षा 50 बार देने के लिए कहना ताकि यह देखा जा सके कि उसे हर बार एक जैसा ग्रेड मिलता है या नहीं)। इसमें बहुत समय लगता है।
  2. बहुत महंगे हैं: इनके लिए एक शिक्षक को पहले हजारों उदाहरणों को ग्रेड करना पड़ता है ताकि सिस्टम को यह सिखाया जा सके कि झूठ कैसा दिखता है।
  3. बहुत सरल हैं: वे केवल इस बात को देखते हैं कि रोबोट अपने शब्दों से कितना "हैरान" (surprised) है, जो अक्सर विफल हो जाता है जब रोबोट पूरे आत्मविश्वास के साथ गलत होता है।

खोज: "फोकस" मीटर (The "Focus" Meter)

शोधकर्ताओं ने रोबोट के मस्तिष्क के अंदर (विशेष रूप से इसके अटेंशन मैकेनिज्म या ध्यान तंत्र पर) झाँका। कल्पना कीजिए कि रोबोट शब्द दर शब्द एक वाक्य लिख रहा है। हर बार जब वह एक नया शब्द लिखता है, तो वह अगले शब्द का निर्णय लेने के लिए पिछले शब्दों को देखता है। इस "पीछे देखने" की प्रक्रिया को अटेंशन (attention) कहा जाता है।

शोधकर्ताओं ने एक अजीब पैटर्न की खोज की:

  • जब रोबंडा सच बोल रहा होता है: तो वह अभी-अभी लिखे गए शब्द पर बहुत बारीकी से और स्थिर ध्यान देता है। यह एक सावधान लेखक की तरह है जो यह सुनिश्चित करने के लिए अपने पिछले वाक्य की जाँच करता है कि नया वाक्य उसमें सटीक रूप से फिट बैठे।
  • जब रोबोट हैलुसिनेट (भ्रमित) कर रहा होता है: तो अचानक, उसके मस्तिष्क के भीतर कुछ विशिष्ट "सेंसरों" (जिन्हें अटेंशन हेड्स कहा जाता है) के लिए, वह फोकस तेजी से गिर जाता है। ऐसा लगता है जैसे रोबोट अपने पिछले शब्दों को देखना बंद कर देता है और अस्पष्ट विचारों के आधार पर कल्पना करने या अनुमान लगाने लगता है।

उपमा: कल्पना कीजिए कि एक शेफ खाना बना रहा है।

  • सत्य मोड (Truthful mode): शेफ सूप को चखता है, सामग्री को देखता है, और नमक का एक चुटकी डालता है। वे तत्काल कार्य पर केंद्रित होते हैं।
  • हैलुसिनेशन मोड (Hallucination mode): शेफ अचानक बिना चखे या देखे बिना ही रैंडम मसाले डालने लगता है। वास्तविक खाना बनाने की प्रक्रिया पर उनका ध्यान गायब हो जाता है।

शोधकर्ताओं ने पाया कि रोबोट के मस्तिष्क में विशिष्ट "सेंसर" एक झूठ पकड़ने वाले यंत्र (lie detector) की तरह काम करते हैं। जब ये सेंसर पिछले शब्द पर ध्यान केंद्रित करना बंद कर देते हैं, तो यह एक बड़ा संकेत (red flag) होता है कि रोबोट कुछ गलत बोलने वाला है।

समाधान: RAUQ (द "प्लग-एंड-प्ले" डिटेक्टर)

लेखकों ने एक सिस्टम बनाया जिसे RAUQ कहा जाता है जो इस खोज का उपयोग करता है। यहाँ बताया गया है कि यह क्या विशेष बनाता है:

  1. यह एक "वन-पास" चमत्कार है: अन्य तरीकों के विपरीत जो रोबोट को कई बार सोचने के लिए मजबूर करते हैं, RAUQ रोबोट को उत्तर लिखते समय केवल एक बार देखता है। यह रोबोट की गति को धीमा नहीं करता है।
  2. यह "प्लग-एंड-प्ले" है: आपको इसे प्रशिक्षित करने या इसे अध्ययन करने के लिए झूठ की पाठ्यपुस्तक देने की आवश्यकता नहीं है। यह स्वचालित रूप से लगभग किसी भी रोबोट मॉडल पर काम करता है जिसे आप एक्सेस कर सकते हैं (जब तक कि आप उसके आंतरिक "फोकस" सेंसर देख सकते हों)।
  3. यह एक "रिकरेंट" जासूस है: यह केवल एक शब्द को अलग से नहीं देखता। यह एक चलता हुआ स्कोर रखता है। यदि रोबोट अपना ध्यान खोने लगता है, तो स्कोर बढ़ जाता है। यदि वह ध्यान वापस पाता है, तो स्कोर कम हो सकता है। यह वाक्य लिखे जाने के दौरान पूरे वाक्य के लिए एक "अनिश्चितता स्कोर" (uncertainty score) बनाता है।

यह कितना अच्छा काम करता है?

टीम ने 9 अलग-अलग रोबोट मॉडलों का उपयोग करके 12 विभिन्न कार्यों (जैसे सामान्य ज्ञान के उत्तर देना, समाचारों का सारांश बनाना और भाषाओं का अनुवाद करना) पर RAUQ का परीक्षण किया।

  • परिणाम: मौजूदा 15 अन्य तरीकों की तुलना में झूठ पकड़ने में RAUQ सबसे अच्छा था।
  • लागत: यह रोबोट के उत्तर देने के समय में 1% से भी कम का इजाफा करता है। गति के मामले में यह लगभग मुफ्त है।

मुख्य निष्कर्ष (The Bottom Line)

RAUQ को रोबोट के मस्तिष्क के भीतर बैठे एक रियल-टाइम झूठ पकड़ने वाले यंत्र के रूप में समझें। इसे पहले से तथ्यों को जानने की आवश्यकता नहीं है; यह बस यह जानता है कि रोबोट कब अपना "विचार खो रहा है"। क्योंकि यह बहुत तेज़ है और इसे अतिरिक्त प्रशिक्षण की आवश्यकता नहीं है, यह इन शक्तिशाली AI मॉडलों का उपयोग करने वाले किसी भी व्यक्ति के लिए एक तैयार उपकरण है ताकि यह सुनिश्चित किया जा सके कि वे मनगढ़ंत बातें नहीं बना रहे हैं।

यह शोध पत्र क्या दावा नहीं करता है:

  • यह रोबोट के झूठ को ठीक करने का दावा नहीं करता है (यह केवल उन्हें पहचानता है)।
  • यह दावा नहीं करता है कि यह "ब्लैक बॉक्स" रोबोट (जैसे कि वे जिनसे आप वेबसाइट के माध्यम से बात करते हैं जहाँ आप आंतरिक सेंसर नहीं देख सकते) पर बिना किसी विशेष "प्रॉक्सि" (proxy) रोबोट के काम करेगा।
  • यह दावा नहीं करता है कि यह हर एक प्रकार की त्रुटि के लिए एकदम सटीक है, लेकिन यह तथ्यात्मक हैलुसिनेशन के लिए अत्यधिक प्रभावी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →