Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
यह शोध पत्र TOHA को प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) प्रणालियों के लिए एक टोपोलॉजी-आधारित मतिभ्रम डिटेक्टर (hallucination detector) है, जो प्रॉम्प्ट और रिस्पॉन्स अटेंशन ग्राफ्स के बीच टोपोलॉजिकल डाइवर्जेंस को मापकर तथ्यात्मक रूप से गलत आउटपुट की पहचान करता है, और न्यूनतम डेटा एवं कंप्यूटेशनल संसाधनों के साथ अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी कहानीकार के रूप में करें। जब आप इससे कोई प्रश्न पूछते हैं, तो यह केवल शब्दों में "सोचता" नहीं है; बल्कि यह उन शब्दों के बीच के विशाल, अदृश्य कनेक्शनों के जाल को देखता है जो इसने अब तक देखे हैं और जो शब्द यह अब कहने वाला है। इस जाल को अटेंशन मैप (Attention Map) कहा जाता है।
यह शोध पत्र एक नया टूल पेश करता है जिसे TOHA (TOpology-based HAllucination detector) कहा जाता है, ताकि इस कहानीकार को तब पकड़ा जा सके जब वह मनगढ़ंत बातें (hallucinate) बनाने लगे। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
1. कहानीकार का जाल (द अटेंशन ग्राफ)
LLM के अटेंशन मैप को एक शहर के मानचित्र के रूप में समझें।
- प्रॉम्प्ट (आपका प्रश्न): ये मानचित्र के बाईं ओर की इमारतें हैं।
- रिस्पॉन्स (जवाब): ये दाईं ओर बनाई जा रही नई इमारतें हैं।
- रेखाएं (Lines): इमारतों को जोड़ने वाली रेखाएं दिखाती हैं कि मॉडल एक शब्द लिखते समय दूसरे शब्द को कितनी मजबूती से "देख" रहा है। यदि मॉडल सच बोल रहा है, तो नई इमारतें (जवाब) पुरानी इमारतों (आपके प्रश्न के तथ्यों) से मजबूती से जुड़ी होनी चाहिए।
2. "हैलुसिनेशन" (मनगढ़ंत तथ्य) की समस्या
जब मॉडल हैलुसिनेट करता है, तो वह मूल शहर से ठीक से न जुड़ने वाली नई संरचनाएं बनाना शुरू कर देता है। यह ऐसा है जैसे मॉडल एक ऐसे पुल का निर्माण कर रहा हो जो आपके प्रश्न में मौजूद किसी ऐसी इमारत तक जाता है जो वास्तव में मौजूद ही नहीं है।
- सत्यपूर्ण उत्तर: नई इमारतें पुराने तथ्यों से मजबूत और छोटी कड़ियों (bridges) द्वारा जुड़ी होती हैं।
- हैलुसिनेटेड उत्तर: नई इमारतें हवा में तैर रही होती हैं, या बहुत लंबी, कमजोर या गैर-मौजूद कड़ियों से जुड़ी होती हैं।
3. TOHA डिटेक्टिव (टोपोलॉजिकल डायवर्जेंस)
TOHA एक जासूस है जो इन कनेक्शनों के आकार (shape) को मापता है। यह "टोपोलॉजिकल डायवर्जेंस" नामक गणितीय अवधारणा का उपयोग करता है।
- उपमा (Analogy): कल्पना करें कि आपके पास पत्थरों का एक ढेर है (आपके प्रश्न के शब्द) और आप उनके ठीक बगल में पत्थरों का एक नया ढेर (जवाब) बनाने की कोशिश कर रहे हैं।
- यदि आप एक सटीक प्रति (faithful copy) बना रहे हैं, तो आप नए पत्थरों को पुराने पत्थरों से बांधने के लिए छोटी रस्सियों का उपयोग करते हैं। कुल रस्सी की लंबाई कम होती है।
- यदि आप मनगढ़ंत बातें बना रहे हैं, तो आपके नए पत्थर दूर होंगे या हवा में तैर रहे होंगे। उन्हें पुराने ढेर से जोड़ने के लिए, आपको बहुत लंबी, महंगी रस्सियों की आवश्यकता होगी।
- स्कोर (Score): TOHA इन "रस्सियों" की कुल लंबाई (गणितीय रूप से, एक मिनिमल स्पैनिंग फॉरेस्ट की लंबाई) की गणना करता है।
- कम कुल रस्सी की लंबाई = उत्तर तथ्यों पर आधारित है (लो हैलुसिनेशन स्कोर)।
- लंबी कुल रस्सी की लंबाई = उत्तर तथ्यों से दूर भटक रहा है (हाई हैलुसिनेशन स्कोर)।
4. "विशेष आँखें" (हैलुसिनेशन-अवेयर हेड्स)
LLM के कई "हेड्स" (मस्तिष्क के अलग-अलग हिस्से जो टेक्स्ट को देखते हैं) होते हैं। शोध में पाया गया कि सभी हेड्स झूठ पकड़ने में समान रूप से सक्षम नहीं हैं।
- कुछ हेड्स कॉपी करने वाली मशीनों की तरह कार्य करते हैं। भ्रमित होने पर वे वाक्य के बिल्कुल पहले शब्द की ओर देखते हैं।
- शोधकर्ताओं ने पाया कि विशिष्ट "हेड्स" लगातार एक लंबी रस्सी की लंबाई (उच्च डायवर्जेंस) दिखाते हैं जब भी मॉडल झूठ बोलता है, चाहे विषय कुछ भी हो।
- TOHA पूरे मस्तिष्क की जांच नहीं करता; यह केवल इन कुछ "विशेष आँखों" से उनकी राय मांगता है। यदि वे कहते हैं, "हे, ये कनेक्शन बहुत लंबे हैं," तो TOHA इसे हैलुसिनेशन के रूप में चिह्नित कर देता है।
5. यह क्यों एक बड़ी बात है
- कोई अतिरिक्त ट्रेनिंग नहीं: अन्य तरीकों के विपरीत जिन्हें झूठ को पहचानने के लिए हजारों उदाहरणों की आवश्यकता होती है, TOHA "ट्रेनिंग-फ्री" है। यह बस वास्तविक समय में कनेक्शन के गणित को देखता है।
- सुपर फास्ट: अन्य तरीके अक्सर मॉडल को 10 या 20 बार कहानी सुनाने के लिए कहते हैं ताकि वे देख सकें कि जवाब मेल खाते हैं या नहीं (जैसे किसी गवाह को अपनी कहानी दोहराने के लिए कहना)। TOHA को कहानी को केवल एक बार देखने की आवश्यकता होती है। यह इन धीमी विधियों की तुलना में 70 गुना तक तेज़ है।
- हर जगह काम करता है: शोधकर्ताओं ने इसे विभिन्न मॉडलों (जैसे Llama और Mistral) और विभिन्न कार्यों (प्रश्न पूछना, समाचारों का सारांश देना) पर परखा। यह लगातार अच्छा काम करता है, भले ही मॉडल पूरी तरह से अलग विषयों पर बात कर रहा हो।
सारांश
TOHA AI कहानियों के लिए एक गुणवत्ता नियंत्रण निरीक्षक (quality control inspector) की तरह है। तथ्यों की जांच करने के लिए कहानी को पढ़ने के बजाय, यह ब्लूप्रिंट (अटेंशन मैप) को देखता है। यदि ब्लूप्रिंट दिखाता है कि कहानी के नए हिस्से मूल तथ्यों से बहुत दूर तैर रहे हैं, तो TOHA रेड फ्लैग (चेतावनी) उठा देता है। यह इसे तेजी से, सस्ते में और बिना झूठ की कोई डिक्शनरी याद किए करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।