Detecting LLM Hallucinations via Embedding Cluster Geometry: A Three-Type Taxonomy with Measurable Signatures
यह शोध पत्र टोकन एम्बेडिंग क्लस्टर संरचनाओं के आधार पर LLM मतिभ्रम (hallucinations) को तीन विशिष्ट प्रकारों में विभाजित करने के लिए एक ज्यामितीय वर्गीकरण (geometric taxonomy) प्रस्तावित करता है और आर्किटेक्चर-निर्भर भेद्यता प्रोफाइल (vulnerability profiles) स्थापित करने हेतु तीन मापने योग्य सांख्यिकियों (ध्रुवीयता युग्मन, क्लस्टर सामंजस्य और रेडियल सूचना प्रवणता) का उपयोग करके 11 ट्रांसफॉर्मर मॉडलों में इस ढांचे को मान्य करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, जादुई पुस्तकालय है जहाँ हर किताब एक बहुत ही आत्मविश्वासी, बहुत तेज़ लाइब्रेरियन (AI) द्वारा लिखी गई है। कभी-कभी, यह लाइब्रेरियन ऐसी कहानियाँ बना लेता है जो सुनने में तो एकदम सही लगती हैं लेकिन पूरी तरह से झूठी होती हैं। इसे "हैलुसिनेशन" (Hallucination) कहा जाता है।
ज्यादातर लोग इन झूठों को पकड़ने के लिए अंतिम कहानी को पढ़ने और यह देखने की कोशिश करते हैं कि क्या वह समझ में आ रही है। लेकिन यह शोध पत्र एक अलग विचार प्रस्तावित करता है: कहानी को पढ़ने के बजाय, चलिए लाइब्रेरियन के दिमाग के नक्शे (Brain Map) को देखते हैं जब वह सोच रहा होता है।
लेखक, मैटिक कोरुन (Matic Korun), सुझाव देते हैं कि जब लाइब्रेरियन भ्रमित होता है, तो उसका दिमाग केवल "खाली" नहीं हो जाता। इसके बजाय, उसके विचार एक नक्शे पर विशिष्ट, अजीब पैटर्न में फंस जाते हैं। इन पैटर्नों के आकार को मापकर, हम यह भविष्यवाणी कर सकते हैं कि कौन सा झूठ आने वाला है, इससे पहले कि वह लिखा भी जाए।
यहाँ इस पेपर के तीन प्रकार के "ब्रेन मैप" विफलताओं का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:
तीन प्रकार के हैलुसिनेशन (Hallucinations)
कल्पना कीजिए कि लाइब्रेरियन का दिमाग अलग-अलग विषयों के लिए अलग-अलग मोहल्लों (clusters) वाला एक शहर है, जैसे कि "जानवर," "खाना बनाना," या "इतिहास।"
1. "अस्पष्ट पथिक" (The Vague Drifter) (प्रकार 1: सेंटर-ड्रिफ्ट)
- क्या होता है: लाइब्रेरियन से ऐसा सवाल पूछा जाता है जिसे वह वास्तव में समझ नहीं पाता है। किसी विशिष्ट मोहल्ले में जाने के बजाय, वह बस शहर के चौक (नक्शे के केंद्र) में भटकने लगता है।
- परिणाम: वह आपको एक ऐसा उत्तर देता है जो सुरक्षित है, सामान्य है और आत्मविश्वास से भरा लगता है, लेकिन वह कुछ भी उपयोगी नहीं कहता।
- उदाहरण: "ज़ोग (Zog) नामक देश की राजधानी क्या है?" -> "यह एक बहुत महत्वपूर्ण शहर है जहाँ बहुत से लोग रहते हैं।" (सच है, लेकिन बेकार है)।
- पहचान (Signature): विचार कमजोर है और नक्शे के बिल्कुल बीच में स्थित है, किसी विशिष्ट मोहल्ले से बहुत दूर।
2. "आत्मविश्वासी गलत-क्षेत्र" (The Confident Wrong-Well) (प्रकार 2: रोंग-वेल कन्वर्जेंस)
- क्या होता है: लाइब्रेरियन बहुत केंद्रित है! वह सीधे एक विशिष्ट मोहल्ले में पहुँच जाता है, लेकिन वह गलत मोहल्ला है। वह इस मोहल्ले में इतना आश्वस्त है कि वह आपकी बात नहीं सुनेगा।
- परिणाम: वह एक विस्तृत, विशिष्ट और विश्वासजनक झूठ देता है।
- उदाहरण: "बिजली का बल्ब किसने आविष्कार किया था?" -> "थॉमस एडिसन ने 1805 में बिजली का बल्ब आविष्कार किया था।" (आत्मविश्वासी, विस्तृत, लेकिन तारीख गलत है)।
- पहचान: विचार एक मोहल्ले के भीतर गहराई में है, लेकिन वह सवाल के लिए गलत मोहल्ला है।
3. "जंगल में खोया हुआ" (The Lost in the Wild) (प्रकार 3: कवरेज गैप)
- क्या होता है: लाइब्रेरियन से इतनी अजीब या नई चीज़ के बारे में पूछा जाता है कि नक्शे पर उसके लिए कोई मोहल्ला मौजूद ही नहीं है। वह एक ऐसे रेगिस्तान में खड़ा है जहाँ कोई सड़कें नहीं जातीं।
- परिणाम: वह बड़बड़ाना शुरू कर देता है, बकवास बनाता है, या यादृच्छिक (random) विषयों के बीच कूदने लगता है।
- उदाहरण: "मंगलवार की आवाज़ का रंग क्या है?" -> "यह एक तेज़ बैंगनी रंग है जिसका स्वाद बिजली जैसा है।"
- पहचान: विचार खाली स्थान में तैर रहा है, किसी भी मोहल्ले से दूर, बिना किसी स्पष्ट दिशा के।
तीन "रूलर" (Ruler) उपकरण
इसे सिद्ध करने के लिए, लेखक ने लाइब्रेरियन के ब्रेन मैप को मापने के लिए तीन विशेष रूलर बनाए। उन्होंने इनका परीक्षण 11 अलग-अलग AI मॉडल (जैसे BERT, GPT-2, आदि) पर किया।
"विपरीत-पक्ष" रूलर (पोलैरिटी कपलिंग, ):
- उपमा: एक अच्छे पुस्तकालय में, विपरीत अर्थ वाले शब्द (जैसे "गर्म" और "ठंडा") एक ही मोहल्ले में लेकिन कमरे के विपरीत दिशाओं में होने चाहिए।
- निष्कर्ष: प्रत्येक AI मॉडल ने इस परीक्षण को पास किया। उनके दिमाग स्वाभाविक रूप से विपरीतों को सही ढंग से व्यवस्थित करते हैं। यह एक सार्वभौमिक नियम है कि ये AI कैसे सोचते हैं।
"मोहल्ले की कसावट" रूलर (क्लस्टर कोहेजन, ):
- उपमा: क्या एक मोहल्ले के शब्द वास्तव में एक साथ जुड़े हुए हैं? या वह मोहल्ला सिर्फ एक यादृच्छिक गड़बड़ी है?
- निष्कर्ष: प्रत्येक AI मॉडल ने इसे भी पास किया। मोहल्ले वास्तविक और घने हैं। AI जानता है कि "सेब" और "केला" एक साथ आते हैं, और "कार" और "साइकिल" एक साथ आते हैं।
"घर से दूरी" रूलर (रेडियल ग्रेडिएंट, ):
- उपमा: यह मापता है कि क्या केंद्र से दूर जाने पर लाइब्रेरियन के विचार "भारी" या "हल्के" होते जाते हैं। आमतौर पर, दुर्लभ, जटिल शब्द किनारे पर दूर होते हैं, और सामान्य शब्द केंद्र के पास होते हैं।
- निष्कर्ष: 11 में से 9 मॉडलों में यहाँ एक स्पष्ट पैटर्न था।
- खामी (Glitch): दो मॉडल (ALBERT और MiniLM) इस परीक्षण में विफल रहे। क्यों?
- ALBERT बहुत "दबा हुआ" (squished) था। इसने एक विशाल पुस्तकालय को एक छोटी अलमारी में फिट करने की कोशिश की, जिससे सब कुछ संकुचित हो गया।
- MiniLM "डिस्टिल्ड" (छोटा बनाने के लिए प्रशिक्षित) था। इसने नक्शे को इतना सपाट कर दिया कि केंद्र से "दूरी" का कोई महत्व नहीं रह गया।
- सबक: ये दो मॉडल "अस्पष्ट पथिक" (प्रकार 1) वाली गलती करने की अधिक संभावना रखते हैं क्योंकि उनका "दूरी" चेतावनी तंत्र टूटा हुआ है।
यह क्यों मायने रखता है
आमतौर पर, हम झूठ पकड़े जाने के बाद उसे पकड़ने की कोशिश करते हैं। यह शोध पत्र कहता है: "हम विचार के आकार को देखकर झूठ को आते हुए देख सकते हैं।"
- यदि विचार केंद्र के बहुत करीब है, तो यह एक अस्पष्ट झूठ है।
- यदि विचार गलत मोहल्ले के बहुत अंदर है, तो यह एक आत्मविश्वासी झूठ है।
- यदि विचार खाली रेगिस्तान में है, तो यह एक बकवास (nonsense) झूठ है।
AI के दिमाग की "ज्यामिति" (geometry) को समझकर, हम बेहतर सुरक्षा जाल बना सकते हैं। हम एक छोटे, संकुचित AI (जैसे MiniLM) को अनिश्चित होने पर अतिरिक्त सावधान रहने के लिए कह सकते हैं, क्योंकि हम जानते हैं कि उसका ब्रेन मैप थोड़ा धुंधला है।
संक्षेप में: लेखक ने AI के मन का मानचित्र बनाया और पाया कि झूठों का एक विशिष्ट आकार होता है। यदि हम उस आकार को माप सकते हैं, तो हम झूठ बोलने से पहले ही उन्हें रोक सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।