HALT: Hallucination Assessment via Log-probs as Time series
यह शोध पत्र HALT को प्रस्तुत करता है, जो एक हल्का और कुशल मतिभ्रम डिटेक्टर (hallucination detector) है जो मौजूदा विधियों की तुलना में बेहतर प्रदर्शन और गति प्राप्त करने के लिए टोकन लॉग-संभाव्यता (token log-probabilities) का समय श्रृंखला (time series) के रूप में विश्लेषण करता है, साथ ही HUB को भी प्रस्तुत करता है, जो लार्ज लैंग्वेज मॉडल्स में मतिभ्रम का पता लगाने के मूल्यांकन के लिए दस विविध क्षमताओं को एकीकृत करने वाला एक व्यापक बेंचमार्क है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कहानीकार को कहानी सुनाते हुए सुन रहे हैं। कभी-कभी, वे पूर्ण आत्मविश्वास के साथ बोलते हैं, उनकी आवाज़ स्थिर और स्पष्ट होती है। अन्य समय में, वे हकला सकते हैं, हिचकिचा सकते हैं, या कोई भी ऐसी बात बताने से ठीक पहले उनकी आवाज़ लड़खड़ा सकती है जो सच नहीं है।
लंबे समय से, लार्ज लैंग्वेज मॉडल्स (LLMs) को झूठ बोलने (या "हैलुसिनेट" करने) से पकड़ने की कोशिश करने वाले शोधकर्ता दो मुख्य दृष्टिकोणों का उपयोग करते आए हैं:
- "व्हाइट-बॉक्स" दृष्टिकोण: कहानीकार से उनके गुप्त नोट्स और मस्तिष्क की तरंगें दिखाने के लिए कहना। यह तब बहुत अच्छा है जब आप उस कहानीकार के मालिक हों, लेकिन यदि आप केवल एक सार्वजनिक API (जैसे कि एक चैटबॉट) का उपयोग कर रहे हैं, तो यह असंभव है।
- "ब्लैक-बॉक्स" दृष्टिकोण: कहानीकार को कहानी दोहराने के लिए कहना या दूसरे कहानीकार से तथ्य-जांच (फैक्ट-चेक) करने के लिए कहना। यह धीमा, महंगा है, और कभी-कभी दूसरा कहानीकार भी झूठ बोल जाता है।
HALT (लॉग-प्रोब्स के रूप में टाइम सीरीज़ के माध्यम से हॉलुसिनेशन असेसमेंट) एक नया, चतुर जासूस है जिसे न तो गुप्त नोट्स की आवश्यकता है और न ही दूसरे कहानीकार की। यह केवल कहानीकार के आत्मविश्वास की लय को सुनता है।
मूल विचार: आत्मविश्वास की "धड़कन" को सुनना
जब एक AI टेक्स्ट जेनरेट करता है, तो वह केवल एक शब्द नहीं चुनता; वह गणना करता है कि अगला संभावित शब्द क्या होगा। इन गणनाओं को लॉग-प्रोबेबिलिटीज (log-probabilities) कहा जाता है। इन्हें AI का आंतरिक "कॉन्फिडेंस मीटर" मान लें जो हर शब्द के लिए काम करता है।
लेखकों ने महसूस किया कि ये कॉन्फिडेंस मीटर केवल वहां बैठे नहीं रहते; वे एक टाइम सीरीज़ (एक धड़कन या स्टॉक मार्केट चार्ट की तरह) की तरह चलते हैं।
- जब एक AI सच बोल रहा होता है, तो उसका कॉन्फिडेंस मीटर आमतौर पर एक सुचारू, स्थिर लय का पालन करता है।
- जब वह हॉलुसिनेट करने लगता है (कुछ मनगढ़ंत बनाने लगता है), तो उसकी लय अजीब हो जाती है। इसमें अचानक उछाल आ सकता है, गिरावट आ सकती है, या एक विशिष्ट पैटर्न में डगमगाहट हो सकती है, भले ही AI बहुत आत्मविश्वासी दिखाई दे रहा हो।
HALT एक छोटा, हल्का कंप्यूटर प्रोग्राम ("GRU" मॉडल) है जिसे इस आत्मविश्वास की लय को देखने के लिए प्रशिक्षित किया गया है। यह उन शब्दों को नहीं पढ़ता जो AI कहता है; यह केवल AI के आत्मविश्वास के ग्राफ को देखता है जो बोलते समय बदलता है।
जासूस का टूलकिट: HALT
HALT एक विशेष स्टेथोस्कोप की तरह है। यह उन शीर्ष 20 सबसे संभावित शब्दों को देखता है जिन्हें AI विचार में ले रहा है। यह मापता है:
- चुनाव कितना अस्थिर है: क्या AI दो शब्दों के बीच उलझा हुआ है? (उच्च अनिश्चितता)।
- परिवर्तन कितना अचानक है: क्या AI अचानक 99% निश्चितता से 50% पर आ गया?
- समय के साथ पैटर्न: क्या कॉन्फिडेंस कर्व एक चिकनी पहाड़ी की तरह है या एक ऊबड़-खाबड़ पर्वत श्रृंखला की तरह?
इस "कॉन्फिडेंस हार्टबीट" को अपने मस्तिष्क में फीड करके, HALT यह पहचानना सीख जाता है कि जब एक AI झूठ बोलना शुरू करता है तो किस तरह की "अतालता" (arrhythmia) होती है।
नया स्टेडियम: HUB
यह परीक्षण करने के लिए कि क्या HALT वास्तव में काम करता है, लेखकों ने एक विशाल नया परीक्षण मैदान बनाया जिसे HUB (हॉलुसिनेशन डिटेक्शन यूनिफाइड बेंचमार्क) कहा जाता है।
कल्पना कीजिए कि पिछले परीक्षण केवल एक छोटे, शांत पुस्तकालय (केवल सरल तथ्यों या चैट पर ध्यान केंद्रित करना) में खेलने जैसे थे। HUB 10 अलग-अलग खेलों वाला एक विशाल, अराजक स्टेडियम है:
- रीजनिंग स्पोर्ट्स (तर्क आधारित खेल): गणित, कोडिंग, लॉजिक पहेलियाँ और एल्गोरिदम।
- सामान्य स्पोर्ट्स: चैटिंग, समाचारों का सारांश देना और सामान्य ज्ञान (ट्रिविया) के उत्तर देना।
लेखकों ने महसूस किया कि "हॉलुसिनेशन" केवल तथ्य बनाने (जैसे यह कहना कि चंद्रमा पनीर से बना है) के बारे में नहीं है। यह लॉजिकल हॉलुसिनेशन के बारे में भी है—जहाँ AI तथ्यों को सही रखता है लेकिन वहां तक पहुँचने के लिए गणित या तर्क के चरणों में गलती कर देता है। HUB इन सभी का परीक्षण करता है।
परिणाम: छोटा लेकिन शक्तिशाली
पेपर HALT की तुलना अन्य डिटेक्टरों से करता है:
- Lettuce: एक बहुत बड़ा, भारी डिटेक्टर (एक विशाल टैंक की तरह) जो वास्तविक टेक्स्ट को पढ़ता है।
- व्हाइट-बॉक्स मेथड्स: ऐसे डिटेक्टर जिन्हें AI के आंतरिक मस्तिष्क को देखने की आवश्यकता होती है (जिसे आप अधिकांश व्यावसायिक AI के साथ नहीं कर सकते)।
आश्चर्य: HALT उस भारी टैंक (Lettuce) से 30 गुना छोटा है और 60 गुना तेज़ है। फिर भी, यह अधिक बार जीतता है!
- यह 10 में से 7 खेलों में भारी टैंक को हरा देता है।
- यह बड़े टैंक के समान ही अच्छा काम करता है लेकिन इसे टेक्स्ट पढ़ने या AI के मस्तिष्क को देखने की आवश्यकता नहीं होती। यह केवल आत्मविश्वास की लय को सुनता है।
महत्वपूर्ण सीमाएं (जो पेपर कहता है)
- यह मॉडल-विशिष्ट है: HALT एक ऐसे कोच की तरह है जो किसी विशेष खिलाड़ी की धड़कन को पूरी तरह जानता है। यदि आप HALT को "Llama" नामक AI पर प्रशिक्षित करते हैं, तो यह Llama में झूठ पकड़ने में विशेषज्ञ बन जाता है। यदि आप उसी HALT को "Qwen" नामक दूसरे AI पर उपयोग करने का प्रयास करते हैं, तो यह भ्रमित हो जाता है। अलग-अलग मॉडलों के लिए "धड़कन" के पैटर्न अलग होते हैं।
- इसे "कॉन्फिडेंस नंबर्स" तक पहुंच की आवश्यकता है: आपको AI के मस्तिष्क की आवश्यकता नहीं है, लेकिन आपको API से हर शब्द के लिए शीर्ष 20 कॉन्फिडेंस नंबर प्राप्त करने की आवश्यकता है। यदि कोई API उन नंबरों को पूरी तरह से छिपा देता है, तो HALT काम नहीं कर सकता।
- यह पता लगाता है, सुधारता नहीं है: HALT एक स्मोक अलार्म (धुआं पहचानने वाला यंत्र) है। यह आपको बताता है कि AI कब हॉलुसिनेट कर रहा है, लेकिन यह यह नहीं बताता कि क्यों या कहानी को कैसे ठीक किया जाए।
सारांश उपमा
एक AI को एक जादूगर की तरह समझें जो एक करतब दिखा रहा है।
- पुराने डिटेक्टर जादूगर की टोपी के नीचे झांकने की कोशिश करते थे (व्हाइट-बॉक्स) या दर्शकों से वोट मांगने की कोशिश करते थे कि क्या करतब असली था (ब्लैक-बॉक्स टेक्स्ट विश्लेषण)।
- HALT बस जादूगर के हाथों को देखता है। वह जानता है कि जब एक जादूगर टोपी से नकली खरगोश निकालने वाला होता है, तो उसके हाथ की हरकतें थोड़ी झटकेदार और अप्रत्याशित हो जाती हैं, भले ही वह आत्मविश्वास से मुस्कुरा रहा हो। HALT को AI के कॉन्फिडेंस नंबरों में उस विशिष्ट "झटकेदार हाथ" के पैटर्न को पहचानने के लिए प्रशिक्षित किया गया है, जिससे वह बिना जादू देखे या किसी और से पूछे, तुरंत झूठ को पकड़ लेता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।