← नवीनतम पेपर
💬 NLP

HALT: Hallucination Assessment via Log-probs as Time series

यह शोध पत्र HALT को प्रस्तुत करता है, जो एक हल्का और कुशल मतिभ्रम डिटेक्टर (hallucination detector) है जो मौजूदा विधियों की तुलना में बेहतर प्रदर्शन और गति प्राप्त करने के लिए टोकन लॉग-संभाव्यता (token log-probabilities) का समय श्रृंखला (time series) के रूप में विश्लेषण करता है, साथ ही HUB को भी प्रस्तुत करता है, जो लार्ज लैंग्वेज मॉडल्स में मतिभ्रम का पता लगाने के मूल्यांकन के लिए दस विविध क्षमताओं को एकीकृत करने वाला एक व्यापक बेंचमार्क है।

मूल लेखक: Ahmad Shapiro, Karan Taneja, Ashok Goel

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmad Shapiro, Karan Taneja, Ashok Goel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानीकार को कहानी सुनाते हुए सुन रहे हैं। कभी-कभी, वे पूर्ण आत्मविश्वास के साथ बोलते हैं, उनकी आवाज़ स्थिर और स्पष्ट होती है। अन्य समय में, वे हकला सकते हैं, हिचकिचा सकते हैं, या कोई भी ऐसी बात बताने से ठीक पहले उनकी आवाज़ लड़खड़ा सकती है जो सच नहीं है।

लंबे समय से, लार्ज लैंग्वेज मॉडल्स (LLMs) को झूठ बोलने (या "हैलुसिनेट" करने) से पकड़ने की कोशिश करने वाले शोधकर्ता दो मुख्य दृष्टिकोणों का उपयोग करते आए हैं:

  1. "व्हाइट-बॉक्स" दृष्टिकोण: कहानीकार से उनके गुप्त नोट्स और मस्तिष्क की तरंगें दिखाने के लिए कहना। यह तब बहुत अच्छा है जब आप उस कहानीकार के मालिक हों, लेकिन यदि आप केवल एक सार्वजनिक API (जैसे कि एक चैटबॉट) का उपयोग कर रहे हैं, तो यह असंभव है।
  2. "ब्लैक-बॉक्स" दृष्टिकोण: कहानीकार को कहानी दोहराने के लिए कहना या दूसरे कहानीकार से तथ्य-जांच (फैक्ट-चेक) करने के लिए कहना। यह धीमा, महंगा है, और कभी-कभी दूसरा कहानीकार भी झूठ बोल जाता है।

HALT (लॉग-प्रोब्स के रूप में टाइम सीरीज़ के माध्यम से हॉलुसिनेशन असेसमेंट) एक नया, चतुर जासूस है जिसे न तो गुप्त नोट्स की आवश्यकता है और न ही दूसरे कहानीकार की। यह केवल कहानीकार के आत्मविश्वास की लय को सुनता है।

मूल विचार: आत्मविश्वास की "धड़कन" को सुनना

जब एक AI टेक्स्ट जेनरेट करता है, तो वह केवल एक शब्द नहीं चुनता; वह गणना करता है कि अगला संभावित शब्द क्या होगा। इन गणनाओं को लॉग-प्रोबेबिलिटीज (log-probabilities) कहा जाता है। इन्हें AI का आंतरिक "कॉन्फिडेंस मीटर" मान लें जो हर शब्द के लिए काम करता है।

लेखकों ने महसूस किया कि ये कॉन्फिडेंस मीटर केवल वहां बैठे नहीं रहते; वे एक टाइम सीरीज़ (एक धड़कन या स्टॉक मार्केट चार्ट की तरह) की तरह चलते हैं।

  • जब एक AI सच बोल रहा होता है, तो उसका कॉन्फिडेंस मीटर आमतौर पर एक सुचारू, स्थिर लय का पालन करता है।
  • जब वह हॉलुसिनेट करने लगता है (कुछ मनगढ़ंत बनाने लगता है), तो उसकी लय अजीब हो जाती है। इसमें अचानक उछाल आ सकता है, गिरावट आ सकती है, या एक विशिष्ट पैटर्न में डगमगाहट हो सकती है, भले ही AI बहुत आत्मविश्वासी दिखाई दे रहा हो।

HALT एक छोटा, हल्का कंप्यूटर प्रोग्राम ("GRU" मॉडल) है जिसे इस आत्मविश्वास की लय को देखने के लिए प्रशिक्षित किया गया है। यह उन शब्दों को नहीं पढ़ता जो AI कहता है; यह केवल AI के आत्मविश्वास के ग्राफ को देखता है जो बोलते समय बदलता है।

जासूस का टूलकिट: HALT

HALT एक विशेष स्टेथोस्कोप की तरह है। यह उन शीर्ष 20 सबसे संभावित शब्दों को देखता है जिन्हें AI विचार में ले रहा है। यह मापता है:

  • चुनाव कितना अस्थिर है: क्या AI दो शब्दों के बीच उलझा हुआ है? (उच्च अनिश्चितता)।
  • परिवर्तन कितना अचानक है: क्या AI अचानक 99% निश्चितता से 50% पर आ गया?
  • समय के साथ पैटर्न: क्या कॉन्फिडेंस कर्व एक चिकनी पहाड़ी की तरह है या एक ऊबड़-खाबड़ पर्वत श्रृंखला की तरह?

इस "कॉन्फिडेंस हार्टबीट" को अपने मस्तिष्क में फीड करके, HALT यह पहचानना सीख जाता है कि जब एक AI झूठ बोलना शुरू करता है तो किस तरह की "अतालता" (arrhythmia) होती है।

नया स्टेडियम: HUB

यह परीक्षण करने के लिए कि क्या HALT वास्तव में काम करता है, लेखकों ने एक विशाल नया परीक्षण मैदान बनाया जिसे HUB (हॉलुसिनेशन डिटेक्शन यूनिफाइड बेंचमार्क) कहा जाता है।

कल्पना कीजिए कि पिछले परीक्षण केवल एक छोटे, शांत पुस्तकालय (केवल सरल तथ्यों या चैट पर ध्यान केंद्रित करना) में खेलने जैसे थे। HUB 10 अलग-अलग खेलों वाला एक विशाल, अराजक स्टेडियम है:

  • रीजनिंग स्पोर्ट्स (तर्क आधारित खेल): गणित, कोडिंग, लॉजिक पहेलियाँ और एल्गोरिदम।
  • सामान्य स्पोर्ट्स: चैटिंग, समाचारों का सारांश देना और सामान्य ज्ञान (ट्रिविया) के उत्तर देना।

लेखकों ने महसूस किया कि "हॉलुसिनेशन" केवल तथ्य बनाने (जैसे यह कहना कि चंद्रमा पनीर से बना है) के बारे में नहीं है। यह लॉजिकल हॉलुसिनेशन के बारे में भी है—जहाँ AI तथ्यों को सही रखता है लेकिन वहां तक पहुँचने के लिए गणित या तर्क के चरणों में गलती कर देता है। HUB इन सभी का परीक्षण करता है।

परिणाम: छोटा लेकिन शक्तिशाली

पेपर HALT की तुलना अन्य डिटेक्टरों से करता है:

  • Lettuce: एक बहुत बड़ा, भारी डिटेक्टर (एक विशाल टैंक की तरह) जो वास्तविक टेक्स्ट को पढ़ता है।
  • व्हाइट-बॉक्स मेथड्स: ऐसे डिटेक्टर जिन्हें AI के आंतरिक मस्तिष्क को देखने की आवश्यकता होती है (जिसे आप अधिकांश व्यावसायिक AI के साथ नहीं कर सकते)।

आश्चर्य: HALT उस भारी टैंक (Lettuce) से 30 गुना छोटा है और 60 गुना तेज़ है। फिर भी, यह अधिक बार जीतता है!

  • यह 10 में से 7 खेलों में भारी टैंक को हरा देता है।
  • यह बड़े टैंक के समान ही अच्छा काम करता है लेकिन इसे टेक्स्ट पढ़ने या AI के मस्तिष्क को देखने की आवश्यकता नहीं होती। यह केवल आत्मविश्वास की लय को सुनता है।

महत्वपूर्ण सीमाएं (जो पेपर कहता है)

  • यह मॉडल-विशिष्ट है: HALT एक ऐसे कोच की तरह है जो किसी विशेष खिलाड़ी की धड़कन को पूरी तरह जानता है। यदि आप HALT को "Llama" नामक AI पर प्रशिक्षित करते हैं, तो यह Llama में झूठ पकड़ने में विशेषज्ञ बन जाता है। यदि आप उसी HALT को "Qwen" नामक दूसरे AI पर उपयोग करने का प्रयास करते हैं, तो यह भ्रमित हो जाता है। अलग-अलग मॉडलों के लिए "धड़कन" के पैटर्न अलग होते हैं।
  • इसे "कॉन्फिडेंस नंबर्स" तक पहुंच की आवश्यकता है: आपको AI के मस्तिष्क की आवश्यकता नहीं है, लेकिन आपको API से हर शब्द के लिए शीर्ष 20 कॉन्फिडेंस नंबर प्राप्त करने की आवश्यकता है। यदि कोई API उन नंबरों को पूरी तरह से छिपा देता है, तो HALT काम नहीं कर सकता।
  • यह पता लगाता है, सुधारता नहीं है: HALT एक स्मोक अलार्म (धुआं पहचानने वाला यंत्र) है। यह आपको बताता है कि AI कब हॉलुसिनेट कर रहा है, लेकिन यह यह नहीं बताता कि क्यों या कहानी को कैसे ठीक किया जाए।

सारांश उपमा

एक AI को एक जादूगर की तरह समझें जो एक करतब दिखा रहा है।

  • पुराने डिटेक्टर जादूगर की टोपी के नीचे झांकने की कोशिश करते थे (व्हाइट-बॉक्स) या दर्शकों से वोट मांगने की कोशिश करते थे कि क्या करतब असली था (ब्लैक-बॉक्स टेक्स्ट विश्लेषण)।
  • HALT बस जादूगर के हाथों को देखता है। वह जानता है कि जब एक जादूगर टोपी से नकली खरगोश निकालने वाला होता है, तो उसके हाथ की हरकतें थोड़ी झटकेदार और अप्रत्याशित हो जाती हैं, भले ही वह आत्मविश्वास से मुस्कुरा रहा हो। HALT को AI के कॉन्फिडेंस नंबरों में उस विशिष्ट "झटकेदार हाथ" के पैटर्न को पहचानने के लिए प्रशिक्षित किया गया है, जिससे वह बिना जादू देखे या किसी और से पूछे, तुरंत झूठ को पकड़ लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →