← नवीनतम पेपर
🤖 machine learning

Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping

यह शोध पत्र 'आंसर-एग्रीमेंट रिप्रेजेंटेशन शेपिंग' (ARS) प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) विधि है जो काउंटरफैक्चुअल लेटेंट इंटरवेंशन (counterfactual latent interventions) के माध्यम से उत्तर स्थिरता को स्पष्ट रूप से एनकोड करने वाले ट्रेस-कंडीशन्ड रिप्रेजेंटेशन्स सीखकर बड़े रीजनिंग मॉडल्स में मतिभ्रम (hallucination) का पता लगाने की क्षमता को बढ़ाता है, जिससे मानव एनोटेशन की आवश्यकता के बिना ही लेटेंट अस्थिरता को उजागर किया जा सके।

मूल लेखक: Jianxiong Zhang, Bing Guo, Yuming Jiang, Haobo Wang, Bo An, Sean Du

प्रकाशित 2026-05-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jianxiong Zhang, Bing Guo, Yuming Jiang, Haobo Wang, Bo An, Sean Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी छात्र (AI) है जो एक परीक्षा दे रहा है। जब छात्र सही उत्तर देता है, तो आमतौर पर उनके पास तथ्यों की ठोस और अटूट समझ होती है। लेकिन जब वे गलत होते हैं (भ्रम या hallucination), तो वे अक्सर केवल अनुमान लगा रहे होते हैं या मनगढ़ंत बातें बना रहे होते हैं, भले ही उनका स्पष्टीकरण बहुत प्रभावशाली लगे।

समस्या यह है कि यह छात्र अपना अंतिम उत्तर देने से पहले एक लंबा, विस्तृत "विचार प्रक्रिया" (reasoning trace) लिखता है। कभी-कभी, यह लंबा स्पष्टीकरण इतना अच्छी तरह से लिखा जाता है कि यह हमें यह सोचने के लिए धोखा दे देता है कि उत्तर सही है, भले ही वह सही न हो।

यह शोध पत्र इन गलतियों को पकड़ने के लिए एक नया टूल पेश करता है जिसे ARS (Answer-agreement Representation Shaping) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "क्या होगा अगर?" वाला खेल (Latent Intervention)

आमतौर पर, यह जांचने के लिए कि क्या छात्र अनुमान लगा रहा है, आप उनसे वही प्रश्न दस बार पूछ सकते हैं ताकि यह देख सकें कि क्या वे दस अलग-अलग उत्तर देते हैं। लेकिन इसमें बहुत अधिक समय और प्रयास लगता है।

ARS कुछ अधिक स्मार्ट करता है। यह उस सटीक क्षण को देखता है जब छात्र अपनी विचार प्रक्रिया पूरी करता है और अंतिम उत्तर लिखने ही वाला होता है। इस विशिष्ट पल पर, ARS छात्र के मस्तिष्क को एक छोटा सा, अदृश्य "धक्का" (mathematical perturbation) देता है।

  • यदि छात्र वास्तव में उत्तर जानता है: तो यह छोटा सा धक्का उनके मन को नहीं बदलेगा। वे अभी भी वही सही उत्तर लिखेंगे।
  • यदि छात्र भ्रमित (hallucinating) है: तो उनकी समझ डगमगा रही है। यह छोटा सा धक्का उन्हें असंतुलित कर देगा, और वे अचानक एक बिल्कुल अलग, गलत उत्तर लिख देंगे।

2. उत्तरों को छाँटना (Representation Shaping)

ARS इस "क्या होगा अगर?" वाले खेल को हर प्रश्न के लिए कई बार खेलता है। यह उन सभी अलग-अलग उत्तरों को एकत्र करता है जो इन छोटे धक्कों के बाद छात्र द्वारा दिए गए होते हैं।

  • यह उन उत्तरों को एक साथ रखता है जो मूल उत्तर के साथ सहमत (agree) होते हैं।
  • यह उन उत्तरों को दूर धकेलता है जो असहमत (disagree) हैं (जो डगमगा रहे हैं)।

इसे एक पुस्तकालय को व्यवस्थित करने जैसा समझें। यदि कोई पुस्तक "सत्य तथ्य" है, तो कमरे को हिलाने पर भी वह अपनी जगह पर मजबूती से टिकी रहती है। यदि कोई पुस्तक "झूठा तथ्य" है, तो कमरे को हिलाने पर वह अपनी शेल्फ से गिर जाती है और दूसरे ढेर में जा गिरती है। ARS किताबों को इस तरह व्यवस्थित करना सीखता है ताकि "सत्य" और "झूठे" ढेर स्पष्ट रूप से अलग हो सकें।

3. परिणाम: एक बेहतर डिटेक्टर (Detector)

एक बार जब ARS इस तरह से उत्तरों को व्यवस्थित कर लेता है, तो यह अंतिम उत्तर के लिए एक विशेष "मानचित्र" (embedding) बनाता है।

  • ARS से पहले: मानचित्र अव्यवस्थित था। सत्य और झूठे उत्तर बहुत समान दिखते थे, जिससे डिटेक्टर के लिए उनके बीच अंतर करना कठिन था।
  • ARS के बाद: मानचित्र साफ है। सत्य उत्तर मजबूती से एक साथ क्लस्टर (cluster) होते हैं, और झूठे उत्तर उनसे दूर बिखरे हुए होते हैं।

अब, कोई भी मानक "झूठ पकड़ने वाला यंत्र" (lie detector) इस नए मानचित्र को देखकर लगभग तुरंत भ्रम (hallucination) को पहचान सकता है, बिना छात्र से प्रश्न दोबारा पूछे या उनके लंबा स्पष्टीकरण लिखने का इंतज़ार किए।

यह क्यों महत्वपूर्ण है

यह शोध पत्र दिखाता है कि यह विधि उन पिछले तकनीकों से बेहतर काम करती है जो सीधे लंबे तर्क वाले पाठ (reasoning text) का विश्लेषण करने की कोशिश करती थीं। यह इस बात को समझने जैसा है कि छात्र के लंबे निबंध को पढ़ना भ्रमित करने वाला है, लेकिन यह जांचना कि क्या उनकी मूल समझ एक छोटे से धक्के के तहत स्थिर है, झूठ पकड़ने की कुंजी है।

शोध पत्र के मुख्य निष्कर्ष:

  • मानव की आवश्यकता नहीं: यह प्रणाली इस "क्या होगा अगर?" खेल को खेलकर खुद को सिखाती है; इसे हर उत्तर को सत्य या असत्य के रूप में लेबल करने के लिए मनुष्यों की आवश्यकता नहीं है।
  • तेज़: इसे वास्तविक परीक्षण (inference) के दौरान AI को कई बार चलाने की आवश्यकता नहीं होती है; "धक्का" देने की प्रक्रिया केवल प्रशिक्षण चरण के दौरान मानचित्र बनाने के लिए होती है।
  • प्रभावी: परीक्षणों में, इस विधि ने जटिल तर्क कार्यों में गलत उत्तरों को पहचानने की क्षमता में काफी सुधार किया, और अन्य अत्याधुनिक डिटेक्टरों से बेहतर प्रदर्शन किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →