← नवीनतम पेपर
🤖 machine learning

Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs

यह शोधपत्र EG-VAR प्रस्तुत करता है, जो एक Lean 4-आधारित एजेंटिक रीजनिंग आर्किटेक्चर है जो यह सुनिश्चित करके अनुभवजन्य अनुमान (empirical inference) में LLM मतिभ्रम (hallucinations) को समाप्त करता है कि सभी सत्यापित आउटपुट प्रमाणित टूल कॉल्स और कर्नेल-चेक्ड प्रमाणों से संरचनात्मक रूप से व्युत्पन्न हैं, जबकि किसी भी असमर्थित दावे का स्पष्ट रूप से ऑडिट करता है या उससे परहेज करता है।

मूल लेखक: Junyu Ren

प्रकाशित 2026-07-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyu Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, बातूनी रोबोट सहायक (एक LLM) है जिसे दुनिया की कहानियाँ सुनाना बहुत पसंद है। समस्या क्या है? कभी-कभी, यह रोबोट अपनी यादों पर इतना विश्वास करने लगता है कि वह मनगढ़ंत तथ्य बना लेता है या अपने सामने मौजूद वास्तविक साक्ष्यों को अनदेखा कर देता है। यह एक ऐसे छात्र की तरह है, जिसे जब किसी पाठ्यपुस्तक के साथ गणित के सवाल को जांचने के लिए कहा जाता है, तो वह उस उत्तर को लिख देता है जो उसे लगता है कि सही है क्योंकि उसे वह अपने सपने में याद आया था, भले ही पाठ्यपुस्तक में कुछ और लिखा हो।

लंबे समय तक, लोगों ने इसे ठीक करने के लिए रोबोट को बाहरी स्रोतों का एक "टूलबॉक्स" देने की कोशिश की, जैसे कि एक कैलकुलेटर या डेटाबेस। लेकिन यह शोध पत्र तर्क देता है कि रोबोट को केवल टूलबॉक्स थमा देना ही काफी नहीं है। रोबोट अभी भी टूलबॉक्स को अनदेखा कर सकता है, या वह टूलबॉक्स के नंबरों का उपयोग तो कर सकता है लेकिन अपनी कहानी को फिट करने के लिए उनके तर्क को बदल सकता है। यह एक शेफ को ताजी, सत्यापित सामग्री देने जैसा है, लेकिन उसे उसे किसी भी तरह से पकाने की छूट दे देना; अंतिम व्यंजन फिर भी एक आपदा हो सकता है।

बड़ी अवधारणा: "सत्यापित दावा" (Verified Claim) फैक्ट्री

लेखकों ने, जुनयु रेन (Junyu Ren) के नेतृत्व में, EG-VAR (एविडेंस-ग्राउंडेड वेरीफाइड एजेंटिक रीजनिंग) नामक एक नई प्रणाली बनाई है। इसे केवल एक रोबोट के रूप में न देखें जो सवालों के जवाब देता है, बल्कि एक उच्च-सुरक्षा वाली फैक्ट्री के रूप में देखें जिसमें एक बहुत ही सख्त, बिना पलक झपकाए काम करने वाला निरीक्षक (इंस्पेक्टर) है।

यहाँ यह फैक्ट्री चरण-दर-चरण कैसे काम करती है:

  1. टूल लेयर (विश्वसनीय कूरियर): सबसे पहले, एक विश्वसनीय, उबाऊ, नियतात्मक (deterministic) मशीन (जो बातूनी रोबोट नहीं है) स्रोत—जैसे कि स्प्रेडशीट या डेटाबेस—पर जाती है और कच्चे नंबर प्राप्त करती है। यह इन नंबरों पर "सत्यापित" (Verified) की मुहर लगाती है। फैक्ट्री में वास्तविक डेटा लाने का यही एकमात्र तरीका है।
  2. फॉर्मलाइज़र (अनुवादक): फिर बातूनी रोबोट (LLM) से मानव प्रश्न को एक सख्त, गणितीय भाषा में अनुवाद करने के लिए कहा जाता है जिसे Lean 4 कहते हैं। यह रोबोट से एक पैराग्राफ के बजाय एक कानूनी अनुबंध या गणितीय प्रमाण लिखने के लिए कहने जैसा है।
  3. कर्नेल (बिना पलक झपकाए देखने वाला निरीक्षक): यह सबसे महत्वपूर्ण हिस्सा है। एक छोटा, अत्यंत सख्त कंप्यूटर प्रोग्राम (एक Lean कर्नेल) निरीक्षक के रूप में कार्य करता है। यह रोबोट के "अनुबंध" की एक-एक लाइन की जाँच करता है।
    • स्वर्ण नियम: निरीक्षक का एक नियम है कि, "आप तब तक किसी तथ्य को VERIFIED (सत्यापित) घोषित नहीं कर सकते जब तक कि आप एक स्टैम्प और सील किए हुए नंबर की ओर इशारा न कर सकें जो विश्वसनीय कूरियर से आया हो।"
    • यदि रोबोट कोई नंबर मनगढ़ंत बनाता है, या यदि वह नंबरों का उपयोग तो करता है लेकिन तर्क को गलत तरीके से जोड़ता है, तो निरीक्षक पूरे काम को अस्वीकार (reject) कर देता है।
  4. परिणाम:
    • यदि प्रमाण पास हो जाता है, तो फैक्ट्री एक VERIFIED उत्तर प्रिंट करती है। यह उत्तर एक "रीप्लेएबल ऑडिट ट्रेल" के साथ आता है, जिसका अर्थ है कि कोई भी बाद में गणित को फिर से चलाकर देख सकता है कि उत्तर मूल डेटा से कैसे बनाया गया था।
    • यदि प्रमाण विफल हो जाता है, तो फैक्ट्री अनुमान नहीं लगाती है। यह ABSTAIN (जिसका अर्थ है "मुझे नहीं पता" या "मैं इसे सिद्ध नहीं कर सकता") कहती है। यह एक आत्मविश्वासी झूठ के बजाय एक ईमानदार "मैं हार मानता हूँ" है।

शोध पत्र ने वास्तव में क्या पाया

लेखकों ने तालिकाओं (स्प्रेडशीट्स) के बारे में प्रश्नों के एक विशिष्ट सेट (120 प्रश्न) पर इस प्रणाली का परीक्षण किया।

  • "परफेक्ट" स्कोर: जब प्रश्न स्पष्ट थे और रोबोट को सही उपकरण दिए गए थे, तो EG-VAR ने 120 में से 120 प्रश्न सही किए। यह 100% सटीक था।
  • प्रतिस्पर्धा: अन्य प्रणालियों ने, जिन्होंने समान उपकरणों का उपयोग किया लेकिन उनमें सख्त निरीक्षक नहीं था, 120 में से 114 सही किए (95%)। वे अभी भी गलतियाँ कर रहे थे।
  • "काउंटरफैक्चुअल" टेस्ट: यह असली तनाव परीक्षण था। लेखकों ने तालिकाओं को लिया और गुप्त रूप से नंबरों को बदल दिया ताकि वे रोबोट की "याददाश्त" (जो उसके प्रशिक्षण से मिली थी) का खंडन कर सकें (जैसे किसी देश की जनसंख्या को बदलकर बहुत कम कर देना)।
    • सख्त निरीक्षक के बिना, रोबोट ने नए नंबरों को अनदेखा किया और अपनी पुरानी यादों पर 80% से 90% बार टिके रहे।
    • EG-VAR के साथ, सिस्टम नए, बदले हुए नंबरों के प्रति 100% वफादार रहा। इससे कोई फर्क नहीं पड़ा कि रोबोट की पुरानी याददाश्त कितनी मजबूत थी; निरीक्षक ने उसे नए डेटा का उपयोग करने के लिए मजबूर किया।

यह शोध पत्र क्या खारिज करता है (निषेध क्षेत्र)

यह पेपर इस बारे में बहुत स्पष्ट है कि यह प्रणाली क्या नहीं है और क्या नहीं कर सकती है:

  • यह सभी मतिभ्रम (hallucinations) के लिए कोई जादुई इलाज नहीं है। पेपर स्पष्ट रूप से कहता है कि रोबोट मानव प्रश्न को गणितीय भाषा में अनुवाद करने में गलती कर सकता है। यदि रोबोट प्रश्न को गलत समझ लेता है और गलत गणितीय समस्या लिख देता है, तो निरीक्षक उस गणितीय समस्या की पूरी तरह से जाँच करेगा, लेकिन उत्तर मूल प्रश्न के लिए गलत होगा।
    • उनके परीक्षणों में, यह "अनुवाद त्रुटि" एक मॉडल के साथ लगभग 3.3% और एक अधिक शक्तिशाली मॉडल के साथ 1.7% बार हुई।
  • यह खराब डेटा को ठीक नहीं करता है। यदि मूल स्प्रेडशीट में कोई झूठ है, तो यह प्रणाली उस झूठ को निष्ठापूर्वक सत्यापित करेगी। सिस्टम यह गारंटी देता है कि उत्तर स्रोत से आया है, न कि यह कि स्रोत सत्य है।
  • यह "शायद" वाला सिस्टम नहीं है। पेपर उन प्रणालियों के विरुद्ध तर्क देता है जो "कॉन्फिडेंस स्कोर" (जैसे "मैं 80% आश्वस्त हूँ") देती हैं। इसके बजाय, EG-VAR एक सख्त "हाँ/ना" गेट का उपयोग करता है। या तो आपके पास एक सत्यापित प्रमाण है, या आपके पास एक ईमानदार "मैं अलग हटता हूँ" (abstain) है।

वे कितने आश्वस्त हैं?

लेखक अपने सिस्टम की संरचनात्मक सुरक्षा के बारे में बहुत आश्वस्त हैं। उन्होंने गणितीय रूप से सिद्ध किया है (Theorems 3.1 और 3.2) कि:

  1. बिना स्टैम्प किए गए टूल कॉल के समर्थन के कोई भी VERIFIED उत्तर कभी प्रकट नहीं हो सकता।
  2. एक VERIFIED उत्तर के तर्क का प्रत्येक चरण कर्नेल द्वारा जांचा गया है और गणितीय रूप से वैध है।

हालाँकि, मानव भाषा के अनुवाद में रोबोट की सटीकता के संबंध में, वे अधिक सतर्क हैं। उन्होंने अपने विशिष्ट परीक्षणों में त्रुटि दर (3.3% और 1.7%) को मापा और सुझाव दिया कि ये संख्याएँ बेहतर हो सकती हैं यदि वे रोबोट को प्रश्नों को सही ढंग से अनुवादित करने के लिए अधिक प्रशिक्षित करें। लेकिन "सुरक्षा तल" (safety floor)—यह गारंटी कि सिस्टम चुपचाप झूठ नहीं बोलेगा—उनके आर्किटेक्चर में अंतर्निहित है, न कि केवल रोबोट के मस्तिष्क में।

निष्कर्ष

EG-VAR एक ऐसी फैक्ट्री की तरह है जो उत्पाद भेजने से पहले यह दिखाने से इनकार कर देती है कि उपयोग किए गए हर हिस्से के लिए रसीद है। यदि रोबोट कोई नकली हिस्सा चुराने की कोशिश करता है, तो फैक्ट्री लाइन रोक देती है और कहती है, "नहीं, हम इसे शिप नहीं कर सकते।" यह "झूठ बोलने वाले रोबोटों" की समस्या को "रसीदों की कमी" की समस्या में बदल देता है, जिसे पकड़ना और ठीक करना बहुत आसान है। हालाँकि यह हर समस्या को हल नहीं करता है (रोबोट अभी भी ऑर्डर को गलत समझ सकता है), यह सुनिश्चित करता है कि जब फैक्ट्री "सत्यापित" (Verified) कहती है, तो उसका वास्तव में वही अर्थ होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →