← नवीनतम पेपर
🤖 AI

Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents

NabaOS एक हल्का, वास्तविक समय का सत्यापन ढांचा है जो भारतीय ज्ञानमीमांसा (epistemology) से प्रेरित है, जो दावों को ज्ञानमीमांसीय स्रोतों के माध्यम से वर्गीकृत करके और उन्हें HMAC-हस्ताक्षरित टूल रसीदों के विरुद्ध क्रॉस-रेफरेंस करके AI एजेंटों के मतिभ्रम (hallucinations) का पता लगाता है, जो अव्यवहारिक क्रिप्टोग्राफिक प्रमाण विधियों की तुलना में न्यूनतम विलंबता के साथ उच्च पहचान सटीकता प्राप्त करता है।

मूल लेखक: Abhinaba Basu

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhinaba Basu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास नबा (Naba) नाम की एक सुपर-स्मार्ट, अत्यधिक कुशल व्यक्तिगत सहायक है। नबा आपके ईमेल चेक कर सकती है, स्टॉक की कीमतें देख सकती है और उड़ानें बुक कर सकती है। लेकिन किसी भी ऐसे सहायक की तरह जिसने बहुत सारी किताबें और फिल्में देखी हैं, नबा कभी-कभी बहक जाती है।

कभी-कभी नबा कहती है, "मैंने आपका ईमेल चेक किया और एलिस के 5 संदेश मिले," जबकि वास्तव में ईमेल सर्वर ने केवल 3 संदेश ही भेजे थे। अन्य समय पर, नबा कह सकती है, "मैंने बैंक को कॉल किया," जबकि वास्तव में उसने मददगार दिखने के लिए बस एक नंबर मनगढ़ंत बनाया था। इसे हैलुसिनेशन (Hallucination) कहा जाता है, और यह एक बड़ी समस्या है क्योंकि आप झूठ के आधार पर वित्तीय निर्णय ले सकते हैं।

यह पेपर NabaOS पेश करता है, जो एक नया सिस्टम है जिसे नबा को बिना धीमा किए उसके झूठ पकड़ने के लिए डिज़ाइन किया गया है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: क्यों "जादुई प्रमाण" (Magic Proofs) काम नहीं करते

वैज्ञानिकों ने इसे जीरो-नॉलेज प्रूफ (Zero-Knowledge Proofs) का उपयोग करके हल करने की कोशिश की है (इन्हें "गणितीय जादुई रसीद" समझें)। ये एक अत्यंत जटिल क्रिप्टोग्राफिक सील की तरह हैं जो यह सिद्ध करते हैं कि कंप्यूटर ने गणित सही ढंग से किया है।

  • कमी: इन जादुई सीलों को बनाने में मिनटों या घंटों का समय लगता है। यदि आप नबा से पूछते हैं, "मौसम कैसा है?" और आपको यह साबित करने के लिए कि उत्तर वास्तविक है, 10 मिनट तक "गणितीय जादू" का इंतज़ार करना पड़े, तो आप इस सहायक का उपयोग कभी नहीं करेंगे। यह बहुत धीमा है और इसके लिए महंगे सुपर-कंप्यूटर की आवश्यकता होती है।

2. समाधान: "डिजिटल रसीद" प्रणाली

भारी गणितीय जादू के बजाय, NabaOS एक ऐसी प्रणाली का उपयोग करता है जो प्राचीन भारतीय दर्शन (विशेष रूप से न्याय स्कूल के तर्क) से प्रेरित है, जो ज्ञान को इस आधार पर वर्गीकृत करती है कि वह कहाँ से आया है

NabaOS को एक रेस्टोरेंट मैनेजर के रूप में समझें जो शेफ (AI) पर अंधविश्वास नहीं करता। इसके बजाय, मैनेजर किचन की रसीदों की जाँच करता है।

  • यह कैसे काम करता है:
    1. जब नबा आपका ईमेल चेक करना चाहती है, तो वह "किचन" (टूल) से इसे करने के लिए कहती है।
    2. किचन काम करता है और तुरंत एक हस्ताक्षरित रसीद (Signed Receipt) प्रिंट करता है। यह रसीद कहती है: "मैंने ईमेल चेक किया। मुझे 3 संदेश मिले। यहाँ एक गुप्त कोड है जो प्रमाणित करता है कि मैंने यह किया।"
    3. फिर नबा आपके लिए एक रिपोर्ट लिखती है।
    4. जादू: नबा को दिखाने से पहले, NabaOS जल्दी से रसीद की जाँच करता है।
      • यदि नबा कहती है "मुझे 5 ईमेल मिले," लेकिन रसीद कहती है "3," तो सिस्टम तुरंत इसे झूठ के रूप में चिह्नित कर देता है।
      • यदि नबा कहती है "मैंने बैंक को कॉल किया," लेकिन बैंक कॉल के लिए कोई रसीद नहीं है, तो सिस्टम जान जाता है कि नबा ने इसे मनगढ़ंत बनाया है।

यह जाँच 15 मिलीसेकंड से भी कम समय लेती है (एक पलक झपकने से भी तेज़), इसलिए आपको इंतज़ार नहीं करना पड़ता।

3. "ट्रस्ट लेबल" (केवल हाँ/ना नहीं)

अधिकांश सुरक्षा प्रणालियाँ आपको एक साधारण "सुरक्षित" या "असुरक्षित" स्टैम्प देती हैं। NabaOS अधिक स्मार्ट है। यह आपको ट्रस्ट लेबल (Trust Label) देता है कि नबा कैसे जानती है कि जानकारी क्या है, इसके लिए पाँच श्रेणियों का उपयोग करता है:

  1. प्रत्यक्ष दृष्टि (Pratyaksha): "मैंने 3 ईमेल देखे।"
    • लेबल: पूर्णतः सत्यापित (Fully Verified)। (रसीद प्रमाणित करती है कि यह सच है)।
  2. अनुमान (Anumana): "एलिस के ईमेल छोटे होने के कारण वह चिंतित लग रही है।"
    • लेबल: मुख्यतः सत्यापित (Mostly Verified)। (ईमेल मौजूद हैं, लेकिन "चिंता" नबा की व्याख्या है, तथ्य नहीं)।
  3. शब्द (Shabda): "रॉयटर्स का कहना है कि ब्याज दरें बढ़ रही हैं।"
    • लेबल: सत्यापित स्रोत (Verified Source)। (हमने जाँच की कि क्या नबा वास्तव में रॉयटर्स की वेबसाइट पर गई थी)।
  4. अभाव (Abhava): "बॉब के कोई ईमेल नहीं मिले।"
    • लेबल: सत्यापित अनुपस्थिति (Verified Absence)। (रसीद प्रमाणित करती है कि खोज का परिणाम खाली रहा)।
  5. शुद्ध राय (Ungrounded): "मुझे लगता है कि बॉब एक अच्छा व्यक्ति है।"
    • लेबल: अपुष्ट (Unverified)। (कोई टूल इस्तेमाल नहीं किया गया; यह केवल नबा की राय है)।

यह क्यों मायने रखता है: यदि आप "मुख्यतः सत्यापित" देखते हैं, तो आप जानते हैं कि तथ्य सत्य हैं, लेकिन "निष्कर्ष" नबा का अनुमान है। आप उस अनुमान पर कितना भरोसा करना है, यह तय कर सकते हैं।

4. "गहन जाँच" (Deep Dive Check)

कभी-कभी नबा एक स्वायत्त एजेंट (Autonomous Agent) होती है जो जटिल कार्य करने के लिए इंटरनेट पर जाती है (जैसे कि यात्रा बुक करना)। ऐसे मामलों में, NabaOS एक स्पॉट चेक (Spot Check) करता है।

  • यदि नबा कहती है, "मुझे इस वेबसाइट पर एक उड़ान मिली है," तो NabaOS स्वतंत्र रूप से उस वेबसाइट पर जाकर देखेगा कि क्या वह उड़ान वास्तव में मौजूद है।
  • यदि वेबसाइट फर्जी है या उड़ान जा चुकी है, तो NabaOS झूठ पकड़ लेता है।

5. परिणाम

शोधकर्ताओं ने 1,800 विभिन्न परिदृश्यों (जिसमें चार भाषाओं में ईमेल, स्टॉक और समाचार शामिल थे) पर इस प्रणाली का परीक्षण किया।

  • सफलता दर: इसने 91% झूठ पकड़े।
  • गति: इसने लगभग कोई देरी नहीं की (एक पलक झपकने से भी कम)।
  • सटीकता: जब सिस्टम कहता है कि कोई दावा "पूर्णतः सत्यापित" है, तो यह 98.7% बार सही होता है।

मुख्य निष्कर्ष

वर्तमान AI सुरक्षा इस बात को सिद्ध करने की कोशिश करती है कि कंप्यूटर ने सही ढंग से काम किया है, जो कि भारी गणित का उपयोग करता है। NabaOS यह सिद्ध करता है कि कहानी सच है, और इसके लिए वह रसीदों की जाँच करता है।

यह एक जादूगर से यह साबित करने के लिए पूछने के बीच का अंतर है कि उसने छिपे हुए तार का उपयोग नहीं किया (जो कठिन और धीमा है) बनाम उससे उस ट्रेन के टिकट की रसीद माँगना जिसका उसने दावा किया था (जो तेज़, आसान और विश्वसनीय है)।

इन "रसीदों" और "ट्रस्ट लेबल" को देकर, NabaOS आपको यह जानने में मदद करता है कि आपको किस पर विश्वास करना है और किसे दोबारा जाँचने की आवश्यकता है, जिससे AI एजेंट आपके पैसे या स्वास्थ्य जैसे वास्तविक जीवन के कार्यों के प्रबंधन के लिए सुरक्षित बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →