← नवीनतम पेपर
🤖 machine learning

Low-Cost Black-Box Detection of LLM Hallucinations via Dynamical System Prediction

यह योगदान भ्रम पहचान (hallucination detection) के लिए एक लागत प्रभावी, ब्लैक-बॉक्स पद्धति प्रस्तुत करता है जो महंगी सैंपलिंग या बाहरी ज्ञान पुनर्प्राप्ति की आवश्यकता के बिना, स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त करने के लिए कूपमैन ऑपरेटर सिद्धांत (Koopman operator theory) का उपयोग करके LLM प्रतिक्रियाओं को गतिशील प्रणालियों के रूप में मॉडल करता है।

मूल लेखक: Dan Wilson, Mohamed Akrout

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dan Wilson, Mohamed Akrout

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानीकार को सुन रहे हैं। कभी-कभी, वह आपको अतीत की एक सच्ची कहानी सुनाता है। अन्य समय में, वह एक ऐसी कहानी बुनता है जो सुनने में पूरी तरह से सुव्यवस्थित और आत्मविश्वासी लगती है लेकिन पूरी तरह से मनगढ़ंत होती है। बड़े भाषा मॉडल (LLMs) बिल्कुल यही करते हैं: वे "भ्रम" (hallucinate) पैदा कर सकते हैं और ऐसे तथ्य बना सकते हैं जो वास्तविक लगते हैं लेकिन सच नहीं होते।

आमतौर पर, इन झूठों को उजागर करना कठिन होता है। या तो आपको AI से एक ही सवाल सौ बार पूछना होगा यह देखने के लिए कि क्या वह अपनी कहानी बदलता है (जो धीमा और महंगा है), या आपको उत्तर को एक अलग तथ्य-जांचकर्ता (fact-checker) के पास भेजना होगा (जिसके लिए इंटरनेट एक्सेस और अतिरिक्त उपकरणों की आवश्यकता होती है)।

यह लेख एक चतुर, कम लागत वाला शॉर्टकट प्रस्तावित करता है। कहानी की सामग्री (content) की जांच करने के बजाय, लेखक उस लय (rhythm) को सुनते हैं जिसमें कहानी सुनाई जा रही है।

मुख्य विचार: "डांसिंग" रिपोर्ट

लेखक AI को एक लेखक के रूप में नहीं, बल्कि एक डायनेमिक सिस्टम के रूप में देखते हैं—एक शानदार शब्द जिसका अर्थ है एक ऐसी मशीन जो एक अनुमानित पैटर्न के माध्यम से चलती है, जैसे एक नर्तक मंच पर कदम रखता है।

  1. मंच (एम्बेडिंग स्पेस): AI द्वारा बोला गया हर शब्द एक विशाल, अदृश्य 3D (या यहाँ तक कि 1000D) स्थान में एक गणितीय बिंदु में परिवर्तित हो जाता है। जैसे-जैसे AI एक वाक्य बनाता है, वह एक बिंदु से दूसरे बिंदु तक जाता है, जिससे एक पथ या "प्रक्षेपवक्र" (trajectory) बनता है।
  2. दो डांस फ्लोर: शोधकर्ताओं ने पाया कि जब एक AI सच बोलता है, तो उसका पथ एक विशिष्ट डांस फ्लोर (एक "मैनिफोल्ड") का अनुसरण करता है। जब वह झूठ बोलता है (भ्रम पैदा करता है), तो वह पूरी तरह से अलग डांस फ्लोर पर कदम रखता है। हालांकि शब्द समान दिख सकते हैं, लेकिन शब्दों के बीच गणितीय "कदम" अलग होते हैं।
  3. प्रेडिक्शन गेम: उन्होंने दो "प्रेडिक्टर्स" (जैसे दो अलग-अलग डांस इंस्ट्रक्टर) बनाए:
    • इंस्ट्रक्टर A ने "सत्य नृत्य" के कदमों को सीखा।
    • इंस्ट्रक्टर B ने "झूठ के नृत्य" के कदमों को सीखा।
  4. स्कोर: जब एक नया वाक्य आता है, तो वे दोनों इंस्ट्रक्टर्स से अगले कदम की भविष्यवाणी करने के लिए कहते हैं।
    • यदि वाक्य सत्य है, तो इंस्ट्रक्टर A (सत्य) अगले कदम की सटीक भविष्यवाणी करता है, जबकि इंस्ट्रक्टर B (झूठ) लड़खड़ा जाता है।
    • यदि वाक्य एक झूठ है, तो इंस्ट्रक्टर B इसकी अच्छी भविष्यवाणी करता है, और इंस्ट्रक्टर A लड़खड़ा जाता है।
    • वे एक "डिफरेंशियल रेसिडुअल स्कोर" की गणना करते हैं: मूल रूप से, एक इंस्ट्रक्टर दूसरे की तुलना में कितना बेहतर प्रदर्शन करता है। यदि "झूठ वाला इंस्ट्रक्टर" जीतता है, तो सिस्टम इसे भ्रम (hallucination) के रूप में चिह्नित करता है।

यह एक बड़ी बात क्यों है

  • वन-पास वंडर: अधिकांश अन्य विधियों को एक ही प्रश्न को कई बार पूछना पड़ता है या डेटाबेस में तथ्यों को खोजना पड़ता है। यह विधि उत्तर को एक ही बार में देखती है और तुरंत निर्णय लेती है। यह एक असली पेंटिंग की तुलना गैलरी की असली पेंटिंग्स से करने के बजाय, ब्रश के स्ट्रोक को एक ही नज़र में पहचानने जैसा है।
  • ब्लैक-बॉक्स फ्रेंडली: आपको AI के आंतरिक मस्तिष्क को देखने की आवश्यकता नहीं है (जिसे बड़ी कंपनियाँ छिपाकर रखती हैं)। आपको केवल उसके द्वारा आउटपुट किए गए टेक्स्ट की आवश्यकता है। यह एक "ब्लैक-बॉक्स" डिटेक्टर की तरह काम करता है।
  • समायोज्य कठोरता (Adjustable Strictness): लेखकों ने एक "कैलिब्रेशन" फंक्शन जोड़ा है। कल्पना कीजिए कि आप एक न्यायाधीश हैं। कभी-कभी आप बहुत सख्त होना चाहते हैं और सूक्ष्म त्रुटियों को भी पकड़ना चाहते हैं। अन्य समय में, आप केवल बड़े, स्पष्ट झूठों में रुचि रखते हैं। सिस्टम को आपके कुछ उदाहरणों के साथ ट्यून किया जा सकता है ताकि एकदम सही "झूठ पकड़ने वाली" संवेदनशीलता सेट की जा सके।

उन्होंने इसका परीक्षण कैसे किया

उन्होंने इस "रिदम डिटेक्टर" का परीक्षण तीन अलग-अलग डेटासेट्स पर किया:

  1. WikiBio: तथ्यात्मक त्रुटियों के लिए जीवनियों की जाँच करना।
  2. HaluEval: मनगढ़ंत विवरणों के लिए सारांशों की जाँच करना।
  3. FELM: गणित और विज्ञान में तार्किक तर्क की जाँच करना।

परिणाम:

  • उनकी विधि वर्तमान में उपलब्ध, सबसे महंगी और सबसे संसाधन-गहन विधियों के बराबर या उनसे बेहतर प्रदर्शन करती है।
  • दिलचस्प बात यह है कि उन्होंने पाया कि वाक्य जितना लंबा होता है (जितना लंबा नृत्य), "सत्य नृत्य" और "झूठ के नृत्य" के बीच अंतर करना उतना ही आसान होता जाता है।
  • यहाँ तक कि जब उन्होंने एक AI मॉडल (जैसे Llama-3) पर प्रशिक्षित होकर दूसरे (जैसे Mistral) पर परीक्षण किया, तो यह आश्चर्यजनक रूप से अच्छा काम करता है, जो बताता है कि "झूठ बोलने की लय" विभिन्न AIs के लिए एक सार्वभौमिक गुण है।

निचोड़

यह लेख शब्दों के बजाय शब्दों के गणितीय प्रवाह का विश्लेषण करके AI के झूठ का पता लगाने की एक विधि पेश करता है। यह तेज़ है, सस्ता है, इसके लिए किसी बाहरी डेटाबेस की आवश्यकता नहीं है, और यह टेक्स्ट पर एक ही नज़र में काम करता है। यह एक ऐसे झूठ पकड़ने वाले यंत्र की तरह है जो शब्दों के बजाय भाषण के संगीत को सुनता है।

उल्लिखित सीमाएँ:
लेख नोट करता है कि जबकि यह विधि झूठ का पता लगाने में उत्कृष्ट है, यह आपको यह नहीं बताती कि वास्तविक सत्य क्या है, न ही यह AI के व्यवहार को ठीक करती है। यह एक डिटेक्टर है, सुधारक (corrector) नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →