← नवीनतम पेपर
💻 computer science

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

यह शोध पत्र कोड और टूल आउटपुट जैसे विविध संरचित इनपुटों में स्पैन-स्तरीय मतिभ्रम (hallucination) का पता लगाने के लिए एक एकीकृत बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक फाइन-ट्यून्ड Qwen3.5-2B मॉडल इन जटिल डोमेन पर मौजूदा डिटेक्टरों और ज़ीरो-शॉट जजों की तुलना में काफी बेहतर प्रदर्शन करता है और साथ ही प्राकृतिक-भाषा RAG बेंचमार्क पर भी प्रतिस्पर्धी बना रहता है।

मूल लेखक: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने लिए एक रिपोर्ट लिखने के लिए एक बहुत ही बुद्धिमान, तेज़ बोलने वाले सहायक को काम पर रख रहे हैं। आप उन्हें संदर्भ पुस्तकों का एक ढेर (संदर्भ/context) और एक विशिष्ट प्रश्न देते हैं। वे जल्दी से उत्तर टाइप करते हैं।

समस्या क्या है? कभी-कभी, सबसे बुद्धिमान सहायक भी थोड़े रचनात्मक हो सकते हैं। वे एक तथ्य गढ़ सकते हैं, एक संख्या को गलत तरीके से मिला सकते हैं, या ऐसे पृष्ठ का उद्धरण दे सकते हैं जो आपकी पुस्तकों में मौजूद ही नहीं है। इसे हैलुसिनेशन (hallucination) कहा जाता है।

लंबे समय से, शोधकर्ताओं ने इन गलतियों को पकड़ने के लिए "फैक्ट-चेकर्स" (तथ्य-जांचकर्ता) बनाए हैं, लेकिन वे ज्यादातर केवल तभी काम करते थे जब सहायक इतिहास या विज्ञान जैसे सामान्य विषयों पर साधारण टेक्स्ट का उपयोग करके लिख रहा होता था।

यह पेपर एक नया, बहुत कठिन फैक्ट-चेकर पेश करता है जिसे आधुनिक दुनिया के लिए डिज़ाइन किया गया है, जहाँ सहायक कंप्यूटर कोड भी लिख रहे हैं, सॉफ्टवेयर टूल लॉग्स का सारांश बना रहे हैं, और संरचित दस्तावेजों (जैसे टेबल और मैनुअल) को पढ़ रहे हैं।

यहाँ उनके द्वारा किए गए कार्यों का विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "कोड" और "लॉग" की अंध बिंदु (Blind Spot)

कल्पना कीजिए कि आपका सहायक एक मैकेनिक है।

  • पुराने फैक्ट-चेकर्स: यह जाँचने में बेहतरीन थे कि क्या मैकेनिक ने यह कहा, "कार लाल है" जबकि कार वास्तव में नीली है।
  • नई वास्तविकता: मैकेनिक अब एक जटिल मरम्मत मैनुअल (कोड) लिख रहा है या एक डिजिटल डायग्नोस्टिक स्क्रीन (टूल आउटपुट) पढ़ रहा है। यदि मैकेनिक एक गलत कमांड लिख देता है जैसे turn_off_engine के बजाय turn_on_engine, तो पूरी कार खराब हो सकती है। या यदि वे एक ऐसा पार्ट नंबर सूचीबद्ध करते हैं जो मौजूद नहीं है, तो ऑर्डर विफल हो जाता है।
  • अंतराल (Gap): मौजूदा फैक्ट-चेकर्स एक उपन्यास पढ़ने वाले इंसान की तरह थे; उन्हें यह नहीं पता था कि कंप्यूटर प्रोग्राम में एक गलत लाइन या सॉफ्टवेयर लॉग में एक विशिष्ट त्रुटि को कैसे पहचाना जाए। वे एक वास्तविक तकनीकी शब्द और एक मनगढ़ंत शब्द के बीच अंतर नहीं कर सकते थे।

2. समाधान: "अंतर पहचानो" (Spot-the-Difference) खेल

लेखकों ने कंप्यूटर को ये विशिष्ट फैक्ट-चेकर बनने के लिए सिखाने हेतु एक विशाल नया प्रशिक्षण मैदान (बेंचमार्क) बनाया।

  • उन्होंने डेटा कैसे बनाया: उन्होंने सही, सटीक उत्तरों (जैसे एक आदर्श मरम्मत मैनुअल) से शुरुआत की। फिर, उन्होंने एक "हैलुसिनेशन इंजेक्टर" (इसे एक शरारती संपादक के रूप में सोचें) का उपयोग करके सूक्ष्म, स्थानीय झूठ को शामिल किया।
    • उदाहरण: उन्होंने एक वास्तविक फंक्शन नाम set_device को एक नकली set_active_device में बदल दिया।
    • उन्होंने केवल यह नहीं कहा कि "यह उत्तर गलत है।" उन्होंने सटीक वर्णों (characters) को चिह्नित किया जहाँ वह झूठ हुआ था।
  • विविधता: उन्होंने 74,000 से अधिक उदाहरण बनाए जो कवर करते हैं:
    • कोड: वास्तविक GitHub सॉफ़्टवेयर फिक्स।
    • टूल आउटपुट: सॉफ़्टवेयर टूल्स से लॉग (जैसे त्रुटि संदेश या खोज परिणाम)।
    • संरचित दस्तावेज़: रिसर्च पेपर्स, README फाइलें, और टेबल एवं सूचियों के साथ विकिपीडिया पेज।
    • सामान्य टेक्स्ट: मानक प्रश्न और उत्तर (यह सुनिश्चित करने के लिए कि वे सामान्य टेक्स्ट की जाँच करना न भूलें)।

3. नया जासूस: "LettuceDetect"

उन्होंने एक नए AI मॉडल (Qwen नामक मॉडल का 2-बिलियन पैरामीटर वाला संस्करण) को प्रशिक्षित किया ताकि वह जासूस की भूमिका निभा सके।

  • कार्य: जासूस अनुरोध (Request), संदर्भ पुस्तकें (Reference Books) और सहायक के उत्तर (Answer) को देखता है। उसे ठीक उस झूठ की ओर उंगली उठानी होगी और कहना होगा, "यह विशिष्ट शब्द मनगढ़ंत है," या "यह संख्या गलत है।"
  • परिणाम:
    • कोड और टूल्स पर: नया जासूस एक सुपरहीरो है। इसने कोड में 60% झूठ पकड़े।
    • प्रतियोगिता: पुराने "ऑफ-द-शेल्फ" फैक्ट-चेकर्स (जैसे LettuceDetect-large) और यहाँ तक कि विशाल, बुद्धिमान AI जज (Zero-shot LLMs) भी कोड में केवल 17% से 22% झूठ ही पकड़ पाए। वे तकनीकी त्रुटियों के प्रति अंधे थे।
    • सामान्य टेक्स्ट पर: नया जासूस सामान्य टेक्स्ट की जाँच करने में भी बहुत अच्छा है (मौजूदा सर्वोत्तम प्रणालियों के समान स्कोर करता है), जो यह साबित करता है कि कोड पढ़ना सीखने के दौरान उसने अपना सामान्य ज्ञान नहीं खोया।

4. "स्पैन-लेवल" (Span-Level) क्यों महत्वपूर्ण है

पेपर इस बात पर जोर देता है कि वे केवल यह नहीं कहते कि "इस उत्तर को अस्वीकार करें।" वे स्पैन-लेवल डिटेक्शन करते हैं।

  • उपमा: कल्पना कीजिए कि एक छात्र ने 10 पन्नों का निबंध लिखा है। एक वाक्य झूठ है।
    • पुराना तरीका: "पूरे निबंध को फेल कर दो।" (यह बहुत कठोर है, बाकी 9 पन्ने एकदम सही हो सकते हैं)।
    • नया तरीका: "उस एक वाक्य को हाइलाइट करें जो झूठ है।" (यह सटीक और सहायक है)।
  • कोड में, यह महत्वपूर्ण है। यदि एक प्रोग्राम में 100 लाइनें हैं और केवल एक लाइन गलत है, तो आप पूरे प्रोग्राम को फेंकना नहीं चाहते; आप बस उस एक लाइन को ठीक करना चाहते हैं।

सारांश

यह पेपर एक नया, एकीकृत "सत्य डिटेक्टर" प्रस्तुत करता है जो आधुनिक AI सहायकों की जटिल, तकनीकी वास्तविकता को संभाल सकता है। यह केवल साधारण टेक्स्ट की जाँच करने से आगे बढ़कर कोड, सॉफ़्टवेयर लॉग और संरचित दस्तावेजों में सूक्ष्म, खतरनाक त्रुटियों को पहचानने की ओर बढ़ता है।

उनका नया मॉडल, LettuceDetect-Qwen-2B, तकनीकी झूठ पकड़ने में पिछले उपकरणों की तुलना में काफी बेहतर है, विशेष रूप से तब जब सहायक कोड लिख रहा हो या सॉफ़्टवेयर लॉग पढ़ रहा हो, जबकि यह सामान्य भाषा के लिए एक शीर्ष-स्तरीय फैक्ट-चेकर बना हुआ है। उन्होंने अपना सारा डेटा और मॉडल जारी कर दिया है ताकि अन्य लोग बेहतर, अधिक विश्वसनीय AI सिस्टम बनाने के लिए इस "अंतर पहचानो" खेल का उपयोग कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →