Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents
यह शोध पत्र कोड और टूल आउटपुट जैसे विविध संरचित इनपुटों में स्पैन-स्तरीय मतिभ्रम (hallucination) का पता लगाने के लिए एक एकीकृत बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक फाइन-ट्यून्ड Qwen3.5-2B मॉडल इन जटिल डोमेन पर मौजूदा डिटेक्टरों और ज़ीरो-शॉट जजों की तुलना में काफी बेहतर प्रदर्शन करता है और साथ ही प्राकृतिक-भाषा RAG बेंचमार्क पर भी प्रतिस्पर्धी बना रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने लिए एक रिपोर्ट लिखने के लिए एक बहुत ही बुद्धिमान, तेज़ बोलने वाले सहायक को काम पर रख रहे हैं। आप उन्हें संदर्भ पुस्तकों का एक ढेर (संदर्भ/context) और एक विशिष्ट प्रश्न देते हैं। वे जल्दी से उत्तर टाइप करते हैं।
समस्या क्या है? कभी-कभी, सबसे बुद्धिमान सहायक भी थोड़े रचनात्मक हो सकते हैं। वे एक तथ्य गढ़ सकते हैं, एक संख्या को गलत तरीके से मिला सकते हैं, या ऐसे पृष्ठ का उद्धरण दे सकते हैं जो आपकी पुस्तकों में मौजूद ही नहीं है। इसे हैलुसिनेशन (hallucination) कहा जाता है।
लंबे समय से, शोधकर्ताओं ने इन गलतियों को पकड़ने के लिए "फैक्ट-चेकर्स" (तथ्य-जांचकर्ता) बनाए हैं, लेकिन वे ज्यादातर केवल तभी काम करते थे जब सहायक इतिहास या विज्ञान जैसे सामान्य विषयों पर साधारण टेक्स्ट का उपयोग करके लिख रहा होता था।
यह पेपर एक नया, बहुत कठिन फैक्ट-चेकर पेश करता है जिसे आधुनिक दुनिया के लिए डिज़ाइन किया गया है, जहाँ सहायक कंप्यूटर कोड भी लिख रहे हैं, सॉफ्टवेयर टूल लॉग्स का सारांश बना रहे हैं, और संरचित दस्तावेजों (जैसे टेबल और मैनुअल) को पढ़ रहे हैं।
यहाँ उनके द्वारा किए गए कार्यों का विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "कोड" और "लॉग" की अंध बिंदु (Blind Spot)
कल्पना कीजिए कि आपका सहायक एक मैकेनिक है।
- पुराने फैक्ट-चेकर्स: यह जाँचने में बेहतरीन थे कि क्या मैकेनिक ने यह कहा, "कार लाल है" जबकि कार वास्तव में नीली है।
- नई वास्तविकता: मैकेनिक अब एक जटिल मरम्मत मैनुअल (कोड) लिख रहा है या एक डिजिटल डायग्नोस्टिक स्क्रीन (टूल आउटपुट) पढ़ रहा है। यदि मैकेनिक एक गलत कमांड लिख देता है जैसे
turn_off_engineके बजायturn_on_engine, तो पूरी कार खराब हो सकती है। या यदि वे एक ऐसा पार्ट नंबर सूचीबद्ध करते हैं जो मौजूद नहीं है, तो ऑर्डर विफल हो जाता है। - अंतराल (Gap): मौजूदा फैक्ट-चेकर्स एक उपन्यास पढ़ने वाले इंसान की तरह थे; उन्हें यह नहीं पता था कि कंप्यूटर प्रोग्राम में एक गलत लाइन या सॉफ्टवेयर लॉग में एक विशिष्ट त्रुटि को कैसे पहचाना जाए। वे एक वास्तविक तकनीकी शब्द और एक मनगढ़ंत शब्द के बीच अंतर नहीं कर सकते थे।
2. समाधान: "अंतर पहचानो" (Spot-the-Difference) खेल
लेखकों ने कंप्यूटर को ये विशिष्ट फैक्ट-चेकर बनने के लिए सिखाने हेतु एक विशाल नया प्रशिक्षण मैदान (बेंचमार्क) बनाया।
- उन्होंने डेटा कैसे बनाया: उन्होंने सही, सटीक उत्तरों (जैसे एक आदर्श मरम्मत मैनुअल) से शुरुआत की। फिर, उन्होंने एक "हैलुसिनेशन इंजेक्टर" (इसे एक शरारती संपादक के रूप में सोचें) का उपयोग करके सूक्ष्म, स्थानीय झूठ को शामिल किया।
- उदाहरण: उन्होंने एक वास्तविक फंक्शन नाम
set_deviceको एक नकलीset_active_deviceमें बदल दिया। - उन्होंने केवल यह नहीं कहा कि "यह उत्तर गलत है।" उन्होंने सटीक वर्णों (characters) को चिह्नित किया जहाँ वह झूठ हुआ था।
- उदाहरण: उन्होंने एक वास्तविक फंक्शन नाम
- विविधता: उन्होंने 74,000 से अधिक उदाहरण बनाए जो कवर करते हैं:
- कोड: वास्तविक GitHub सॉफ़्टवेयर फिक्स।
- टूल आउटपुट: सॉफ़्टवेयर टूल्स से लॉग (जैसे त्रुटि संदेश या खोज परिणाम)।
- संरचित दस्तावेज़: रिसर्च पेपर्स, README फाइलें, और टेबल एवं सूचियों के साथ विकिपीडिया पेज।
- सामान्य टेक्स्ट: मानक प्रश्न और उत्तर (यह सुनिश्चित करने के लिए कि वे सामान्य टेक्स्ट की जाँच करना न भूलें)।
3. नया जासूस: "LettuceDetect"
उन्होंने एक नए AI मॉडल (Qwen नामक मॉडल का 2-बिलियन पैरामीटर वाला संस्करण) को प्रशिक्षित किया ताकि वह जासूस की भूमिका निभा सके।
- कार्य: जासूस अनुरोध (Request), संदर्भ पुस्तकें (Reference Books) और सहायक के उत्तर (Answer) को देखता है। उसे ठीक उस झूठ की ओर उंगली उठानी होगी और कहना होगा, "यह विशिष्ट शब्द मनगढ़ंत है," या "यह संख्या गलत है।"
- परिणाम:
- कोड और टूल्स पर: नया जासूस एक सुपरहीरो है। इसने कोड में 60% झूठ पकड़े।
- प्रतियोगिता: पुराने "ऑफ-द-शेल्फ" फैक्ट-चेकर्स (जैसे LettuceDetect-large) और यहाँ तक कि विशाल, बुद्धिमान AI जज (Zero-shot LLMs) भी कोड में केवल 17% से 22% झूठ ही पकड़ पाए। वे तकनीकी त्रुटियों के प्रति अंधे थे।
- सामान्य टेक्स्ट पर: नया जासूस सामान्य टेक्स्ट की जाँच करने में भी बहुत अच्छा है (मौजूदा सर्वोत्तम प्रणालियों के समान स्कोर करता है), जो यह साबित करता है कि कोड पढ़ना सीखने के दौरान उसने अपना सामान्य ज्ञान नहीं खोया।
4. "स्पैन-लेवल" (Span-Level) क्यों महत्वपूर्ण है
पेपर इस बात पर जोर देता है कि वे केवल यह नहीं कहते कि "इस उत्तर को अस्वीकार करें।" वे स्पैन-लेवल डिटेक्शन करते हैं।
- उपमा: कल्पना कीजिए कि एक छात्र ने 10 पन्नों का निबंध लिखा है। एक वाक्य झूठ है।
- पुराना तरीका: "पूरे निबंध को फेल कर दो।" (यह बहुत कठोर है, बाकी 9 पन्ने एकदम सही हो सकते हैं)।
- नया तरीका: "उस एक वाक्य को हाइलाइट करें जो झूठ है।" (यह सटीक और सहायक है)।
- कोड में, यह महत्वपूर्ण है। यदि एक प्रोग्राम में 100 लाइनें हैं और केवल एक लाइन गलत है, तो आप पूरे प्रोग्राम को फेंकना नहीं चाहते; आप बस उस एक लाइन को ठीक करना चाहते हैं।
सारांश
यह पेपर एक नया, एकीकृत "सत्य डिटेक्टर" प्रस्तुत करता है जो आधुनिक AI सहायकों की जटिल, तकनीकी वास्तविकता को संभाल सकता है। यह केवल साधारण टेक्स्ट की जाँच करने से आगे बढ़कर कोड, सॉफ़्टवेयर लॉग और संरचित दस्तावेजों में सूक्ष्म, खतरनाक त्रुटियों को पहचानने की ओर बढ़ता है।
उनका नया मॉडल, LettuceDetect-Qwen-2B, तकनीकी झूठ पकड़ने में पिछले उपकरणों की तुलना में काफी बेहतर है, विशेष रूप से तब जब सहायक कोड लिख रहा हो या सॉफ़्टवेयर लॉग पढ़ रहा हो, जबकि यह सामान्य भाषा के लिए एक शीर्ष-स्तरीय फैक्ट-चेकर बना हुआ है। उन्होंने अपना सारा डेटा और मॉडल जारी कर दिया है ताकि अन्य लोग बेहतर, अधिक विश्वसनीय AI सिस्टम बनाने के लिए इस "अंतर पहचानो" खेल का उपयोग कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।