← नवीनतम पेपर
💬 NLP

DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning

यह शोध पत्र DynHD का प्रस्ताव करता है, जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स के लिए एक नवीन मतिभ्रम (hallucination) डिटेक्शन फ्रेमवर्क है, जो सूचनात्मक टोकन को फ़िल्टर करने के लिए एक सिमेंटिक-अवेयर मॉड्यूल को अनिश्चितता साक्ष्य के डीनॉइजिंग डायनेमिक्स में विसंगतियों का विश्लेषण करने वाले विचलन-आधारित डिटेक्टर के साथ जोड़कर सटीकता और दक्षता में सुधार करता है।

मूल लेखक: Yanyu Qian, Yue Tan, Yixin Liu, Wang Yu, Shirui Pan

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanyu Qian, Yue Tan, Yixin Liu, Wang Yu, Shirui Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार (AI) है जो आपके द्वारा दिए गए विवरण के आधार पर एक चित्र बनाने की कोशिश कर रहा है। लेकिन यह कलाकार एक बहुत ही विशिष्ट तरीके से काम करता है: शुरुआत से अंत तक एक बार में एक ब्रशस्ट्रोक लगाने के बजाय, वे स्टैटिक नॉइज़ (static noise) से ढके कैनवास के साथ शुरू करते हैं और धीरे-धीरे, चरण-दर-चरण, छवि को स्पष्ट करने के लिए उसे परिष्कृत (refine) करते हैं। ये डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (D-LLMs) कैसे काम करते हैं, इसका यही तरीका है। वे सुसंगत कहानियाँ बनाने में बहुत अच्छे हैं, लेकिन कभी-कभी, वे शोर (noise) में इतने खो जाते हैं कि वे ऐसी चीजें पेंट करने लगते हैं जो कभी हुई ही नहीं—जैसे कि एक बिल्ली का रॉकेट शिप उड़ाना। इसे हैलुसिनेशन (hallucination) कहा जाता है।

समस्या यह है कि आप कलाकार को चित्र पूरा होने से पहले, पेंटिंग करते दौरान कैसे पकड़ें, ताकि आप उन्हें कह सकें, "हे, रुक जाओ! वह हिस्सा नकली है।"

यह पेपर DynHD पेश करता है, जो इन गलतियों को वास्तविक समय (real-time) में पकड़ने के लिए बनाया गया एक नया "स्पॉटर" (spotter) है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: बहुत अधिक शोर, बहुत कम संकेत (Signal)

कल्पना कीजिए कि कलाकार एक पोर्ट्रेट पेंट कर रहा है। अधिकांश समय, वे केवल बैकग्राउंड भर रहे होते हैं या सामान्य विवरण जोड़ रहे होते हैं (जैसे कि "नीला आकाश" या "एक मेज")। ये हिस्से आसान होते हैं और यह नहीं बताते कि पेंटिंग नकली है या नहीं।
हालाँकि, महत्वपूर्ण हिस्से—जैसे कि व्यक्ति का चेहरा या शहर का नाम—वही हैं जहाँ गलतियाँ होती हैं।

  • पुराना तरीका: पिछले तरीके पूरे पेंटिंग प्रक्रिया को देखते थे, सभी ब्रशस्ट्रोक का औसत निकालते थे। यह एक 10-पेज के निबंध में एक गलत शब्द को खोजने के लिए पूरी चीज़ को एक साथ पढ़ने जैसा है। आप विशिष्ट त्रुटि को नहीं पकड़ पाते क्योंकि सही शब्दों का "शोर" उसे दबा देता है।
  • DynHD का समाधान: DynHD एक स्मार्ट फिल्टर की तरह काम करता है। यह उबाऊ बैकग्राउंड शोर (जैसे विराम चिह्न या फिलर शब्द) को अनदेखा करता है और केवल उन "महत्वपूर्ण" शब्दों पर ज़ूम करता है जो वास्तव में अर्थ रखते हैं। यह कहता है, "आकाश को छोड़ो; आइए चेहरे को करीब से देखें।"

2. गुप्त मंत्र: गलती के "आकार" को देखना

यह इस पेपर का सबसे रचनात्मक हिस्सा है।
कल्पना कीजिए कि आप ट्रैक पर एक धावक को देख रहे हैं।

  • एक तथ्यात्मक रूप से सही उत्तर: धावक तेज़ शुरू करता है, शायद शुरुआत में थोड़ा लड़खड़ाता है, लेकिन फिर अपनी लय पकड़ लेता है और फिनिश लाइन पर धीरे से रुकने के लिए सुचारू रूप से धीमा हो जाता है। उसका रास्ता एक चिकना, नीचे की ओर जाने वाला वक्र (curve) है।
  • एक हैलुसिनेशन (Hallucination): धावक ठीक से शुरू करता है, लेकिन फिर वह भ्रमित हो जाता है। वह रुकता है, इधर-उधर देखता है, घबरा जाता है, और अचानक फिनिश लाइन के ठीक पहले पीछे की ओर दौड़ने लगता है या ऊपर-नीचे उछलने लगता है। उसका रास्ता टेढ़ा-मेढ़ा और अनिश्चित होता है।

DynHD केवल यह नहीं देखता कि धावक कितनी तेज़ जा रहा है (अनिश्चितता स्कोर); यह समय के साथ उसके रास्ते के आकार को देखता है।

  • यह एक "रेफरेंस मैप" बनाता है कि एक आदर्श, सत्यवादी धावक कैसा दिखता है।
  • जैसे-जैसे AI उत्तर उत्पन्न करता है, DynHD इस आदर्श मानचित्र के विरुद्ध AI के वास्तविक पथ की तुलना करता है।
  • यदि AI का पथ अचानक "उछलता" है या अंत के पास अटक (stagnate) जाता है, तो DynHD चिल्लाकर कहता है, "यह एक हैलुसिनेशन है!"

3. दो-चरणीय प्रक्रिया

DynHD दो चरणों में काम करता है, जैसे एक कोच एथलीट को प्रशिक्षित करता है:

  1. फिल्टर (सिग्नल को साफ करना): यह उन सभी "बेकार" शब्दों (जैसे "the", "a", या विराम चिह्न) को हटा देता है जो झूठ पकड़ने में मदद नहीं करते। यह केवल महत्वपूर्ण संज्ञाओं (nouns) और क्रियाओं (verbs) पर ध्यान केंद्रित करता है।
  2. डेविएशन डिटेक्टर (कोच):
    • पहले, यह हजारों सही उत्तरों का अध्ययन करके सीखता है कि एक "सामान्य" उत्तर कैसा दिखता है। यह एक "गोल्ड स्टैंडर्ड" कर्व बनाता है।
    • फिर, जब एक नया उत्तर उत्पन्न किया जा रहा होता है, तो यह वास्तविक समय में AI के कॉन्फिडेंस कर्व (confidence curve) पर नज़र रखता है।
    • यदि AI का कर्व गोल्ड स्टैंडर्ड से विचलित होता है—विशेष रूप से यदि यह सुचारू रूप से स्थिर होने के बजाय वापस ऊपर उछलता है या अटक जाता है—तो DynHD इसे झूठ के रूप में चिह्नित करता है।

यह पहले की तुलना में बेहतर क्यों है?

  • गति: पुराने तरीकों के लिए अक्सर AI से एक ही सवाल 100 बार पूछना पड़ता था यह देखने के लिए कि क्या वह अलग-अलग उत्तर देता है (जैसे किसी झूठे व्यक्ति से 100 बार पूछना कि क्या उसकी कहानी बदलती है)। यह धीमा और महंगा है। DynHD एक ही पेंटिंग प्रक्रिया को देखता है और तुरंत झूठ पकड़ लेता है।
  • सटीकता: "शोर" को अनदेखा करके और अनिश्चितता के "आकार" पर ध्यान केंद्रित करके, यह उन झूठों को पकड़ लेता है जिन्हें अन्य तरीके मिस कर देते हैं। यह एक जासूस की तरह है जो केवल यह नहीं सुनता कि आप क्या कहते हैं, बल्कि यह भी देखता है कि आप इसे कैसे कहते हैं।

निष्कर्ष

DynHD एक सुपर-स्मार्ट आर्ट क्रिटिक की तरह है जो केवल यह नहीं देखता कि पेंटिंग अच्छी है या नहीं। इसके बजाय, वे पूरी प्रक्रिया के दौरान कलाकार के हाथ की गतिविधियों को देखते हैं। यदि कलाकार का हाथ अंत से ठीक पहले हिलने लगता है या अजीब, अनिश्चित हरकतें करने लगता है, तो DynHD जान जाता है कि पेंटिंग नकली है, भले ही अंतिम चित्र ठीक लग रहा हो।

यह AI मॉडल्स को बहुत अधिक विश्वसनीय बनाता है, यह सुनिश्चित करता है कि जब वे आपको कोई तथ्य बताते हैं, तो वे केवल मनगढ़ंत बातें नहीं कर रहे होते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →