← नवीनतम पेपर
🤖 AI

Local Intrinsic Dimension Unveils Hallucinations in Diffusion Models

यह शोध पत्र प्रस्तावित करता है कि डिफ्यूजन मॉडल्स में संरचनात्मक मतिभ्रम (structural hallucinations), मॉडल-प्रेरित मैनिफोल्ड पर उच्च स्थानीय अंतर्निहित आयाम (high local intrinsic dimension - LID) द्वारा संचालित अस्थिरताओं से उत्पन्न होते हैं, और 'इंट्रिंसिक क्वेंचिंग' (Intrinsic Quenching - IQ) नामक एक विधि पेश करता है जो LID को कम करने और विशेष रूप से मेडिकल इमेजिंग में शारीरिक निरंतरता (anatomical consistency) में सुधार करते हुए इन विसंगतियों को प्रभावी ढंग से कम करने के लिए है।

मूल लेखक: Bartlomiej Sobieski, Matthew Tivnan, Dawid Płudowski, Michał Jan Włodarczyk, Pengfei Jin, Przemyslaw Biecek, Quanzheng Li

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bartlomiej Sobieski, Matthew Tivnan, Dawid Płudowski, Michał Jan Włodarczyk, Pengfei Jin, Przemyslaw Biecek, Quanzheng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक डिफ्यूजन मॉडल (Diffusion Model) की कल्पना एक ऐसे मास्टर मूर्तिकार के रूप में करें जिसने हजारों मूर्तियों का अध्ययन करने में अपने कई वर्ष बिताए हैं। उनका काम पत्थर के एक ब्लॉक (शोर/noise) से नए आकार उकेरना है, जिसमें वे तब तक टुकड़े हटाते रहते हैं जब तक कि एक आदर्श रूप उभर न आए। आमतौर पर, वे बहुत अच्छा काम करते हैं। लेकिन कभी-कभी, वे भ्रमित हो जाते हैं और एक ऐसी मूर्ति बना देते हैं जिसमें छह उंगलियां, तीन आंखें, या फूल जैसी दिखने वाली एक हथेली होती है। एआई (AI) की दुनिया में, इन गलतियों को हैलुसिनेशन (hallucinations) कहा जाता है।

यह शोध पत्र तर्क देता है कि ये गलतियाँ इसलिए होती हैं क्योंकि मूर्तिकार उनके मानसिक मानचित्र के एक "धुंधले" हिस्से में खो जाता है। लेखक इसे ठीक करने का एक नया तरीका प्रस्तावित करते हैं, जो यह मापता है कि मूर्तिकार का रास्ता कितना "लहराता" (wobbly) है और फिर उसे धीरे से सुचारू बनाता है।

उनकी खोज और समाधान का विवरण यहाँ दिया गया है:

1. समस्या: मूर्तिकार का "लहराता" हुआ रास्ता

लेखकों का सुझाव है कि जब एक डिफ्यूजन मॉडल एक हैलुसिनेशन (जैसे छह उंगलियों वाला हाथ) बनाता है, तो यह केवल एक यादृच्छिक त्रुटि नहीं होती है। यह मॉडल के "मानसिक परिदृश्य" (जिसे मैनिफोल्ड/manifold कहा जाता है) के एक विशिष्ट भाग में हो रहा है जहाँ ज्यामिति अस्थिर है।

सोचिए कि मॉडल का प्रशिक्षण डेटा (training data) एक चिकना, सपाट घाटी है जहाँ वास्तविक हाथ मौजूद होते हैं।

  • सामान्य पीढ़ी (Normal Generation): मॉडल घाटी के फर्श पर सुचारू रूप से चलता है, जिससे आदर्श हाथ बनते हैं।
  • हैलुसिनेशन (Hallucination): मॉडल एक डगमगाती, अस्थिर ढलान पर कदम रख देता है। यहाँ, जमीन में अतिरिक्त, अदृश्य आयाम (dimensions) दिखाई देने लगते हैं। क्योंकि जमीन लहरदार है, मॉडल गलती से अतिरिक्त उंगलियां या गलत संरेखित आंखें बना देता है।

लेखक इस अस्थिरता को लोकल मैनिफोल्ड इनस्टेबिलिटी (Local Manifold Instability - LMI) कहते हैं। यह एक ट्रैम्पोलिन पर चलने जैसा है जो अजीब दिशाओं में खिंच रहा है; आप अनजाने में उस आकार में जा सकते हैं जिसे आप नहीं चाहते थे।

2. खोज: "लहरों" को मापना

इन लहरदार स्थानों को खोजने के लिए, लेखकों ने लोकल इंट्रिन्सिक डायमेंशन (Local Intrinsic Dimension - LID) नामक अवधारणा का अध्ययन किया।

  • उपमा: कल्पना कीजिए कि एक कमरे में तैरता हुआ कागज का एक सपाट पन्ना (2D) है। यदि आप कागज के एक छोटे से बिंदु को देखते हैं, तो वह सपाट (2D) महसूस होता है। लेकिन यदि कागज मुड़ा हुआ है या यदि मॉडल हैलुसिनेट कर रहा है, तो वह स्थान अचानक ऐसा महसूस करा सकता है जैसे उसमें हिलने के लिए अतिरिक्त, अनावश्यक दिशाएं (जैसे 3D या 4D) हों।
  • निष्कर्ष: शोध पत्र दिखाता है कि जब मॉडल गलती करने वाला होता है (जैसे अतिरिक्त उंगली जोड़ना), तो वह स्थान जिसके माध्यम से वह चल रहा है, उसका "डायमेंशन" अचानक बढ़ जाता है। यह ऐसा है जैसे मॉडल उस दिशा में चलने की कोशिश कर रहा है जो अस्तित्व में ही नहीं होनी चाहिए।

उन्होंने इसे एक फिल्टर बनाकर परीक्षण किया जो इन "बढ़े हुए आयामों" को पहचानता है। उन्होंने पाया कि यह फिल्टर उन पिछले तरीकों की तुलना में बेहतर है जो इस बात पर ध्यान देते थे कि छवि समय के साथ कैसे बदलती है।

3. समाधान: "इंट्रिन्सिक क्वेंचिंग" (Intrinsic Quenching - IQ)

एक बार जब उन्हें पता चल गया कि गलतियाँ कहाँ हो रही हैं (उन लहरदार, उच्च-आयामी स्थानों में), तो उन्होंने इंट्रिन्सिक क्वेंचिंग (Intrinsic Quenching - IQ) नामक एक सुधार बनाया।

  • रूपक: कल्पना कीजिए कि मॉडल एक सड़क पर चलती हुई कार है। जब वह एक ऊबड़-खाबड़, अस्थिर हिस्से से टकराती है (एक हैलुसिनेशन), तो कार डगमगाने लगती है।
  • सुधार: IQ एक स्मार्ट सस्पेंशन सिस्टम की तरह कार्य करता है। जैसे ही कार उस ऊबड़-खाबड़ हिस्से के पास पहुँचती है, यह अस्थिरता का पता लगा लेती है। कार को डगमगाने देने के बजाय, यह कार को धीरे से वापस चिकने, स्थिर हिस्से पर धकेल देती है। यह अतिरिक्त, अनावश्यक आयामों को "पिचक" (deflate) देता है, जिससे मॉडल को तार्किक, वास्तविक दुनिया के नियमों (जैसे "हाथों में केवल पांच उंगलियां होती हैं") पर टिके रहने के लिए मजबूर किया जाता है।

वे इसे "क्वेंचिंग" (Quenching) कहते हैं क्योंकि यह एक गर्म, अस्थिर धातु को ठंडा करके उसे ठोस और स्थिर बनाने जैसा है।

4. क्या यह काम करता है?

लेखकों ने कई अलग-अलग कार्यों पर इसका परीक्षण किया:

  • हाथ बनाना: उन्होंने दिखाया कि IQ अन्य तरीकों की तुलना में छह उंगलियों वाले हाथों की संख्या को नाटकीय रूप से कम करता है।
  • मेडिकल इमेजिंग: उन्होंने मस्तिष्क के सीटी स्कैन (डॉक्टरों द्वारा उपयोग किए जाने वाले चित्र) के पुनर्निर्माण में इसका परीक्षण किया। इस मामले में, एक हैलुसिनेशन एक नकली ट्यूमर या मस्तिष्क के गायब हिस्से के रूप में दिख सकता है, जो खतरनाक है। IQ ने यह सुनिश्चित करने में मदद की कि पुनर्निर्मित चित्र शारीरिक रूप से सही हों और उनमें कोई काल्पनिक बीमारी न दिखे।
  • चेहरे और जानवर: इसने उत्पन्न चेहरों और जानवरों की तस्वीरों की गुणवत्ता में भी सुधार किया, जिससे वे अधिक स्वाभाविक दिखने लगे।

सारांश

शोध पत्र का दावा है कि एआई हैलुसिनेशन इसलिए होते हैं क्योंकि मॉडल अपने स्वयं के गणित के "लहरदार" हिस्सों में खो जाता है। इस लहर (Local Intrinsic Dimension का उपयोग करके) को मापकर और मॉडल को धीरे से स्थिर जमीन पर वापस धकेलकर (Intrinsic Quenching का उपयोग करके), हम एआई को छह उंगलियों वाले हाथों या नकली ट्यूमर जैसी असंभव चीजें बनाने से रोक सकते हैं। यह एआई को वास्तविकता की "ठोस जमीन" पर बने रहने का तरीका सिखाने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →