← नवीनतम पेपर
🤖 AI

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

यह शोध पत्र एक कॉज़ल डिकोडिंग फ्रेमवर्क प्रस्तावित करता है जो पीढ़ी के दौरान हस्तक्षेप करके स्प्यूरियस डिपेंडेंसीज़ को कम करता है, जिससे उच्च वर्णनात्मक गुणवत्ता बनाए रखते हुए और अत्याधुनिक निष्ठा (स्टेट-ऑफ-द-आर्ट फेथफुलनेस) प्राप्त करते हुए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑब्जेक्ट हैलुसिनेशन को प्रभावी ढंग से कम किया जाता है।

मूल लेखक: Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान रोबोट सहायक है जिसका नाम MLLM (मल्टीमॉडल लार्ज लैंग्वेज मॉडल) है। आप उसे एक मेज पर रखी पिज्जा की तस्वीर दिखाते हैं और उससे पूछते हैं, "इस तस्वीर में क्या है?"

आदर्श रूप से, रोबोट को कहना चाहिए, "मुझे एक प्लेट पर पिज्जा दिख रहा है।"

लेकिन कभी-कभी, यह रोबोट थोड़ा ज़्यादा रचनात्मक हो जाता है। क्योंकि इसने पिज्जा पार्टियों के बारे में लाखों कहानियाँ पढ़ी हैं, यह आत्मविश्वास से कह सकता है, "मुझे एक पिज्जा, एक प्लेट, एक चाकू, और एक कांटा दिख रहा है।"

समस्या यह है कि तस्वीर में चाकू या कांटा नहीं है। रोबोट हैलुसिनेट (Hallucinate) कर रहा है। वह उन वस्तुओं के बारे में बना रहा है जो वहां मौजूद नहीं हैं क्योंकि वह इस बात पर बहुत अधिक निर्भर कर रहा है कि उसे उन शब्दों के आधार पर क्या देखना चाहिए जो उसने अभी लिखे हैं, न कि उस पर जो वह वास्तव में देख रहा है।

यह शोध पत्र इस समस्या को ठीक करने के लिए COAD (कॉज़ल ऑब्जेक्ट-अवेयर डिकोडिंग) नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसे सरल भाषा में यहाँ समझाया गया है।

समस्या: "इको चैंबर" (गूँजने वाले कमरे) का प्रभाव

रोबोट के दिमाग को एक शोर भरे कमरे की तरह समझें।

  1. तस्वीर: आप रोबोट को पिज्जा की एक तस्वीर दिखाते हैं।
  2. टेक्स्ट: रोबोट अपनी कहानी लिखना शुरू करता है, "पिज़्ज़ा का एक टुकड़ा..."
  3. ग्लिच (खराबी): जैसे ही वह "पिज्जा" लिखता है, उसका दिमाग "पिज्जा पार्टी" के बारे में सोचने लगता है। वह एक चाकू और कांटे की कल्पना करने लगता है, भले ही वे फोटो में न हों। फिर वह लिखता है, "...चाकू और कांटे के साथ।"

रोबोट एक इको चैंबर में फँस गया है। वह अपने पिछले शब्दों ("पिज्जा") को सुनता है और मान लेता है कि उनके बाद पिज्जा से जुड़े अन्य शब्द ("चाकू") अवश्य आएंगे, जिससे वह वास्तविक दृश्य साक्ष्य को अनदेखा कर देता है। यह उस व्यक्ति की तरह है जो कहानी सुनाते समय कहानी में इतना बहक जाता है कि वह उन पात्रों का आविष्कार कर देता है जो कभी आए ही नहीं थे।

समाधान: COAD (एक "फैक्ट-चेकर" रोबोट)

लेखकों ने इसे रोकने के लिए COAD नामक एक सिस्टम बनाया है। वे दो मुख्य तरीकों का उपयोग करते हैं: एक जासूस और एक समय-यात्री

1. जासूस (ऑब्जेक्ट डिटेक्टर)

इससे पहले कि रोबोट अपनी कहानी लिखना शुरू करे, COAD एक विशेष जासूस (एक ऑब्जेक्ट डिटेक्शन टूल) को लाता है।

  • जासूस फोटो को देखता है और कहता है, "मुझे एक पिज्जा दिख रहा है। मुझे एक प्लेट दिख रही है। मुझे चाकू नहीं दिख रहा है। मुझे कांटा नहीं दिख रहा है।"
  • तथ्यों की इस सूची को एक सख्त नियम पुस्तिका के रूप में रोबोट को सौंप दिया जाता है।

2. समय-यात्री (कॉज़ल इन्फरेंस - Causal Inference)

यही सबसे चतुर हिस्सा है। रोबोट आमतौर पर अपनी कहानी शब्द-दर-शब्द लिखता है। यदि वह "पिज्जा" लिखता है, तो उसे अगला शब्द "चाकू" लिखने का प्रलोभन हो सकता है।

  • सामान्य रोबोट: "मुझे एक पिज्जा दिख रहा है... शायद एक चाकू?" (यह अपनी याददाश्त के आधार पर अनुमान लगाता है)।
  • COAD रोबोट: सिस्टम कॉज़ल इन्फरेंस नामक एक गणितीय ट्रिक का उपयोग करता है। यह अनिवार्य रूप से रोबोट से पूछता है: "यदि हम जादू से उन शब्दों के प्रभाव को हटा दें जो आपने अभी लिखे हैं, और केवल जासूस की सूची और तस्वीर को देखें, तो आप क्या कहेंगे?"

यह अदालत में एक गवाह से पूछने जैसा है: "वकील ने आपसे जो कुछ भी कहा उसे भूल जाइए। अपनी आँखों से जो देखा, उसके आधार पर ही बताइए कि क्या हुआ था।"

रोबोट के पिछले अनुमानों और उसके अगले अनुमान के बीच के "तार को काटकर", COAD रोबोट को अपने कल्पना (टेक्स्ट इको) के बजाय जासूस की सूची (दृश्य सत्य) पर निर्भर रहने के लिए मजबूर करता है।

व्यवहार में यह कैसे काम करता है

कल्पना कीजिए कि आप समुद्र तट (बीच) के बारे में एक कहानी लिख रहे हैं।

  • COAD के बिना: आप लिखते हैं "सूरज गर्म है।" आपका दिमाग सोचता है, "गर्म सूरज का मतलब है समुद्र तट," इसलिए आप लिखते हैं "वहाँ एक सर्फ़बोर्ड है।" लेकिन रुकिए, फोटो में कोई सर्फ़बोर्ड नहीं है! आपने इसे केवल इसलिए बना लिया क्योंकि "सूरज" और "सर्फ़बोर्ड" अक्सर अपने डेटा में एक साथ आते हैं।
  • COAD के साथ:
    1. एक जासूस फोटो की जाँच करता है और कहता है: "सूरज: हाँ। सर्फ़बोर्ड: नहीं।"
    2. कॉज़ल सिस्टम हस्तक्षेप करता है। यह लेखक को बताता है: " 'सूरज' शब्द के आधार पर अनुमान लगाना बंद करें। जासूस के नोट को देखें। नोट कहता है 'कोई सर्फ़बोर्ड नहीं'। इसलिए, 'सर्फ़बोर्ड' न लिखें।"
    3. लेखक कहता है: "सूरज गर्म है। रेत सुनहरी है।" (सटीक और सत्यनिष्ठ)।

परिणाम

शोधकर्ताओं ने कई अलग-अलग तस्वीरों और सवालों पर इसका परीक्षण किया।

  • पुराना तरीका: रोबोट कुछ परीक्षणों में लगभग 30% बार वस्तुएं बना रहा था (जैसे चाकू और कांटा)।
  • COAD तरीका: रोबोट ने 6% से भी कम बार वस्तुएं बनाईं।

यह एक ऐसे कहानीकार को एक सख्त संपादक देने जैसा है जो आवर्धक लेंस (मैग्नीफाइंग ग्लास) लेकर फोटो की जाँच करता है, ताकि यह सुनिश्चित हो सके कि हर एक शब्द वास्तविकता से मेल खाता है।

यह क्यों महत्वपूर्ण है

यह वास्तविक दुनिया के उपयोगों के लिए एक बड़ी बात है।

  • चिकित्सा (Medical): यदि कोई रोबोट एक्स-रे देख रहा है, तो उसे ऐसी टूटी हुई हड्डी का आविष्कार नहीं करना चाहिए जो वहाँ मौजूद ही नहीं है।
  • कानूनी (Legal): यदि कोई रोबोट अपराध स्थल की फोटो का वर्णन कर रहा है, तो उसे ऐसे हथियार की कल्पना नहीं करनी चाहिए जो वहां मौजूद नहीं था।

COAD केवल सटीक होने के लिए "अधिक प्रयास" नहीं करता है; यह रोबोट के सोचने के तरीके को बदल देता है। यह रोबोट को अपने आंतरिक शोर को सुनना बंद करने और दृश्य साक्ष्य को सुनना शुरू करने के लिए मजबूर करता है, जिससे यह एक बहुत अधिक विश्वसनीय सहायक बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →