← नवीनतम पेपर
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

यह शोध पत्र HEAL का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो सिनर्जी हेड्स (synergy heads) में सूचना वितरण विचलन (information distribution drifts) का विश्लेषण करके और आउटपुट को तथ्यात्मक साक्ष्यों की ओर मोड़ने के लिए डायनेमिक कैलिब्रेशन लागू करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) की पहचान करता है और उन्हें कम करता है।

मूल लेखक: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

प्रकाशित 2026-09-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal large language models) कृत्रिम बुद्धिमत्ता का एक शक्तिशाली नया वर्ग है जिसे एक ही समय में देखने और बोलने के लिए डिज़ाइन किया गया है। पारंपरिक प्रणालियों के विपरीत जो टेक्स्ट या छवियों को अलग-थलग रूप से प्रोसेस करती हैं, ये मॉडल एक तस्वीर को देख सकते हैं और उसका वर्णन कर सकते हैं, उसके बारे में प्रश्न पूछ सकते हैं, या जो वे देखते हैं उसके आधार पर एक कहानी सुना सकते हैं। वे सूचना के दो अलग-अलग प्रवाहों को आपस में बुनकर काम करते हैं: छवि से प्राप्त विजुअल डेटा और विशाल मात्रा में टेक्स्ट से सीखी गई भाषाई पैटर्न। इन प्रणालियों के लिए चिकित्सा इमेजिंग या स्वायत्त ड्राइविंग जैसे उच्च-जोखिम वाले क्षेत्रों में वास्तव में उपयोगी होने के लिए, उन्हें विश्वसनीय होना चाहिए। हालांकि, वे अक्सर 'हैलुसिनेशन' (hallucination) नामक समस्या से ग्रस्त होते हैं। यह तब होता है जब मॉडल एक ऐसा उत्तर उत्पन्न करता है जो सुनने में आत्मविश्वासी और तर्कसंगत लगता है लेकिन दृश्य दुनिया के बारे में तथ्यात्मक रूप से गलत होता है, जैसे कि यह दावा करना कि बिल्ली की तस्वीर में कुत्ता है, या ऐसी विवरणों की रचना करना जो चित्र में मौजूद ही नहीं हैं।

लंबे समय तक, शोधकर्ताओं का मानना था कि ये त्रुटियां इसलिए होती हैं क्योंकि मॉडल अपने भाषा के आंतरिक ज्ञान पर बहुत अधिक ध्यान दे रहा था और वास्तविक चित्र पर पर्याप्त ध्यान नहीं दे रहा था। प्रचलित विचार यह था कि जैसे-जैसे मॉडल अपना उत्तर लिखता है, वह चित्र से दूर चला जाता है और केवल शब्दों के आधार पर जो वह देखने की अपेक्षा करता है, उस पर बहुत अधिक निर्भर हो जाता है। इसे ठीक करने के लिए, पिछले प्रयासों ने मॉडल को चित्र पर अधिक ध्यान केंद्रित करने के लिए मजबूर करने या पूरी प्रणाली को शुरू से फिर से प्रशिक्षित करने पर ध्यान केंद्रित किया। इन तरीकों ने अक्सर मॉडल को एक 'ब्लैक बॉक्स' के रूप में माना, जिससे इसके व्यवहार को बाहर से नियंत्रित किया गया बिना यह समझे कि त्रुटि वास्तव में क्यों हुई।

शेन्ज़ेन यूनिवर्सिटी ऑफ एडवांस्ड टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने अब इन मॉडलों के इंजन के भीतर झाँककर एक अलग स्पष्टीकरण खोजने का प्रयास किया है। वे प्रस्तावित करते हैं कि हॉलुसिनेशन केवल चित्र पर ध्यान की कमी के कारण नहीं होते हैं, न ही इसलिए कि मॉडल चित्र को पूरी तरह से अनदेखा कर देता है। इसके बजाय, उन्होंने पाया कि त्रुटि तब उत्पन्न होती है जब मॉडल के प्रोसेसिंग नेटवर्क के विशिष्ट हिस्सों के भीतर विजुअल और भाषistic जानकारी के बीच का आंतरिक संतुलन अस्थिर हो जाता है। शोधकर्ताओं ने HEAL नामक एक विधि विकसित की है, जिसका अर्थ है 'हेड-लेवल इंफॉर्मेशन डिसेंटैंगलमेंट एंड कैलिब्रेशन' (Head-lEvel information disentAnglement and caLibration), जो इस असंतुलन को वास्तविक समय में पहचानने और ठीक करने का काम करती है।

उनकी खोज का मूल आधार यह है कि मॉडल सूचना को कैसे प्रोसेस करता है। इन बड़े मॉडलों के भीतर, कई छोटे प्रोसेसिंग यूनिट होते हैं जिन्हें 'अटेंशन हेड्स' (attention heads) कहा जाता है। इन हेड्स को एक वाक्य को समझने के लिए मिलकर काम करने वाली विशेषज्ञों की एक टीम के रूप में समझें। कुछ विशेषज्ञ शुद्ध रूप से शब्दों पर ध्यान केंद्रित करते हैं, अन्य शुद्ध रूप से चित्र पर, और तीसरा समूह दोनों को मिलाने का काम करता है। शोधकर्ताओं ने पाया कि दोनों धाराओं को मिलाने वाले समूह—जिसे वे 'सिनर्जी हेड्स' (synergy heads) कहते हैं—वहीं से समस्या शुरू होती है। जब मॉडल सही ढंग से काम कर रहा होता है, तो ये सिनर्जी हेड्स एक स्वस्थ संतुलन बनाए रखते हैं, विजुअल और भाषाई जानकारी को एक स्थिर अनुपात में रखते हैं। हालांकि, जब मॉडल हॉलुसिनेट करने लगता है, तो यह संतुलन बिगड़ जाता है। इन मिश्रण करने वाले हेड्स के भीतर सूचना का वितरण उस स्वस्थ संतुलन से दूर चला जाता है, जिससे मॉडल दृश्य साक्ष्य से अपना जुड़ाव खो देता है।

महत्वपूर्ण रूप से, शोधकर्ताओं ने इस विचार को खारिज कर दिया कि हॉलुसिनेशन इसलिए होते हैं क्योंकि चित्र को देखने वाले विशेषज्ञ कम हैं या चित्र विशेषज्ञों की शक्ति कमजोर है। उनके विश्लेषण ने दिखाया कि मॉडल के सच बोलने या झूठ बोलने पर विजुअल-केंद्रित हेड्स की संख्या स्थिर रहती है। समस्या विजुअल अटेंशन की कमी नहीं है, बल्कि यह है कि मिश्रण करने वाले विशेषज्ञ सूचना के मिश्रण को कैसे संभालते हैं, उसमें विचलन आता है। जब मॉडल सही विवरण उत्पन्न करता है, तो सिनर्जी हेड्स विजुअल और भाषाई इनपुट को एक स्थिर अनुपात में रखते हैं। जब वह हॉलुसिनेट करता है, तो वह अनुपात बिगड़ जाता है, जो अक्सर भाषाई पैटर्न की ओर बहुत अधिक झुक जाता है जबकि विजुअल कनेक्शन कमजोर हो जाता है, भले ही चित्र वहां मौजूद हो।

इसे हल करने के लिए, टीम ने एक डायनेमिक कैलिब्रेशन रणनीति बनाई है जो एक वास्तविक समय के रेगुलेटर की तरह कार्य करती है। मॉडल को फिर से प्रशिक्षित करने या इसके आर्किटेक्चर को बदलने के बजाय, HEAL जनरेशन प्रक्रिया के दौरान हस्तक्षेप करता है। यह सिनर्जी हेड्स के माध्यम से बहने वाली सूचना की निगरानी करता है और पता लगाता है कि कब संतुलन बिगड़ने लगता है। जब विचलन का पता चलता है, तो सिस्टम एक कैलिब्रेशन फैक्टर इंजेक्ट करता है जो विजुअल और भाषाई जानकारी को धीरे से सही संतुलन की ओर वापस धकेलता है। यह प्रक्रिया निरंतर और अनुकूलन योग्य है; यह मॉडल को भाषा को अनदेज़ करने या चित्र पर अत्यधिक ध्यान केंद्रित करने के लिए मजबूर नहीं करती है, बल्कि आंतरिक प्रतिनिधित्व को उस स्थिति की ओर वापस मोड़ती है जहाँ दृश्य साक्ष्य को भाषाई संदर्भ के विरुद्ध उचित रूप से भारित किया जाता है।

शोधकर्ताओं ने LLaVA और Qwen के संस्करणों सहित कई अत्याधुनिक मॉडलों पर इस दृष्टिकोण का परीक्षण किया। परिणाम विभिन्न प्रणालियों और कार्यों में सुसंगत रहे। इस डायनेमिक कैलिब्रेशन को लागू करने से, मॉडलों ने अपनी बोलने की क्षमता और रचनात्मकता को बनाए रखते हुए काफी कम हॉलुसिनेशन उत्पन्न किए। उन परीक्षणों में, जो यह मापने के लिए डिज़ाइन किए गए थे कि मॉडल कितनी बार चित्र में मौजूद न होने वाली वस्तुओं की रचना करते हैं, इस नई पद्धति ने उन पिछली तकनीकों की तुलना में अधिक प्रभावी ढंग से त्रुटियों को कम किया जो केवल विजुअल अटेंशन को बढ़ाने का प्रयास करती थीं। अध्ययन बताता है कि इन प्रणालियों में विश्वसनीयता की कुंजी केवल उन्हें चित्र पर अधिक ध्यान देने के लिए कहना नहीं है, बल्कि यह सुनिश्चित करना है कि दृष्टि और वाणी का आंतरिक मिश्रण स्थिर रहे।

यह कार्य आर्टिफिशियल इंटेलिजेंस के दुनिया को समझने के तरीके पर एक नया दृष्टिकोण प्रदान करता है। यह दिखाता है कि विश्वसनीयता केवल पर्याप्त डेटा या शक्तिशाली हार्डवेयर के बारे में नहीं है, बल्कि विभिन्न प्रकार की सूचनाओं के बीच एक नाजुक आंतरिक संतुलन बनाए रखने के बारे में है। इस बात की पहचान करके कि यह संतुलन कहाँ टूटता है और इसे बहाल करने का एक सरल तरीका प्रदान करके, शोधकर्ताओं ने अधिक भरोसेमंद मल्टीमॉडल सिस्टम की ओर एक मार्ग खोल दिया है। यह विधि हल्की (lightweight) है और इसे फिर से प्रशिक्षित करने के लिए आवश्यक विशाल कंप्यूटेशनल संसाधनों की आवश्यकता नहीं है, जो इसे दृश्य और बोलने वाली एआई की सटीकता में सुधार करने के लिए एक व्यावहारिक उपकरण बनाती है। निष्कर्ष बताते हैं कि भविष्य में एआई विश्वसनीयता में सुधार इन आंतरिक संबंधों को सूक्ष्म रूप से ट्यून करने से आ सकता है, न कि शून्य से बड़े और अधिक जटिल मॉडल बनाने से।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →