← नवीनतम पेपर
💬 NLP

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

यह शोध पत्र प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कार्य-अप्रासंगिक टेक्स्ट (task-irrelevant text) बाइनरी विजुअल जजमेंट्स को व्यवस्थित रूप से पक्षपाती बनाता है, जो निर्णय मार्जिन में एक पूर्वानुमेय एफ़ाइन ट्रांसफॉर्मेशन (affine transformation) को प्रेरित करता है, और इस प्रभाव को अनस्ट्रक्चर्ड नॉइज़ के बजाय एक अनुमान योग्य ज्यामितीय विरूपण (geometric distortion) के रूप में अभिलक्षित करता है।

मूल लेखक: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

प्रकाशित 2026-08-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस के परिदृश्य में, एक नई पीढ़ी के सिस्टम उभरे हैं जो एक ही समय में देख और बोल सकते हैं। ये मल्टीमॉडल मॉडल किसी चित्र को देखने और उसके बारे में उत्तर देने, या किसी दृश्य का विस्तार से वर्णन करने के लिए प्रशिक्षित किए जाते हैं। वे शक्तिशाली उपकरण हैं, जो वस्तुओं की पहचान करने, चित्रों के भीतर टेक्स्ट पढ़ने और जटिल स्थितियों के बारे में तर्क करने में सक्षम हैं। हालाँकि, ये सिस्टम शून्य में काम नहीं करते हैं। वास्तविक दुनिया के अनुप्रयोगों में, उन्हें अक्सर चित्र के साथ अतिरिक्त जानकारी दी जाती है: उपयोगकर्ता के पिछले संदेश, एक निकाला गया लेख, या एक डेटाबेस प्रविष्टि। यह अतिरिक्त टेक्स्ट मॉडल को चित्र को बेहतर ढंग से समझने में मदद करने के लिए होता है। लेकिन क्या होगा यदि वह अतिरिक्त टेक्स्ट चित्र से संबंधित न हो? क्या मॉडल शोर को अनदेखा कर देगा, या वह भ्रमित हो जाएगा? यह प्रश्न इस बात के केंद्र में है कि कैसे ये बुद्धिमान सिस्टम सूचना को कैसे संसाधित करते हैं जब उनका ध्यान एक दृश्य और असंबंधित शब्दों के बीच विभाजित होता है।

शोधकर्ताओं ने एक नियंत्रित प्रयोग का उपयोग करके ठीक इसी परिदृश्य का परीक्षण करने का निर्णय लिया। उन्होंने चित्रों और प्रश्नों की एक श्रृंखला ली, जैसे कि यह पूछना कि क्या फोटो में एक कुत्ता बाधा के ऊपर से कूद रहा है। फिर उन्होंने प्रत्येक प्रश्न के लिए इनपुट के दो संस्करण बनाए। पहले संस्करण में, मॉडल ने केवल चित्र और प्रश्न देखा। दूसरे संस्करण में, मॉडल ने वही चित्र और प्रश्न देखा, लेकिन प्रॉम्प्ट में पूरी तरह से अप्रासंगिक टेक्स्ट का एक ब्लॉक डाला गया था। यह टेक्स्ट किसी पुस्तक या लेख का एक यादृच्छिक वाक्य था, जैसे कि फ्रांस की यात्रा करने वाले व्यक्ति के बारे में एक कहानी, जिसका कुत्ते या बाधा से कोई संबंध नहीं था। शोधकर्ता यह देखना चाहते थे कि क्या यह यादृच्छिक शोर उनके निर्णय को बदल देगा।

परिणाम चौंकाने वाले थे। जब अप्रासंगिक टेक्स्ट जोड़ा गया, तो मॉडलों ने इसे केवल अनदेखा नहीं किया। इसके बजाय, उन्होंने लगातार अपने उत्तर बदल दिए। इससे भी महत्वपूर्ण बात यह थी कि उन्होंने अपने उत्तरों को किसी भी यादृच्छिक तरीके से नहीं बदला। मॉडल "नहीं" कहने की ओर काफी अधिक झुक गए, भले ही चित्र स्पष्ट रूप से एक "हाँ" वाली स्थिति दिखा रहा हो। उदाहरण के लिए, यदि एक मॉडल इस बात पर आश्वस्त था कि कुत्ता कूद रहा है, तो अप्रासंगिक टेक्स्ट के जुड़ने से अक्सर वह हिचकिचाने लगा और अपने उत्तर को बदलकर यह कहने लगा कि कुत्ता नहीं कूद रहा है। यह बदलाव विभिन्न प्रकार के चित्रों और विभिन्न मॉडलों में हुआ, जो एक यादृच्छिक गड़बड़ी के बजाय एक व्यवस्थित दोष का सुझाव देता है। मॉडल केवल थोड़े कम सटीक नहीं हो रहे थे; उन्हें एक विशिष्ट प्रकार की त्रुटि की ओर धकेला जा रहा था, जहाँ वे उस दृश्य साक्ष्य पर संदेह करने लगे जिसे वे देख रहे थे।

यह समझने के लिए कि ऐसा क्यों हो रहा था, शोधकर्ताओं ने केवल अंतिम उत्तरों से आगे जाकर देखा। उन्होंने उन आंतरिक विश्वास स्कोर (confidence scores) की जांच की जो मॉडल निर्णय लेने से पहले उत्पन्न करते हैं। उन्होंने पाया कि मॉडल सूचना को कैसे संसाधित करते हैं, इसमें एक बहुत ही विशिष्ट पैटर्न था। जब मॉडल ने अकेले चित्र देखा, तो उनके पास अपने उत्तर के प्रति विश्वास का एक निश्चित स्तर था। जब अप्रासंगिक टेक्स्ट जोड़ा गया, तो वह विश्वास गायब नहीं हुआ या अराजक नहीं हुआ। इसके बजाय, वह एक अनुमानित, गणितीय तरीके से स्थानांतरित हो गया। नया विश्वास स्तर मूल का एक विकृत संस्करण था, जो संकुचित था और एक विशिष्ट दिशा में धकेला गया था। यह ऐसा था मानो अतिरिक्त टेक्स्ट एक फिल्टर की तरह काम कर रहा था जिसने मॉडल की निश्चितता को सिकोड़ दिया और तराजू को दृश्य साक्ष्य के विरुद्ध झुका दिया।

इस खोज ने इस विचार को खारिज कर दिया कि मॉडल अतिरिक्त शब्दों से केवल भ्रमित हो रहे थे या टेक्स्ट एक यादृच्छिक स्टैटिक शोर की तरह कार्य कर रहा था। यदि यह यादृच्छिक शोर होता, तो त्रुटियाँ बिखरी हुई और अप्रत्याशित होतीं। इसके बजाय, त्रुटियाँ एक सख्त नियम का पालन करती थीं। शोधकर्ताओं ने इस नियम को एक सुसंगत बदलाव के रूप में वर्णित किया, जहाँ मॉडल का आंतरिक निर्णय टेक्स्ट की उपस्थिति से खिंच गया और स्थानांतरित हो गया। उन्होंने पाया कि इस बदलाव को मापा जा सकता था और यहाँ तक कि अनुमान भी लगाया जा सकता था। इस बदलाव के पैटर्न को समझकर, वे एक सरल सुधार पद्धति बनाने में सक्षम हुए। यह पद्धति अप्रासंगिक टेक्स्ट के कारण होने वाले नुकसान को आंशिक रूप से उलट सकती थी, जिससे मॉडल की चित्र में जो देख रहा है उस पर भरोसा करने की क्षमता बहाल हो गई।

अध्ययन ने यह भी प्रकट किया कि टेक्स्ट को कैसे प्रस्तुत किया जाता है, यह मायने रखता है। जब अप्रासंगिक टेक्स्ट को इस तरह से प्रस्तुत किया गया जैसे कि वह चित्र से संबंधित हो सकता है, तो विरूपण और भी अधिक शक्तिशाली हो गया। मॉडल ऐसा व्यवहार करते थे जैसे कि वे यादृच्छिक शब्दों को सुराग मान रहे हों, और उन्हें अपने चित्र की समझ में फिट करने की कोशिश कर रहे हों, जिससे और भी अधिक भ्रम पैदा हुआ। यह सुझाव देता है कि मॉडल केवल सूचना के निष्क्रिय प्राप्तकर्ता नहीं हैं, बल्कि वे जो कुछ भी उन्हें दिया जाता है उसका अर्थ निकालने की सक्रिय रूप से कोशिश करते हैं, भले ही वह जानकारी बेकार हो। वे यह अंतर करने में संघर्ष करते हैं कि क्या दृश्य कार्य के लिए प्रासंगिक है और क्या केवल पृष्ठभूमि का शोर है।

ये निष्कर्ष आर्टिफिशियल इंटेलिजेंस द्वारा सूचना को संभालने के तरीके को देखने का एक नया तरीका प्रदान करते हैं। यह पता चला है कि दृश्य कार्य में अतिरिक्त टेक्स्ट जोड़ने से केवल आवाज नहीं बढ़ती; यह मॉडल की सोच के आकार को बदल देता है। मॉडल उन्हें दिए गए संदर्भ के प्रति संवेदनशील होते हैं, और यह संवेदनशीलता उन्हें अपनी आँखों पर संदेह करने के लिए मजबूर कर सकती है। हालाँकि शोधकर्ताओं ने दिखाया है कि इस प्रभाव को मापा और आंशिक रूप से सुधारा जा सकता है, मूल समस्या बनी हुई है: ये सिस्टम अभी भी अप्रासंगिक को अनदेखा करने के लिए पर्याप्त मजबूत नहीं हैं। जैसे-जैसे इन तकनीकों को अधिक जटिल वास्तविक दुनिया के सिस्टम में एकीकृत किया जा रहा है जहाँ उन्हें लगातार डेटा की धाराएँ प्राप्त होंगी, शोर के प्रति उनकी प्रतिक्रिया को समझना महत्वपूर्ण है। यह कार्य इन पूर्वाग्रहों को पहचानने के लिए एक स्पष्ट नैदानिक उपकरण (diagnostic tool) प्रदान करता है और ऐसे सिस्टम बनाने की नींव रखता है जो चित्र पर ध्यान केंद्रित कर सकें, भले ही उनके आसपास की दुनिया विकर्षणों से भरी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →