← नवीनतम पेपर
🤖 AI

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

यह शोध पत्र विजुअल एम्बेडिंग्स और टेक्स्ट मैनिफोल्ड के बीच ज्यामितीय अति-संरेखण (geometric over-alignment) को डिकोडर-आधारित विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) के मूल कारण के रूप में पहचानता है, और प्रशिक्षण-मुक्त एवं फाइन-ट्यूनिंग उपचार प्रस्तावित करता है जो इस भाषाई पूर्वाग्रह को बाहर प्रोजेक्ट करके बिना किसी कम्प्यूटेशनल ओवरहेड के कई बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: जब "स्क्रिप्ट" "दृश्य" पर हावी हो जाती है

कल्पना कीजिए कि आप एक लाइव नाटक देख रहे हैं। कलाकार मंच पर हैं (छवि/इमेज) और एक सूत्रधार (नैरेटर) स्क्रिप्ट से पढ़ रहा है (लैंग्वेज मॉडल)।

एक आदर्श दुनिया में, सूत्रधार ठीक वही बताता है जो वह मंच पर देख रहा है। लेकिन वर्तमान AI सिस्टम (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) में, सूत्रधार की एक बुरी आदत है: वह स्क्रिप्ट का इतना आदी हो जाता है कि वह उन चीजों का वर्णन करने लगता है जो वहां मौजूद ही नहीं हैं।

उदाहरण के लिए, यदि आप AI को एक खाली डाइनिंग टेबल की तस्वीर दिखाते हैं, तो AI आत्मविश्वास के साथ कह सकता है, "वहाँ मेज पर एक व्यक्ति बैठा है जिसके पास एक कप और एक बोतल है।" भले ही मेज खाली हो, AI इन वस्तुओं को "हैलुसिनेट" (भ्रमित होकर देखना) करता है क्योंकि, उसके ट्रेनिंग डेटा में, डाइनिंग टेबल के साथ लोग, कप और बोतलें लगभग हमेशा दिखाई देते हैं। AI अपनी सांख्यिकीय अनुमान (कि आमतौर पर क्या होता है) को दृश्य वास्तविकता (कि वास्तव में क्या हो रहा है) के ऊपर प्राथमिकता दे रहा है।

मूल कारण: "ओवर-अलाइनमेंट" का जाल

पेपर का तर्क है कि ऐसा इसलिए होता है क्योंकि AI को जिस तरह से बनाया गया है, वह वैसा ही है। AI को काम करने के योग्य बनाने के लिए, इंजीनियर "दृष्टि" वाले हिस्से (आंखों) और "भाषा" वाले हिस्से (मस्तिष्क) को एक ही भाषा बोलने के लिए मजबूर करते हैं। वे विजुअल डेटा को टेक्स्ट के समान गणितीय स्थान (मैथमेटिकल स्पेस) में दबा देते हैं।

लेखक इसे "ओवर-अलाइनमेंट" (Over-Alignment) कहते हैं।

उपमा (Analogy):
कल्पना कीजिए कि आप एक शांत, नाजुक वायलिन सोलो (विजुअल डिटेल्स) सुनने की कोशिश कर रहे हैं। लेकिन, संगीत को रिकॉर्ड करना आसान बनाने के लिए, आप वायलिन को एक विशाल, गूँजते हुए स्पीकर के माध्यम से बजाने के लिए मजबूर करते हैं जो तेज, जेनेरिक ड्रम बीट्स (टेक्स्ट पैटर्न्स) बजाने के लिए ट्यून किया गया है।

  • ड्रम की आवाज इतनी तेज है कि वह वायलिन को दबा देती है।
  • रिकॉर्डर (AI) को लगता है कि उसे हर जगह ड्रम सुनाई दे रहे हैं, भले ही वायलिन एक शांत नोट बजा रहा हो।
  • AI "ड्रम्स" के साथ बहुत अधिक अलाइन (Over-aligned) हो जाता है और वायलिन को सुनना बंद कर देता है।

पेपर का दावा है कि विजुअल डेटा को टेक्स्ट स्पेस में पूरी तरह फिट करने के मजबूर करने से, AI अनजाने में इमेज डेटा में एक "भाषाई पूर्वाग्रह" (Linguistic Bias) डाल देता है। AI चित्र को देखना बंद कर देता है और केवल शब्दों के जुड़ाव के आधार पर अनुमान लगाने लगता है।

खोज: "शोर" (Noise) को खोजना

शोधकर्ताओं ने AI के मस्तिष्क के भीतर देखने के लिए प्रिंसिपल कंपोनेंट एनालिसिस (PCA) नामक एक गणितीय उपकरण का उपयोग किया। PCA को "तेज ड्रम" को "शांत वायलिन" से अलग करने के तरीके के रूप में समझें।

उन्होंने पाया कि:

  1. "शोर" (टेक्स्ट पैटर्न्स की ओर झुकाव) AI के गणितीय स्थान के कुछ विशिष्ट दिशाओं में केंद्रित है। ये टॉप प्रिंसिपल कंपोनेंट्स (Top Principal Components) हैं।
  2. वास्तविक विजुअल विवरण (वायलिन) अन्य दिशाओं में छिपे हुए हैं, लेकिन उन्हें शोर द्वारा दबा दिया गया है।
  3. यह "शोर" सार्वभौमिक है; यह लगभग सभी डेटासेट्स में दिखाई देता है, जिसका अर्थ है कि यह एक संरचनात्मक दोष है कि कैसे AI को प्रशिक्षित किया गया है, न कि केवल किसी एक विशिष्ट तस्वीर की गलती।

समाधान: ड्रम की आवाज को कम करना

लेखक इस समस्या को ठीक करने के दो तरीके प्रस्तावित करते हैं, दोनों ही उन तेज ड्रम बीट्स (टॉप प्रिंसिपल कंपोनेंट्स) की "आवाज कम करने" से संबंधित हैं ताकि वायलिन को फिर से सुना जा सके।

1. "ट्रेनिंग-फ्री" फिक्स (शो के बाद का संपादन)

यह तरीका तब काम करता है जब AI पहले से ही प्रशिक्षित हो चुका होता है। यह एक नाटक की रिकॉर्डिंग लेने और उसे सुनने से पहले ऑडियो फिल्टर का उपयोग करके ड्रम ट्रैक को म्यूट करने जैसा है।

  • यह कैसे काम करता है: जब AI किसी इमेज को देखता है, तो शोधकर्ता इमेज डेटा को "टेक्स्ट नॉइज़" की दिशाओं से गणितीय रूप से दूर ले जाते हैं।
  • परिणाम: AI वास्तविक दृश्य साक्ष्य पर निर्भर रहने के लिए मजबूर होता है क्योंकि "अनुमान लगाने" वाले शॉर्टकट ब्लॉक कर दिए जाते हैं।
  • बोनस: इसके लिए अतिरिक्त कंप्यूटिंग पावर की आवश्यकता नहीं होती है और न ही AI को दोबारा ट्रेन करने की जरूरत होती है।

2. "बायस-अवेयर" ट्रेनिंग (रिहर्सल में बदलाव)

यह तरीका AI के सीखने के तरीके को बदल देता है।

  • यह कैसे काम करता है: ट्रेनिंग के दौरान, शोधकर्ता AI को कभी भी उन "ड्रम बीट" वाले शॉर्टकट्स का उपयोग करने से रोकते हैं। वे AI को सांख्यिकीय अनुमान के सहारे के बिना इमेज और टेक्स्ट के बीच संबंध सीखने के लिए मजबूर करते हैं।
  • परिणाम: AI पहले दिन से ही अपने उत्तरों को विजुअल साक्ष्य में "ग्राउंड" (आधारित) करना सीख जाता है, जिससे वह बिना मनगढ़ंत बातें किए लंबी, जटिल दृश्यों का वर्णन करने में बहुत बेहतर हो जाता है।

परिणाम: स्पष्ट दृष्टि

पेपर ने इन तरीकों का परीक्षण कई बेंचमार्क (AI हैलुसिनेशन को पकड़ने के लिए डिज़ाइन किए गए टेस्ट) पर किया।

  • कम हैलुसिनेशन: AI ने उन वस्तुओं को बनाना बंद कर दिया जो वहां नहीं थीं (जैसे खाली डाइनिंग टेबल वाला उदाहरण)।
  • बेहतर सटीकता: AI चित्र में जो कुछ भी था उसका सटीक वर्णन करने में बहुत बेहतर हो गया, विशेष रूप से लंबे विवरणों में।
  • कोई समझौता नहीं: AI अन्य कार्यों में "कम बुद्धिमान" नहीं हुआ; वह बस जो उसने देखा उसके प्रति अधिक ईमानदार हो गया।

सारांश

पेपर निष्कर्ष निकालता है कि इन AI मॉडल्स को बनाने का वर्तमान तरीका उन्हें भाषा पैटर्न के पक्ष में विजुअल विवरणों को "भूलने" के लिए मजबूर करता है। उन विशिष्ट दिशाओं को गणितीय रूप से हटाकर जहाँ यह भाषाई पूर्वाग्रह रहता है, हम वास्तविक विजुअल सिग्नल को "अनमास्क" (Unmask) कर सकते हैं, जिससे AI दुनिया को वैसा ही देख पाता है जैसी वह वास्तव में है, न कि जैसा वह होने की उम्मीद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →