← नवीनतम पेपर
🧬 biology

Modulating Cross-Modal Convergence with Single-Stimulus, Intra-Modal Dispersion

यह शोध पत्र यह प्रदर्शित करने के लिए 'जनरलाइज्ड प्रोक्रस्टेस एल्गोरिदम' का उपयोग करते हुए एक एकल-उद्दीपन पद्धति प्रस्तुत करता है कि विज़न मॉडलों के बीच इंट्रा-मोडल रिप्रजेंटेशनल डिस्पर्शन (intra-modal representational dispersion), लैंग्वेज मॉडलों के साथ क्रॉस-मोडल अलाइनमेंट को दृढ़ता से नियंत्रित करता है, जहाँ विज़न मॉडलों के बीच उच्च सहमति वाले उद्दीपन काफी अधिक क्रॉस-मोडल अभिसरण (cross-modal convergence) उत्पन्न करते हैं।

मूल लेखक: Eghbal A. Hosseini, Brian Cheung, Evelina Fedorenko, Alex H. Williams

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eghbal A. Hosseini, Brian Cheung, Evelina Fedorenko, Alex H. Williams

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI मॉडल कुछ चीजों पर "सहमत" क्यों होते हैं और दूसरों पर क्यों नहीं?

कल्पना कीजिए कि एक कमरे में अलग-अलग कला समीक्षकों (art critics) का समूह है। एक पारंपरिक चित्रकार है, एक आधुनिक फोटोग्राफर है, और एक डिजिटल कलाकार है। वे सभी एक ही पेंटिंग को देखते हैं।

कभी-कभी, वे इस बात पर पूरी तरह सहमत होते हैं कि वह पेंटिंग किस बारे में है। वे सभी कह सकते हैं, "यह एक उदास, बारिश वाला दिन है।"
अन्य समय में, वे बुरी तरह असहमत होते हैं। एक कहता है, "यह एक उत्सव है," दूसरा कहता, "यह एक दुःस्वप्न है," और तीसरा कहता, "यह सिर्फ एक नीला धब्बा है।"

यह शोध पत्र एक सरल प्रश्न पूछता है: क्या इससे फर्क पड़ता है कि हम उन्हें कौन सी पेंटिंग दिखा रहे हैं?

शोधकर्ताओं ने पाया कि यदि आप समीक्षकों को एक ऐसी पेंटिंग दिखाते हैं जिस पर वे सभी सहमत हैं (कम असहमति), तो वे भाषा AI (language AI) के अनुरूप शब्दों का उपयोग करके उसका वर्णन करने में बहुत बेहतर होते हैं। लेकिन यदि आप उन्हें एक ऐसी पेंटिंग दिखाते हैं जिस पर वे बहस करते हैं (उच्च असहमति), तो उनके दृश्य बोध (visual understanding) और भाषा AI के बीच का संबंध टूट जाता है।

समस्या: हम आमतौर पर "औसत" को देखते हैं

अतीत में, वैज्ञानिक AI मॉडलों के व्यवहार को हजारों छवियों को एक साथ औसत (average) करके देखते थे। यह पूछने जैसा है कि, "औसत रूप से, क्या इन समीक्षकों के बीच सहमति है?" उत्तर आमतौर पर होता है, "हाँ, ज्यादातर।"

लेकिन लेखकों ने महसूस किया कि औसत छिपा हुआ सच है। सिर्फ इसलिए कि औसत अच्छा है, इसका मतलब यह नहीं है कि हर एक छवि को एक ही तरह से समझा जाता है। कुछ छवियां AI के लिए भी भ्रमित करने वाली होती हैं।

समाधान: "ग्रुप हग" (सामान्यीकृत प्रोक्रस्टेस विश्लेषण - Generalized Procrustes Analysis)

यह पता लगाने के लिए कि कौन सी छवियां सहमति का कारण बनती हैं और कौन सी बहस का, शोधकर्ताओं ने सामान्यीकृत प्रोक्रस्टेस विश्लेषण (GPA) नामक एक गणितीय तकनीक का उपयोग किया।

उपमा (Analogy):
कल्पना कीजिए कि आपके पास एक ही शहर के तीन अलग-अलग मानचित्र (maps) हैं, जिन्हें अलग-अलग लोगों द्वारा बनाया गया है।

  • मानचित्र A को 90 डिग्री घुमाया गया है।
  • मानचित्र B को उल्टा कर दिया गया है।
  • मानचित्र C को खींचा (stretch) गया है।

तुलना करने के लिए, आप उन्हें बस एक दूसरे के ऊपर नहीं रख सकते; वे मेल नहीं खाएंगे। आपको उन्हें तब तक घुमाना, पलटना और खींचना होगा जब तक कि वे पूरी तरह से एक सीध में न आ जाएं। एक बार जब वे संरेखित (align) हो जाते हैं, तो आप देख सकते हैं कि मानचित्र कहाँ असहमत हैं।

  • यदि मानचित्र एक विशिष्ट सड़क पर पूरी तरह से मेल खाते हैं, तो वह "कम फैलाव" (low dispersion) है (सभी सहमत हैं)।
  • यदि मानचित्र उस सड़क को तीन पूरी तरह से अलग स्थानों पर दिखाते हैं, तो वह "उच्च फैलाव" (high dispersion) है (सभी भ्रमित हैं)।

शोधकर्ताओं ने यह काम AI विजन मॉडलों (जैसे DINOv2, CLIP, और MAE) के साथ किया। उन्होंने मॉडलों के "मस्तिष्क" को संरेखित करके एक संयुक्त सहमति (Joint Consensus) बनाई। फिर, उन्होंने व्यक्तिगत छवियों को देखा कि प्रत्येक मॉडल समूह के औसत से कितना "विचलित" (drift) हुआ।

खोज: सहमति जुड़ाव को बढ़ावा देती है

एक बार जब उन्होंने छवियों को दो ढेरों में विभाजित कर दिया—"सहमति का ढेर" (कम फैलाव) और "बहस का ढेर" (उच्च फै डेरिवेशन)—तो उन्होंने कुछ नया परीक्षण किया।

उन्होंने पूछा: यदि हम इन छवियों को एक विजन AI और एक भाषा AI (जैसे चैटबॉट) में डालते हैं, तो क्या वे एक-दूसरे को बेहतर समझते हैं?

परिणाम:

  • सहमति का ढेर: जब विजन मॉडलों ने एक छवि के बारे में सहमति जताई, तो भाषा मॉडल ने उसे लगभग पूरी तरह से समझ लिया। "देखने" और "बोलने" के बीच का संबंध सामान्य से दोगुना मजबूत था।
  • बहस का ढेर: जब विजन मॉडल भ्रमित थे या असहमत थे, तो भाषा मॉडल खो गया। संबंध कमजोर था।

रूपक (Metaphor):
सोचिए कि विजन AI और भाषा AI दो लोग हैं जो एक अनुवादक के माध्यम से बातचीत करने की कोशिश कर रहे हैं।

  • यदि विजन AI एक स्पष्ट, स्पष्ट सूर्यास्त को देख रहा है, तो वह कहता है, "सूर्यास्त।" अनुवादक इसे भाषा AI तक पहुँचाता है, जो कहता है, "आह, एक सूर्यास्त!" पूर्ण संरेखण।
  • यदि विजन AI एक भ्रमित करने वाली अमूर्त पेंटिंग को देख रहा है, तो वह कह सकता है, "नीला भंवर? लाल धब्बा? शायद एक बिल्ली?" अनुवादक भ्रमित है। भाषा AI को केवल निरर्थक शब्द सुनाई देते हैं। कोई संरेखण नहीं।

यह क्यों मायने रखता है

यह शोध पत्र सोचने का हमारा तरीका बदल देता है। यह सुझाव देता है कि AI मॉडल केवल सामान्य रूप से "स्मार्ट" या "मूर्ख" नहीं होते हैं। वे स्थितिजन्य रूप से स्मार्ट (situationally smart) होते हैं।

  1. बेहतर परीक्षण: यदि हम जानना चाहते हैं कि क्या कोई AI वास्तव में मानव मस्तिष्क या भाषा के साथ "संरेखित" है, तो हमें केवल यादृच्छिक (random) मिश्रित छवियों पर परीक्षण नहीं करना चाहिए। हमें विशेष रूप से उन छवियों पर परीक्षण करना चाहिए जहाँ मॉडल सहमत होते हैं।
  2. मस्तिष्क को समझना: मनुष्य भी कुछ चीजों पर अधिक सहमत होते हैं। यह अध्ययन करके कि कौन सी छवियां AI मॉडलों को सहमत करती हैं, हम यह सीख सकते हैं कि दुनिया की कौन सी विशेषताएं ऐसी हैं जो इतनी "सार्वभौमिक" हैं कि उन्हें मशीन और इंसान दोनों समझ सकें।
  3. "प्लेटोनिक" विचार: यह शोध पत्र इस विचार का समर्थन करता है कि दुनिया की एक "वास्तविक" अंतर्निहित संरचना (एक प्लेटोनिक आदर्श) होती है। जब AI मॉडल इस संरचना को अच्छी तरह से सीखते हैं, तो वे सभी एक ही उत्तर पर पहुँचते हैं। जब उन्होंने इसे अच्छी तरह से नहीं सीखा होता है, तो वे अलग हो जाते हैं।

संक्षेप में

शोधकर्ताओं ने एक उपकरण बनाया है जो यह मापने के लिए है कि AI मॉडल एक ही तस्वीर के बारे में कितना "बहस" करते हैं। उन्होंने पाया कि जब AI मॉडल इस बात पर सहमत होते हैं कि वे क्या देख रहे हैं, तो वे एक ही भाषा भी बोलते हैं। यह हमें बेहतर, अधिक संरेखित AI सिस्टम बनाने को समझने में मदद करता है जो केवल डेटा को रटते नहीं हैं, बल्कि दुनिया को इस तरह से समझते हैं जो मानवीय धारणा (human perception) से मेल खाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →