Toward a mechanistic understanding of inference in visual cortex and diffusion models
यह शोध पत्र पेयरवाइज इंटरैक्शन (pairwise interactions) के साथ स्पार्स कोडिंग पर आधारित एक न्यूनतम, व्याख्या योग्य डिफ्यूजन मॉडल प्रस्तुत करता है जो उच्च-प्रदर्शन इमेज डिनोइज़िंग प्राप्त करने के लिए V1 हॉरिजॉन्टल कनेक्शन की नकल करता है और जैविक संवेदी अनुमान (biological perceptual inference) तथा ब्लैक-बॉक्स डिफ्यूजन आर्किटेक्चर की आंतरिक कार्यप्रणाली, दोनों में यांत्रिक अंतर्दृष्टि प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मस्तिष्क का जासूसी कार्य और AI की स्वप्न मशीन
कल्पना कीजिए कि आप एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग बिखरे हुए, धुंधले हैं और उनमें से आधे गायब हैं। जब भी आप दुनिया को देखते हैं, ठीक यही होता है। आपकी आँखें केवल एक आदर्श फोटोग्राफ नहीं लेतीं; वे प्रकाश और छाया के एक उलझे हुए ढेर को प्राप्त करती हैं। इसे समझने के लिए, आपके मस्तिष्क को एक जासूस की तरह काम करना पड़ता है, जो अंतराल को भरता है और अनुमान लगाता है कि पूरी तस्वीर कैसी दिखती होगी। इस प्रक्रिया को "परसेप्चुअल इन्फरेंस" (perceptual inference) कहा जाता है। दशकों से, वैज्ञानिक आश्चर्य करते रहे हैं कि मस्तिष्क यह सब इतनी सहजता से कैसे कर लेता है। वे जानते हैं कि विजुअल कॉर्टेक्स (मस्तिष्क का वह हिस्सा जो देखता है) में न्यूरॉन्स विशिष्ट तरीकों से जुड़े होते हैं, जैसे दोस्तों का एक जाल जो आपस में बात करके इस बात पर सहमत होते हैं कि वे क्या देख रहे हैं।
साथ ही, "डिफ्यूजन मॉडल" (diffusion model) नामक एक नए प्रकार के आर्टिफिशियल इंटेलिजेंस ने शानदार चित्र बनाने के लिए प्रसिद्धि प्राप्त की है। ये AI सिस्टम शुद्ध स्टैटिक नॉइज़ (static noise)—जैसे पुराने टीवी स्क्रीन पर दिखने वाली बर्फ जैसी हलचल—से शुरुआत करके और धीरे-धीरे उसे साफ करके एक स्पष्ट तस्वीर उभरने तक काम करते हैं। वे इसमें अविश्वसनीय रूप से अच्छे हैं, लेकिन वे "ब्लैक बॉक्स" भी हैं। हम जानते हैं कि वे काम करते हैं, लेकिन हमें वास्तव में यह नहीं पता कि उनके भीतर के लाखों छोटे डिजिटल न्यूरॉन्स यह कैसे तय करते हैं कि एक कुत्ता या एक चेहरा कैसा दिखना चाहिए। बड़ा सवाल यह है: क्या मस्तिष्क और ये AI मॉडल दृष्टि की पहेली को सुलझाने के लिए एक ही गुप्त तरकीबों का उपयोग कर रहे हैं? यदि हम उन नियमों को समझ सकें जिनका AI पालन कर रहा है, तो शायद हम अंततः यह समझ पाएंगे कि हमारा अपना मस्तिष्क कैसे काम करता है।
पेपर का बड़ा विचार: एक बड़े मस्तिष्क वाला एक सरल मॉडल
यह पेपर एक नया, सरल मॉडल पेश करता है जो हमारे मस्तिष्क के देखने के तरीके और AI द्वारा चित्र बनाने के तरीके के बीच के अंतर को पाटने की कोशिश करता है। लेखकों ने, जो UC बर्कले और अन्य संस्थानों के शोधकर्ताओं की एक टीम है, एक कंप्यूटर प्रोग्राम बनाया जो प्राथमिक विजुअल कॉर्टेक्स (V1) की नकल करता है, जो मस्तिष्क में दृश्य जानकारी के लिए पहला पड़ाव है। एक विशाल, जटिल डीप लर्निंग नेटवर्क का उपयोग करने के बजाय जिसे पढ़ना असंभव है, उन्होंने स्पार्स कोडिंग (sparse coding) नामक अवधारणा पर आधारित एक "मिनिमल" मॉडल बनाया।
स्पार्स कोडिंग को एक ऐसी पहेली की तरह समझें जहाँ आप एक तस्वीर बनाने के लिए केवल कुछ विशिष्ट टुकड़ों का उपयोग करते हैं। मस्तिष्क में, इसका अर्थ है कि किसी छवि को दर्शाने के लिए किसी भी समय केवल कुछ ही न्यूरॉन्स सक्रिय (fire) होते हैं। लेखकों ने इस विचार को लिया और इसमें एक मोड़ जोड़ा: उन्होंने न्यूरॉन्स को एक विशिष्ट तरीके से एक-दूसरे से बात करने दी। मानक मॉडलों में, न्यूरॉन्स को अक्सर स्वतंत्र कार्यकर्ता माना जाता है। लेकिन इस नए मॉडल में, लेखकों ने न्यूरॉन्स को एक "सोशल नेटवर्क" (इंटरैक्शन मैट्रिक्स) दिया जो उन्हें एक-दूसरे को प्रभावित करने की अनुमति देता है। यह मॉडल को यह सीखने में मदद करता है कि यदि छवि के एक हिस्से में एक रेखा ऊपर की ओर जा रही है, तो अगला हिस्सा उस रेखा को जारी रखने की संभावना रखता है, भले ही छवि शोरपूर्ण या टूटी हुई हो।
उन्होंने क्या पाया: मस्तिष्क का "सोशल नेटवर्क"
जब शोधकर्ताओं ने इस मॉडल को प्राकृतिक छवियों (जैसे परिदृश्य और वस्तुओं की तस्वीरें) पर प्रशिक्षित किया, तो कुछ दिलचस्प हुआ। मॉडल ने जो "सोशल नेटवर्क" सीखा, वह बिल्कुल वास्तविक मानव मस्तिष्क में पाए जाने वाले भौतिक कनेक्शनों जैसा दिखता है। विशेष रूप से, मॉडल ने उन न्यूरॉन्स के बीच मजबूत संबंध विकसित किए जो समान कोणों के प्रति ट्यून किए गए थे और एक पंक्ति में व्यवस्थित थे। इसे कोलीनियर फैसिलिटेशन (collinear facilitation) के रूप में जाना जाता है।
वास्तविक दुनिया में, यही कारण है कि आप घास के बीच से रेंगते हुए सांप को आसानी से देख पाते हैं, भले ही उसके कुछ हिस्से छिपे हों। आपका मस्तिष्क बिंदुओं को जोड़ देता है। पेपर दिखाता है कि यह मॉडल भी ऐसा ही कर सकता है। जब उन्होंने इसे एक टूटी हुई, छिपी हुई कंटूर (जैसे एक रेखा जो बादल के पीछे गायब हो जाती है) वाली तस्वीर दिखाई, तो मॉडल ने केवल तुक्का नहीं लगाया। इसने अपने सीखे हुए कनेक्शनों का उपयोग करके गायब रेखा को "भरने" के लिए किया, जिससे एक चिकना, निरंतर वक्र (curve) बन गया। इसका प्रदर्शन विशाल, जटिल AI मॉडलों के लगभग बराबर था, लेकिन एक बड़े लाभ के साथ: क्योंकि उनका मॉडल सरल है, शोधकर्ता वास्तव में इसके अंदर देख सकते थे कि यह कैसे काम करता है।
सफलता का रहस्य: AI कैसे "सोचता" है
पेपर की सबसे रोमांचक खोजों में से एक यह है कि मॉडल "भरने" (filling in) की प्रक्रिया को कैसे संभालता है। लेखकों ने गणित को तोड़कर दिखाया कि मॉडल केवल अनुमान नहीं लगाता; यह एक तालाब में लहर की तरह गतिविधि को फैलाता है। जब एक न्यूरॉन एक रेखा के हिस्से का पता लगाता है, तो वह अपने पड़ोसियों को संकेत भेजता है। यदि वे पड़ोसी भी सक्रिय और संरेखित (aligned) हैं, तो संकेत मजबूत हो जाता है, जिससे यह विचार पुख्ता होता है कि वहां एक रेखा मौजूद है। यदि पड़ोसी गलत संरेखित या निष्क्रिय हैं, तो संकेत कट जाता है।
पेपर सुझाव देता है कि यह प्रक्रिया एक "पदानुक्रम" (hierarchy) बनाती है, भले ही मॉडल में केवल एक ही परत हो। मॉडल के लगभग 30% न्यूरॉन्स ने प्रत्यक्ष दृश्य इनपुट से पूरी तरह से अलग होने का कौशल सीखा। ये "अलग हुए न्यूरॉन्स" (detached neurons) एक दूसरी, छिपी हुई परत की तरह कार्य करते हैं जो बड़ी तस्वीर को समझने में मदद करती है। वे पिक्सेल को नहीं देखते; इसके बजाय, वे वैश्विक नियमों को लागू करने में मदद करते हैं, जैसे कि यह सुनिश्चित करना कि चेहरे पर दोनों आँखें एक-दूसरे के सापेक्ष सही जगह पर हों। यह समझाता है कि कैसे मॉडल एक पूरा नया चेहरा बना सकता है जो वास्तविक दिखता है, भले ही उसने वह सटीक चेहरा पहले कभी न देखा हो। यह याद रखना नहीं है; यह चेहरे की ज्यामिति को समझना है।
यह क्यों मायने रखता है: AI से जीव विज्ञान तक
पेपर सुझाव देता है कि आधुनिक AI डिफ्यूजन मॉडलों का जटिल, रहस्यमय व्यवहार वास्तव में हमारे विजुअल कॉर्टेक्स में पाए जाने वाले उन्हीं सरल, जैविक सिद्धांतों द्वारा संचालित हो सकता है। डीप लर्निंग का "ब्लैक बॉक्स" केवल उन सरल, रिकरेंट सर्किट्स का एक बहुत ही जटिल संस्करण हो सकता है जिन्हें लेखकों ने बनाया है।
यह साबित करके कि एक सरल, व्याख्या योग्य मॉडल विशाल AI सिस्टम के प्रदर्शन का मुकाबला कर सकता है, लेखक मस्तिष्क का अध्ययन करने का एक नया तरीका प्रदान करते हैं। वे प्रस्ताव देते हैं कि दृश्य प्रणाली इन विशिष्ट कनेक्शनों का उपयोग अस्पष्टता को दूर करने के लिए करती है, जिससे एक शोरपूर्ण, भ्रमित करने वाली दुनिया एक स्पष्ट, सुसंगत तस्वीर में बदल जाती है। यह केवल एक सिद्धांत नहीं है; मॉडल के भविष्यवाणियां कि न्यूरॉन्स विभिन्न प्रकार के शोर के प्रति कैसे प्रतिक्रिया करते हैं, वास्तविक जैविक मस्तिष्क में हाल के प्रयोगों के अनुरूप हैं।
संक्षेप में, यह पेपर सुझाव देता है कि देखने और कला बनाने का रहस्य एक ही हो सकता है: नियमों का एक सरल सेट जो स्थानीय सुरागों को जोड़ने और एक वैश्विक कहानी बनाने की अनुमति देता है। चाहे वह आपके मस्तिष्क में एक न्यूरॉन हो या AI में एक डिजिटल वेट (weight), लक्ष्य अराजकता में पैटर्न खोजना है। और अब, इस मॉडल की मदद से, हमारे पास इस बात का बहुत स्पष्ट मानचित्र है कि वह पैटर्न कैसे उभरता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।