Extremely coarse learning objectives induce human-aligned representations in AI vision models
यह अध्ययन प्रदर्शित करता है कि एआई विजन मॉडलों को अत्यंत व्यापक शिक्षण उद्देश्यों, जैसे कि केवल आठ व्यापक श्रेणियों के बीच अंतर करने, के साथ प्रशिक्षित करने से ऐसे आंतरिक निरूपण प्राप्त होते हैं जो सूक्ष्म-स्तरीय या स्व-पर्यवेक्षित कार्यों पर प्रशिक्षित मॉडलों की तुलना में मानव तंत्रिका प्रतिक्रियाओं और संवेदी निर्णयों के साथ अधिक निकटता से संरेखित होते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
द दशकों से, वैज्ञानिक यह समझने की कोशिश कर रहे हैं कि मानव मस्तिष्क प्रकाश के सैलाब को दुनिया की एक स्पष्ट तस्वीर में कैसे बदल देता है। उन्हें लंबे समय से संदेह था कि इसका उत्तर हमारे दृश्य तंत्र (विजुअल सिस्टम) द्वारा सूचनाओं को व्यवस्थित करने के तरीके में निहित है, जो प्रकृति की अव्यवस्था को "जानवर", "उपकरण" या "वाहन" जैसी सुव्यवस्थित श्रेणियों में वर्गीकृत करता है। इन विचारों का परीक्षण करने के लिए, शोधकर्ताओं ने कृत्रिम बुद्धिमत्ता (AI) प्रणालियाँ बनाई हैं जो मस्तिष्क की संरचना की नकल करती हैं, और उन्हें हजारों विशिष्ट वस्तुओं को पहचानने के लिए प्रशिक्षित किया है। ये डिजिटल मस्तिष्क शक्तिशाली उपकरण बन गए हैं, लेकिन एक अनसुलझा प्रश्न बना हुआ था: क्या मानव जैसा विजन विकसित करने के लिए मस्तिष्क को वास्तव में इतने विशाल संख्या में विशिष्ट लेबल सीखने की आवश्यकता है? शायद इंसान की तरह देखने का रहस्य वस्तुओं के एक विशाल विश्वकोश को याद करने में नहीं, बल्कि दुनिया को छाँटने के एक बहुत सरल, व्यापक तरीके को सीखने में है।
जॉन्स हॉपकिन्स विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस संभावना का परीक्षण करने के लिए मानक एआई प्रशिक्षण की जटिलता को हटाकर इस पर काम किया। छवियों की एक हजार अलग-अलग श्रेणियों के बीच अंतर करना सिखाने के बजाय, जो कि एक सामान्य अभ्यास है, उन्होंने अपने कृत्रिम नेटवर्क को उन्हीं छवियों को कुछ बहुत ही व्यापक समूहों में वर्गीकृत करना सिखाया। उन्होंने इन समूहों के लिए मानव-निर्मित लेबल का उपयोग नहीं किया; इसके बजाय, उन्होंने कंप्यूटर को डेटा के भीतर अपने स्वयं के प्राकृतिक विभाजन खोजने दिए, जिससे ऐसी श्रेणियाँ बनीं जो शायद "जीवित चीजों" को "मशीनों" से या "इनडोर दृश्यों" को "आउटडोर दृश्यों" से अलग कर सकें। फिर उन्होंने सैकड़ों ऐसे नेटवर्क को प्रशिक्षित किया, जिसमें समूहों की संख्या दो से लेकर साठ-चौसठ तक भिन्न थी, और तुलना की कि कैसे परिणामी डिजिटल मस्तिष्क वास्तविक मानव मस्तिष्क की गतिविधि और मानव पर्यवेक्षकों के व्यवहार से मेल खाते हैं।
परिणाम आश्चर्यजनक थे। शोधकर्ताओं ने पाया कि इन अत्यंत सरल, मोटे (कोर्स) श्रेणियों पर प्रशिक्षित नेटवर्क ने दृश्य जगत के आंतरिक मानचित्र विकसित किए जो मानव मस्तिष्क की गतिविधि से मेल खाने में उतने ही अच्छे, और अक्सर एक हजार श्रेणियों वाले नेटवर्क से भी बेहतर थे। जब उन्होंने यह मापा कि ये कृत्रिम मस्तिष्क मानव दृश्य वल्कुट (विजुअल कॉर्टेक्स) के स्कैन और मैकाक बंदरों के मस्तिष्क की रिकॉर्डिंग के साथ कितनी अच्छी तरह संरेखित होते हैं, तो केवल आठ व्यापक समूहों पर प्रशिक्षित मॉडल सबसे जटिल मॉडलों के बराबर प्रदर्शन करते पाए गए। इससे भी अधिक आश्चर्यजनक बात यह थी कि इन सरल नेटवर्कों ने वस्तुओं के बीच समानता के बारे में मानवीय निर्णयों को आज उपलब्ध किसी भी अन्य मॉडल की तुलना में बेहतर तरीके से समझा, जिसमें सबसे उन्नत कृत्रिम बुद्धिमत्ता प्रणाली भी शामिल है।
यह खोज इस प्रचलित विचार को चुनौती देती है कि मानव जैसा दिखने वाली मशीन बनाने के लिए, उसे विशिष्ट वस्तुओं के नामों की एक विशाल, विस्तृत सूची पर प्रशिक्षित किया जाना चाहिए। अध्ययन बताता है कि मानव दृश्य प्रणाली को दुनिया की परिष्कृत समझ विकसित करने के लिए एक सूक्ष्म, हजार-स्तरीय वर्गीकरण कार्य की आवश्यकता नहीं हो सकती है। इसके बजाय, छवियों को व्यापक, अर्थपूर्ण समूहों में वर्गीकृत करने की क्षमता एक ऐसा दृश्य प्रतिनिधित्व उत्पन्न करने के लिए पर्याप्त प्रतीत होती है जो हमारे अपने दृष्टिकोण को प्रतिबिंबित करता है। शोधकर्ताओं ने प्रदर्शित किया कि यह प्रभाव विभिन्न प्रकार के न्यूरल नेटवर्क आर्किटेक्चर, पुराने, सरल डिजाइनों से लेकर आधुनिक, जटिल प्रणालियों तक, में सत्य है, और यह तब भी काम करता है जब प्रशिक्षण डेटा सीमित हो।
टीम ने यह भी पता लगाया कि क्या इन व्यापक श्रेणियों को बनाने का विशिष्ट तरीका मायने रखता है। उन्होंने पाया कि परिणाम तब भी समान रहे चाहे श्रेणियाँ छवियों के सांख्यिकीय पैटर्न से प्राप्त की गई हों या "प्राकृतिक बनाम कृत्रिम" या "छोटा बनाम बड़ा" जैसे स्पष्ट, मानव-समझने योग्य अवधारणाओं द्वारा परिभाषित की गई हों। यह इंगित करता है कि मुख्य कारक सीखने के लक्ष्य की व्यापकता (कोर्सनेस) है, न कि उपयोग किए गए विशिष्ट लेबल। अध्ययन ने आगे दिखाया कि इन मोटे तौर पर प्रशिक्षित नेटवर्कों ने केवल एक जटिल नेटवर्क द्वारा सीखे गए संस्करण का सरलीकृत रूप नहीं सीखा; बल्कि, उन्होंने दृश्य सूचना को व्यवस्थित करने का एक मौलिक रूप से भिन्न तरीका विकसित किया जो मानवीय धारणा के साथ अधिक निकटता से मेल खाता था।
यह दिखाते हुए कि एक आश्चर्यजनक रूप से सरल शिक्षण उद्देश्य मानव-संरेखित विजन उत्पन्न कर सकता है, यह कार्य हमारी समझ को पुनर्गठित करता है कि एक मशीन को देखने के लिए क्या आवश्यक है। यह सुझाव देता है कि ऐसी कृत्रिम बुद्धिमत्ता का मार्ग जो वास्तव में मानव धारणा को प्रतिबिंबित करती है, उसे अधिक डेटा या अधिक जटिल कार्यों में खिलाने में नहीं, बल्कि उसे दुनिया को व्यापक, अधिक मौलिक संदर्भों में देखने के लिए सिखाने में निहित है। ये निष्कर्ष एआई सिस्टम बनाने के लिए एक नया मार्ग खोलते हैं जो न केवल शक्तिशाली हैं, बल्कि वास्तव में मानव अनुभव के दृश्य संगठन के साथ संरेखित भी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।