← नवीनतम पेपर
🧬 biology

Extremely coarse learning objectives induce human-aligned representations in AI vision models

यह अध्ययन प्रदर्शित करता है कि एआई विजन मॉडलों को अत्यंत व्यापक शिक्षण उद्देश्यों, जैसे कि केवल आठ व्यापक श्रेणियों के बीच अंतर करने, के साथ प्रशिक्षित करने से ऐसे आंतरिक निरूपण प्राप्त होते हैं जो सूक्ष्म-स्तरीय या स्व-पर्यवेक्षित कार्यों पर प्रशिक्षित मॉडलों की तुलना में मानव तंत्रिका प्रतिक्रियाओं और संवेदी निर्णयों के साथ अधिक निकटता से संरेखित होते हैं।

मूल लेखक: Yash Mehta, Michael Bonner

प्रकाशित 2026-09-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Mehta, Michael Bonner

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

द दशकों से, वैज्ञानिक यह समझने की कोशिश कर रहे हैं कि मानव मस्तिष्क प्रकाश के सैलाब को दुनिया की एक स्पष्ट तस्वीर में कैसे बदल देता है। उन्हें लंबे समय से संदेह था कि इसका उत्तर हमारे दृश्य तंत्र (विजुअल सिस्टम) द्वारा सूचनाओं को व्यवस्थित करने के तरीके में निहित है, जो प्रकृति की अव्यवस्था को "जानवर", "उपकरण" या "वाहन" जैसी सुव्यवस्थित श्रेणियों में वर्गीकृत करता है। इन विचारों का परीक्षण करने के लिए, शोधकर्ताओं ने कृत्रिम बुद्धिमत्ता (AI) प्रणालियाँ बनाई हैं जो मस्तिष्क की संरचना की नकल करती हैं, और उन्हें हजारों विशिष्ट वस्तुओं को पहचानने के लिए प्रशिक्षित किया है। ये डिजिटल मस्तिष्क शक्तिशाली उपकरण बन गए हैं, लेकिन एक अनसुलझा प्रश्न बना हुआ था: क्या मानव जैसा विजन विकसित करने के लिए मस्तिष्क को वास्तव में इतने विशाल संख्या में विशिष्ट लेबल सीखने की आवश्यकता है? शायद इंसान की तरह देखने का रहस्य वस्तुओं के एक विशाल विश्वकोश को याद करने में नहीं, बल्कि दुनिया को छाँटने के एक बहुत सरल, व्यापक तरीके को सीखने में है।

जॉन्स हॉपकिन्स विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस संभावना का परीक्षण करने के लिए मानक एआई प्रशिक्षण की जटिलता को हटाकर इस पर काम किया। छवियों की एक हजार अलग-अलग श्रेणियों के बीच अंतर करना सिखाने के बजाय, जो कि एक सामान्य अभ्यास है, उन्होंने अपने कृत्रिम नेटवर्क को उन्हीं छवियों को कुछ बहुत ही व्यापक समूहों में वर्गीकृत करना सिखाया। उन्होंने इन समूहों के लिए मानव-निर्मित लेबल का उपयोग नहीं किया; इसके बजाय, उन्होंने कंप्यूटर को डेटा के भीतर अपने स्वयं के प्राकृतिक विभाजन खोजने दिए, जिससे ऐसी श्रेणियाँ बनीं जो शायद "जीवित चीजों" को "मशीनों" से या "इनडोर दृश्यों" को "आउटडोर दृश्यों" से अलग कर सकें। फिर उन्होंने सैकड़ों ऐसे नेटवर्क को प्रशिक्षित किया, जिसमें समूहों की संख्या दो से लेकर साठ-चौसठ तक भिन्न थी, और तुलना की कि कैसे परिणामी डिजिटल मस्तिष्क वास्तविक मानव मस्तिष्क की गतिविधि और मानव पर्यवेक्षकों के व्यवहार से मेल खाते हैं।

परिणाम आश्चर्यजनक थे। शोधकर्ताओं ने पाया कि इन अत्यंत सरल, मोटे (कोर्स) श्रेणियों पर प्रशिक्षित नेटवर्क ने दृश्य जगत के आंतरिक मानचित्र विकसित किए जो मानव मस्तिष्क की गतिविधि से मेल खाने में उतने ही अच्छे, और अक्सर एक हजार श्रेणियों वाले नेटवर्क से भी बेहतर थे। जब उन्होंने यह मापा कि ये कृत्रिम मस्तिष्क मानव दृश्य वल्कुट (विजुअल कॉर्टेक्स) के स्कैन और मैकाक बंदरों के मस्तिष्क की रिकॉर्डिंग के साथ कितनी अच्छी तरह संरेखित होते हैं, तो केवल आठ व्यापक समूहों पर प्रशिक्षित मॉडल सबसे जटिल मॉडलों के बराबर प्रदर्शन करते पाए गए। इससे भी अधिक आश्चर्यजनक बात यह थी कि इन सरल नेटवर्कों ने वस्तुओं के बीच समानता के बारे में मानवीय निर्णयों को आज उपलब्ध किसी भी अन्य मॉडल की तुलना में बेहतर तरीके से समझा, जिसमें सबसे उन्नत कृत्रिम बुद्धिमत्ता प्रणाली भी शामिल है।

यह खोज इस प्रचलित विचार को चुनौती देती है कि मानव जैसा दिखने वाली मशीन बनाने के लिए, उसे विशिष्ट वस्तुओं के नामों की एक विशाल, विस्तृत सूची पर प्रशिक्षित किया जाना चाहिए। अध्ययन बताता है कि मानव दृश्य प्रणाली को दुनिया की परिष्कृत समझ विकसित करने के लिए एक सूक्ष्म, हजार-स्तरीय वर्गीकरण कार्य की आवश्यकता नहीं हो सकती है। इसके बजाय, छवियों को व्यापक, अर्थपूर्ण समूहों में वर्गीकृत करने की क्षमता एक ऐसा दृश्य प्रतिनिधित्व उत्पन्न करने के लिए पर्याप्त प्रतीत होती है जो हमारे अपने दृष्टिकोण को प्रतिबिंबित करता है। शोधकर्ताओं ने प्रदर्शित किया कि यह प्रभाव विभिन्न प्रकार के न्यूरल नेटवर्क आर्किटेक्चर, पुराने, सरल डिजाइनों से लेकर आधुनिक, जटिल प्रणालियों तक, में सत्य है, और यह तब भी काम करता है जब प्रशिक्षण डेटा सीमित हो।

टीम ने यह भी पता लगाया कि क्या इन व्यापक श्रेणियों को बनाने का विशिष्ट तरीका मायने रखता है। उन्होंने पाया कि परिणाम तब भी समान रहे चाहे श्रेणियाँ छवियों के सांख्यिकीय पैटर्न से प्राप्त की गई हों या "प्राकृतिक बनाम कृत्रिम" या "छोटा बनाम बड़ा" जैसे स्पष्ट, मानव-समझने योग्य अवधारणाओं द्वारा परिभाषित की गई हों। यह इंगित करता है कि मुख्य कारक सीखने के लक्ष्य की व्यापकता (कोर्सनेस) है, न कि उपयोग किए गए विशिष्ट लेबल। अध्ययन ने आगे दिखाया कि इन मोटे तौर पर प्रशिक्षित नेटवर्कों ने केवल एक जटिल नेटवर्क द्वारा सीखे गए संस्करण का सरलीकृत रूप नहीं सीखा; बल्कि, उन्होंने दृश्य सूचना को व्यवस्थित करने का एक मौलिक रूप से भिन्न तरीका विकसित किया जो मानवीय धारणा के साथ अधिक निकटता से मेल खाता था।

यह दिखाते हुए कि एक आश्चर्यजनक रूप से सरल शिक्षण उद्देश्य मानव-संरेखित विजन उत्पन्न कर सकता है, यह कार्य हमारी समझ को पुनर्गठित करता है कि एक मशीन को देखने के लिए क्या आवश्यक है। यह सुझाव देता है कि ऐसी कृत्रिम बुद्धिमत्ता का मार्ग जो वास्तव में मानव धारणा को प्रतिबिंबित करती है, उसे अधिक डेटा या अधिक जटिल कार्यों में खिलाने में नहीं, बल्कि उसे दुनिया को व्यापक, अधिक मौलिक संदर्भों में देखने के लिए सिखाने में निहित है। ये निष्कर्ष एआई सिस्टम बनाने के लिए एक नया मार्ग खोलते हैं जो न केवल शक्तिशाली हैं, बल्कि वास्तव में मानव अनुभव के दृश्य संगठन के साथ संरेखित भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →