LaVCa: LLM-assisted Visual Cortex Captioning
यह शोध पत्र LaVCa का प्रस्ताव करता है, जो एक नवीन डेटा-संचालित दृष्टिकोण है जो छवियों के लिए प्राकृतिक-भाषा विवरण (कैप्शन) उत्पन्न करने हेतु लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे मानव दृश्य वल्कुट (विजुअल कॉर्टेक्स) की वोक्सेल चयनात्मकता (वोक्सेल सिलेक्टिविटी) की अधिक सटीक और विस्तृत व्याख्या प्रदान होती है और मौजूदा डीप न्यूरल नेटवर्क-आधारित विधियों की तुलना में दृश्य वल्कुट के भीतर सूक्ष्म कार्यात्मक विभेदन को प्रकट किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका मस्तिष्क एक विशाल, हलचल भरी लाइब्रेरी है। इस लाइब्रेरी के भीतर, लाखों छोटे, विशिष्ट लाइब्रेरियन (जिन्हें voxels कहा जाता है) अपनी मेजों पर बैठे हैं। प्रत्येक लाइब्रेरियन एक विशिष्ट प्रकार की जानकारी के लिए जिम्मेदार है। कोई केवल "लाल चीजों" की परवाह करता है, कोई केवल "मुस्कुराते चेहरों" की, और कोई केवल "बारिश में साइकिल चलाने" की।
द दशकों से, वैज्ञानिक यह पता लगाने की कोशिश कर रहे हैं कि प्रत्येक लाइब्रेरियन क्या देख रहा है। उन्होंने इसके लिए दो मुख्य तरीकों का उपयोग किया है:
- पुराना तरीका: वे लाइब्रेरियन को तस्वीरें दिखाते थे और पूछते थे, "क्या आपको यह पसंद आया?" और फिर एक साधारण चेकलिस्ट के आधार पर उनके काम का अनुमान लगाते थे (जैसे, "हाँ, वे चेहरों को पसंद करते हैं")। यह सटीक था लेकिन बहुत ही सतही था, जैसे किसी जटिल पेंटिंग को केवल "एक चित्र" कहकर वर्णित करना।
- "ब्लैक बॉक्स" वाला तरीका: उन्होंने लाइब्रेरियन की प्रतिक्रियाओं की भविष्यवाणी करने के लिए सुपर-जटिल AI का उपयोग करना शुरू किया। हालांकि यह बहुत सटीक था, लेकिन यह AI एक "ब्लैक बॉक्स" था। यह प्रतिक्रिया की भविष्यवाणी तो पूरी तरह से कर सकता था, लेकिन यह मानवीय भाषा में यह नहीं समझा सकता था कि ऐसा क्यों हुआ। यह एक अत्यंत बुद्धिमान अनुवादक की तरह था जो ऐसी भाषा बोलता है जिसे कोई समझ नहीं पाता।
LaVCa से मिलिए (नया तरीका)
इस शोध पत्र के लेखकों ने, जो ICLR 2026 में प्रकाशित हुआ है, LaVCa (LLM-असिस्टेड विजुअल कॉर्टेक्स कैपशनिंग) नामक एक नया टूल पेश किया है। LaVCa को एक सुपर-स्मार्ट, रचनात्मक पत्रकार के रूप में सोचें जिसे इन मस्तिष्क लाइब्रेरियन का साक्षात्कार लेने के लिए काम पर रखा गया है।
LaVCa इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "पसंदीदा फोटो" की खोज
सबसे पहले, LaVCa एक विशिष्ट लाइब्रेरियन (voxel) को देखता है और पूछता है: "दुनिया की उन शीर्ष 50 तस्वीरों में से कौन सी हैं जो आपको सबसे अधिक उत्साहित करती हैं?"
यह लाखों छवियों को स्कैन करने के लिए एक शक्तिशाली AI का उपयोग करता है और उन तस्वीरों को ढूंढ निकालता है जो उस विशिष्ट लाइब्रेरियन की मेज को सबसे अधिक रोशन करती हैं।
2. "फोटो विवरण" चरण
इसके बाद, LaVCa इन 50 पसंदीदा तस्वीरों को एक मल्टीमॉडल AI (एक रोबोट जो देख और बोल सकता है) को दिखाता है। रोबोट प्रत्येक फोटो का विस्तार से वर्णन करता है।
- फोटो 1: "एक खेत में दौड़ता हुआ गोल्डन रिट्रीवर।"
- फोटो 2: "एक बच्चे के साथ खेलता हुआ कुत्ता।"
- फोटो 3: "गलीचे पर सोता हुआ एक पिल्ला।"
3. "कीवर्ड डिटेक्टिव" चरण
यहीं पर LaVCa चतुर हो जाता है। केवल विवरणों को पढ़ने के बजाय, यह एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है—जो ChatGPT का एक बहुत ही उन्नत संस्करण है—एक जासूस के रूप में कार्य करने के लिए। LLM उन सभी 50 विवरणों को देखता है और पूछता है: "यहाँ सामान्य सूत्र क्या है?"
यह मुख्य अवधारणाओं को निकालता है: "कुत्ता," "दौड़ना," "बच्चा," "खेलना," "सोना।"
4. "अंतिम कहानी" चरण
अंत में, LLM उन कीवर्ड्स को लेता है और उन्हें एक एकल, सुंदर, प्राकृतिक वाक्य में बुनता है जो पूरी तरह से सारांशित करता है कि उस लाइब्रेरियन को क्या पसंद है।
- परिणाम: "यह लाइब्रेरियन बच्चों के साथ कुत्तों की परस्पर क्रिया वाली छवियों को पसंद करता है, चाहे वे खेल रहे हों या सो रहे हों।"
यह एक बड़ी बात क्यों है?
1. यह पुराने तरीकों की तुलना में अधिक सटीक है
शोध पत्र दिखाता है कि LaVCa के विवरण पिछले तरीकों (जैसे BrainSCUBA) की तुलना में यह भविष्यवाणी करने में बहुत बेहतर हैं कि मस्तिष्क आगे क्या करेगा। यह मौसम के पूर्वानुमान के बीच के अंतर जैसा है जो कहता है "शायद बारिश हो सकती है" बनाम वह जो कहता है "दोपहर 4 बजे भारी गरज के साथ बारिश होने की 90% संभावना है।" LaVCa विस्तृत पूर्वानुमान देता है।
2. यह छिपी हुई गहराई को प्रकट करता है
वैज्ञानिक पहले सोचते थे कि मस्तिष्क के कुछ हिस्से सरल होते हैं। उदाहरण के लिए, "फेस एरिया" (OFA) के बारे में सोचा जाता था कि इसे केवल "चेहरे" की परवाह होती है।
लेकिन LaVCा ने पाया कि ये लाइब्रेरियन वास्तव में बहुत चूजी (picky) हैं! कुछ केवल मुस्कुराते चेहरों की परवाह करते हैं, अन्य चेहरे वाले जानवरों की, और अन्य बारिश में चेहरों की। LaVCa ने उजागर किया कि "साधारण" मस्तिष्क क्षेत्र भी वास्तव में अविश्वसनीय रूप से जटिल और विविध हैं।
3. यह मानव भाषा बोलता है
सबसे अच्छी बात? इसका आउटपुट नंबरों या कोड की सूची नहीं है। यह एक वाक्य है जिसे आप पढ़ सकते हैं और समझ सकते हैं। यह आपके मस्तिष्क के रहस्यमय विद्युत संकेतों को एक कहानी में बदल देता है।
निष्कर्ष
LaVCa आपके मस्तिष्क के मौन लाइब्रेरियन को आवाज देने जैसा है। केवल यह अनुमान लगाने के बजाय कि वे क्या सोच रहे हैं, अब हम उनसे पूछ सकते हैं, "आप क्या देखते हैं?" और एक स्पष्ट, विस्तृत और आश्चर्यजनक रूप से काव्यमय उत्तर प्राप्त कर सकते हैं। यह हमें समझने में मदद करता है कि मनुष्य दुनिया को कैसे देखते हैं और भविष्य में बेहतर, अधिक मानव-समान AI बनाने में भी मदद कर सकता है।
संक्षेप में: LaVCa मस्तिष्क के बिखरे हुए, जटिल संकेतों को लेता है, उन तस्वीरों को ढूंढता है जो उन्हें ट्रिगर करती हैं, और एक सुपर-स्मार्ट AI का उपयोग करके उस हिस्से का सारांश लिखने के लिए एक आदर्श, एक-वाक्य का विवरण तैयार करता है जिसे वह हिस्सा पसंद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।