EVA: Bridging Performance and Human Alignment in Hard-Attention Vision Models for Image Classification
यह शोधपत्र EVA को प्रस्तुत करता है, जो एक तंत्रिका विज्ञान-प्रेरित (neuroscience-inspired) हार्ड-अटेंशन फ्रेमवर्क है जो वेरिएंस कंट्रोल और एडेप्टिव गेटिंग के माध्यम से वर्गीकरण सटीकता (classification accuracy) और मानव-समान स्कैनपाथ संरेखण (human-like scanpath alignment) के बीच स्पष्ट रूप से संतुलन बनाता है, और बिना गेज़ सुपरविजन (gaze supervision) के CIFAR-10 और COCO-Search18 जैसे डेटासेट्स पर श्रेष्ठ व्याख्यात्मकता (interpretability) प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अंधेरे कमरे में किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक टॉर्च है, लेकिन उसकी बैटरी कमजोर है, इसलिए आप एक बार में केवल एक छोटे से स्थान पर ही रोशनी डाल सकते हैं। आपको अगला कदम यह तय करने के लिए उठाना होगा कि आगे कहाँ देखना है, जो आपने अभी देखा है।
मानव दृष्टि (Human Vision) बिल्कुल इसी तरह काम करती है। हम पूरी दुनिया को एक साथ हाई डेफिनेशन में नहीं देखते। इसके बजाय, हमारी आँखें इधर-उधर घूमती हैं (सैकेड्स/saccades), दिलचस्प विवरणों पर ध्यान केंद्रित करती हैं (फिक्सेशन/fixations) और हमारे मस्तिष्क में एक तस्वीर बनाने के लिए इनका उपयोग करती हैं।
अब, एक रोबोट बनाने की कल्पना करें जो ऐसा ही कर सके। लंबे समय तक, वैज्ञानिकों ने ऐसे रोबोट बनाने की कोशिश की जो वस्तुओं को पहचानने में बहुत सटीक (super accurate) हों (जैसे कि "वह एक कुत्ता है!")। लेकिन उन्होंने इसे पूरी तस्वीर को एक साथ देखकर किया, जैसे कि एक सुपर-पावर्ड कैमरा।
समस्या यह है कि जब ये रोबोट सही उत्तर का अनुमान लगाने में बहुत अच्छे हो जाते हैं, तो वे मनुष्यों की तरह दिखना बंद कर देते हैं। वे शायद "कुत्ता" का सही अनुमान लगा लें, लेकिन वे कुत्ते के चेहरे के बजाय उसकी पूंछ या पीछे की घास को देख रहे होंगे। वे "ब्लैक बॉक्स" हैं—वे सही उत्तर तो देते हैं, लेकिन हमें यह नहीं पता होता कि उन्होंने कहाँ और क्यों देखा।
EVA का आगमन: "स्मार्ट डिटेक्टिव"
यह पेपर EVA नामक एक नए AI मॉडल का परिचय देता है। EVA को एक कैमरे के रूप में नहीं, बल्कि एक टॉर्च लिए हुए जासूस के रूप में सोचें।
EVA दो समस्याओं को एक साथ हल करने के लिए बनाया गया है:
- सटीक होना: इसे सही वस्तु का अनुमान लगाना चाहिए।
- मानव जैसा होना: इसे उसी तरह वस्तु को देखना चाहिए जैसे एक इंसान देखेगा (उदाहरण के लिए, कुत्ते के चेहरे को देखना, न कि घास को)।
आमतौर पर, यहाँ एक समझौता (trade-off) होता है। यदि आप जासूस को स्मार्ट बनाते हैं (सही अनुमान लगाने में बेहतर), तो वे देखना बंद कर देते हैं और केवल एक छोटे से सुराग के आधार पर अनुमान लगाते हैं। यदि आप उन्हें इंसान की तरह अधिक देखने के लिए बनाते हैं, तो वे गलतियाँ भी अधिक कर सकते हैं। लेखक इसे "एलाइनमेंट टैक्स" (Alignment Tax) कहते हैं—मानव जैसा दिखने के लिए चुकाई जाने वाली कीमत।
EVA कैसे काम करता है (इसका गुप्त सूत्र)
EVA तीन विशेष "मस्तिष्क भागों" के साथ बनाया गया है जो हमारे तंत्रिका तंत्र (nervous system) से प्रेरित हैं, लेकिन कंप्यूटर के लिए सरल बनाए गए हैं:
फोविया और पेरीफेरी (टॉर्च और धुंधलापन):
ठीक आपकी आँखों की तरह, EVA का एक तीक्ष्ण केंद्र (fovea) और एक धुंधला किनारा (periphery) है। यह एक बार में छवि के एक छोटे से तीक्ष्ण हिस्से को देखता है, साथ ही आसपास का एक धुंधला दृश्य भी देखता है। यह इसे पूरी तस्वीर देखने के लिए अपने "टॉर्च" को हिलाने के लिए मजबूर करता है।"अनिश्चितता मीटर" (विचलन नियंत्रण - Variance Control):
कल्पना कीजिए कि आप अपनी चाबियाँ ढूँढ रहे हैं। यदि आप बहुत पक्के तौर पर जानते हैं कि आपने उन्हें मेज पर देखा था, तो आप करीब से और स्थिर होकर देखते हैं। यदि आप अनिश्चित हैं ("क्या मैं उन्हें कार में छोड़ आया?"), तो आप हर कोने की जाँच करने के लिए इधर-उधर तेजी से देखने लगते हैं।
EVA में एक अंतर्निहित "अनिश्चितता मीटर" है। जब यह भ्रमित होता है, तो यह अपने "टॉर्च" को अधिक इधर-उधर घुमाता है (एक्सप्लोर करता है)। जब यह आश्वस्त होता है, तो यह अपनी दृष्टि को स्थिर कर लेता है। यह इसे एक जिज्ञासु मानव की तरह दिखाता है, न कि एक कठोर मशीन की तरह।"गेटकीपर" (अनुकूली गेटिंग - Adaptive Gating):
कल्पना कीजिए कि आप एक दोस्त से बात कर रहे हैं जो सुराग इकट्ठा कर रहा है। कभी-कभी, आपका दोस्त आपको एक नया सुराग देता है जो आपकी राय को पूरी तरह बदल देता है। कभी-कभी, वह एक ऐसा सुराग लाता है जिसका कोई महत्व नहीं होता।
EVA में एक "गेटकीपर" है जो यह तय करता है कि नई जानकारी को कितना महत्व दिया जाए। यदि नया दृश्य महत्वपूर्ण है, तो गेट चौड़ा खुल जाता है। यदि यह केवल शोर (noise) है, तो गेट बंद रहता है। यह EVA को यह सीखने के बीच संतुलन बनाने में मदद करता है कि नई चीजें कैसे सीखी जाएं और जो वह पहले से जानता है उस पर कैसे टिका रहे।
परिणाम: यह क्यों मायने रखता है
शोधकर्ताओं ने बिल्लियों, कुत्तों, कारों और अन्य चीजों की तस्वीरों पर EVA का परीक्षण किया। यहाँ उन्होंने जो पाया वह है:
- यह काम पूरा करता है: EVA पूरी छवि को देखने वाले "सुपर-कैमरा" जितना ही सही वस्तु का अनुमान लगाने में सक्षम है।
- यह हमारे जैसा दिखता है: जब आप किसी तस्वीर पर EVA की "आँखों" के घूमने को देखते हैं, तो यह एक ऐसे पथ का अनुसरण करता है जैसा कि एक इंसान देखेगा। यह कुत्ते के चेहरे, कार के पहियों आदि को देखता है।
- कोई धोखाधड़ी नहीं: आमतौर पर, रोबोट को इंसान की तरह दिखाने के लिए, आपको मनुष्यों द्वारा चीजों को देखने के हजारों वीडियो दिखाने होते हैं (गज़ सुपरविजन/gaze supervision)। EVA ने बिना कभी भी मानव नेत्र गति देखे, मानव की तरह देखना सीख लिया। इसने इसे केवल सही उत्तर पाने की कोशिश करके समझ लिया।
बड़ी तस्वीर
हमें इसकी परवाह क्यों है?
भविष्य में, हम बीमारियों का निदान करने में डॉक्टरों की मदद करने के लिए या यातायात में नेविगेट करने के लिए आत्म-चालित कारों (self-driving cars) के लिए AI का उपयोग कर सकते हैं। हमें इन AI सिस्टमों पर भरोसा करने की आवश्यकता है।
यदि एक AI कहता है, "यहाँ एक ट्यूमर है," लेकिन हम यह नहीं देख सकते कि वह ऐसा क्यों सोचता है, तो हम उस पर भरोसा नहीं कर सकते। लेकिन यदि AI, EVA की तरह है, तो हम उसकी "टॉर्च" को चलते हुए देख सकते हैं। हम देख सकते हैं, "ओह, इसने संदिग्ध स्थान को देखा, फिर ज़ूम किया, फिर आसपास के ऊतकों (tissue) को देखा। यह तर्कसंगत है!"
EVA इस अंतर को पाटता है। यह साबित करता है कि हमें एक स्मार्ट AI और एक मानव-समान AI के बीच चयन करने की आवश्यकता नहीं है। एक मानव की तरह "देखने" के लिए AI को डिजाइन करके, हमें एक ऐसा सिस्टम मिलता है जो न केवल सटीक है, बल्कि व्याख्या योग्य (interpretable), भरोसेमंद और सुरक्षित भी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।