← नवीनतम पेपर
💻 computer science

AAMIL-Net: Prototype-Calibrated Activity Guided Attention Fusion for Multi-Instance Learning

यह शोधपत्र AAMIL-Net प्रस्तुत करता है, जो एक नवीन मल्टीपल इंस्टेंस लर्निंग फ्रेमवर्क है जो प्रोटोटाइप-कैलिब्रेटेड एक्टिविटी स्कोरिंग, एडेप्टिव एम्बिग्युटी मार्जिन्स और कॉन्ट्रास्टिव इंस्टेंस रेगुलराइजेशन के माध्यम से अटेंशन-कॉन्फिडेंस मिसअलाइनमेंट को हल करता है, और बाहरी प्रीट्रेनिंग के बिना विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Chen Rui, Jie Li, Fang Fang

प्रकाशित 2026-09-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chen Rui, Jie Li, Fang Fang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक निरंतर चुनौती है जिसे 'वीकली सुपरवाइज्ड लर्निंग' (weakly supervised learning) के रूप में जाना जाता है। कल्पना कीजिए कि एक डॉक्टर ऊतक के नमूने (tissue sample) की एक विशाल, उच्च-रिज़ॉल्यूशन वाली तस्वीर से बीमारी का निदान करने की कोशिश कर रहा है। वह तस्वीर इतनी बड़ी है कि उसमें हजारों छोटे क्षेत्र शामिल हैं, लेकिन डॉक्टर के पास पूरी छवि के लिए केवल एक ही लेबल है: "बीमार" या "स्वस्थ"। उन्हें यह नहीं पता कि छवि के कौन से विशिष्ट छोटे क्षेत्र बीमारी के दोषी हैं। यह 'मल्टीपल इंस्टेंस लर्निंग' (Multiple Instance Learning) की मूल समस्या है। कंप्यूटर को यह समझना होगा कि पूरी तस्वीर के अंतिम निर्णय के आधार पर छवि के कौन से छोटे हिस्से अपराधी हैं।

वर्षों से, शोधकर्ता इस समस्या को हल करने के लिए 'अटेंशन' (attention) नामक पद्धति पर भरोसा करते रहे हैं। कंप्यूटर यह सीखने की कोशिश करता है कि छवि के किन हिस्सों पर "ध्यान देना" सबसे महत्वपूर्ण लगता है। हालांकि, इस दृष्टिकोण में एक छिपा हुआ दोष है। कंप्यूटर अक्सर छवि के सबसे दृश्य रूप से केंद्रीय या संरचनात्मक रूप से स्पष्ट हिस्सों से विचलित हो जाता है, भले ही वे हिस्से निदान के लिए अप्रासंगिक हों। वह ऊतक स्लाइड के केंद्र पर ध्यान केंद्रित कर सकता है क्योंकि वह भाग बहुत व्यस्त (busy) दिखता है, जबकि वह बीमारी के उन छोटे, बिखरे हुए पैच को मिस कर सकता है जो वास्तव में मुख्य कुंजी हैं। इससे 'फॉल्स अलार्म' (false alarms) की स्थिति पैदा होती है, जहाँ कंप्यूटर एक स्वस्थ स्लाइड को केवल इसलिए बीमार समझ लेता है क्योंकि उसने गलत जगहों को देखा था।

हेफेई यूनिवर्सिटी के शोधकर्ताओं ने इस विशिष्ट समस्या को ठीक करने के लिए AAMIL-Net नामक एक नया सिस्टम विकसित किया है। उनका कार्य, जो एक शोध लेख में प्रकाशित हुआ है, एक ऐसा ढांचा पेश करता है जो कंप्यूटर को यह पहचानने में मदद करता है कि क्या महत्वपूर्ण दिखता है और वास्तव में क्या महत्वपूर्ण है। केवल छवि की संरचना को देखने के बजाय, यह प्रणाली प्रत्येक छोटे टुकड़े की "सक्रियता" (activity) को मापने का प्रयास करती है। यह एक गहरा प्रश्न पूछती है: क्या यह विशिष्ट पैच वास्तव में बीमारी की श्रेणी से संबंधित है, या यह केवल एक शोर भरा बैकग्राउंड विवरण है जो संयोग से केंद्र में है?

शोधकर्ताओं ने अपने समाधान को तीन मुख्य विचारों के इर्द-गिर्द बनाया है जो कंप्यूटर के फोकस को निर्देशित करने के लिए मिलकर काम करते हैं। सबसे पहले, उन्होंने एक ऐसी प्रणाली बनाई जो केवल एक छवि से नहीं, बल्कि डेटा के पूरे संग्रह से सीखती है। उन्होंने एक मानसिक "प्रोटोटाइप" या एक मानक उदाहरण स्थापित किया कि वास्तव में एक बीमार पैच और एक स्वस्थ पैच कैसा दिखता है, जो हजारों उदाहरणों पर आधारित है। जब कंप्यूटर एक नई छवि का परीक्षण करता है, तो वह हर छोटे पैच की इन वैश्विक मानकों के साथ तुलना करता है। यह कंप्यूटर को उस पैच से धोखा खाने से रोकता है जो व्यस्त दिखता है लेकिन बीमारी की वास्तविक विशेषताओं से मेल नहीं खाता।

दूसना, यह प्रणाली धैर्यवान और अनुकूलनीय होने के लिए डिज़ाइन की गई है। सीखने के शुरुआती चरणों में, कंप्यूटर को अनिश्चित होने की अनुमति दी जाती है, जिससे वह विभिन्न संभावनाओं को खोजने के लिए एक विस्तृत जाल फैला सके। जैसे-जैसे यह अधिक सीखता है, प्रणाली अपने मानदंडों को कड़ा करती जाती है, जिससे यह अधिक सटीक हो जाती है कि क्या मैच माना जाए। यह कंप्यूटर को प्रशिक्षण प्रक्रिया के बहुत जल्दी जल्दबाजी में निर्णय लेने से रोकता है। तीसरा, यह प्रणाली अपनी आंतरिक स्मृति में "स्वस्थ" उदाहरणों को "बीमार" उदाहरणों से दूर धकेलने के लिए एक विशेष तकनीक का उपयोग करती है। इन दोनों समूहों को अलग रखने के लिए मजबूर करके, कंप्यूटर उनके बीच अंतर करने में बहुत बेहतर हो जाता है, भले ही साक्ष्य बहुत धुंधले हों।

शोधकर्ताओं ने इस नए दृष्टिकोण का परीक्षण कई कठिन कार्यों पर किया, जिसमें सक्रिय दवा अणुओं की पहचान करना, लोमड़ियों और बाघों जैसे जानवरों की छवियों को एनोटेट करना और समाचार लेखों का वर्गीकरण करना शामिल है। चिकित्सा क्षेत्र में, उन्होंने इसे CAMELYON16 डेटासेट पर लागू किया, जिसमें लिम्फ नोड्स की पूरी-स्लाइड छवियां शामिल हैं जहाँ कैंसरयुक्त ऊतक कुल क्षेत्र के दस प्रतिशत से भी कम स्थान घेर सकते हैं। यह एक चरम परीक्षण है, क्योंकि कंप्यूटर को घास के ढेर में सुई ढूंढनी है। परिणामों ने दिखाया कि AAMIL-Net ने उच्च स्तर की सटीकता प्राप्त की, और इसने पिछले तरीकों की तुलना में कैंसरयुक्त स्लाइड्स को अधिक बार सही ढंग से पहचाना। इसने तेजी से भी सीखा, और बीस से चालीस चक्रों के बजाय पंद्रह से कम प्रशिक्षण चक्रों में ही अपने शिखर प्रदर्शन तक पहुँच गया।

एक सबसे महत्वपूर्ण खोज यह थी कि इस प्रणाली ने चिकित्सा छवियों के विशाल डेटा को कैसे संभाला। पारंपरिक पद्धतियां अक्सर इन छवियों के विशाल आकार के साथ संघर्ष करती हैं, जिन्हें कंप्यूटर मेमोरी की भारी मात्रा की आवश्यकता होती है। यह नया सिस्टम एक "स्पार्स" (sparse) अटेंशन मैकेनिज्म का उपयोग करता है, जिसका अर्थ है कि यह छवि पैच के बीच केवल सबसे प्रासंगिक कनेक्शनों को देखता है, न कि हर एक संभावित कनेक्शन को प्रोसेस करने की कोशिश करता है। इसने शोधकर्ताओं को सोलह गीगाबाइट मेमोरी वाले एकल ग्राफिक्स कार्ड पर मॉडल को प्रशिक्षित करने की अनुमति दी, जो कि पुराने, अधिक मेमोरी-खपत वाले सिस्टम के लिए असंभव कार्य होता।

यह अध्ययन पुष्टि करता है कि इन तीन तंत्रों—वैश्विक तुलना, अनुकूलनीय शिक्षण और श्रेणियों का सख्त पृथक्करण—को जोड़कर, कंप्यूटर उस भ्रम को दूर कर सकता है जिसने पिछले मॉडलों को परेशान किया है। यह सफलतापूर्वक कंप्यूटर को छवि के संरचनात्मक रूप से केंद्रीय लेकिन अप्रासंगिक हिस्सों द्वारा गुमराह होने से रोकता है। शोधकर्ताओं ने प्रदर्शित किया कि यह दृष्टिकोण टेक्स्ट से लेकर अणुओं और मेडिकल स्कैन तक विभिन्न प्रकार के डेटा पर काम करता है, जो यह सुझाव देता है कि "अटेंशन मिसअलाइनमेंट" (attention misalignment) की समस्या आर्टिफिशियल इंटेलिजेंस में एक सार्वभौमिक मुद्दा है जिसे सिस्टम को केवल दृश्य प्रमुखता के बजाय वास्तविक सक्रियता खोजने के लिए सिखाकर हल किया जा सकता है।

अंत में, यह कार्य आर्टिफिशियल इंटेलिजेंस को चिकित्सा जैसे महत्वपूर्ण क्षेत्रों में सहायता करने के लिए एक स्पष्ट मार्ग प्रदान करता है। कंप्यूटर को सही साक्ष्य पर ध्यान केंद्रित करने के लिए सुनिश्चित करके, न कि केवल सबसे स्पष्ट साक्ष्य पर, यह प्रणाली गलत सूचनाओं (false alarms) के जोखिम को कम करती है। यह विशेष रूप से पैथोलॉजी में महत्वपूर्ण है, जहाँ एक गलत निदान या एक गलत पॉजिटिव (false positive) के गंभीर परिणाम हो सकते हैं। शोधकर्ताओं ने पाया कि उनकी विधि ने न केवल सटीकता में सुधार किया, बल्कि प्रशिक्षण प्रक्रिया को भी अधिक कुशल बनाया, जिससे जटिल डेटा का विश्लेषण करने के लिए एक व्यावहारिक उपकरण मिलता है जहाँ उत्तर शोर के समुद्र के भीतर छिपा होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →