How to gain valuable insight from scarce data with Machine Learning: a post-hoc explanation tool to identify biases in biological images classification
यह अध्ययन प्रदर्शित करता है कि दुर्लभ जैविक इमेज डेटासेट पर SHAP जैसे पोस्ट-हॉक स्पष्टीकरण उपकरणों को लागू करने से छिपे हुए पूर्वाग्रहों का पता लगाया जा सकता है, जैसे कि मॉडल जैविक पैटर्न के बजाय व्यक्तिगत पशु विशेषताओं पर ओवरफिट हो रहे हैं, और साथ ही यह भी उजागर किया जा सकता है कि सीमित डेटा से वैध जैविक अंतर्दृष्टि निकालने के लिए कार्यों को कैसे पुनर्गठित किया जाए।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने वाले जासूस हैं: क्या आप एक ऐसे घाव के बीच अंतर बता सकते हैं जो पूरी तरह से ठीक हो रहा है (पुनर्जीवित हो रहा है) और एक ऐसे घाव के बीच जिसमें निशान (स्कार) बन रहा है?
जीव विज्ञान की दुनिया में, वैज्ञानिकों के पास एक शक्तिशाली नया उपकरण है: मशीन लर्निंग (ML)। मशीन लर्निंग को एक सुपर-स्मार्ट, अति-सतर्क इंटर्न की तरह समझें जो चूहों के ऊतकों (टिशू) की हजारों तस्वीरों को देख सकता है और किसी भी इंसान की तुलना में तेजी से पैटर्न पहचान सकता है।
हालाँकि, इसमें एक पेंच है। जीव विज्ञान में, ये तस्वीरें लेना महंगा, समय लेने वाला और नैतिक रूप से कठिन होता है। आप लाखों चूहों की लाखों तस्वीरें नहीं ले सकते। आपके पास केवल एक बहुत छोटा डेटासेट है—शायद केवल 28 चूहों की तस्वीरें।
यहाँ वह कहानी है कि क्या हुआ जब वैज्ञानिकों ने अपने इस सुपर-स्मार्ट इंटर्न को इस छोटे से डेटासेट पर इस्तेमाल करने की कोशिश की, और कैसे उन्होंने सच्चाई खोजने के लिए एक विशेष "टॉर्च" का उपयोग किया।
1. जाल: इंटर्न ने धोखाधड़ी की
वैज्ञानिकों ने अपने AI इंटर्न को कार्य दिया: "इन तस्वीरों को देखो और मुझे बताओ कि क्या यह चूहा निशान (स्कार) के साथ ठीक हो रहा है या पुनर्जीवित (रीजेनरेट) हो रहा है।"
इंटर्न ने ट्रेनिंग तस्वीरों का अध्ययन किया और परीक्षा में अव्वल आया। उसने 100% सही उत्तर दिए! वैज्ञानिक रोमांचित थे। लेकिन फिर, उन्होंने इंटर्न को नई तस्वीरें दिखाईं जो उन चूहों की थीं जिन्हें उसने पहले कभी नहीं देखा था।
इंटर्न बुरी तरह विफल रहा। वह हर बार गलत साबित हुआ।
क्यों?
ऐसा हुआ कि इंटर्न वास्तव में "निशान" बनाम "पुनर्जीवित होने" के बारे में सीख नहीं रहा था। वह धोखाधड़ी कर रहा था। उसने व्यक्तिगत चूहों को पहचानना सीख लिया था।
इसे ऐसे समझें: कल्पना करें कि आप एक बच्चे को "सेब" और "संतरे" के बीच अंतर करना सिखाने की कोशिश कर रहे हैं। लेकिन, संयोग से, जब भी आप एक सेब दिखाते, तो उसे बॉब ने पकड़ा होता, और जब भी आप एक संतरा दिखाते, तो उसे एलिस ने पकड़ा होता।
बच्चा यह पैटर्न सीख जाता है: "अगर बॉब ने पकड़ा है, तो यह सेब है। अगर एलिस ने पकड़ा है, तो यह संतरा है।"
बच्चा फलों के बारे में नहीं सीख रहा है; वह बॉब और एलिस के बारे में सीख रहा है। जब आप उसे एलिस द्वारा पकड़ा गया सेब देते हैं, तो वह भ्रमित हो जाता है और गलत अनुमान लगाता है।
यहाँ बिल्कुल यही हुआ। AI ने वास्तविक उपचार प्रक्रिया के बजाय प्रत्येक विशिष्ट चूहे की अनूठी "फिंगरप्रिंट" (जैसे धूल का एक छोटा कण, एक विशिष्ट कोण, या एक अनूठी जैविक विशेषता) को पहचानना सीख लिया था।
2. टॉर्च: SHAP (एक पोस्ट-हॉक स्पष्टीकरण)
वैज्ञानिकों ने हार नहीं मानी। उन्होंने SHAP नामक एक उपकरण का उपयोग किया। SHAP को एक आवर्धक लेंस (मैग्निफाइंग ग्लास) या एक टॉर्च की तरह समझें जो AI के मस्तिष्क पर रोशनी डालती है ताकि यह देखा जा सके कि निर्णय लेते समय वह वास्तव में किस चीज़ को देख रहा था।
जब उन्होंने इस रोशनी को AI पर डाला, तो उन्होंने कुछ बहुत ही दिलचस्प देखा:
- जिन विशेषताओं का उपयोग AI ने "पुनर्जीवन" (Regeneration) का अनुमान लगाने के लिए किया था, वे वही विशेषताएं थीं जिनका उपयोग उसने "यह चूहा नंबर 5 है" का अनुमान लगाने के लिए किया था।
- AI गलत पहेली हल कर रहा था। वह "घाव का निदान" करने के बजाय "गेस हू?" (Guess Who?) खेल रहा था।
3. ट्विस्ट: छिपा हुआ खजाना ढूंढना
लेकिन कहानी विफलता के साथ समाप्त नहीं होती। वैज्ञानिकों ने AI की गलतियों को और करीब से देखा।
भले ही AI "निशान" और "पुनर्जीवन" के बीच अंतर नहीं कर सका, लेकिन वह चूहों के समूहों को बनाने में बहुत अच्छा था। जब उन्होंने कन्फ्यूजन मैट्रिक्स (एक चार्ट जहाँ AI भ्रमित होता है) को देखा, तो उन्होंने एक पैटर्न देखा:
- AI अक्सर तीसरे दिन (Day 3) के एक चूहे को तीसरे दिन के ही दूसरे चूहे के साथ भ्रमित कर देता था।
- वह दसवें दिन (Day 10) के एक चूहे को दसवें दिन के ही दूसरे चूहे के साथ भ्रमित कर देता था।
यह ऐसा था जैसे AI कह रहा हो: "मैं यह तो नहीं बता सकता कि यह निशान है या पुनर्जीवित ऊतक, लेकिन मैं निश्चित रूप से बता सकता हूँ कि यह फोटो चोट लगने के 3 दिन बाद की है या 10 दिन बाद की!"
ब्रेकथ्रू (महत्वपूर्ण खोज):
वैज्ञानिकों को एहसास हुआ कि डेटा में मूल्यवान जानकारी थी, बस वह वह जानकारी नहीं थी जो उन्होंने मूल रूप से मांगी थी। तीसरे दिन और दसवें दिन के बीच के जैविक परिवर्तन, निशान और पुनर्जीवित होने के सूक्ष्म अंतरों की तुलना में बहुत अधिक मजबूत और आसानी से देखे जाने योग्य थे।
इसलिए, उन्होंने सवाल बदल दिया। "क्या यह निशान है या पुनर्जीवन?" पूछने के बजाय, उन्होंने पूछा, "क्या यह तीसरा दिन है या दसवां दिन?"
परिणाम: AI फिर से जीनियस बन गया। उसने दिनों के बीच अंतर सफलतापूर्वक सीखा।
बड़ा सबक
यह पेपर हमें विज्ञान में, विशेष रूप से जब डेटा कम हो, AI का उपयोग करने के बारे में एक महत्वपूर्ण सबक सिखाता है:
- AI एक दर्पण है: यह पैटर्न खोजेगा, भले ही वे पैटर्न आकस्मिक हों (जैसे सेब और संतरे के बजाय बॉब बनाम एलिस को पहचानना)।
- केवल स्कोर पर भरोसा न करें: सिर्फ इसलिए कि एक AI टेस्ट में उच्च स्कोर प्राप्त करता है, इसका मतलब यह नहीं है कि उसने वही सीखा जो आप सोचते हैं कि उसने सीखा है।
- परदे के पीछे देखें: AI को "व्याख्या" करने के लिए SHAP जैसे उपकरणों का उपयोग करके, वैज्ञानिक इन पूर्वाग्रहों को पकड़ सकते हैं।
- जरूरत पड़ने पर रास्ता बदलें: कभी-कभी, डेटा आपके मूल प्रश्न का उत्तर नहीं दे सकता है, लेकिन यह एक अलग, समान रूप से महत्वपूर्ण प्रश्न का उत्तर दे सकता है। इस मामले में, AI अंतिम परिणाम की भविष्यवाणी नहीं कर सका, लेकिन वह ठीक-ठीक बता सका कि उपचार की प्रक्रिया कितनी आगे बढ़ चुकी है।
संक्षेप में: वैज्ञानिकों ने "टॉर्च" का उपयोग यह समझने के लिए किया कि उनका AI व्यक्तिगत चूहों को पहचानकर धोखाधड़ी कर रहा था। एक बार जब उन्होंने इसे पकड़ लिया, तो उन्हें एहसास हुआ कि उनका AI वास्तव में ऊतकों के प्रकारों के बजाय समय को ट्रैक करने में माहिर था। इसने एक विफलता को एक खोज में बदल दिया, जिससे यह सिद्ध हुआ कि भले ही डेटासेट छोटे और अपूर्ण हों, फिर भी हम मूल्यवान जैविक अंतर्दृष्टि पा सकते हैं यदि हमें पता हो कि कहाँ देखना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।