ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction
यह शोध पत्र ISAAC को प्रस्तुत करता है, जो एक पोस्ट-हॉक ऑडिटिंग फ्रेमवर्क है जो मैकेनिस्टिक (mechanistic) बनाम स्प्यूरियस (spurious) हस्तक्षेपों के प्रति डीप लर्निंग मॉडल्स की संवेदनशीलता को मापकर ड्रग-टारगेट इंटरेक्शन के लिए उनकी कारण संबंधी तर्क क्षमता (causal reasoning capabilities) का मूल्यांकन करता है, जिससे तर्क में महत्वपूर्ण संरचनात्मक विसंगतियों का खुलासा होता है जो समान भविष्य कहनेवाला प्रदर्शन (predictive performance) के बावजूद मानक सटीकता मेट्रिक्स द्वारा अनपेक्षित रहती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशिष्ट व्यंजन बनाने के लिए एक शेफ को काम पर रख रहे हैं। आप उन्हें एक टेस्ट टेस्ट देते हैं, और वे हर बार परफेक्ट स्कोर प्राप्त करते हैं। आप मान लेते हैं कि वे एक जीनियस हैं जो वास्तव में रेसिपी, सामग्री और खाना पकाने के विज्ञान (केमिस्ट्री) को समझते हैं।
लेकिन क्या होगा अगर वे वास्तव में भोजन का स्वाद नहीं ले रहे हैं? क्या होगा अगर वे बस यह याद कर रहे हैं कि "जब भी प्लेट नीली होती है, तो खाना स्वादिष्ट होता है," भले ही प्लेट के रंग का स्वाद से कोई लेना-देना न हो? वे सही उत्तर प्राप्त कर रहे हैं (उच्च सटीकता), लेकिन गलत कारणों से (स्पूरियस कोरिलेशन/भ्रामक संबंध)।
यह वह समस्या है जिसे ISAAC पेपर संबोधित करता है, विशेष रूप से ड्रग डिस्कवरी (दवा की खोज) की दुनिया में।
समस्या: "स्मार्ट" लेकिन "अनजान" AI
चिकित्सा जैसे वैज्ञानिक क्षेत्रों में, हम यह अनुमान लगाने के लिए AI का उपयोग करते हैं कि क्या कोई दवा किसी विशिष्ट प्रोटीन से चिपकेगी (जैसे ताले में चाबी का फिट होना)। हम आमतौर पर इन AI मॉडल्स को उनकी सटीकता (Accuracy) से आंकते हैं: "क्या इसने सही उत्तर दिया?"
लेखकों का तर्क है कि उच्च सटीकता एक जाल है। एक AI एक अजीब पैटर्न को देखकर सही उत्तर दे सकता है (जैसे "हमारे डेटाबेस में मौजूद सभी सफल दवाओं के नाम में एक निश्चित अक्षर था") बजाय इसके कि वह वास्तविक जीव विज्ञान (ताले के आकार) को समझे। यदि आप ताले का आकार बदल देते हैं, तो वह "स्मार्ट" AI विफल हो सकता है, भले ही वह टेस्ट में परफेक्ट रहा हो।
समाधान: ISAAC (एक "हस्तक्षेप" जासूस)
लेखकों ने ISAAC नामक एक टूल बनाया है। ISAAC को केवल यह परखने के रूप में न देखें कि AI क्या जानता है, बल्कि यह परखने के रूप में देखें कि वह कैसे सोचता है।
केवल AI से "उत्तर क्या है?" पूछने के बजाय, ISAAC "क्या होगा अगर?" का खेल खेलता है।
- सेटअप: कल्पना कीजिए कि AI एक प्रोटीन (ताले) को देख रहा है।
- मैकेनिस्टिक इंटरवेंशन (असली टेस्ट): ISAAC ताले के एक छोटे, महत्वपूर्ण हिस्से को (वह हिस्सा जो वास्तव में चाबी को थामे रखता है) लेता है और उसमें सूक्ष्म बदलाव करता है।
- अपेक्षा: यदि AI वास्तव में जीव विज्ञान को समझता है, तो ताले के की-होल (चाबी के छेद) को बदलने पर AI कहेगा, "हे, यह अब फिट नहीं होगा!" भविष्यवाणी महत्वपूर्ण रूप से बदल जानी चाहिए।
- स्पूरियस इंटरवेंशन (नकली टेस्ट): ISAAC ताले के एक रैंडम, महत्वहीन हिस्से को (जैसे बाहर लगा एक सजावटी पेंच) लेता है और उसे बदल देता है।
- अपेक्षा: यदि AI स्मार्ट है, तो उसे पेंच की परवाह नहीं होनी चाहिए। उसकी भविष्यवाणी वैसी ही रहनी चाहिए।
स्कोरकार्ड: रीजनिंग स्कोर (RS)
ISAAC यह तुलना करता है कि AI इन दो परिवर्तनों के प्रति कैसे प्रतिक्रिया देता है।
- उच्च रीजनिंग स्कोर (High Reasoning Score): AI ने असली ताले के बदलाव पर कड़ी प्रतिक्रिया दी और नकली पेंच के बदलाव को अनदेखा कर दिया। निर्णय: यह AI वास्तव में जीव विज्ञान के बारे में तर्क (reasoning) कर रहा है।
- निम्न रीजनिंग स्कोर (Low Reasoning Score): AI ने पेंच पर प्रतिक्रिया दी, या ताले पर प्रतिक्रिया नहीं दी, या दोनों पर समान रूप से प्रतिक्रिया दी। निर्णय: यह AI संभवतः सतही पैटर्न के आधार पर केवल अनुमान लगा रहा है।
प्रयोग: तीन शेफ, एक रेसिपी
शोधकर्ताओं ने तीन अलग-अलग AI मॉडल्स (DeepDTA, DeepConvDTI, और TAPB) का परीक्षण उसी ड्रग-टारगेट डेटा पर किया।
- परिणाम: तीनों मॉडल्स ने लगभग एक जैसा "टेस्ट टेस्ट" स्कोर (सटीकता) प्राप्त किया। पारंपरिक मानकों के अनुसार, वे सभी समान रूप से अच्छे थे।
- ट्विस्ट: जब ISAAC ने अपना "क्या होगा अगर?" खेल खेला, तो मॉडल्स ने पूरी तरह से अलग व्यवहार किया।
- एक मॉडल (TAPB) ने दिखाया कि वह वास्तव में प्रोटीन के सही हिस्सों पर ध्यान दे रहा था। इसका "रीजनिंग स्कोर" उच्च था।
- अन्य मॉडल्स नकली बदलावों से भ्रमित हो गए या असली बदलावों पर प्रतिक्रिया नहीं दी। उनके "रीजनिंग स्कोर" कम थे।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि सटीकता पर्याप्त नहीं है। दो मॉडल्स रिपोर्ट कार्ड पर बिल्कुल समान दिख सकते हैं लेकिन उनके "दिमाग" पूरी तरह से अलग हो सकते हैं। एक वास्तविक वैज्ञानिक हो सकता है, और दूसरा केवल भाग्यशाली अनुमान लगाने वाला।
ISAAC हमें पर्दे के पीछे झांकने का एक तरीका देता है। यह केवल यह नहीं पूछता, "क्या आपने सही उत्तर दिया?" बल्कि यह पूछता है, "क्या आपने सही कारण से सही उत्तर दिया?"
ड्रग डिस्कवरी की दुनिया में, AI यह भविष्यवाणी क्यों करता है, यह जानना उतना ही महत्वपूर्ण है जितनी कि स्वयं भविष्यवाणी, क्योंकि यदि AI नकली पैटर्न पर निर्भर है, तो यह वैज्ञानिकों को वास्तविक जीवन में गलत रास्ते पर ले जा सकता है। ISAAC हमें उन नकली पैटर्न को पहचानने में मदद करता है इससे पहले कि वे समस्या पैदा करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।