Empty scaffold allocation bias in molecular distribution shift evaluation
यह शोध पत्र प्रकट करता है कि मानक स्कैफोल्ड-आधारित मूल्यांकन विधियाँ रासायनिक रूप से विषम "नो-स्कैफोल्ड" अणुओं को एक एकल इकाई के रूप में गलत तरीके से मानकर एक छिपा हुआ आवंटन पूर्वाग्रह उत्पन्न करती हैं, जो सामान्य बेंचमार्क में सामान्यीकरण मेट्रिक्स को विकृत करता है, और संतुलित प्रतिनिधित्व एवं सटीक प्रदर्शन मूल्यांकन को बहाल करने के लिए एक "एम्प्टी-स्कैफोल्ड-अवेयर" सुधार का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ हैं जो एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं। आप जानना चाहते हैं कि क्या रोबोट वास्तव में खाना बनाने के सिद्धांतों को सीख सकता है या वह केवल विशिष्ट व्यंजनों (रेसिपी) को रट रहा है। इसे परखने के लिए, आप उसे अभ्यास के लिए कुछ व्यंजन (प्रशिक्षण सेट/training set) देते हैं और फिर उसे उन पूरी तरह से नए व्यंजनों पर परखते हैं जिन्हें उसने पहले कभी नहीं देखा (परीक्षण सेट/test set)।
AI रसायन विज्ञान की दुनिया में, वैज्ञानिक स्कैफोल्ड स्प्लिटिंग (Scaffold Splitting) नामक एक विधि का उपयोग करते हैं। वे अणुओं को उनके "कंकाल" (skeleton)—उस मुख्य रिंग-और-लिंकर संरचना के आधार पर समूहों में बांटते हैं जो उन्हें एक साथ थामे रखती है। विचार सरल है: यदि आप रोबोट को एक प्रकार के कंकाल के बारे में सिखाते हैं, तो आपको उसे एक अलग कंकाल पर परखना चाहिए ताकि यह देखा जा सके कि वह वास्तव में रसायन विज्ञान को समझता है या नहीं। यदि रोबोट नए कंकाल पर विफल हो जाता है, तो इसका मतलब है कि वह केवल पुराने कंकाल को रट रहा था।
लेकिन यहाँ एक मोड़ है: कुछ अणुओं का कोई कंकाल ही नहीं होता।
"घोस्ट" (Ghost) अणु
रसायन विज्ञान में, किसी अणु का कंकाल खोजने का एक मानक तरीका है। लेकिन कुछ अजीब, लचीले या छोटे अणुओं के लिए, यह प्रक्रिया एक खाली बाल्टी लौटाती है। ये "नो-स्कैफोल्ड" (no-scaffold) अणु हैं। इनके पास कोई साझा रिंग संरचना नहीं होती; वे अवशेषों का एक अराजक मिश्रण होते हैं।
चीन यूनिवर्सिटी ऑफ पेट्रोलियम (ईस्ट चाइना) और तियांगोंग यूनिवर्सिटी के ताओ सोंग, योंग वांग और उनकी टीम द्वारा लिखित शोध पत्र ने यह खोजा कि हमारे AI शेफों का परीक्षण करने के तरीके में एक बड़ी खामी है।
खामी (The Glitch):
मानक परीक्षण नियम कहते हैं: "एक ही कंकाल वाले सभी अणुओं को एक ही समूह में रखें।" लेकिन चूंकि "नो-स्कैफोल्ड" अणुओं का कंकाल खाली होता है, इसलिए कंप्यूटर उन्हें एक ही एकल, विशाल समूह मान लेता है। वह उन सभी को एक ही बाल्टी में डाल देता है।
समस्या:
क्योंकि उन्हें एक अविभाज्य समूह के रूप में माना जाता है, कंप्यूटर अक्सर इन सभी "घोस्ट" अणुओं को परीक्षण सेट में डाल देता है और प्रशिक्षण सेट में एक भी नहीं छोड़ता।
- उपमा: कल्पना कीजिए कि आप एक छात्र को फल पहचानने में सिखा रहे हैं। आप उसे सेब, केले और संतरे दिखाते हैं। लेकिन अंतिम परीक्षा के लिए, आप उसे "रहस्यमय मेश" (mystery mush) का एक कटोरा देते हैं (नो-स्कैफोल्ड अणु)। आपने उसे कभी नहीं सिखाया कि "मेश" कैसा दिखता है, लेकिन आप उम्मीद करते हैं कि वह उसका स्वाद बता दे।
- परिणाम: छात्र (AI) बुरी तरह विफल हो जाता है। लेकिन क्या यह इसलिए है क्योंकि छात्र रसायन विज्ञान में बुरा है? या इसलिए क्योंकि आपने अभ्यास के दौरान ही "मेश" श्रेणी को पूरी तरह से छिपाकर धोखाधड़ी की?
यह कितना आम है?
लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने डेटा का विश्लेषण किया। उन्होंने पाया कि यह "घोस्ट" समस्या हर जगह है:
- MoleculeNet के 16 में से 8 लोकप्रिय डेटासेट्स में, 10% से अधिक अणुओं का कोई कंकाल नहीं था।
- FreeSolv और QM7 जैसे विशिष्ट डेटासेट्स में, लगभग 50% अणु "घोस्ट" थे।
- ड्रग-टेस्टिंग कार्यों के एक विशाल संग्रह (Deep-PK/ADMET) में, 73 में से 40 कार्यों में 10% से अधिक नो-स्कैफोल्ड अणु थे।
"खाली बाल्टी" एक अव्यवस्था है
लेखकों ने जांचा कि क्या ये "घोस्ट" अणु वास्तव में एक-दूसरे के समान हैं। उन्होंने पाया कि वे समान नहीं थे।
- वास्तविक कंकाल समूह चचेरे भाइयों के परिवार की तरह होते हैं; वे एक जैसे दिखते हैं।
- "नो-स्कैफोल्ड" समूह यादृच्छिक कचरे के ढेर की तरह है। उनके बीच औसत समानता केवल 0.110 है, जो रैंडम शोर (noise) से भी थोड़ा ही अधिक है।
- वे उन अणुओं से भी बहुत दूर हैं जिन्हें AI ने वास्तव में सीखा है। प्रशिक्षण सेट में एक "घोस्ट" अणु का निकटतम "पड़ोसी" केवल 0.300 समान है, जबकि वास्तविक परिवारों के पड़ोसी 0.477 से 0.573 समान होते हैं।
चूंकि वे प्रशिक्षण डेटा से इतने अलग हैं, AI के पास उन्हें सीखने का कोई मौका नहीं है।
परिणाम क्या हैं: स्कोर झूठ बोलते हैं
जब AI को इन "घोस्ट" अणुओं पर परीक्षण के लिए छोड़ा जाता है (जिन्हें उसने प्रशिक्षण में नहीं देखा), तो परिणाम बहुत खराब होते हैं, लेकिन इस तरह से नहीं कि AI "बुद्धिमान लेकिन बदकिस्मत" है।
1. वर्गीकरण (Classification - हाँ/ना वाले प्रश्न) के लिए:
AI चीजों को सही ढंग से रैंक करना बंद कर देता है। इसके स्कोर घटकर "प्रायर बेसलाइन" (prior baseline) तक गिर जाते हैं।
- उपमा: यदि आप एक छात्र को 100 रहस्यमय वस्तुओं को "सबसे अच्छे" से "सबसे खराब" के क्रम में रखने के लिए कहते हैं, और उसे पता ही नहीं है कि वे क्या हैं, तो वह हर चीज़ के लिए "औसत" का अनुमान लगा सकता है।
- डेटा: लेखकों ने पाया कि रैंकिंग प्रदर्शन में भारी गिरावट आई। MoleculeNet डेटासेट्स में, औसत स्कोर 0.259 (सामान्य) से गिरकर 0.035 (घोस्ट्स) हो गया। ADMET में, यह 0.409 से गिरकर 0.119 हो गया।
- चौंकाने वाला तथ्य: Tox21 डेटासेट में, सामान्य अणुओं के 0.303 की तुलना में, घोस्ट्स के लिए स्कोर गिरकर 0.018 रह गया। AI केवल विफल नहीं हो रहा था; वह हार मानकर रैंडम अनुमान लगा रहा था।
2. रिग्रेशन (Regression - संख्यात्मक भविष्यवाणियों) के लिए:
त्रुटियां (errors) विस्फोट की तरह बढ़ गईं।
- डेटा: सापेक्ष त्रुटि (relMAE) औसतन 1.35 गुना बढ़ गई।
- चरम सीमा: कुछ मामलों में, त्रुटि सामान्य से 2-गुना (दोगुनी) या यहाँ तक कि 3-गुना (तिगुनी) अधिक थी। MoleculeNet में, 44.8% टेस्ट पॉइंट्स में त्रुटि दोगुनी से भी अधिक थी। यह सामान्य भिन्नता की तुलना में बहुत बड़ा अंतर है।
क्या अन्य तरीकों ने इसे ठीक किया?
लेखकों ने डेटा को विभाजित करने के अन्य लोकप्रिय तरीकों की जांच की, जैसे UMAT क्लस्टरिंग, DataSAIL, और LoHi। उन्हें उम्मीद थी कि ये स्मार्ट तरीके समस्या को हल कर देंगे।
- निष्कर्ष: उन्होंने ऐसा नहीं किया। हालांकि उन्होंने सभी घोस्ट्स को टेस्ट सेट में नहीं डाला, फिर भी उन्होंने प्रशिक्षण सेट में बहुत कम घोस्ट्स छोड़े।
- डेटा: स्टैंडर्ड स्प्लिटिंग के साथ, सबसे खराब स्थिति में प्रशिक्षण सेट में 0% घोस्ट्स थे। DataSAIL के साथ, प्रशिक्षण सेट में अभी भी केवल 14.7% घोस्ट्स थे, जबकि टेस्ट सेट में 81.6% थे।
- निष्कर्ष: वर्तमान में कोई भी विधि यह गारंटी नहीं देती कि AI को इन "घोस्ट" अणुओं पर अभ्यास करने का मौका मिलेगा।
समाधान: "एम्प्टी-स्कैफोल्ड-अवेयर" रिपेयर (ESA)
लेखकों ने केवल समस्या नहीं बताई; उन्होंने ESA नामक एक पैच बनाया।
- यह कैसे काम करता है: उन्होंने "वास्तविक" अणुओं (जिनके पास कंकाल हैं) के लिए मानक विभाजन बनाए रखा, लेकिन "घोस्ट" अणुओं को सावधानीपूर्वक पुनर्वितरित किया। उन्होंने सुनिश्चित किया कि प्रशिक्षण सेट को घोस्ट्स का एक उचित हिस्सा मिले, जबकि अभी भी परीक्षण के लिए कुछ को टेस्ट सेट में रखा गया ताकि यह देखा जा सके कि क्या AI उन्हें संभाल सकता है।
- परिणाम: इसने असंतुलन को ठीक कर दिया। प्रशिक्षण सेट में घोस्ट्स की संख्या 14.7% से बढ़कर 26.0% हो गई। टेस्ट सेट में यह 81.6% से घटकर 11.5% रह गया।
- सुरक्षा जांच: उन्होंने सुनिश्चित किया कि यह AI को टेस्ट के उत्तरों को "झांकने" (peek) की अनुमति देकर धोखाधड़ी न करे। प्रशिक्षण घोस्ट्स और टेस्ट घोस्ट्स के बीच समानता कम रही, जिससे AI को उन्हें सीखना पड़ा, न कि केवल रटना।
मुख्य निष्कर्ष (The Takeaway)
यह शोध पत्र तर्क देता है कि हम केवल एक उच्च स्कोर देखकर यह नहीं कह सकते कि, "बहुत बढ़िया, AI तैयार है!" यदि टेस्ट सेट "घोस्ट" अणुओं से भरा है जिन्हें AI ने प्रशिक्षण के दौरान कभी नहीं देखा, तो वह स्कोर भ्रामक है। यह सामान्यीकरण (generalization) का परीक्षण नहीं है; यह इस बात का परीक्षण है कि AI बिना लाइफ जैकेट के गहरे पानी में फेंके जाने पर कैसा व्यवहार करता है।
लेखक सुझाव देते हैं कि भविष्य के परीक्षणों में तीन चीजें स्पष्ट रूप से रिपोर्ट की जानी चाहिए:
- कितने "घोस्ट" अणु हैं?
- AI को कितने अणुओं के साथ अभ्यास करने का मौका मिला?
- कितने टेस्ट के लिए बचे हैं?
जब तक हम इसे ठीक नहीं करते, हम अपने मॉलिक्यूलर AI की बुद्धिमत्ता का अत्यधिक आकलन करते रहेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।