Tokenization for Molecular Foundation Models
मूल लेखक: Alexius Wadell, Anoushka Bhutani, Venkatasubramanian Viswanathan
मूल लेखक: Alexius Wadell, Anoushka Bhutani, Venkatasubramanian Viswanathan
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: आणविक फाउंडेशन मॉडल के लिए टोकनाइज़ेशन (Tokenization)
समस्या विवरण
ऊर्जा भंडारण से लेकर फार्मास्युटिकल खोज तक के उद्योगों के लिए रासायनिक गुणों की सटीक भविष्यवाणी करना अत्यंत महत्वपूर्ण है। जबकि ट्रांसफॉर्मर आर्किटेक्चर ने नेचुरल लैंग्वेज प्रोसेसिंग (NLP) में क्रांति ला दी है, आणविक फाउंडेशन मॉडलों के अनुप्रयोग में एक मौलिक बाधा आती है: टोकनाइज़ेशन। वर्तमान आणविक मॉडल मुख्य रूप से "एटम-वाइज" (Atom-wise) टोकनाइज़ेशन पर निर्भर करते हैं, जहाँ सिंपलीफाइड मॉलिक्यूलर इनपुट लाइन एंट्री सिस्टम (SMILES) स्ट्रिंग्स को फिक्स्ड वोकैबुलरी का उपयोग करके परमाणु-स्तर के टोकन में विभाजित किया जाता है।
इस दृष्टिकोण की प्राथमिक सीमा OpenSMILES स्पेसिफिकेशन को पूरी तरह से कवर करने में इसकी अक्षमता है। एटम-वाइज टोकनाइज़र ब्रैकेट वाले परमाणुओं (जो आइसोटोप, काइरल केंद्र, चार्ज और स्पष्ट हाइड्रोजन गणना को एनकोड करते हैं) को एकल, अविभाज्य टोकन के रूप में देखते हैं। इन विशेषताओं के प्रत्येक संभावित संयोजन को कवर करने के लिए, एक वोकैबुलरी को 28 ट्रिलियन से अधिक टोकनों की आवश्यकता होगी। फलस्वरूप, मौजूदा मॉडल 3,000 से कम टोकन वाली वोकैबुलरी का उपयोग करते हैं, जिसके परिणामस्वरूप कवरेज में महत्वपूर्ण अंतराल आता है। जब वे नवीन ब्रैकेट वाले परमाणुओं का सामना करते हैं, तो ये क्लोज्ड-वोकैबुलरी टोकनाइज़र एक जेनेरिक अननोन टोकन [UNK] का सहारा लेते हैं, जो काइरैलिटी या विशिष्ट आइसोटोपिक संरचना जैसे महत्वपूर्ण रासायनिक विवरणों को छिपा सकता है। इसके अलावा, मौजूदा ओपन-वोकैबुलरी विकल्प (जैसे BPE-आधारित योजनाएं) अक्सर अस्पष्टता से ग्रस्त होते हैं, जहाँ अलग-अलग रासायनिक संस्थाएं (उदाहरण के लिए, सल्फर-कार्बन बॉन्ड बनाम तत्व स्कैंडियम) एक ही टोकन में विलीन हो जाती हैं।
कार्यप्रणाली (Methodology)
लेखक एक नया टोकनाइज़ेशन फ्रेमवर्क, Smirk, और एक संकुचित संस्करण, Smirk-GPE, प्रस्तावित करते हैं, जिसे OpenSMILES स्पेसिफिकेशन का पूर्ण कवरेज प्राप्त करने और कम्प्यूटेशनल दक्षता बनाए रखने के लिए डिज़ाइन किया गया है।
Smirk टोकनाइज़ेशन: यह योजना OpenSMILES स्पेसिफिकेशन द्वारा परिभाषित ग्लिफ्स (glyphs) के आधार पर SMILES स्ट्रिंग्स के दो-चरणीय, कैरेक्टर-लेवल डिकंपोजिशन का उपयोग करती है।
- चरण 1: परमाणुओं में डिकंपोजिशन (जैसे,
OC[C@@H][OH]→O C [C@@H] [OH])। - चरण 2: ब्रैकेट वाले परमाणुओं को उनके घटक ग्लिफ्स में डिकंपोजिशन (जैसे,
[C@@H]→[ C @ @ H ])। - यह दृष्टिकोण अस्पष्ट अनुक्रमों (जैसे, बॉन्ड के रूप में
Scबनाम स्कैंडियम के रूप में[Sc]) के बीच अंतर करता है, क्योंकि यह ब्रैकेट और आंतरिक प्रतीकों को अलग-अलग टोकन के रूप में मानता है। परिणामी वोकैबुलरी 165 टोकन पर स्थिर है, इसके लिए किसी प्रशिक्षण की आवश्यकता नहीं है, और यह गारंटी देता है कि किसी भी OpenSMILES-एनकोडेड अणु को बिना[UNK]टोकन के टोकनाइज़ किया जा सकता है।
- चरण 1: परमाणुओं में डिकंपोजिशन (जैसे,
Smirk-GPE (ग्लीफ पेयर एनकोडिंग): ब्रैकेट वाले परमाणुओं के पूर्ण डिकंपोजिशन के कारण होने वाली बढ़ी हुई अनुक्रम लंबाई (fertility) को संबोधित करने के लिए, लेखकों ने Smirk-GPE लागू किया है। यह वेरिएंट विशेष रूप से ग्लिफ टोकन पर बाइट-पेयर एनकोडिंग (BPE)-जैसी संपीड़न रणनीति लागू करता है। मानक BPE के विपरीत जो स्ट्रिंग्स को मर्ज करता है, Smirk-GPE टोकन आईडी पर मर्ज नियम सीखता है, यह सुनिश्चित करते हुए कि रासायनिक रूप से सार्थक विलय (जैसे, सल्फर और कार्बन ग्लिफ को जोड़ना) परमाणु प्रतीकों (जैसे, स्कैंडियम) के साथ अस्पष्टता पैदा न करे।
मूल्यांकन ढांचा (Evaluation Framework):
- इंट्रिन्सिक मेट्रिक्स (Intrinsic Metrics): लेखकों ने फर्टिलिटी (औसत अनुक्रम लंबाई), नॉर्मलाइज्ड एंट्रॉपी (संपीड़न दक्षता), टोकन इम्बैलेंस, और
[UNK]टोकन की आवृत्ति का उपयोग करके टोकनाइज़र्स का मूल्यांकन किया। - लो-कॉस्ट प्रॉक्सी (Low-Cost Proxy): यह पहचानते हुए कि प्रत्येक टोकनाइज़र के लिए पूर्ण ट्रांसफॉर्मर मॉडल को प्रशिक्षित करना कम्प्यूटेशनल रूप से महंगा है, लेखकों ने n-ग्राम मॉडल का उपयोग एक प्रॉक्सी के रूप में किया। उन्होंने 1.6 बिलियन SMILES स्ट्रिंग्स पर n-ग्राम मॉडल प्रशिक्षित किए और डाउनस्ट्रीम प्रदर्शन का अनुमान लगाने के लिए क्रॉस-एंट्रॉपी लॉस और सूचना हानि (KL-डाइवर्जेंस के माध्यम से) को मापा।
- एक्सट्रिन्सिक वैलिडेशन (Extrinsic Validation): अपने n-ग्राम प्रॉक्सी को मान्य करने के लिए, लेखकों ने 11 विभिन्न टोकनाइज़र्स और तीन आणविक एनकोडिंग का उपयोग करके 18 एनकोडर-ओनली RoBERta मॉडल को शून्य से प्री-ट्रेन किया। इन मॉडलों को MoleculeNet और tmQM से छह रिग्रेशन और सात क्लासिफिकेशन कार्यों पर फाइन-ट्यून किया गया था।
- इंट्रिन्सिक मेट्रिक्स (Intrinsic Metrics): लेखकों ने फर्टिलिटी (औसत अनुक्रम लंबाई), नॉर्मलाइज्ड एंट्रॉपी (संपीड़न दक्षता), टोकन इम्बैलेंस, और
मुख्य परिणाम
- कवरेज: Smirk और Smirk-GPE एकमात्र मूल्यांकित टोकनाइज़र हैं जो OpenSMILES स्पेसिफिकेशन का 100% कवरेज प्राप्त करते हैं, जिससे
[UNK]टोकन का उपयोग समाप्त हो जाता है। इसके विपरीत, मौजूदा केमिस्ट्री-विशिष्ट टोकनाइज़र (SPE, APE और विभिन्न BPE वेरिएंट सहित) गैर-नगण्य आवृत्ति (tmQM डेटासेट पर ~50% तक) के साथ[UNK]टोकन उत्सर्जित करते हैं। - सूचना हानि (Information Loss): सीमित कवरेज वाले टोकनाइज़र पर्याप्त सूचना हानि प्रदर्शित करते हैं, विशेष रूप से उन डेटासेट्स पर जो ट्रांजिशन मेटल्स और स्टीरियोकेमिस्ट्री से समृद्ध हैं (जैसे, tmQM)। उदाहरण के लिए, MoLFormer टोकनाइज़र tmQM पर अज्ञात टोकन के कारण 40.3 nats/molecule का नुकसान उठाता है, जबकि Smirk वेरिएंट इस गिरावट को कम करता है।
- प्रदर्शन सहसंबंध (Performance Correlation): अध्ययन में n-ग्राम मेट्रिक्स (क्रॉस-एंट्रॉपी और सूचना हानि) और ट्रांसफॉर्मर-आधारित मॉडलों के डाउनस्ट्रीम प्रदर्शन के बीच एक मजबूत रैखिक सहसंबंध पाया गया। यह टोकनाइज़र गुणवत्ता के मूल्यांकन के लिए एक कम लागत वाले प्रॉक्सी के रूप में n-ग्राम के उपयोग को मान्य करता है।
- डाउनस्ट्रीम प्रभाव:
- Smirk ने tmQM डेटासेट पर प्रीट्रेनिंग गुणवत्ता और डाउनस्ट्रीम प्रदर्शन पर सकारात्मक प्रभाव दिखाया।
- MoleculeNet कार्यों पर (जो छोटे कार्बनिक अणुओं द्वारा संचालित हैं), Smirk ने मानक एटम-वाइज टोकनाइज़ेशन के समान प्रदर्शन किया।
- खराब कवरेज वाले टोकनाइज़रों (SPE/APE) ने बेसलाइन की तुलना में प्रीट्रेनिंग और डाउनस्ट्रीम प्रदर्शन दोनों को नकारात्मक रूप से प्रभावित किया।
- पाया गया कि आणविक एनकोडिंग (SMILES बनाम SELFIES) का चुनाव टोकनाइज़र के चुनाव की तुलना में नगण्य प्रभाव रखता है।
महत्व और दावे
यह शोध पत्र तर्क देता है कि रसायन विज्ञान के लिए एक फाउंडेशन मॉडल को रासायनिक स्थान की पूरी व्यापकता को एनकोड करना चाहिए ताकि महत्वपूर्ण विशेषताओं को छिपाने से बचा जा सके। लेखक दावा करते हैं कि वर्तमान टोकनाइज़र अनजाने में परमाणु-स्तर की जानकारी (जैसे सिस्प्लेटिन में काइरैलिटी या विशिष्ट आइसोटोप) को धुंधला कर देते हैं, जिससे संभावित रूप से महत्वपूर्ण सूचना हानि होती है जो केवल सैद्धांतिक नहीं है बल्कि चिकित्सकीय और औद्योगिक रूप से प्रासंगिक अणुओं को प्रभावित करती है।
इस कार्य का महत्व निम्नलिखित में निहित है:
- मजबूती (Robustness): यह प्रदर्शित करना कि ओपन-वोकैबुलरी टोकनाइज़र (Smirk/Smirk-GPE) रासायनिक स्थान का मजबूत कवरेज प्रदान करते हैं, जिससे
[UNK]टोकन से जुड़ी सूचना हानि को रोका जा सकता है। - दक्षता (Efficiency): यह स्थापित करना कि n-ग्राम मॉडल टोकनाइज़र प्रदर्शन के मूल्यांकन के लिए एक विश्वसनीय, कम लागत वाले प्रॉक्सी के रूप में कार्य कर सकते हैं, जिससे हाइपरपैरामीटर ट्यूनिंग और मॉडल चयन का कम्प्यूटेशनल बोझ कम हो जाता है।
- व्याख्यात्मकता (Interpretability): यह उजागर करना कि Smirk शोधकर्ताओं को ब्रैकेट वाले परमाणुओं की सूचना-समृद्ध सामग्री को सीधे हेरफेर करने की अनुमति देता है, जो एटम-वाइज टोकनाइज़ेशन के व्याख्यात्मक लाभों को बढ़ाता है और आउट-ऑफ-वोकैबुलरी त्रुटियों के जोखिम को हटाता है।
लेखक निष्कर्ष निकालते हैं कि हालांकि वर्तमान बेंचमार्क (जैसे MoleculeNet) तत्वों और स्टीरियोकेमिस्ट्री की विविधता की कमी के कारण सीमित-कवरेज वाले टोकनाइज़रों की कमियों को पूरी तरह से उजागर नहीं कर सकते हैं, फिर भी रासायनिक स्थान के संपूर्ण एनकोडिंग में सक्षम टोकनाइज़रों की ओर संक्रमण विश्वसनीय आणविक फाउंडेशन मॉडल के लिए आवश्यक है। वे समुदाय को अपने बेंचमार्क स्कोप का कठोरता से मूल्यांकन करने और डेटासेट्स में विविध रासायनिक विशेषताओं को शामिल करने के लिए प्रोत्साहित करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते AI के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।