Molecular Representations for Large Language Models
यह शोध पत्र MolJSON को प्रस्तुत करता है, जो एक नवीन आणविक प्रतिनिधित्व है जो विभिन्न तर्क कार्यों (reasoning tasks) में SMILES और IUPAC नामों जैसे पारंपरिक प्रारूपों की तुलना में व्यवस्थित रूप से बेहतर प्रदर्शन करता है, यह प्रदर्शित करते हुए कि स्पष्ट आणविक ग्राफ स्कीमा रसायन विज्ञान में LLM के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान लेकिन शाब्दिक अर्थों को समझने वाले रोबोट को एक जटिल 3D संरचना, जैसे कि एक अणु (molecule), को समझने और बनाने के बारे में सिखाने की कोशिश कर रहे हैं। समस्या यह नहीं है कि रोबोट मूर्ख है; समस्या यह है कि आप उससे गलत भाषा में बात कर रहे हैं।
यह शोध पत्र इस बारे में है कि कैसे बड़े भाषा मॉडलों (LLMs) के लिए रसायन विज्ञान (chemistry) के बारे में बात करने हेतु सही "बोली" (dialect) को खोजा जाए।
समस्या: "केमिस्ट" की तरह बोलना बनाम "रोबोट" की तरह बोलना
दशकों से, रसायन शास्त्री कंप्यूटर पर अणुओं को लिखने के दो मुख्य तरीके इस्तेमाल करते आए हैं:
- SMILES: इसे एक लंबे, भ्रमित करने वाले टेक्स्ट स्ट्रिंग के रूप में समझें जो एक अणु का वर्णन करने के लिए उसके माध्यम से "चलकर" (walking) विवरण देता है। यह एक घर का वर्णन करने जैसा है जैसे, "सामने के दरवाजे से शुरू करें, बाएं मुड़ें, सीढ़ियों से ऊपर जाएं, दाएं मुड़ें और आप रसोई में हैं।" यदि आप एक भी कदम चूक जाते हैं या क्रम गलत कर देते हैं, तो पूरा विवरण बिखर जाता है।
- IUPAC नाम: ये आधिकारिक, मानव-पठनीय नाम हैं (जैसे "ethanoic acid")। ये एक घर का वर्णन करने के लिए एक जटिल कानूनी अनुबंध को पढ़ने जैसा है। ये मनुष्यों के लिए सटीक हैं लेकिन एक रोबोट के लिए इन्हें समझना बहुत कठिन है क्योंकि इनके नियम अविश्वसनीय रूप से सख्त हैं और वाक्य बहुत लंबे होते हैं।
शोधकर्ताओं ने पाया कि जब उन्होंने AI मॉडलों से इन पुराने प्रारूपों का उपयोग करके अणु पढ़ने या लिखने के लिए कहा, तो मॉडलों ने बहुत सारी गलतियाँ कीं। यह एक रोबोट को किसी विदेशी भाषा में लिखे गए पाठ निर्देशों के आधार पर लेगो (Lego) किला बनाने के लिए कहने जैसा था; वह अक्सर गलत चीज़ बनाता या भ्रमित हो जाता।
समाधान: "MolJSON" का परिचय
लेखकों ने MolJSON नामक एक नया प्रारूप बनाया।
MolJSON को एक कहानी या निर्देशों के सेट के रूप में नहीं, बल्कि एक ब्लूप्रिंट या पुर्जों की सूची (parts list) के रूप में सोचें।
- "बिंदु A से बिंदु B तक जाने" के बजाय, MolJSON कहता है: "यहाँ सभी ईंटों (परमाणुओं/atoms) की एक सूची है और यहाँ ठीक वही सूची है कि कौन सी ईंटें आपस में जुड़ी हुई हैं (बंधों/bonds)।"
- यह एक संरचित सूची (JSON) की तरह दिखता है जिसे कंप्यूटर पसंद करते हैं। यह स्पष्ट रूप से प्रत्येक हिस्से और उनके जुड़ाव को सूचीबद्ध करता है, बिना AI को अणु के माध्यम से "चलने" या जटिल व्याकरण नियमों को डिकोड करने के लिए मजबूर किए।
प्रयोग: अनुवाद परीक्षण (The Translation Test)
यह देखने के लिए कि क्या यह नया प्रारूप बेहतर काम करता है, शोधकर्ताओं ने विभिन्न AI मॉडलों (जैसे GPT-5 और Claude) के साथ तीन प्रकार के परीक्षण आयोजित किए:
अनुवादक परीक्षण (The Translator Test): AI को एक अणु एक प्रारूप (जैसे SMIled स्ट्रिंग) में दें और उसे दूसरे प्रारूप में फिर से लिखने के लिए कहें।
- परिणाम: जब AI को MolJSON के रूप में आउटपुट देना था, तो वह लगभग 71% बार सही था। जब इसे SMILES या IUPAC नाम आउटपुट करने के लिए कहा गया, तो यह केवल लगभग 43% बार सही था। AI पुराने भाषाओं को अच्छी तरह से "बोल" ही नहीं पा रहा था।
भूलभुलैया परीक्षण (सबसे छोटा रास्ता - The Maze Test): AI को एक अणु दें और पूछें, "इस फ्लोरीन परमाणु और उस क्लोरीन परमाणु के बीच कितने बंध (bonds) हैं?"
- परिणाम: MolJSON के साथ, AI 98.5% बार सही था। SMILES के साथ, यह 92% था, और IUPAC नामों के साथ, यह गिरकर 82% रह गया।
- बोनस: AI ने MolJSON ब्लूप्रिंट मिलने पर भूलभुलैया को हल करने के लिए कम "ब्रेन टोकन" (कंप्यूटिंग पावर) का उपयोग किया। उसे पहले संरचना को समझने में अपनी ऊर्जा बर्बाद करने की आवश्यकता नहीं पड़ी।
निर्माता परीक्षण (प्रतिबंधित जनरेशन - The Builder Test): AI को निर्देश दें कि "एक ऐसा अणु बनाएं जिसमें एक फ्लोरीन, एक क्लोरीन और दो रिंग हों।"
- परिणाम: जब AI को MolJSON में उत्तर देने की अनुमति दी गई, तो वह 95% बार सफल रहा। जब उसे SMILES स्ट्रिंग आउटपुट करने के लिए मजबूर किया गया, तो वह केवल 64% बार सफल हुआ।
MolJSON क्यों जीता?
शोध पत्र सुझाव देता है कि SMILES और IUPAC नाम AI को एक साथ दो कठिन काम करने के लिए मजबूर करते हैं:
- संरचना को डिकोड करना: उसे यह समझना होता है कि अणु कैसा दिखता है।
- संरचना को पुनः एनकोड करना: उसे उस मानसिक छवि को वापस एक सख्त टेक्स्ट प्रारूप में बदलना होता है।
MolJSON कठिन हिस्से को छोड़ देता है। यह AI को संरचना सीधे देता है (परमाणु और बंध) और इसे सीधे संरचना आउटपुट करने देता है। यह एक रोबोट को एक पैराग्राफ के बजाय एक बॉक्स में लेगो ईंटें और अंतिम किले की एक तस्वीर देने जैसा है।
निष्कर्ष (The Takeaway)
शोधकर्ताओं ने पाया कि आप अणु को कैसे दर्शाते हैं, यह AI की बुद्धिमत्ता जितनी ही महत्वपूर्ण है। भले ही AI मॉडलों को लाखों SMILES स्ट्रिंग्स और IUPAC नामों पर प्रशिक्षित किया गया था, फिर भी वे इस नए, संरचित "ब्लूप्रिंट" प्रारूप (MolJSON) का उपयोग करने पर काफी बेहतर प्रदर्शन करते हैं।
संक्षेप में: यदि आप चाहते हैं कि AI रसायन विज्ञान करे, तो उसे रासायनिक पहेलियों (SMILES/IUPAC) में बोलना बंद करें और उसे स्पष्ट, संरचित ब्लूप्रिंट (MolJSON) में बोलना शुरू करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।