← नवीनतम पेपर
💬 NLP

Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation

यह शोध पत्र 'स्पीक-टू-स्ट्रक्चर' (S^2-Bench) को प्रस्तुत करता है, जो ओपन-डोमेन, वन-टू-मेनी नेचुरल लैंग्वेज-ड्रिवन मॉलिक्यूल जनरेशन कार्यों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, साथ ही इसमें 'ओपनमोलइन्स' (OpenMolIns) भी शामिल है, जो एक ऐसा डेटासेट है जो फाइन-ट्यून्ड मॉडल्स को यथार्थवादी आणविक डिजाइन में अग्रणी एलएलएम (LLMs) से बेहतर प्रदर्शन करने में सक्षम बनाता है।

मूल लेखक: Jiatong Li, Junxian Li, Weida Wang, Yunqing Liu, Changmeng Zheng, Yatao Bian, Dongzhan Zhou, Xiao-yong Wei, Qing Li

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiatong Li, Junxian Li, Weida Wang, Yunqing Liu, Changmeng Zheng, Yatao Bian, Dongzhan Zhou, Xiao-yong Wei, Qing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "उत्तर का अनुमान लगाने" से "समाधान को डिजाइन करने" तक

कल्पना कीजिए कि आप एक शेफ (रसोइया) हैं। वर्षों से, शोधकर्ताओं ने AI शेफ का परीक्षण करने के लिए उन्हें एक विशिष्ट रेसिपी (जैसे "एक चॉकलेट केक बनाएं") दी है और उनसे पहले से मौजूद डेटाबेस में मौजूद एक विशिष्ट केक को फिर से बनाने के लिए कहा है। यदि AI ठीक वैसा ही केक बनाता है जैसा डेटाबेस में है, तो उसे गोल्ड स्टार मिलता है।

समस्या: वास्तविक कुकिंग (और वास्तविक विज्ञान) नकल करने के बारे में नहीं है। यदि आप एक शेफ से पूछते हैं, "मेरे लिए एक ऐसा केक बनाएं जिसमें चीनी कम हो लेकिन स्वाद मीठा हो," तो इसका केवल एक ही सही उत्तर नहीं होता। सैकड़ों अलग-अलग रेसिपी हो सकती हैं जो काम कर सकती हैं। पुराने परीक्षण बहुत सख्त थे; वे AI को केवल "सही" उत्तर याद रखने के लिए पुरस्कृत करते थे, न कि रचनात्मक होने के लिए।

समाधान: यह पेपर S2-Bench (Speak-to-Structure) पेश करता है। यह एक नया परीक्षण है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या AI एक वास्तविक रचनात्मक शेफ की तरह कार्य कर सकता है। एक प्रतिलिपि (copy) मांगने के बजाय, यह AI से एक विवरण के आधार पर नई चीजें आविष्कार करने के लिए कहता है, यह जानते हुए कि कई संभावित "सही" उत्तर हो सकते हैं।


तीन चुनौतियाँ (द "मेन्यू")

यह पेपर AI का परीक्षण तीन विशिष्ट कार्यों पर करता है, जो कुकिंग चैलेंज के विभिन्न स्तरों की तरह हैं:

  1. मॉलिक्यूल एडिटिंग (द "ट्वीक" चैलेंज - बदलाव करना):

    • उपमा: कल्पना कीजिए कि आपके पास एक विशिष्ट कार मॉडल है। टेस्ट AI से कहता है "एक टर्बोचार्जर जोड़ें" या "सनरूफ हटा दें।"
    • लक्ष्य: AI को मूल कार को लेना चाहिए और केवल वह विशिष्ट परिवर्तन करना चाहिए बिना इंजन को खराब किए या कार को नाव में बदले। यह परीक्षण करता है कि क्या AI यह समझता है कि चीजें आपस में कैसे जुड़ती हैं।
  2. मॉलिक्यूल ऑप्टिमाइज़ेशन (द "अपग्रेड" चैलेंज - सुधार करना):

    • उपमा: आपके पास एक कार है, और आप इसे "तेज़" या "अधिक ईंधन-कुशल" बनाना चाहते हैं।
    • लक्ष्य: AI को एक विशिष्ट गुण (जैसे गति) में सुधार करने के लिए कार को संशोधित करना होगा जबकि कार को पहचानने योग्य बनाए रखना होगा। केवल शुरुआत से एक नई, तेज़ कार बनाना पर्याप्त नहीं है; इसे मूल कार में एक सुधार होना चाहिए।
  3. कस्टमाइज्ड मॉलिक्यूल जनरेशन (द "ब्लैंक कैनवस" चैलेंज - खाली कैनवास):

    • उपमा: आप AI को बताते हैं, "मेरे लिए एक ऐसा वाहन बनाएं जिसमें ठीक 4 पहिये, एक लाल बॉडी और एक V8 इंजन हो।"
    • लक्ष्य: AI को बिना किसी शुरुआती टेम्पलेट के, इन सख्त नियमों के अनुरूप पूरी तरह से नया वाहन आविष्कार करना होगा। यह सबसे कठिन परीक्षण है क्योंकि AI को बिना किसी आधार के इन नियमों का पूरी तरह से पालन करना होता है।

नया ट्रेनिंग मैनुअल: OpenMolIns

AI को इन कार्यों में बेहतर बनाने के लिए, लेखकों ने एक विशाल नया प्रशिक्षण पुस्तक बनाया जिसे OpenMolIns कहा जाता है।

  • पुराना तरीका: पिछले प्रशिक्षण ग्रंथों में उदाहरण बहुत कम थे, और वे ज्यादातर "प्रश्न: यह अणु क्या है? उत्तर: [सटीक अणु का नाम]" जैसे थे। इसने AI को याद करने (memorize) के लिए सिखाया।
  • नया तरीका: OpenMolIns 1.2 मिलियन उदाहरणों का एक विशाल पुस्तकालय है जहाँ AI रसायन विज्ञान के तर्क (logic) को सीखता है। यह AI को सिखाता है: "यदि आप कुछ तेज़ बनाना चाहते हैं, तो यह हिस्सा जोड़ने का प्रयास करें," बजाय इसके कि केवल "यहाँ उत्तर है।"

परिणाम: इस नए प्रशिक्षण पुस्तक का उपयोग करके, एक अपेक्षाकृत छोटे AI मॉडल (Llama3.1-8B) ने इन रचनात्मक कार्यों पर बहुत बड़े, अधिक प्रसिद्ध मॉडलों (जैसे GPT-4o और Claude-3.5) को हरा दिया। इसने साबित कर दिया कि केवल एक विशाल मस्तिष्क होने से ज्यादा महत्वपूर्ण अच्छा प्रशिक्षण है।


वे AI को ग्रेड कैसे देते हैं (द "स्कोरकार्ड")

पुराने परीक्षणों में, यदि AI ने शब्द-दर-शब्द लक्ष्य से मेल खाता हुआ अणु लिखा, तो उसे 100% मिलता था। लेकिन इस नए परीक्षण में, यह पर्याप्त नहीं है। लेखकों ने एक स्मार्ट स्कोरिंग सिस्टम बनाया है:

  1. क्या आपने निर्देशों का पालन किया? (सफलता दर - Success Rate)
  2. क्या यह एक तर्कसंगत परिवर्तन है? (समानता - Similarity)
    • पकड़: यदि आपने कार में "पहिया जोड़ने" के लिए कहा, और AI ने एक पूरी तरह से अलग कार बनाई जिसमें संयोग से एक पहिया था, तो पुराना टेस्ट कहेगा "अच्छा काम किया!" नया टेस्ट कहता है, "नहीं, आपने वास्तव में मूल कार को संशोधित नहीं किया; आपने बस प्रॉम्प्ट को अनदेखा किया और कुछ और बना दिया।"
  3. क्या यह नया है? (नवीनता - Novelty)
    • "ब्लैंक कैनवस" चुनौती के लिए, AI को कुछ ऐसा आविष्कार करने के लिए अंक मिलते हैं जो दुनिया के डेटाबेस में पहले से मौजूद नहीं है।

मुख्य निष्कर्ष (Key Takeaways)

  • याददाश्त काफी नहीं है: वर्तमान AI मॉडल तथ्यों को याद रखने में अच्छे हैं लेकिन रसायन विज्ञान में जटिल, रचनात्मक निर्देशों का पालन करने में संघर्ष करते हैं।
  • "वन-टू-मेनी" (एक-से-अनेक) वास्तविक है: विज्ञान में, एक प्रश्न के कई वैध उत्तर हो सकते हैं। पुराने परीक्षणों ने इसकी अनुमति नहीं दी; नया वाला देता है।
  • छोटे मॉडल जीत सकते हैं: सही प्रशिक्षण डेटा (OpenMolIns) के साथ, एक छोटा, सस्ता AI, अणुओं को डिजाइन करने के लिए विशाल, महंगे मॉडलों से बेहतर प्रदर्शन कर सकता है।
  • "मानवीय" जांच: लेखकों ने विशेषज्ञों से AI के काम को देखा। उन्होंने पाया कि नया स्कोरिंग सिस्टम (जो रैंडम अनुमानों के बजाय तार्किक परिवर्तनों को पुरस्कृत करता है) पुराने "सटीक मिलान" वाले सिस्टम की तुलना में मानव विचारों से बहुत बेहतर मेल खाता है।

संक्षेप में, यह पेपर AI के अभ्यास के लिए एक बेहतर जिम बनाता है। केवल फ्लैशकार्ड याद करने के बजाय, अब AI वास्तव में बातचीत के आधार पर नई चीजें डिजाइन करना और बनाना सीख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →