← नवीनतम पेपर
💬 NLP

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

यह शोध पत्र MolQuest को प्रस्तुत करता है, जो वास्तविक रासायनिक डेटा पर आधारित एक नवीन मल्टी-टर्न इंटरैक्टिव बेंचमार्क है जो आणविक संरचना स्पष्टीकरण में लार्ज लैंग्वेज मॉडल्स की एबडक्टिव रीजनिंग (abductive reasoning) और रणनीतिक निर्णय लेने की क्षमताओं का मूल्यांकन करता है, जिससे यह प्रकट होता है कि अत्याधुनिक मॉडल भी इन जटिल वैज्ञानिक परिदृश्यों में सटीकता के साथ संघर्ष करते हैं।

मूल लेखक: Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आप किसी अपराध स्थल को नहीं, बल्कि एक रहस्यमय रासायनिक यौगिक (chemical compound) को देख रहे हैं। आप नहीं जानते कि यह क्या है, लेकिन आपके पास वैज्ञानिक उपकरणों (जैसे कि एक तराजू, एक स्पेक्ट्रोमीटर, या एक सूक्ष्मदर्शी) का एक टूलबॉक्स है जो आपको सुराग दे सकते हैं।

यह शोध पत्र, MolQuest, यह परीक्षण करने का एक नया तरीका पेश करता है कि आर्टिफिशियल इंटेलिजेंस (AI) उस जासूस की भूमिका निभाने में कितना अच्छा है।

यहाँ इसका सरल शब्दों में विवरण दिया गया है:

1. पुराना तरीका बनाम नया तरीका

पुराना तरीका (स्थिर परीक्षण - Static Tests):
कल्पना कीजिए कि एक शिक्षक आपको एक पूरा किया हुआ पहेली (puzzle) का चित्र देता है जिसमें सभी टुकड़े पहले से ही मेज पर रखे हुए हैं और आपसे पूछता है, "यह कौन सा चित्र है?"

  • समस्या: अधिकांश AI परीक्षण आज इसी तरह काम करते हैं। AI को सारा डेटा एक साथ मिल जाता है और वह बस उत्तर का अनुमान लगा लेता है। यह एक बहुविकल्पीय प्रश्न (multiple-choice quiz) की तरह है। AI अपने प्रशिक्षण डेटा से उत्तरों को केवल याद भी कर सकता है बजाय इसके कि वह वास्तव में समस्या के बारे में सोचे

नया तरीका (MolQuest):
अब, कल्पना कीजिए कि शिक्षक ने पहेली के टुकड़ों को एक बंद डिब्बे में रख दिया है। आप उन सभी को एक साथ नहीं देख सकते। आपको एक-एक करके विशिष्ट टुकड़े माँगने होंगे।

  • नियम: आपके पास एक सीमित बजट है (जो वास्तविक प्रयोगों की लागत का अनुकरण करता है)। यदि आप गलत टुकड़ा मांगते हैं, तो आप पैसा बर्बाद करते हैं। यदि आप बहुत अधिक मांगते हैं, तो आपके पास समय खत्म हो जाता है।
  • लक्ष्य: आपको यह अनुमान लगाना है कि चित्र क्या है और रणनीतिक रूप से पूछना है, "क्या मैं लाल टुकड़ा देख सकता हूँ?" या "नीला टुकड़ा कैसा दिखता है?" और फिर उस सुराग का उपयोग अगले कदम का अनुमान लगाने के लिए करना है।

MolQuest रसायन विज्ञान के लिए यही "बंद डिब्बे" वाला परिदृश्य है। यह AI को एक वास्तविक वैज्ञानिक की तरह कार्य करने के लिए मजबूर करता है: योजना बनाना, पूछना, सोचना और सुधार करना।

2. "रसायन शास्त्री" एजेंट (The "Chemist" Agent)

इस परीक्षण में, AI केवल एक चैटबॉट नहीं है; यह एक स्वायत्त एजेंट (एक डिजिटल वैज्ञानिक) है।

  • यह एक खाली स्लेट से शुरू करता है।
  • इसे निर्णय लेना होता है: "क्या मुझे पहले अणु (molecule) को तौलना चाहिए? या मुझे इसके चुंबकीय अनुनाद (NMR) को देखना चाहिए?"
  • यह एक परिकल्पना (अनुमान) बनाता है, इसकी जांच नए डेटा के साथ करता है, और यदि अनुमान गलत होता है, तो यह अपना विचार बदलता है और फिर से प्रयास करता है।
  • यह तभी रुकता है जब वह इतना आश्वस्त हो जाता है कि वह कह सके, "मुझे पता है कि यह अणु क्या है!"

3. बड़ा आश्चर्य (परिणाम)

शोधकर्ताओं ने दुनिया के 12 सबसे स्मार्ट AI मॉडलों का इस नए परीक्षण पर परीक्षण किया (जिसमें GPT, Gemini और Claude जैसे बड़े नाम शामिल हैं)। उन्होंने यह पाया:

  • "स्मार्ट" जासूस: कुछ मॉडलों (जैसे Gemini 3) ने ठीक-ठाक प्रदर्शन किया, और लगभग 50% उत्तर सही दिए। वे वास्तव में अपनी जांच की अच्छी योजना बना सके।
  • "भ्रमित" जासूस: अधिकांश अन्य मॉडल 30% से नीचे स्कोर करते हैं।
  • "मतिभ्रम" (Hallucination) की समस्या: कई मॉडल आश्वस्त थे लेकिन गलत थे। वे एक ऐसा अणु संरचना (structure) बताते थे जो दिखने में तो अच्छी थी लेकिन भौतिक नियमों से मेल नहीं खाती थी (जैसे कि तीन पहियों और चौकोर टायर वाली कार)।
  • "अति-विचार करने वाले" (Over-Thinkers): कुछ मॉडल एक लूप में फंस गए। वे बार-बार और अधिक डेटा मांगते रहे, अपना "बजट" बर्बाद करते रहे, लेकिन फिर भी पहेली को हल नहीं कर सके। उनमें यह कहने का आत्मविश्वास नहीं था कि, "ठीक है, मेरे पास पर्याप्त जानकारी है, अब मैं एक अनुमान लगा सकता हूँ।"

4. यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि केवल स्मार्ट होना काफी नहीं है; आपको रणनीतिक होने की आवश्यकता है।

  • स्थिर परीक्षण (Static tests) एक छात्र को रेसिपी सुनाने के लिए कहने जैसा है।
  • MolQuest उस छात्र को रसोई में सीमित सामग्री के साथ रखने और उन्हें एक ऐसा भोजन बनाने के लिए कहने जैसा है जिसे उन्होंने पहले कभी नहीं देखा है।

यह अध्ययन दिखाता है कि हालांकि AI तथ्यों को जानने में बेहतर हो रहा है, लेकिन यह अभी भी रणनीतिक तर्क (strategic reasoning) में बहुत खराब है—यह जानना कि आगे क्या पूछना है, कब रुकना है, और अनिश्चितता को कैसे संभालना है।

निष्कर्ष (The Takeaway)

MolQuest विज्ञान में AI के लिए एक वास्तविकता की जाँच (reality check) है। यह हमें बताता है कि भविष्य के लिए AI को बनाने के लिए, हम केवल उसे अधिक डेटा नहीं दे सकते। हमें उसे एक जासूस की तरह सोचना, स्मार्ट अनुमान लगाना और यह जानना सिखाना होगा कि कब उसके पास मामला सुलझाने के लिए पर्याप्त सबूत हैं।

वर्तमान में, हमारे AI जासूस अभी भी थोड़े अनाड़ी हैं, लेकिन यह नया बेंचमार्क हमें उन्हें भविष्य के शानदार वैज्ञानिकों के रूप में प्रशिक्षित करने के लिए एक स्पष्ट मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →