← नवीनतम पेपर
🤖 AI

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

यह शोधपत्र ChemCost को प्रस्तुत करता है, जो पहचान स्थापित करने, आपूर्तिकर्ता उद्धरणों (supplier quotes) को प्राप्त करने और अंकगणित करने के माध्यम से रासायनिक अभिक्रिया लागतों का अनुमान लगाने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए एक कठोर बेंचमार्क है, जो यह प्रकट करता है कि भंगुर पार्सिंग (brittle parsing), अप्रभावी साक्ष्य एकीकरण और खराब शोर मजबूती (noise robustness) के कारण उन्नत एजेंट भी इस कार्य में संघर्ष करते हैं।

मूल लेखक: Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो यह पता लगाने की कोशिश कर रहे हैं कि एक विशेष व्यंजन बनाने में वास्तव में कितनी लागत आएगी। आपके पास रेसिपी (रासायनिक अभिक्रिया) है, लेकिन आपके पास सामग्री की कीमतें नहीं हैं, और आपको यह भी नहीं पता कि सही मात्रा प्राप्त करने के लिए आपको किस ब्रांड या पैकेज का आकार खरीदना होगा।

यह शोध पत्र एक नया "परीक्षण" पेश करता है जिसे CHEMCOST कहा जाता है, यह देखने के लिए कि क्या उन्नत एआई कंप्यूटर (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) इस समस्या को हल करने के लिए एक स्मार्ट शॉपिंग असिस्टेंट की तरह कार्य कर सकते हैं।

यहाँ इस शोध पत्र के निष्कर्षों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. चुनौती: यह केवल "गूगलिंग" नहीं है

लेखकों ने यह देखना चाहा कि क्या एआई एक वैज्ञानिक खरीद एजेंट (scientific procurement agent) की तरह कार्य कर सकता है। यह केवल कविता लिखने या सामान्य ज्ञान के प्रश्न का उत्तर देने के बारे में नहीं है। यह एक बहु-चरणीय गणितीय और खरीदारी की पहेली है:

  • नाम का खेल: रेसिपी में "TEA" लिखा हो सकता है। क्या वह ट्राईएथिलमाइन (एक रसायन) है या ट्राइएथेनॉलमाइन (एक अलग रसायन)? एआई को यह समझना होगा कि वास्तव में किस अणु (molecule) का अर्थ लिया जाना है।
  • शॉपिंग की खोज: एआई को 2,300,000 से अधिक आपूर्तिकर्ता उद्धरणों (supplier quotes) के एक स्थिर डेटाबेस से कीमतें खोजनी होंगी। वह केवल अनुमान नहीं लगा सकता; उसे विशिष्ट "पैक" (जैसे, 1 ग्राम की बोतल बनाम 100 ग्राम की बोतल) को खोजना होगा जो रेसिपी में फिट बैठता हो।
  • गणित: इसे "1.5 इक्विवेलेंट्स" को ग्राम में बदलना होगा, प्रत्येक सामग्री की लागत की गणना करनी होगी, और अंतिम उत्पाद की मात्रा से विभाजित करके प्रति ग्राम मूल्य निकालना होगा।

उपमा: कल्पना कीजिए कि एआई एक छात्र है जो अपनी अंतिम परीक्षा दे रहा है। शिक्षक उन्हें एक रेसिपी, कीमतों के टैग वाली एक बंद लाइब्रेरी और एक कैलकुलेटर देते हैं। छात्र को सही सामग्रियां ढूंढनी होंगी, सही आकार खरीदना होगा, गणित करना होगा और एक संख्या सौंपनी होगी: कुल लागत।

2. परीक्षण: CHEMCOST

शोधकर्ताओं ने 1,427 विभिन्न रासायनिक रेसिपी के साथ एक बेंचमार्क बनाया।

  • "उत्तर कुंजी" (The Answer Key): उन्होंने एआई को इंसानों द्वारा ग्रेड करने के लिए नहीं कहा। इसके बजाय, उन्होंने वास्तविक कीमतों का एक "स्थिर" डेटाबेस और नियमों का एक सख्त सेट बनाया। कंप्यूटर पहले से ही सटीक सही उत्तर की गणना करता है। इसका मतलब है कि ग्रेडिंग 100% वस्तुनिष्ठ है—इसमें कोई मानवीय पूर्वाग्रह नहीं है।
  • "शोर" (Noise) का परीक्षण: यह देखने के लिए कि क्या एआई वास्तव में स्मार्ट है या केवल पैटर्न को याद कर रहा है, उन्होंने रेसिपी में बदलाव किए। उन्होंने नाम बदल दिए (उदाहरण के लिए, 'O' के बजाय '0' के साथ "Na2C03" लिखना), यील्ड प्रतिशत हटा दिया, या निर्देशों को अव्यवस्थित, असंरचित टेक्स्ट में लिख दिया।

3. परिणाम: "टूल एक्सेस" पर्याप्त नहीं है

शोधकर्ताओं ने कई अलग-अलग एआई मॉडल का परीक्षण किया, जिनमें सबसे बड़े "फ्रंटियर" मॉडल से लेकर विशेष रसायन विज्ञान मॉडल तक शामिल थे। यहाँ क्या हुआ:

  • सीमा (The Ceiling): सबसे स्मार्ट एआई मॉडल भी साफ, आसान इनपुट पर लगभग 50% उत्तर सही (25% त्रुटि मार्जिन के भीतर) दे पाए। वे पूर्णता से बहुत दूर हैं।
  • "टूल" का जाल: एआई मॉडल्स को "टूल्स" (जैसे रासायनिक नामों के लिए सर्च इंजन और मूल्य खोज) दिए गए थे। शोध पत्र में पाया गया कि टूल्स का होना आवश्यक है, लेकिन पर्याप्त नहीं है।
    • उपमा: एक छात्र को कैलकुलेटर और लाइब्रेरी कार्ड देने से यह गारंटी नहीं मिलती कि वह गणित की समस्या को सही ढंग से हल करेगा। उन्हें अभी भी यह जानने की आवश्यकता है कि कैलकुलेटर में कौन सी संख्या डालनी है और कौन सी किताब खोलनी है।
  • "भंगुरता" (The Brittle Problem) की समस्या: जब इनपुट थोड़ा भी अव्यवस्थित था (जैसे रासायनिक नाम में टाइपो या अजीब फॉर्मेटिंग त्रुटि), तो एआई मॉडल अक्सर पूरी तरह से हार मान लेते थे या गलत उत्तर देते थे।
    • उपमा: यदि एक मानव शेफ "Na2C03" (जीरो के साथ) देखता है, तो वह अनुमान लगा सकता है कि यह "Na2CO3" के लिए एक टाइपो है। हालाँकि, एआई अक्सर घबरा जाता है, आइटम को खोजने में विफल रहता है, और प्रयास करना बंद कर देता है।

4. वे कहाँ विफल होते हैं?

पेपर ने विस्तार से बताया कि एआई कहाँ फंसता है:

  1. पार्सिंग (Parsing): वे सामग्रियों को खोजने के लिए अव्यवस्थित टेक्स्ट को पढ़ नहीं पाते।
  2. साक्ष्य एकीकरण (Evidence Integration): वे कीमतें तो ढूंढ लेते हैं लेकिन उन्हें रेसिपी की मात्रा के साथ सही ढंग से जोड़ नहीं पाते।
  3. पैक चयन (Pack Selection): वे गलत आकार की बोतल चुनते हैं (जब उन्हें केवल 1 ग्राम की आवश्यकता होती है, तो 100 ग्राम की बोतल खरीदना, या इसके विपरीत)।
  4. हार मान लेना (Giving Up): जब टेक्स्ट अव्यवस्थित होता है, तो वे समाधान निकालने के बजाय उत्तर देने से मना कर देते हैं।

5. "मानवीय" बेंचमार्क

शोधकर्ताओं ने वास्तविक मानव रसायन विज्ञान विशेषज्ञों (chemists) से टेस्ट लिया।

  • परिणाम: इंसानों ने एआई से बेहतर प्रदर्शन किया (साफ इनपुट पर लगभग 67% सटीकता), लेकिन उनसे भी गलतियाँ हुईं। यह साबित करता है कि यह कार्य वास्तव में कठिन है, विशेषज्ञों के लिए भी। यह दर्शाता कि कार्य केवल "डम्ब" नहीं है; यह पढ़ने, खोजने और गणना करने का एक जटिल तालमेल है जो मनुष्यों और मशीनों दोनों के लिए कठिन है।

सारांश

पेपर निष्कर्ष निकालता है कि हालांकि एआई टूल्स का उपयोग करने में बेहतर हो रहा है, फिर भी यह वास्तविक दुनिया के रासायनिक लागत अनुमान के लिए पर्याप्त विश्वसनीय नहीं है। यह संघर्ष करता है जब जानकारी पूरी तरह से व्यवस्थित नहीं होती है, और यह अक्सर कीमत खोजने और अंतिम कुल राशि की गणना करने के बीच के संबंध को जोड़ने में विफल रहता है।

संक्षेप में: एआई एक बहुत तेज़, बहुत जानकार इंटर्न की तरह है जिसके पास पूरे इंटरनेट और एक कैलकुलेटर तक पहुंच है, लेकिन उसे अभी भी अपने काम की दोबारा जांच करने के लिए एक इंसान की आवश्यकता है, खासकर जब निर्देश थोड़े अव्यवस्थित तरीके से लिखे गए हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →