← नवीनतम पेपर
🤖 AI

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

यह शोध पत्र OmniMatBench प्रस्तुत करता है, जो 19 पदार्थ विज्ञान उपक्षेत्रों में 3,171 विशेषज्ञ-क्यूरेटेड समस्याओं वाला एक मानव-कैलिब्रेटेड मल्टीमॉडल बेंचमार्क है, जो वर्तमान मल्टीमॉडल लैंग्वेज मॉडल्स में महत्वपूर्ण तर्क संबंधी सीमाओं को प्रकट करता है और वैज्ञानिक अनुसंधान में विश्वसनीय एआई सहायकों को विकसित करने के लिए एक आधार स्थापित करता है।

मूल लेखक: Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों के एक समूह को विशेषज्ञ सामग्री वैज्ञानिक (materials scientists) बनने के लिए सिखाने की कोशिश कर रहे हैं, जो बहुत बुद्धिमान और विद्वान हैं। आप यह जानना चाहते हैं कि क्या वे केवल धातुओं और प्लास्टिक के बारे में तथ्य रट सकते हैं, या क्या वे वास्तव में वास्तविक दुनिया की समस्याओं को हल करने के लिए एक इंजीनियर की तरह सोच सकते हैं।

यह शोध पत्र एक नया, बहुत कठिन परीक्षण पेश करता है जिसे OmniMatBench कहा जाता है, ताकि इस प्रश्न का उत्तर दिया जा सके। इसका विवरण सरल शब्दों में यहाँ दिया गया है:

1. समस्या: रोबोट तथ्य जानते हैं, लेकिन "कैसे" में संघर्ष करते हैं

वर्तमान AI मॉडल (रोबोटों) को ऐसे छात्रों के रूप में सोचें जिन्होंने पूरी विश्वकोश (encyclopedia) को कंठस्थ कर लिया है। वे आपको बता सकते हैं कि "स्टील मजबूत है" या "तांबा बिजली का संचालन करता है।" हालांकि, सामग्री विज्ञान (materials science) केवल तथ्य जानने के बारे में नहीं है; यह तर्क करने (reasoning) के बारे में है। यह एक मशीन की तस्वीर देखने, एक जटिल सूत्र को समझने और यह पता लगाने के बारे में है कि वास्तव में एक पुल कैसे बनाया जाए या एक विशिष्ट मिश्र धातु (alloy) क्यों विफल हुई।

पिछले परीक्षणों में केवल रोबोटों से सामान्य ज्ञान पूछा जाता था या उनसे अंतिम उत्तर का अनुमान लगाने के लिए कहा जाता था। यह शोध पत्र तर्क देता है कि हमें एक ऐसा परीक्षण चाहिए जो यह जांच सके कि क्या रोबोट पूरी प्रक्रिया को समझता है—सामग्री को जानने से लेकर, उसकी संरचना को समझने, उसे बनाने का तरीका पता लगाने और अंत में, उसका उपयोग कैसे करना है तक।

2. समाधान: रोबोटों के लिए एक "महा-परीक्षा"

लेखकों ने OmniMatBench बनाया है, जो AI के लिए एक विशाल, अंतिम वर्ष की विश्वविद्यालय परीक्षा की तरह है।

  • क्षेत्र (Scope): यह सामग्री विज्ञान के 19 विभिन्न उप-क्षेत्रों को कवर करता है। इसे "कठोर धातुओं" और "रत्नों" से लेकर "वेल्डिंग" और "नैनोटेक्नोलॉजी" तक सब कुछ कवर करने के रूप में समझें।
  • प्रश्न: इसमें 3,171 प्रश्न शामिल हैं जिन्हें मानव विशेषज्ञों (वैज्ञानिकों और प्रोफेसरों) द्वारा बनाया और जांचा गया है।
  • प्रारूप (Format): यह केवल बहुविकल्पीय (multiple-choice) नहीं है। इसमें शामिल हैं:
    • मुक्त-अंत वाले प्रश्न (Open-ended questions): जहाँ रोबोट को अपने तर्क की व्याख्या करनी होती है (जैसे एक लघु निबंध)।
    • गणना संबंधी समस्याएं (Calculation problems): जहाँ रोबोट को गणित करना होगा, सही सूत्रों का उपयोग करना होगा, इकाइयों (units) को सही रखना होगा (जैसे "जूल" बनाम "वाट"), और अपने उत्तर को पूरी तरह से फॉर्मेट करना होगा।

3. परीक्षण: रोबोटों ने कैसा प्रदर्शन किया?

शोधकर्ताओं ने 13 सबसे स्मार्ट AI मॉडल (दोनों बड़ी तकनीकी कंपनियों और ओपन-सोर्स समूहों के) को इस परीक्षा से गुजारा।

परिणाम निराशाजनक थे:

  • "सबसे स्मार्ट" रोबोट: सबसे अच्छा मॉडल (Claude Opus 4.7) भी केवल 0.372 स्कोर (1.0 में से) प्राप्त कर सका। यह एक मानव विश्वविद्यालय में फेल होने वाले ग्रेड के समान है।
  • अंतर (The Gap): वे विश्वसनीय सहायकों के रूप में बहुत दूर हैं। वे अनुमान लगाने या अस्पष्ट उत्तर देने में अच्छे हैं, लेकिन जब उन्हें सटीक होने की आवश्यकता होती है, तो वे विफल हो जाते हैं।
  • "भ्रम" का जाल (The "Hallucination" Trap): रोबोट अक्सर ऐसे उत्तर देते थे जो सही लगते थे लेकिन गलत तर्क पर आधारित थे। उदाहरण के लिए, एक रोबोट किसी काम के लिए सही धातु तो चुन सकता है, लेकिन वहां तक पहुँचने के लिए गलत भौतिकी सूत्र का उपयोग कर सकता है। यह एक छात्र की तरह है जो गणित की परीक्षा में गलती से संख्याओं को गलत क्रम में जोड़कर सही उत्तर प्राप्त कर लेता है।

4. वे कहाँ विफल हुए? (क्यों?)

शोध पत्र ने पाया कि रोबोटों के संघर्ष करने के चार मुख्य कारण थे:

  1. विशेषज्ञ ज्ञान (Specialized Knowledge): वे सामान्य विज्ञान (जैसे "स्टील क्या है?") के साथ ठीक हैं लेकिन विशिष्ट इंजीनियरिंग विषयों (जैसे "एक ट्विन-स्क्रू एक्सट्रूडर कैसे काम करता है?") में बहुत खराब हैं।
  2. कठोर सोच (Rigid Thinking): वे हर समस्या के लिए एक ही तरह के "नुस्खे" या सूत्रों का उपयोग करने की प्रवृत्ति रखते हैं, भले ही समस्या के लिए एक अलग दृष्टिकोण की आवश्यकता हो।
  3. दृश्य भ्रम (Visual Confusion): जब उन्हें किसी ग्राफ या मशीन के आरेख (diagram) को दिखाया जाता है, तो वे अक्सर संख्याओं को गलत पढ़ लेते हैं या मशीन के डिज़ाइन के एक महत्वपूर्ण हिस्से को मिस कर देते हैं।
  4. गणित और इकाइयाँ (Math & Units): वे इकाइयों का हिसाब रखने में संघर्ष करते हैं (मीटर और मिलीमीटर को मिला देना) या अपने उत्तरों के लिए सख्त फॉर्मेटिंग नियमों का पालन करने में विफल रहते हैं।

5. "चीट कोड्स" ने ज्यादा मदद नहीं की

शोधकर्ताओं ने रोबोटों को "चीट शीट" (जैसे सही सूत्र प्रदान करना या उन्हें गणित करने के लिए कंप्यूटर कोड लिखने देना) देकर प्रयास किया।

  • फॉर्मूला चीट: रोबोट को सही सूत्र देने से थोड़ी मदद मिली, लेकिन रोबोट अक्सर यह समझने में विफल रहा कि उस विशिष्ट चित्र या समस्या पर इसे कैसे लागू किया जाए।
  • कोड चीट: रोबोट को गणित को हल करने के लिए पायथन (Python) कोड लिखने देने से समस्या हल नहीं हुई। रोबोट एक ऐसा कोड लिखता था जो पूरी तरह से चलता था, लेकिन वह गलत समस्या को हल कर रहा था क्योंकि उसने पहले ही विज्ञान के प्रश्न को गलत समझ लिया था।

निष्कर्ष (The Bottom Line)

OmniMatBench एक चेतावनी है। यह दिखाता है कि जबकि AI विज्ञान के बारे में बात करने में बेहतर हो रहा है, यह अभी भी विज्ञान करने के लिए तैयार नहीं है। "स्मार्ट दिखने" और "वास्तविक सामग्री इंजीनियरिंग समस्या को हल करने" के बीच का अंतर अभी भी बहुत बड़ा है। यह बेंचमार्क शोधकर्ताओं को बेहतर AI बनाने में मदद करने के लिए डिज़ाइन किया गया है जो एक दिन लैब में एक सच्चे साथी के रूप में कार्य कर सके, न कि केवल एक फैंसी विश्वकोश के रूप में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →