← नवीनतम पेपर
💻 computer science

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

यह शोध पत्र SciVQR प्रस्तुत करता है, जो एक व्यापक मल्टीमॉडल बेंचमार्क है जो 54 वैज्ञानिक उपक्षेत्रों में फैला हुआ है और जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के अंतिम उत्तरों और तर्क प्रक्रियाओं दोनों का मूल्यांकन करता है, जिससे जटिल, अंतर-विषयक वैज्ञानिक तर्क करने की उनकी क्षमता में महत्वपूर्ण सीमाओं का पता चलता है।

मूल लेखक: Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल पुस्तकालय के रूप में करें जहाँ रोबोट पढ़ना, देखना और सोचना सीख रहे हैं। लंबे समय से, ये रोबोट (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) सरल कार्यों में माहिर रहे हैं, जैसे कि किसी फोटो में बिल्ली को पहचानना या बुनियादी सामान्य ज्ञान के सवालों के जवाब देना। लेकिन जब आप उनसे कोई जटिल विज्ञान संबंधी समस्या हल करने के लिए कहते हैं जिसमें एक साथ एक आरेख (डायग्राम) को देखने, एक चार्ट को पढ़ने और बहु-चरणीय गणित करने की आवश्यकता होती है, तो वे अक्सर लड़खड़ा जाते हैं।

यहाँ SciVQR का प्रवेश होता है, जो शोधकर्ताओं द्वारा बनाया गया एक नया "फाइनल एग्जाम" है ताकि यह परीक्षण किया जा सके कि ये रोबोट विज्ञान के मामले में वास्तव में कितने स्मार्ट हैं।

यहाँ इस शोध पत्र का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: "ट्रिक क्वेश्चन" का अंतर (The "Trick Question" Gap)

मौजूदा AI परीक्षणों की कल्पना एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) के रूप में करें जहाँ उत्तर स्पष्ट हैं, या प्रश्न बहुत सरल हैं (जैसे प्राथमिक विद्यालय के स्तर के)। शोधकर्ता तर्क देते हैं कि ये परीक्षण यह जाँचने जैसे हैं कि क्या एक छात्र अपने जूते के फीते बांध सकता है, लेकिन वे यह नहीं जाँच रहे हैं कि क्या छात्र सर्जरी कर सकता है।

वर्तमान AI मॉडल अक्सर केवल पैटर्न को पहचानकर सही उत्तर का अनुमान लगा लेते हैं, न कि वास्तव में विज्ञान को समझकर। वे सही उत्तर तो दे सकते हैं लेकिन उन्हें पता नहीं होता कि वह क्यों सही है। शोध पत्र कहता है कि हमें एक ऐसा परीक्षण चाहिए जो AI को अपना काम दिखाने के लिए मजबूर करे, चरण-दर-चरण, ठीक वैसे ही जैसे एक शिक्षक गणित की कक्षा में छात्र से "अपना काम दिखाने" (show your work) के लिए कहता है।

2. समाधान: SciVQR "साइंस ओलंपियाड"

शोधकर्ताओं ने SciVQR बनाया है, जो रोबोटों के लिए एक विशाल, उच्च-दांव वाले साइंस ओलंपियाड की तरह है।

  • विषय: यह छह प्रमुख वैज्ञानिक क्षेत्रों को कवर करता है: गणित, भौतिकी, रसायन विज्ञान, जीव विज्ञान, भूगोल और खगोल विज्ञान।
  • कठिनाई: यह केवल हाई स्कूल का सामान्य ज्ञान नहीं है। इसमें कॉलेज स्तर और स्नातक स्तर की समस्याएं शामिल हैं। कुछ प्रश्न आसान हैं (जैसे कोशिका के भाग को पहचानना), जबकि अन्य कठिन हैं (जैसे विद्युत क्षेत्रों से संबंधित जटिल समीकरणों को हल करना या भूवैज्ञानिक मानचित्रों की व्याख्या करना)।
  • दृश्य संकेत (Visuals): आप इन समस्याओं को केवल टेक्स्ट पढ़कर हल नहीं कर सकते। प्रश्नों के साथ "विजुअल क्लूज़" आते हैं जैसे रासायनिक संरचनाएं, ग्राफ, स्टार चार्ट और वास्तुशिल्प आरेख। AI को एक साथ "देखना" और "पढ़ना" पड़ता है।
  • "उत्तर कुंजी" (The Answer Key): यह सबसे महत्वपूर्ण हिस्सा है। अन्य परीक्षणों के विपरीत जो केवल अंतिम उत्तर देते हैं, SciVQR में विशेषज्ञों द्वारा लिखे गए समाधान पथ (solution paths) शामिल हैं। यह एक मास्टर टीचर की नोटबुक होने जैसा है जो दिखाता है कि समस्या को शुरू से अंत तक कैसे हल किया जाए। यह शोधकर्ताओं को यह जांचने की अनुमति देता है कि AI का तर्क तार्किक है या वह केवल 'हैलुसिनेट' (मनगढ़ंत बातें बनाना) कर रहा है।

3. टेस्ट ड्राइव: रोबोटों का प्रदर्शन कैसा रहा?

शोधकर्ताओं ने शीर्ष AI मॉडलों (दोनों मुफ्त, ओपन-सोर्स और महंगे, "प्रोपराइटरी" जैसे GPT-4o) को इस परीक्षा के माध्यम से गुजारा। यहाँ उन्होंने क्या पाया:

  • "तर्क" की महाशक्ति (The "Reasoning" Superpower): वे मॉडल जिन्हें विशेष रूप से "चरण-दर-चरण सोचने" के लिए प्रशिक्षित किया गया था (जैसे कि एक रोबोट जो कार्य करने से पहले अपनी चाल की योजना बनाने के लिए रुकता है), वे काफी बेहतर प्रदर्शन करते हैं। यह एक ऐसे रोबोट के बीच का अंतर है जो अनुमान लगाता है और एक ऐसे रोबोट के बीच जो गणना करता है।
  • अंतर कम हो रहा है, लेकिन अभी भी मौजूद है: सर्वश्रेष्ठ ओपन-सोर्स मॉडल महंगे मॉडलों की बराबरी कर रहे हैं, लेकिन "रीजनिंग-ऑप्टिमाइज्ड" मॉडल (वे जो गहराई से सोचते हैं) अभी भी जीतते हैं।
  • विषयों में संघर्ष: रोबोट गणित और भौतिकी में आश्चर्यजनक रूप से खराब थे। इन विषयों के लिए भारी गणना और सख्त तर्क की आवश्यकता होती है। वे जीव विज्ञान और भूगोल में बेहतर थे, जो तथ्यों को याद रखने और टेक्स्ट को समझने पर अधिक निर्भर करते हैं।
  • "अपना काम दिखाओ" का प्रभाव: जब शोधकर्ताओं ने मॉडलों से उनके सोचने की प्रक्रिया समझाने को कहा (Chain-of-Thought), तो मॉडल समस्याओं को हल करने में बेहतर हो गए। हालाँकि, कुछ मॉडल निर्देशों से भ्रमित हो गए, जो दर्शाता है कि वे अभी भी जटिल निर्देशों का पालन करने में संघर्ष करते हैं।

4. निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI स्मार्ट हो रहा है, लेकिन इसमें अभी भी "वास्तविक वैज्ञानिक बुद्धिमत्ता" की कमी है। यह अक्सर तथ्यों को याद कर सकता है या पैटर्न पहचान सकता है, लेकिन यह दृश्य जानकारी को गहरे, बहु-चरणीय तर्क के साथ जोड़ने में संघर्ष करता है।

SciVQR एक उपकरण है जो AI को अनुमान लगाकर "चीटिंग" करने से रोकने के लिए है। यह मॉडलों को यह साबित करने के लिए मजबूर करता है कि वे विज्ञान को समझते हैं, न कि केवल शब्दों को। शोधकर्ताओं को उम्मीद है कि यह बेंचमार्क डेवलपर्स को ऐसा AI बनाने के लिए प्रेरित करेगा जो केवल उत्तर नहीं देता, बल्कि वास्तव में यह समझता है कि ब्रह्मांड कैसे काम करता है।

संक्षेप में: SciVQR एक कठोर, दृश्य, बहु-विषयक विज्ञान परीक्षण है जो AI मॉडलों से उनका होमवर्क दिखाने की मांग करता है। यह प्रकट करता है कि हालांकि AI में सुधार हो रहा है, लेकिन इसे अभी भी एक सर्च इंजन के बजाय एक वैज्ञानिक की तरह सोचना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →