InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
यह शोध पत्र InfiniteScienceGym पेश करता है, जो एक प्रक्रियात्मक रूप से जनरेट किया गया बेंचमार्क है जो बड़े भाषा मॉडलों (LLMs) के साक्ष्य-आधारित तर्क और टूल उपयोग का मूल्यांकन करने के लिए सत्यापन योग्य प्रश्नों के साथ स्व-निहित वैज्ञानिक रिपॉजिटरी बनाता है, जिससे यह पता चलता है कि वर्तमान मॉडल सटीकता और अनुत्तरित प्रश्नों की पहचान करने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वैज्ञानिक बनना सिखाने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं: क्या यह रोबोट वास्तव में डेटा के एक बिखरे हुए ढेर को देख सकता है, यह समझ सकता है कि उसका क्या अर्थ है, और यह स्वीकार कर सकता है कि किसी समस्या को हल करने के लिए उसके पास पर्याप्त जानकारी नहीं है?
"InfiniteScienceGym" नामक शोध पत्र इस बात का परीक्षण करने का एक नया, चतुर तरीका पेश करता है। वास्तविक वैज्ञानिक शोध पत्रों की एक विशाल, स्थिर लाइब्रेरी देने के बजाय (जो महंगी है, पक्षपाती है और जिसमें कई पेचीदगियां हैं), उन्होंने एक वीडियो गेम सिम्युलेटर बनाया है जो हर बार एक नया, अनूठा वैज्ञानिक संसार तुरंत तैयार करता है।
यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:
1. समस्या: "पाठ्यपुस्तक" का जाल (The "Textbook" Trap)
वर्तमान में, हम AI वैज्ञानिकों का परीक्षण वास्तविक दुनिया के डेटा (जैसे प्रकाशित शोध पत्रों) का उपयोग करके करते हैं। यह एक ड्राइवर को केवल एक बंद ट्रैक पर, धूप वाले आदर्श दिन पर टेस्ट करने जैसा है।
- पक्षपात (The Bias): वास्तविक शोध पत्र केवल "सफलता की कहानियाँ" दिखाते हैं। वे उन असफल प्रयोगों को छिपा देते हैं जहाँ डेटा अव्यवset या अनिर्णायक था।
- याददाश्त की चाल (The Memory Trick): यदि आप किसी AI से किसी प्रसिद्ध अध्ययन के बारे में पूछते हैं, तो हो सकता है कि वह वास्तव में डेटा को पढ़ने के बजाय अपने प्रशिक्षण डेटा से उत्तर को बस "याद" कर ले। यह एक छात्र की नकल करने जैसा है जिसने गणित समझने के बजाय उत्तर कुंजी (answer key) रट ली है।
- भंडारण की समस्या (The Storage Issue): वास्तविक वैज्ञानिक डेटा बहुत बड़ा होता है। AI को टेस्ट करने के लिए टेराबाइट्स डेटा स्टोर करना ऐसा है जैसे यह जांचने के लिए कि क्या कोई एक वाक्य पढ़ सकता है, अपने बैग में पूरी लाइब्रेरी लेकर चलना।
2. समाधान: "अनंत विज्ञान जिम" (The "Infinite Science Gym")
लेखकों ने एक प्रोसीजरल जनरेटर (procedural generator) बनाया है। इसे एक वीडियो गेम इंजन (जैसे Minecraft या No Man's Sky) की तरह समझें जो हर बार "Start" दबाने पर एक नया, अनूठा संसार बनाता है।
- बीज (The Seed): आप सिस्टम को एक रैंडम नंबर (एक "सीड") देते हैं।
- दुनिया (The World): उस सीड के आधार पर, सिस्टम तुरंत एक नकली वैज्ञानिक प्रोजेक्ट बनाता है। यह बनाता है:
- एक फोल्डर संरचना (जैसे सब-फोल्डर्स के साथ एक बिखरा हुआ डेस्कटॉप)।
- नकली डेटा फाइलें (संख्याओं के साथ स्प्रेडशीट्स)।
- एक प्रोजेक्ट विवरण (एक नकली शोध योजना)।
- ट्विस्ट (The Twist): सिस्टम "चीट कोड" (ग्राउंड ट्रुथ) जानता है। वह ठीक जानता है कि संख्याएँ कैसे बनाई गई थीं।
3. परीक्षण: "सब कुछ जानने वाला" बनाम "ईमानदार" रोबोट
एक बार जब नकली दुनिया बन जाती है, तो सिस्टम AI से प्रश्न पूछता है। दो प्रकार के प्रश्न होते हैं:
- हल करने योग्य पहेली (The Solvable Puzzle): "फोल्डर X के डेटा के आधार पर, औसत तापमान क्या है?"
- लक्ष्य: क्या AI फाइल ढूंढ सकता है, संख्याओं को पढ़ सकता है और गणित कर सकता है?
- जाल (The Trap): "फोल्डर X के डेटा के आधार पर, चंद्रमा का औसत तापमान क्या है?"
- लक्ष्य: क्या AI यह समझ पाता है कि, "रुको, मेरे पास इस फोल्डर में चंद्रमा के बारे में कोई डेटा नहीं है। मुझे कोई भी नंबर बताने के बजाय यह कहना चाहिए कि 'मुझे नहीं पता'"?
यह महत्वपूर्ण है। वास्तविक विज्ञान में, यह स्वीकार करना कि "हमारे पास पर्याप्त डेटा नहीं है" अक्सर सही उत्तर होता है। आज के अधिकांश AI इस मामले में खराब हैं; वे स्मार्ट दिखने के लिए अंदाज़ा लगाने की कोशिश करते हैं।
4. पैराफ्रेस (The Paraphrase): "मानव अनुवादक"
सिस्टम प्रश्नों को एक रोबोटिक, कोड-नुमा प्रारूप में उत्पन्न करता है। इसे निष्पक्ष बनाने के लिए, दूसरा AI इन प्रश्नों को प्राकृतिक मानवीय भाषा में फिर से लिखता है।
- रोबोट संस्करण: "Filter rows where pH > 4.0. Calculate median."
- मानव संस्करण: "जिन प्रयोगों में अम्लता (acidity) अधिक थी, उनके लिए ग्लूकोज का मध्य मान (middle value) क्या था?"
यह सुनिश्चित करता है कि AI केवल कोड पढ़ने में अच्छा नहीं है, बल्कि यह भी समझ सकता है कि एक वास्तविक मानव शोधकर्ता कैसे प्रश्न पूछेगा।
5. परिणाम: "ब्रूट फोर्स" बनाम "स्मार्ट टूल"
लेखकों ने शीर्ष AI मॉडलों (जैसे GPT-5 और Claude) का इस जिम में परीक्षण किया। यहाँ उन्हें क्या मिला:
- कोई भी पूर्ण नहीं है: सबसे अच्छा AI भी केवल 45% प्रश्नों का सही उत्तर दे पाया। वे अभी भी वैज्ञानिक बनने में खराब हैं।
- "मुझे नहीं पता" वाली समस्या (The "I Don't Know" Problem): लगभग सभी मॉडल यह स्वीकार करने में विफल रहे कि एक प्रश्न का उत्तर देना असंभव था। वे अंदाज़ा लगाते रहे, भले ही डेटा गायब था।
- "टोकन" का जाल (The "Token" Trap): कुछ लोग सोचते हैं कि अधिक "टोकन" (शब्दों/प्रोसेसिंग पावर) का उपयोग करने का मतलब है कि AI अधिक गहराई से सोच रहा है। शोध ने इसके विपरीत पाया।
- बेवकूफी भरी रणनीति (The Dumb Strategy): AI पूरी फाइल को अपनी मेमोरी में पढ़ लेता है (जैसे एक वाक्य खोजने के लिए पूरी किताब याद करने की कोशिश करना)। इसमें बहुत ऊर्जा खर्च होती है और अक्सर गलतियों की ओर ले जाती है।
- स्मार्ट रणनीति (The Smart Strategy): सर्वश्रेष्ठ मॉडलों ने टूल्स (उपकरणों) का उपयोग किया। पूरी फाइल पढ़ने के बजाय, उन्होंने कंप्यूटर को एक छोटा सा कोड लिखने को कहा: "हे, मेरे लिए इन पंक्तियों को गिनो।" उन्होंने गणित अपने दिमाग में करने के बजाय कंप्यूटर को कैलकुलेटर के रूप में इस्तेमाल किया।
मुख्य निष्कर्ष (The Big Takeaway)
InfiniteScienceGym एक स्ट्रेस टेस्ट है। यह एक नियंत्रित वातावरण है जहाँ हम उत्तरों को पूरी तरह से जानते हैं। यह प्रकट करता है कि हालांकि AI निबंध लिखने और कोडिंग में बेहतर हो रहा है, लेकिन यह वैज्ञानिक तर्क (scientific reasoning) में अभी भी बहुत खराब है: विशेष रूप से, यह जानने में कि कब रुकना है, कब कहना है "मुझे नहीं पता," और कब भारी काम करने के लिए खुद कोशिश करने के बजाय एक टूल का उपयोग करना है।
यह महसूस करने जैसा है कि एक छात्र जो आवर्त सारणी (periodic table) सुना सकता है, वह आवश्यक रूप से एक अच्छा रसायन शास्त्री नहीं है यदि वह यह नहीं समझ सकता कि एक विशिष्ट प्रयोग क्यों विफल हुआ।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।