NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?
यह शोधपत्र नेचर-परिवार के प्रकाशनों से व्युत्पन्न नेचरबेंच (NatureBench) को प्रस्तुत करता है जो यह प्रकट करता है कि वर्तमान एआई कोडिंग एजेंट वास्तविक वैज्ञानिक खोज कार्यों में मौजूदा अत्याधुनिक (SOTA) स्तरों को पार करने के लिए संघर्ष कर रहे हैं, जो मुख्य रूप से वास्तविक आविष्कार के बजाय पद्धतिगत अनुवाद के माध्यम से सफल होते हैं और गलत विधि चयन एवं सीमित कंप्यूट बजट के कारण विफल हो जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक विशाल, उच्च-दांव वाली कुकिंग प्रतियोगिता चल रही है। जज (शोधकर्ता) के पास दुनिया की सबसे प्रतिष्ठित पाक पत्रिकाओं (Nature परिवार के वैज्ञानिक जर्नल्स) से 90 अविश्वसनीय रूप से जटिल व्यंजनों (रेसिपी) से भरी एक कुकबुक है। ये केवल "टोस्ट कैसे बनाएं" जैसी रेसिपी नहीं हैं; ये "प्रोटीन संरचना को डिकोड करने" या "एक नए ड्रग मॉलिक्यूल के व्यवहार की भविष्यवाणी करने" जैसे जटिल व्यंजन हैं।
इस प्रतियोगिता के प्रतियोगी AI कोडिंग एजेंट्स हैं—स्मार्ट कंप्यूटर प्रोग्राम जिन्हें कोड लिखने और समस्याओं को हल करने के लिए डिज़ाइन किया गया है।
यहाँ ट्विस्ट यह है: प्रतियोगियों को मूल रेसिपी देखने की अनुमति नहीं है। उन्हें केवल कच्चा माल (डेटा) और इस बात का विवरण दिया जाता है कि अंतिम व्यंजन का स्वाद कैसा होना चाहिए (लक्ष्य)। उनका काम एक ऐसा तरीका आविष्कार करना है जिससे वे एक ऐसा व्यंजन बना सकें जो मूल पुरस्कार विजेता संस्करण जितना अच्छा हो, या उससे भी बेहतर हो।
यह कहानी NatureBench की है, जो एक नया परीक्षण है यह देखने के लिए कि क्या AI केवल एक रेसिपी की नकल करने से आगे बढ़कर वास्तव में एक नई रेसिपी का आविष्कार कर सकता है।
समस्या: "कॉपी-पेस्ट" का जाल
इससे पहले, कई AI बेंचमार्क किसी छात्र को गणित का सवाल और उसका उत्तर (answer key) देने जैसा था, और फिर उनसे अपना काम दिखाने के लिए कहना था। यदि छात्र ने बस उत्तर की नकल की, तो वह पास हो गया। लेकिन वास्तविक विज्ञान नकल करने के बारे में नहीं है; यह खोज के बारे में है।
NatureBench के रचनाकारों ने महसूस किया कि पिछले परीक्षण अव्यवस्थित थे। कभी-कभी "रसोई" (कंप्यूटर वातावरण) खराब होती थी, या सामग्री गायब होती थी, जिससे यह बताना असंभव हो जाता था कि AI इसलिए विफल हुआ क्योंकि वह मूर्ख था या इसलिए क्योंकि परीक्षण पक्षपाती था।
इसे ठीक करने के लिए, उन्होंने NatureGym बनाया। NatureGym को एक सुपर-संगठित, स्वचालित किचन क्रू के रूप में समझें।
- फ़िल्टर: उन्होंने हजारों शोध पत्रों को स्कैन किया और केवल उन 90 को चुना जो निष्पक्ष थे, जिनमें सभी सामग्रियां उपलब्ध थीं, और जिन्हें मशीन द्वारा ग्रेड किया जा सकता था।
- फायरवॉल: उन्होंने AI के चारों ओर एक "कांच की दीवार" बनाई। AI सामग्री और लक्ष्य को देख सकता है, लेकिन वह मूल शेफ के नोट्स या जीतने वाले व्यंजन में इस्तेमाल किए गए गुप्त सॉस को नहीं देख सकता।
- कंटेनर: प्रत्येक कार्य को अपने स्वयं के सीलबंद, पूर्ण रसोई (कंटेनर) में रखा गया है ताकि AI बाहरी टूल या इंटरनेट का उपयोग करके धोखाधड़ी न कर सके।
प्रतियोगिता: AI ने कैसा प्रदर्शन किया?
उन्होंने 10 सबसे स्मार्ट AI "शेफ" (जैसे Claude Opus 4.7, GPT-5.5, और Gemini 3.5) को इन 90 व्यंजनों को हल करने के लिए आमंत्रित किया। उनके पास एक सख्त नियम था: गूगलिंग वर्जित है। उन्हें इसे शून्य से समझना था।
परिणाम निराशाजनक थे:
- "काफी अच्छा" क्लब: सबसे अच्छे AI ने भी मूल, पुरस्कार विजेता रेसिपी से मेल खाने में केवल 48% बार सफलता प्राप्त की।
- "मूल से बेहतर" क्लब: AI केवल 18% मामलों में ही मूल से बेहतर व्यंजन बनाने में सफल रहा।
- रियलिटी चेक: बाकी 82% समय में, AI या तो मूल से खराब व्यंजन बनाता था या उसे पूरा करने में असमर्थ रहता था।
वे कैसे सफल (और विफल) हुए?
शोधकर्ताओं ने यह समझने के लिए कि परिणाम क्या थे, इस पर बारीकी से नज़र रखी कि AI शेफ कैसे काम करते हैं।
जीतने की रणनीति: "ट्रांसलेशन ट्रिक"
जब AI सफल हुआ, तो उसने आमतौर पर कोई शानदार वैज्ञानिक खोज नहीं की। इसके बजाय, उसने मेथोडोलॉजिकल ट्रांसलेशन (Methodological Translation) नामक एक ट्रिक का उपयोग किया।
- उपमा: कल्पना कीजिए कि मूल रेसिपी एक जटिल फ्रेंच सूफ़ले (एक कठिन वैज्ञानिक समस्या) के लिए थी। AI ने सूफ़ले बनाने की कोशिश नहीं की। इसके बजाय, उसने सामग्रियों को देखा और कहा, "हे, यह एक पिज्जा जैसा दिखता है जिसे मैं बनाना जानता हूँ!" उसने कठिन वैज्ञानिक समस्या को एक सरल, परिचित गणितीय समस्या में बदल दिया जिसे उसने लाखों बार देखा था।
- 45% सफलताएं इसलिए हुईं क्योंकि AI ने विज्ञान को एक मानक "उत्तर का अनुमान लगाने वाले" खेल में बदल दिया। उसने नई विज्ञान की खोज नहीं की; उसने बस नए डेटा पर पुराने तरीकों को लागू किया।
हारने की रणनीति: "गलत उपकरण और समय की कमी"
जब AI विफल हुआ, तो यह आमतौर पर इसलिए नहीं था क्योंकि वह निर्देशों को नहीं समझ पाया।
- गलत टूल (45%): इसने गलत "किचन गैजेट" चुन लिया। इसने ब्लेंडर का उपयोग करने की कोशिश की जब इसे व्हिस्क (whisk) की आवश्यकता थी। इसने एक ऐसी विधि चुनी जो उस प्रकार की समस्या के लिए मौलिक रूप से गलत थी।
- समय/पैसे की कमी (24%): AI ने खाना बनाना शुरू किया लेकिन व्यंजन को पूरा करने के लिए आवश्यक 4 घंटे की समय सीमा या कंप्यूटर पावर (बजट) समाप्त हो गया।
- गलतफहमी (दुर्लभ): यह बहुत दुर्लभ था कि AI यह न समझ पाया कि व्यंजन कैसा होना चाहिए।
कठिनाई के स्तर
सभी रेसिपी समान रूप से कठिन नहीं थीं।
- आसान व्यंजन: "रिलेशनल रीजनिंग" (बिंदुओं को जोड़ना) और "प्रोटीन बायोलॉजी" से जुड़े कार्यों में AI सबसे आसान पाया गया।
- कठिन व्यंजन: "फिजिकल मॉडलिंग" (भौतिकी का अनुकरण करना) और "मॉलिक्यूलर डिज़ाइन" सबसे कठिन थे।
- "फ्रेंकेंस्टीन" व्यंजन: सबसे कठिन कार्य वे थे जिन्होंने दो अलग-अलग क्षेत्रों को मिलाया (जैसे जीव विज्ञान और भौतिकी को मिलाना)। AI अलग-अलग "व्यंजनों" के ज्ञान को मिलाने में संघर्ष करता रहा।
मुख्य निष्कर्ष
NatureBench हमें बताता है कि हालांकि AI कोडिंग एजेंट्स निर्देशों का पालन करने और बग्स को ठीक करने में बहुत अच्छे होते जा रहे हैं, लेकिन वे अभी तक सच्चे वैज्ञानिक आविष्कारक नहीं हैं।
वे एक जटिल वैज्ञानिक समस्या को लेने और यह कहने में उत्कृष्ट हैं, "मुझे इसके लिए एक शॉर्टकट पता है!" लेकिन वे अभी तक किसी समस्या को देखकर यह कहने में सक्षम नहीं हैं, "मेरे पास एक बिल्कुल नया विचार है जो अभी तक किसी इंसान के दिमाग में नहीं आया है।"
पेपर यह निष्कर्ष निकालता है कि AI को वास्तव में विज्ञान में मदद करने के लिए, हमें केवल इसे विजेजों की नकल करने के लिए कहना बंद करना होगा और इसे यह सिखाना शुरू करना होगा कि सही उपकरण कैसे चुनें और एक कोडर के बजाय एक वैज्ञानिक की तरह कैसे सोचें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।