← नवीनतम पेपर
🤖 AI

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

यह शोध पत्र SciCodePile पेश करता है, जो एक विशाल 128GB का वैज्ञानिक कोड कॉर्पस और 200 कार्यों का एक निष्पादन योग्य बेंचमार्क है, यह प्रदर्शित करने के लिए कि वर्तमान बड़े भाषा मॉडल वैज्ञानिक कोड जनरेशन में काफी संघर्ष करते हैं, जबकि यह भी दर्शाता है कि इस डेटासेट पर प्रशिक्षण करने से उनके प्रदर्शन में पर्याप्त सुधार होता है।

मूल लेखक: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

प्रकाशित 2026-07-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को कोड लिखना सिखाने की कोशिश कर रहे हैं। आप उसे पहले ही बुनियादी बातें सिखा चुके हैं: जैसे एक साधारण वेबसाइट बनाना, कैलकुलेटर बनाना, या एक प्लेलिस्ट को व्यवस्थित करना। वह इन "सामान्य" कार्यों के लिए काफी अच्छा है क्योंकि उसने इनके बारे में लाखों किताबें और वेबसाइटें पढ़ी हैं। लेकिन अब, आप यह देखना चाहते हैं कि क्या यह रोबोट वास्तव में कठिन काम संभाल सकता है: वैज्ञानिकों के लिए कोड लिखना। हम उस कोड की बात कर रहे हैं जो यह सिम्युलेट करता है कि एक वायरस कैसे फैलता है, एक प्रोटीन के फोल्डिंग की गणना कैसे होती है, या एक नई दवा में परमाणुओं के व्यवहार को कैसे मॉडल किया जाता है। यह "वैज्ञानिक कोड" (scientific code) है। यह सामान्य कोड से अलग है क्योंकि यह केवल कंप्यूटर को कुछ करने के लिए कहने के बारे में नहीं है; यह इस बारे में है कि कंप्यूटर का गणित और तर्क प्रकृति के वास्तविक, जटिल और अव्यवस्थित नियमों से मेल खाता है या नहीं। यदि रोबोट सिंटैक्स (syntax) तो सही लिख देता है लेकिन विज्ञान गलत हो जाता है, तो परिणाम केवल एक बग नहीं होगा—यह एक विफल प्रयोग या एक खतरनाक गलत गणना होगी। बड़ा सवाल यह है: क्या हमारे वर्तमान AI रोबोट, जो मानक कोड लिखने में माहिर हैं, वास्तव में वैज्ञानिकों के भारी काम को संभाल सकते हैं?

यहाँ आता है SCICODEPILE, एक विशाल नया प्रोजेक्ट जो इन AI रोबोट्स के लिए एक विशाल, विशिष्ट प्रशिक्षण मैदान और एक कठोर अंतिम परीक्षा की तरह कार्य करता है। इस पेपर के पीछे के शोधकर्ताओं ने निर्णय लिया कि यदि वे वास्तव में यह परीक्षण करना चाहते हैं कि क्या AI वैज्ञानिक कोडिंग को संभाल सकता है, तो उन्हें दो चीजों की आवश्यकता होगी: वास्तविक दुनिया के वैज्ञानिक कोड का एक विशाल पुस्तकालय जिससे वे अध्ययन कर सकें, और एक सख्त परीक्षण जहाँ कोड को वास्तव में चलना और काम करना चाहिए, न कि केवल कागज पर अच्छा दिखना चाहिए।

सबसे पहले, उन्होंने पुस्तकालय बनाया। उन्होंने केवल रैंडम कोड नहीं उठाया; वे इंटरनेट पर 37,737 सार्वजनिक कोड रिपॉजिटरी (repositories) में शिकार करने गए, विशेष रूप से रसायन विज्ञान, जीव विज्ञान, भौतिकी और अन्य विज्ञानों से संबंधित परियोजनाओं की तलाश की। उन्होंने बेकार चीज़ों को छाँटा और अंत में वैज्ञानिक कोड का एक विशाल संग्रह 128GB प्राप्त किया। इसे एक ऐसे पुस्तकालय के रूप में सोचें जिसमें हजारों वास्तविक वैज्ञानिक प्रयोगशालाओं से हर निर्देश पुस्तिका, हर ब्लूप्रिंट और हर कोड शामिल है। उन्होंने इस पुस्तकालय को चार अलग-अलग तरीकों से व्यवस्थित किया: कच्चे कोड फ़ाइलें (raw code files), परियोजनाओं के सारांश, विशिष्ट फंक्शनों के निर्देश, और समस्या-समाधान के जोड़े। यह एक अस्त-व्यस्त गैरेज में कार के पुर्जों को एक पूरी तरह से लेबल किए गए संग्रहालय में व्यवस्थित करने जैसा है जहाँ आप इंजन, मैनुअल और यह देख सकते हैं कि पुर्जे एक साथ कैसे फिट होते हैं।

इसके बाद, उन्होंने परीक्षा बनाई। उन्होंने 200 कार्यों का एक बेंचमार्क तैयार किया। लेकिन असली बात यह है: उन्होंने AI को केवल कोड लिखने और यह जाँचने के लिए नहीं कहा कि क्या यह किसी इंसान के उत्तर के समान दिखता है। उन्होंने AI के कोड को एक "सैंडबॉक्स" में रखा—एक सुरक्षित, अलग डिजिटल खेल का मैदान—और इसे चलाया। यदि कोड क्रैश हो गया, गलत नंबर दिया, या टेस्ट में विफल रहा, तो वह फेल था। यह एक पास/फेल टेस्ट था कि क्या कोड वास्तव में काम कर रहा था।

तो, रोबोटों ने कैसा प्रदर्शन किया? परिणाम एक वास्तविकता का अहसास (reality check) थे। यहाँ तक कि सबसे स्मार्ट AI मॉडल भी, जो आमतौर पर कोडिंग टेस्ट में अव्वल आते हैं, वैज्ञानिक चीजों के साथ संघर्ष करते दिखे। "रिक्त स्थान भरें" शैली के कार्यों पर, सर्वश्रेष्ठ मॉडल केवल पूर्ण स्कोर के 38% तक ही पहुँच पाए। लेकिन "इसे काम करने दो" वाली परीक्षा पर, आंकड़े और भी स्पष्ट थे। सबसे अच्छे मॉडल ने केवल 12.30% बार ही सफलता प्राप्त की। इसका मतलब है कि हर 100 वैज्ञानिक कोडिंग समस्याओं में से, AI ने 88 गलतियाँ कीं। यह सुझाव देता है कि हालांकि AI ऐसा कोड लिखने में अच्छा होता जा रहा है जो सही दिखता है, लेकिन यह अभी भी वैज्ञानिक रूप से विश्वसनीय कोड लिखने से बहुत दूर है।

शोधकर्ताओं ने यह भी दिखाया कि यह नया पुस्तकालय वास्तव में रोबोटों को सिखाने के लिए उपयोगी है। जब उन्होंने एक छोटे AI मॉडल को उनके 128GB के पुस्तकालय का अध्ययन करने दिया, तो इसके प्रदर्शन में उल्लेखनीय उछाल आया। यह एक छात्र को कुछ फ्लैशकार्ड देने के बजाय किताबों का ढेर देने जैसा है; अचानक, वे सामग्री को बहुत बेहतर तरीके से समझते हैं।

संक्षेप में, SCICODEPILE एक विशाल नया उपकरण है जो कहता है, "हे, AI, तुम कोडिंग में अच्छे हो, लेकिन तुम अभी वैज्ञानिक बनने के लिए तैयार नहीं हो।" यह उन्हें बेहतर प्रशिक्षित करने के लिए संसाधन और यह देखने के लिए सख्त परीक्षण प्रदान करता है कि क्या उन्होंने वास्तव में सीखा है। यह एक चेतावनी है कि जबकि हम बड़ी प्रगति कर रहे हैं, एक रोबोट जो कोड लिख सकता है और एक रोबोट जो वास्तविक विज्ञान कर सकता है, उसके बीच अभी भी एक बड़ा अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →