← नवीनतम पेपर
🤖 AI

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

यह शोधपत्र D3-Gym को प्रस्तुत करता है, जो चार विषयों में 565 सत्यापन योग्य, वास्तविक दुनिया के वैज्ञानिक कार्यों वाला पहला स्वचालित रूप से निर्मित डेटासेट है, जो उच्च गुणवत्ता वाले प्रशिक्षण वातावरण और मूल्यांकन संकेत प्रदान करके डेटा-संचालित खोज में ओपन-सोर्स भाषा मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ D3-Gym पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: विज्ञान का "ब्लैक बॉक्स" (Black Box)

कल्पना कीजिए कि आप एक रोबोट को वैज्ञानिक बनना सिखाना चाहते हैं। आप उसे एक पाठ्यपुस्तक (एक लार्ज लैंग्वेज मॉडल) देते हैं और उसे रसायन विज्ञान की कोई समस्या हल करने या किसी मानचित्र का विश्लेषण करने के लिए कहते हैं। समस्या यह है कि वास्तविक दुनिया के विज्ञान में, कोई "उत्तर कुंजी" (answer key) नहीं होती जो स्वचालित रूप से आपको बता सके कि रोबोट सही है या गलत।

सॉफ्टवेयर कोडिंग में, यदि कोई प्रोग्राम क्रैश हो जाता है, तो आपको पता चल जाता है कि वह विफल रहा। लेकिन विज्ञान में, एक प्रोग्राम पूरी तरह से चल सकता है, एक ग्राफ प्रिंट कर सकता है, और फिर भी वैज्ञानिक रूप से निरर्थक हो सकता है। अब तक, शोधकर्ताओं को हर एक उत्तर को मैन्युअल रूप से जांचना पड़ता था, जो धीमा, महंगा और बड़े पैमाने पर करना असंभव था। उत्तरों को स्वचालित रूप से सत्यापित करने के तरीके के बिना, हम इन AI "वैज्ञानिकों" को प्रभावी ढंग से प्रशिक्षित नहीं कर सकते।

समाधान: D3-Gym (वैज्ञानिक जिम)

लेखकों ने D3-Gym बनाया है, जो एक विशाल, स्वचालित AI वैज्ञानिकों के लिए प्रशिक्षण जिम की तरह है।

इसे इस तरह समझें:

  • पुराना तरीका: एक छात्र एक निबंध लिखता है, और एक प्रोफेसर उसे हाथ से ग्रेड करने में 3 घंटे बिताता है। आप दिन में केवल कुछ ही निबंधों को ग्रेड कर सकते हैं।
  • D3-Gym का तरीका: सिस्टम वास्तविक वैज्ञानिक अनुसंधान से 565 अलग-अलग "परीक्षाएं" (कार्य) स्वचालित रूप से उत्पन्न करता है। महत्वपूर्ण बात यह है कि, प्रत्येक परीक्षा के लिए, यह एक जादुई ग्रेडिंग मशीन (एक मूल्यांकन स्क्रिप्ट) भी बनाता है जो वैज्ञानिक नियमों के आधार पर तुरंत जान लेती है कि उत्तर सही है या नहीं, न कि केवल वर्तनी (spelling) के आधार पर।

उन्होंने इसे कैसे बनाया (असेंबली लाइन)

इस जिम का निर्माण करना कठिन था क्योंकि वैज्ञानिक कार्य बहुत अव्यवस्थित होते हैं। लेखकों ने कच्चे वैज्ञानिक अनुसंधान कोड को एक प्रशिक्षण अभ्यास में बदलने के लिए चार-चरणीय असेंबली लाइन बनाई:

  1. खोज अभियान (Scavenger Hunt): उन्होंने वास्तविक डेटा का उपयोग करने वाले कार्यों को खोजने के लिए AutoSDT नामक टूल का उपयोग किया, जो हजारों वास्तविक वैज्ञानिक GitHub रिपॉजिटरी (जैसे डिजिटल लाइब्रेरी) में खोज करता है।
  2. "वास्तविकता" फ़िल्टर (The "Realness" Filter): उन्होंने किसी भी ऐसे कार्य को हटा दिया जिसने नकली या बनावटी डेटा का उपयोग किया था। उन्होंने केवल उन कार्यों को रखा जहाँ कोड वास्तव में भौतिक दुनिया के डेटा (जैसे वास्तविक मौसम मानचित्र या वास्तविक DNA अनुक्रम) पर चलता है।
  3. परीक्षण रन (The Trial Run): उन्होंने कोड को खुद चलाया ताकि यह सुनिश्चित हो सके कि यह वास्तव में काम करता है और एक परिणाम देता है। यदि कोड क्रैश हो गया या कचरा (garbage) पैदा किया, तो उन्होंने उसे हटा दिया।
  4. जादुई ग्रेडर (The Magic Grader - असली सीक्रेट): यह सबसे कठिन हिस्सा है। प्रत्येक कार्य के लिए, उन्होंने एक अत्यंत बुद्धिमान AI का उपयोग करके एक कस्टम "ग्रेडिंग स्क्रिप्ट" लिखी।
    • उपमा: कल्पना कीजिए कि कार्य है "वायरस के प्रसार की भविष्यवाणी करना।" AI केवल यह नहीं देखता कि फ़ाइल मौजूद है या नहीं; यह जाँचता है कि क्या अनुमानित संख्याएँ जैविक रूप से तर्कसंगली हैं, क्या ग्राफ सही दिखता है, और क्या गणित सटीक है। यह उस विशिष्ट समस्या के लिए एक कस्टम टेस्ट लिखता है।

जिम के अंदर क्या है?

D3-Gym में चार प्रमुख वैज्ञानिक क्षेत्रों से लिए गए 565 विशिष्ट चैलेंज शामिल हैं:

  • बायोइन्फॉर्मेटिक्स (Bioinformatics): DNA और प्रोटीन का विश्लेषण।
  • कंप्यूटेशनल केमिस्ट्री (Computational Chemistry): परमाणु कैसे जुड़ते हैं, इसका सिमुलेशन।
  • भौगोलिक सूचना विज्ञान (Geographic Information Science): मौसम और भूभाग का मानचित्रण।
  • मनोविज्ञान और तंत्रिका विज्ञान (Psychology & Neuroscience): मस्तिष्क की तरंगों और संज्ञानात्मक डेटा का विश्लेषण।

प्रत्येक चुनौती के साथ आता है:

  • "परीक्षा प्रश्न" (निर्देश)।
  • "पाठ्यपुस्तक" (डेटा फाइलें)।
  • "उत्तर कुंजी" (एक संदर्भ समाधान)।
  • "ग्रेडिंग मशीन" (मूल्यांकन स्क्रिप्ट)।

क्या यह काम आया? (परिणाम)

शोधकर्ताओं ने इन कार्यों पर विभिन्न आकार के AI मॉडल (छोटे से लेकर बहुत बड़े तक) को प्रशिक्षित करके इस जिम का परीक्षण किया।

  • "गोल्ड स्टैंडर्ड" की जाँच: उन्होंने अपने AI-जनरेटेड ग्रेडिंग स्क्रिप्ट की तुलना मानव विशेषज्ञों से की। AI ग्रेडर 87.5% बार मनुष्यों से सहमत हुए। यह साबित करता है कि "ग्रेडिंग मशीनें" वैज्ञानिक रूप से सुदृढ़ हैं।
  • प्रशिक्षण का बढ़ावा (The Training Boost): जब उन्होंने D3-Gym से "ट्रैजेक्टरीज" (चरण-दर-चरण सोच और कोडिंग) का उपयोग करके AI मॉडल को प्रशिक्षित किया, तो मॉडल वैज्ञानिक समस्याओं को हल करने में बहुत बेहतर हो गए।
    • उपमा: यह एक ऐसे छात्र को लेने जैसा है जिसने एक टेस्ट में 19% स्कोर किया, उसे एक विशेष प्रशिक्षण व्यवस्था दी, और उसे देखते हुए कि वह 27% तक उछल गया।
    • आश्चर्य: एक मध्यम आकार के मॉडल (32B पैरामीटर्स) ने, जिसे D3-Gym पर प्रशिक्षित किया गया था, एक बहुत बड़े, निजी मॉडल (235B पैरामीटर्स) को पछाड़ दिया जिसने यह विशिष्ट प्रशिक्षण नहीं देखा था। इसने वर्तमान में उपलब्ध सबसे "स्मार्ट" निजी मॉडलों को टक्कर देने के भी करीब पहुँच लिया।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि D3-Gym अपनी तरह का पहला डेटासेट है जो स्वचालित रूप से निर्मित और पूरी तरह से सत्यापन योग्य (verifiable) है।

इससे पहले, हम AI को वास्तविक विज्ञान करने के लिए आसानी से प्रशिक्षित नहीं कर सकते थे क्योंकि हम परिणामों को स्वचालित रूप से सत्यापित नहीं कर सकते थे। अब, हमारे पास हजारों ऐसी "ऑटो-ग्रेडर वाली परीक्षाओं" को उत्पन्न करने का एक स्केलेबल तरीका है। यह ओपन-सोर्स AI मॉडल्स को वास्तविक दुनिया के वैज्ञानिक वर्कफ़्लो से सीखने की अनुमति देता है, जिससे मुफ्त, ओपन मॉडल्स और महंगे, क्लोज्ड मॉडल्स के बीच का अंतर कम होता है।

संक्षेप में: उन्होंने एक ऐसा कारखाना बनाया जो बिखरे हुए वैज्ञानिक अनुसंधान को साफ, ऑटो-ग्रेड अभ्यास परीक्षणों में बदल देता है, और इन परीक्षणों का उपयोग करने से AI विज्ञान करने में बहुत अधिक स्मार्ट हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →