← नवीनतम पेपर
💬 NLP

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

यह शोध पत्र **Dr. SCI** को प्रस्तुत करता है, जो एक व्यवस्थित पोस्ट-ट्रेनिंग पाइपलाइन है जिसमें एक बड़े पैमाने का STEM डेटासेट और एक पुनर्गठित प्रशिक्षण वर्कफ़्लो शामिल है—जिसमें एक्सप्लोरेशन-एक्सपैंडिंग SFT, डायनेमिक डिफिकल्टी करिकुलम और रूब्रिक-गाइडेड RL शामिल हैं—जो लार्ज लैंग्वेज मॉडल्स की वैज्ञानिक तर्क क्षमता और ओपन-एंडेड समस्या-समाधान क्षमताओं में महत्वपूर्ण सुधार करता है।

मूल लेखक: Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विश्व-स्तरीय वैज्ञानिक को प्रशिक्षित कर रहे हैं, लेकिन एक मानव प्रोफेसर के बजाय, आप एक AI को प्रशिक्षित कर रहे हैं।

अधिकांश AI प्रशिक्षण एक छात्र को बहुविकल्पीय (multiple-choice) पाठ्यपुस्तक का उपयोग करके पढ़ाने जैसा है। इसे ग्रेड करना आसान है: यदि वे "C" चुनते हैं, तो उन्हें एक गोल्ड स्टार मिलता है; यदि वे "B" चुनते हैं, तो वे फेल हो जाते हैं। यह गणित या सरल तथ्यों के लिए बहुत अच्छा काम करता है, लेकिन विज्ञान उससे कहीं अधिक जटिल है। वास्तविक विज्ञान में लंबे, जटिल स्पष्टीकरण लिखना, विभिन्न विचारों को जोड़ना और एक तर्क प्रस्तुत करना शामिल है।

समस्या यह है कि यदि आप AI को एक खुला प्रश्न देते हैं जैसे, "बताएं कि एक तारे का जन्म कैसे होता है," तो आप उसे ग्रेड कैसे देंगे? यदि AI एक सुंदर, तीन पन्नों का निबंध लिखता है जो काफी हद तक सही है लेकिन गुरुत्वाकर्षण के बारे में एक छोटी सी बारीकी को छोड़ देता है, तो क्या उसे 'A' मिलेगा या 'F'? यदि ग्रेडिंग बहुत सख्त है, तो AI हतोत्साहित हो जाएगा और प्रयास करना बंद कर देगा। यदि यह बहुत आसान है, तो AI एक "सुस्त" (slacker) बन जाएगा जो लंबे, अलंकारिक वाक्य लिखना सीख जाता है जो सुनने में तो स्मार्ट लगते हैं लेकिन वास्तव में कुछ भी नहीं कहते (इसे हम "रिवॉर्ड हैकिंग" कहते हैं)।

यह शोध पत्र, "Dr. SCI," एक नया "प्रशिक्षण स्कूल" है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यहाँ बताया गया है कि उन्होंने तीन चतुर रणनीतियों का उपयोग करके इसे कैसे किया:

1. "विविध पुस्तकालय" रणनीति (Exploration-Expanding SFT)

कल्पना कीजिए कि आपने एक छात्र को केवल तीन जीव विज्ञान की पाठ्यपुस्तकों को पढ़कर सिखाया। वे उन किताबों के विशेषज्ञ बन जाएंगे, लेकिन वे रसायन विज्ञान या भौतिकी के बारे में अनभिज्ञ रहेंगे।

शोधकर्ताओं ने 10 लाख वैज्ञानिक प्रश्नों का एक विशाल, विविध पुस्तकालय बनाया। लेकिन उन्हें एक साथ सब कुछ देने के बजाय, उन्होंने एक विशेष फ़िल्टर का उपयोग किया। उन्होंने उस डेटा की तलाश की जो सोचने के नए तरीकों—नई शब्दावली, नए तर्क पैटर्न और चीजों को समझाने के नए तरीकों को पेश करता था। यह सुनिश्चित करने जैसा है कि एक छात्र केवल यह न सीखे कि क्या सोचना है, बल्कि वह सोचने के सौ अलग-अलग तरीके भी सीख ले।

2. "पहाड़ चढ़ने" की रणनीति (Dynamic Difficulty Curriculum)

यदि आप एक छोटे बच्चे को कैलकुलस सिखाने की कोशिश करते हैं, तो वह हार मान लेगा। यदि आप एक पीएचडी छात्र को बुनियादी जोड़ सिखाते हैं, तो वह ऊब जाएगा। दोनों ही विफल होते हैं।

शोधकर्ताओं ने एक "स्मार्ट सीढ़ी" बनाई। उन्होंने AI का आत्मविश्वास बढ़ाने के लिए आसान प्रश्न देकर शुरुआत की। जैसे-जैसे AI बेहतर होता गया, "सीढ़ी" अपने आप ऊपर की ओर बढ़ी, और कठिन से कठिन चुनौतियाँ पेश करती गई। उन्होंने अनिवार्य रूप से AI को "गोल्डिलॉक्स ज़ोन" (Goldilocks Zone) में रखा—न बहुत आसान, न बहुत कठिन, बल्कि निरंतर विकास के लिए बिल्की सही

3. "विशेषज्ञ प्रोफेसर" रणनीति (SciRubric-Guided RL)

यह सबसे महत्वपूर्ण हिस्सा है। एक साधारण "सही/गलत" ग्रेड के बजाय, उन्होंने AI को एक रूब्रिक (Rubric) दिया—ठीक वैसे ही जैसे एक वास्तविक प्रोफेसर उपयोग करता है।

यह कहने के बजाय कि, "आपका उत्तर 7/10 है," "प्रोफेसर" (एक विशेष AI) उत्तर को देखता है और विशिष्ट बॉक्स चेक करता है:

  • ✅ क्या उन्होंने मुख्य शब्द को परिभाषित किया? (अनिवार्य)
  • ✅ क्या उन्होंने प्रक्रिया के पीछे के क्यों को समझाया? (महत्वपूर्ण)
  • ✅ क्या उन्होंने एक वास्तविक दुनिया का उदाहरण दिया? (वैकल्पिक)
  • ❌ क्या उन्होंने गुरुत्वाकर्षण के बारे में वह सामान्य गलती की? (खामी)

सबसे महत्वपूर्ण बात यह है कि उन्होंने एक "ट्रुथ गार्ड" (Truth Guard) जोड़ा। भले ही AI एक सुंदर, काव्यमय निबंध लिखे, यदि अंतिम उत्तर तथ्यात्मक रूप से गलत है, तो AI को फेल कर दिया जाता है। यह AI को एक "स्मूथ टॉकर" बनने से रोकता है जो गलत है लेकिन आत्मविश्वास से भरा हुआ लगता है।

परिणाम

इस "Dr. SCI" पद्धति का उपयोग करके, यहाँ तक कि एक अपेक्षाकृत छोटा AI (एक "4B" मॉडल, जो एक संक्षिप्त, कुशल छात्र की तरह है) कुछ खुले-अंत वाले परीक्षणों में GPT-4o जैसे बहुत बड़े, अधिक महंगे AI मॉडल की तुलना में जटिल विज्ञान में बेहतर प्रदर्शन करने में सक्षम रहा।

संक्षेप में: उन्होंने AI को एक टेस्ट-टेकर की तरह नहीं, बल्कि एक सच्चे वैज्ञानिक की तरह मानना शुरू किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →