← नवीनतम पेपर
💬 NLP

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

स्केलबॉक्स (ScaleBox) एक उच्च-सटीकता और स्केलेबल कोड सत्यापन प्रणाली है जो स्वचालित विशेष-जज जनरेशन, सूक्ष्म-स्तरीय समानांतर निष्पादन और मल्टी-नोड समन्वय के माध्यम से मौजूदा सैंडबॉक्स की सीमाओं को संबोधित करती है, जिससे बड़े भाषा मॉडलों (large language models) के बड़े पैमाने पर कोड प्रशिक्षण और मूल्यांकन की सटीकता और दक्षता दोनों में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

प्रकाशित 2026-05-01
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट (एक लार्ज लैंग्वेज मॉडल) को मास्टर प्रोग्रामर बनना सिखा रहे हैं। इसे सिखाने के लिए, आप इसे हजारों कोडिंग पहेलियाँ देते हैं और उन्हें हल करने के लिए कहते हैं। लेकिन आप यह कैसे जानेंगे कि रोबोट ने वास्तव में पहेली को सही ढंग से हल किया है या नहीं?

यहीं पर ScaleBox काम आता है। ScaleBox को इन कोडिंग पहेलियों के लिए एक सुपर-पावर्ड, अल्ट्रा-फास्ट और अविश्वसनीय रूप से निष्पक्ष ग्रेडिंग सिस्टम के रूप में समझें।

यहाँ की कहानी है कि पुराना तरीका क्यों टूटा हुआ था और ScaleBox इसे कैसे ठीक करता है, जिसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "कठोर ग्रेडर" बनाम "रचनात्मक समाधानकर्ता"

अतीत में, इन कोडिंग सिस्टम ने "एक्ज़ैक्ट मैच" (सटीक मिलान) नामक एक विधि का उपयोग किया था। कल्पना कीजिए कि एक शिक्षक जो केवल यह जाँचता है कि आपका उत्तर उत्तर कुंजी (answer key) के बिल्कुल समान तरीके से लिखा गया है या नहीं।

  • दोष: यदि पहेली पूछती है, "मुझे कोई भी दो संख्याएँ दें जिनका योग 10 हो," और उत्तर कुंजी कहती है "5 + 5," लेकिन आपका रोबोट लिखता है "1 + 9," तो पुराना सिस्टम इसे गलत घोषित कर देगा।
  • वास्तविकता: कोडिंग में, किसी समस्या को हल करने के कई सही तरीके होते हैं। पुराना सिस्टम एक ऐसे ग्रेडर की तरह था जिसने एक छात्र को "5+5" के बजाय "1+9" लिखने के लिए फेल कर दिया, भले ही गणित एकदम सही था। इसने रोबोट को भ्रमित कर दिया, जिससे उसे लगा कि वह असफल हो रहा है जबकि वास्तव में वह सफल हो रहा था।

2. समाधान: "स्मार्ट रेफरी" (विशेष जज)

ScaleBox एक नई विशेषता पेश करता है जिसे स्पेशल जजेस (विशेष जज) कहा जाता है।

  • उपमा: एक कठोर ग्रेडर के बजाय, एक फुटबॉल खेल में एक स्मार्ट रेफरी की कल्पना करें। रेफरी केवल स्कोर नहीं देखता; वह खेल को देखता है। यदि रोबोट समस्या को हल करने का एक रचनात्मक, वैध तरीका ढूंढता है (जैसे "1+9"), तो स्मार्ट रेफरी तर्क की जाँच करता है, देखता है कि यह काम करता है, और कहता है, "गोल! यह मान्य है!"
  • यह कैसे काम करता है: ScaleBox इन कठिन समस्याओं के लिए इन स्मार्ट रेफरी को स्वचालित रूप से बनाता है। यह जाँचता है कि कोड वास्तव में काम करता है या नहीं, न कि केवल अक्षरों का मिलान करता है। यह रोबोट को झूठे "फेलर" (असफलता) से भ्रमित होने से रोकता है।

3. बाधा: "ट्रैफिक जाम"

पुराने सिस्टम के साथ दूसरी समस्या गति की थी। एक ऐसी फैक्ट्री की कल्पना करें जहाँ एक धीमा कर्मचारी हर एक खिलौने को एक-एक करके जाँचने के लिए बाध्य है। जब आपके पास एक साथ सीखने की कोशिश करने वाले हजारों रोबोट होते हैं, तो फैक्ट्री जाम हो जाती है।

  • दोष: पुराने सिस्टम सब कुछ एक ही लाइन पर चलाने की कोशिश करते थे, जिससे भारी ट्रैफिक जाम हो जाता था। शक्तिशाली कंप्यूटर (GPUs) इंतजार करते रहते थे जबकि धीमे कंप्यूटर (CPUs) तालमेल बिठाने के लिए संघर्ष करते थे।
  • सुधार: ScaleBox एक विशाल, मल्टी-लेन हाईवे बनाने जैसा है। यह काम को विभाजित करता है ताकि कई कंप्यूटरों पर एक ही समय में हजारों टेस्ट किए जा सकें। यह खाली संसाधनों (खाली लेन) का उपयोग करता है ताकि कोई समय बर्बाद न हो।

4. परिणाम: एक बेहतर रोबोट

लेखकों ने एक रोबोट (Qwen3-8B) को इस नए, निष्पक्ष और तेज़ सिस्टम का उपयोग करके कोडिंग सिखाकर ScaleBox का परीक्षण किया।

  • क्या हुआ: क्योंकि रोबोट कठोर ग्रेडर से "झूठे फेलियर" प्राप्त करना बंद कर दिया, इसलिए उसने बहुत तेज़ी से सीखा। वह अधिक स्थिर और आत्मविश्वासी हो गया।
  • स्कोर: मानक कोडिंग चुनौतियों (LiveCodeBench) पर परीक्षण किए जाने पर, ScaleBox के साथ प्रशिक्षित रोबोट ने पुराने, कठोर सिस्टम के साथ प्रशिक्षित रोबोटों की तुलना में काफी अधिक स्कोर किया।

सारांश

ScaleBox एक नया इंफ्रास्ट्रक्चर है जो दो चीजों को करके AI को कोडिंग सिखाने को बेहतर बनाता है:

  1. यह अधिक निष्पक्ष है: यह किसी भी सही समाधान को स्वीकार करने के लिए "स्मार्ट रेफरी" का उपयोग करता है, न कि केवल किताब में दिए गए एक विशिष्ट उत्तर को।
  2. यह अधिक तेज़ है: यह टेस्टिंग के लिए एक हाईवे बनाता है ताकि हजारों कोड चेक बिना किसी ट्रैफिक जाम के तुरंत हो सकें।

परिणामस्वरूप, एक स्मार्ट, अधिक स्थिर AI मिलता है जो अधिक प्रभावी ढंग से कोडिंग सीखता है क्योंकि उसे सटीक फीडबैक मिलता है, न कि भ्रमित करने वाला शोर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →