From Programs to Predictions: A Scalable, Multilingual Platform for Automated Evaluation of Machine-Learning Olympiads
यह शोध पत्र MLCompete को प्रस्तुत करता है, जो एक स्केलेबल, बहुभाषी वेब प्लेटफॉर्म है जिसे एक एसिंक्रोनस, मेट्रिक-अग्नोस्टिक पाइपलाइन और एक सुरक्षित, टू-टियर निष्पादन वातावरण के माध्यम से मशीन-लर्निंग ओलंपियाड का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो रोमानिया के नेशनल एआई ओलंपियाड में सफल परिनियोजन और अंतर्राष्ट्रीय भागीदारी के माध्यम से अपनी मजबूती और विश्वसनीयता का प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाली कुकिंग प्रतियोगिता में हैं, लेकिन आपको एक तैयार व्यंजन खिलाने के बजाय, प्रतियोगी आपको स्वाद के अनुमानों की एक सूची वाला एक गुप्त रेसिपी कार्ड भेज रहे हैं। पुराने दिनों में, कंप्यूटर प्रतियोगिताएं एक सख्त टेस्ट-टेस्ट की तरह होती थीं: आप एक प्रोग्राम सबमिट करते थे, जज उसे चलाता था, और यदि आउटपुट उत्तर कुंजी से बिल्कुल मेल नहीं खाता था, तो आप असफल हो जाते थे। लेकिन इस नई दुनिया के "मशीन लर्निंग ओलंपियाड" में, नियम बदल गए हैं। जज इस बात की परवाह नहीं करते कि कोड पूरी तरह से चलता है या नहीं; उन्हें इस बात की परवाह है कि भविष्यवाणियां सच्चाई के कितने करीब हैं, उन अजीब, कस्टम-मेड स्कोरिंग नियमों का उपयोग करके जो हर एक समस्या के लिए बदलते रहते हैं।
यहाँ MLCompete आता है, जो इस अराजक, उच्च-गति वाले फ्लेवर-चैलेंज को संभालने के लिए बनाया गया एक डिजिटल प्लेटफॉर्म है। यह रोमानिया के नेशनल एआई ओलंपियाड के लिए आधिकारिक रेफरी है, और यह कुछ ऐसा कर रहा है जो कोई अन्य सिस्टम नहीं करता: यह हजारों छात्रों को प्रतिस्पर्धा करने, अपनी "फ्लेवर प्रेडिक्शन्स" सबमिट करने और तुरंत स्कोर प्राप्त करने की अनुमति देता है, भले ही स्कोरिंग नियम बर्फ के टुकड़ों (snowflakes) की तरह अद्वितीय हों।
बड़ा बदलाव: कोड चलाने से लेकर अंदाज़ों को ग्रेड करने तक
लेख तर्क देता है कि आप केवल एक पुराने जमाने के कंप्यूटर जज को बदलकर इसे इस्तेमाल नहीं कर सकते। यह सूप के स्वाद को मापने के लिए स्टॉपवॉच का उपयोग करने जैसा है। पुराने सिस्टम प्रोग्राम के खत्म होने का इंतज़ार करते हैं और फिर एक उत्तर देते हैं। हालाँकि, MLCompete यह समझता है कि एआई प्रतियोगिताओं में, भारी काम सबमिशन से पहले होता है। छात्र अपने मॉडल कहीं और (या प्लेटफॉर्म पर) प्रशिक्षित करते हैं, फिर भविष्यवाणियों से भरी एक फ़ाइल अपलोड करते हैं। प्लेटफॉर्म का काम उस फ़ाइल को लेना, उसकी तुलना एक छिपे हुए "उत्तर कुंजी" (ग्राउंड ट्रुथ) से करना, और एक ऐसे मीट्रिक का उपयोग करके स्कोर की गणना करना है जो उस विशेष समस्या के लिए विशिष्ट हो सकता है।
लेखक स्पष्ट रूप से इस विचार को खारिज करते हैं कि यह एक मानक प्रोग्रामिंग प्रतियोगिता का केवल एक "बड़ा संस्करण" है। वे कहते हैं कि बुनियादी ढांचा मौलिक रूप से भिन्न होना चाहिए क्योंकि डिलिवरेबल एक प्रोग्राम नहीं है; यह भविष्यवाणियों का एक सेट है, और स्कोरिंग "सही या गलत" नहीं है, बल्कि यह इस बात का एक स्लाइडिंग स्केल है कि अंदाज़ा कितना अच्छा है।
यह कैसे काम करता है: एक असेंबली लाइन
MLCompete को एक अत्यंत कुशल, स्वचालित फैक्ट्री लाइन के रूप में सोचें।
- ड्रॉप-ऑफ: जब एक छात्र अपनी प्रेडिक्शन फ़ाइल अपलोड करता है, तो सिस्टम उसे इंतज़ार नहीं करवाता। यह एक स्मार्ट मेलरूम की तरह है जो तुरंत आपके पैकेज पर "प्राप्त हुआ" की मुहर लगाता है और कहता है, "हम इसे जल्दी ही देख लेंगे।" यह असिंक्रोनस (asynchronous) हिस्सा है। छात्र वास्तविक काम होने के दौरान गेम खेलने जा सकता है।
- क्यू (Queue): सबमिशन एक डिजिटल प्रतीक्षा रेखा (मैसेज क्यू) में डाल दिया जाता है। यही असली सफलता का मंत्र है। इसका मतलब है कि यदि 1,000 छात्र ठीक एक ही सेकंड में सबमिट करते हैं, तो सिस्टम क्रैश नहीं होगा; यह बस उन्हें लाइन में लगा देगा।
- स्कोरिंग क्रू: अदृश्य श्रमिकों की एक टीम (जिन्हें "इवैल्यूएटर्स" कहा जाता है) लाइन से अगली फ़ाइल लेती है, विशिष्ट स्कोरिंग स्क्रिप्ट (जो एक मानक गणित सूत्र या समस्या लेखक द्वारा लिखी गई कस्टम स्क्रिप्ट हो सकती है) को चलाती है, और स्कोर की गणना करती है।
- परिणाम: एक बार जब स्कोर तैयार हो जाता है, तो सिस्टम इसे लगभग रियल-टाइम में छात्र की स्क्रीन पर वापस भेज देता है।
पेपर दिखाता है कि यह सेटअप अविश्वसनीय रूप से तेज़ है। 15 दिनों की अवधि में, सिस्टम ने 8.1 मिलियन से अधिक अनुरोधों को संभाला। बैकएंड (संचालन का मस्तिष्क) इतना तेज़ था कि 95% समय में, इसने 255 मिलीसेकंड से कम में उत्तर दिया। यह पलक झपकने से भी तेज़ है।
"दो-चरणों वाला" लीडरबोर्ड
यहाँ एक पेचीदा हिस्सा है जिसे पेपर धोखाधड़ी रोकने के लिए एक चतुर ट्रिक के साथ समझाता है। कल्पना करें कि एक लीडरबोर्ड है जो आपको दिखाता है कि आप अभी कैसा प्रदर्शन कर रहे हैं, लेकिन यह केवल परीक्षण प्रश्नों के एक छोटे, सार्वजनिक हिस्से पर आधारित है। यह छात्रों को जोड़े रखता है। लेकिन असली अंतिम रैंकिंग प्रश्नों के एक गुप्त, निजी हिस्से पर आधारित है जिसे किसी ने नहीं देखा है।
प्लेटफॉर्म एक ही बार में दोनों स्कोर की गणना करता है। यह छात्रों को "सिस्टम को गेम करने" से रोकता है, जहाँ वे हजारों बार सबमिट करके देखते हैं कि कौन सा गलती से गुप्त उत्तरों तक पहुँच जाता है। जीतने के लिए, एक छात्र को डेडलाइन से पहले अपनी दो सर्वश्रेष्ठ सबमिशन को स्पष्ट रूप से चुनना होगा। सिस्टम फिर उन दो में से बेहतर को गुप्त लीडरबोर्ड पर लेता है। यह छात्रों को सिस्टम को स्पैम करने के बजाय अपने सबसे अच्छे काम पर भरोसा करने के लिए मजबूर करता है।
कोड के लिए "सेफ रूम"
कभी-कभी, छात्रों को अपनी भविष्यवाणियाँ उत्पन्न करने के लिए प्लेटफॉर्म के सुपर-कंप्यूटरों पर सीधे अपना कोड चलाने की आवश्यकता होती है। यह खतरनाक है क्योंकि आप नहीं चाहते कि छात्र का बग वाला कोड डेटा चुरा ले या पूरे सिस्टम को क्रैश कर दे।
पेपर एक "डिफेंस-इन-डेप्थ" सुरक्षा मॉडल का वर्णन करता है। सबसे उन्नत चरण (नेशनल टीम सिलेक्शन कैंप) के लिए, छात्रों को शक्तिशाली NVIDIA H200 GPU तक पहुंच मिलती है। लेकिन यहाँ जादू है: प्लेटफॉर्म MIG (Multi-Instance GPU) नामक तकनीक का उपयोग करता है जो एक विशाल GPU को पांच छोटे, अलग-थलग टुकड़ों में विभाजित करती है। प्रत्येक छात्र को मेमोरी और कंप्यूटिंग पावर का अपना छोटा सा हिस्सा मिलता है। यह एक विशाल लाइब्रेरी में हर प्रतियोगी को अपना निजी, साउंडप्रूफ बूथ देने जैसा है। भले ही एक छात्र का कोड अनियंत्रित हो जाए, वह किसी अन्य के डेटा या कंप्यूटर के बाकी हिस्सों को छू भी नहीं सकता।
यह सुनिश्चित करने के लिए कि वे ऑनलाइन उत्तर खोजकर धोखाधड़ी नहीं कर रहे हैं, प्लेटफॉर्म एक "व्हाइटलिस्टिंग प्रॉक्सी" का उपयोग करता है। यह एक सख्त लाइब्रेरियन की तरह है जो आपको केवल एक विशिष्ट, पूर्व-अनुमोदित सूची की किताबें पढ़ने देता है। प्रतियोगिता के दौरान, छात्र केवल प्लेटफॉर्म, अपने आइडेंटिटी प्रोवाइडर और जुपिटर कोडिंग एनवायरनमेंट से ही बात कर सकते हैं। इंटरनेट, पब्लिक मॉडल हब और रैंडम वेबसाइट्स पूरी तरह से ब्लॉक होते हैं।
संख्याएँ: यह कितनी अच्छी तरह काम किया?
लेखकों ने इसे केवल बनाया ही नहीं; उन्होंने इसे एक वास्तविक राष्ट्रीय प्रतियोगिता की अग्निपरीक्षा से गुजारा।
- विश्वसनीयता: सिस्टम लगभग पूरी तरह से चालू रहा। "सर्वर एरर" दर बहुत मामूली 0.007% थी। इसका मतलब है कि हर 10,000 अनुरोधों में से केवल लगभग 7 विफल हुए।
- लागत: उन्होंने यह सब एक एकल, साधारण कंप्यूटर सर्वर ("कमोडिटी K3s नोड") पर प्रबंधित किया। यह एक बड़े थीम पार्क को एक सिंगल टिकट बूथ के साथ चलाने जैसा है जो भीड़ बढ़ने पर अपने और खिड़कियां खोल देता है।
- स्पाइक (Spike): नेशनल टीम सिलेक्शन कैंप के दौरान, ट्रैफिक सामान्य से 3 से 6 गुना बढ़ गया। सिस्टम ने बिना धीमे हुए या क्रैश हुए इस उछाल को सोख लिया, जिसका श्रेय इसकी स्वचालित रूप से अधिक "वर्कर्स" जोड़ने की क्षमता को जाता है।
- स्केलेबिलिटी: लेखकों ने (लाइव टेस्ट के बजाय) सिमुलेशन (कंप्यूटर मॉडल) चलाए ताकि यह देखा जा सके कि सैकड़ों छात्र एक साथ सबमिट करते हैं तो क्या होगा। उन्होंने पाया कि केवल 10 वर्कर्स के पूल के साथ, सिस्टम लगभग शून्य प्रतीक्षा समय के साथ प्रति सेकंड 5 सबमिशन तक संभाल सकता है। यदि लाइन लंबी होती है, तो सिस्टम स्वचालित रूप से अधिक वर्कर्स जोड़ देता है।
यह क्या नहीं है
पेपर सावधानी से बताता है कि इसने अभी तक क्या सिद्ध नहीं किया है। वे स्वीकार करते हैं कि उनका लाइव डेटा केवल 15 दिनों की अवधि को कवर करता है, जिसमें एक "मामूली" प्रतियोगिता का उछाल शामिल था, लेकिन इसमें सैकड़ों छात्रों के बीच होने वाले बड़े "स्प्रिंग" चरणों को शामिल नहीं किया गया है। इसलिए, जबकि सिस्टम ने टीम कैंप के स्पाइक को पूरी तरह से संभाला, लेखक सुझाव देते हैं (सिद्ध करने के बजाय) कि यह सबसे बड़े आयोजनों के लिए और भी अधिक स्केल करेगा। वे यह भी नोट करते हैं कि हालांकि उनके पास मजबूत सुरक्षा है, लेकिन वे अभी भी और भी कठिन "कर्नेल-लेवल" सैंडबॉक्सिंग पर काम कर रहे हैं ताकि कोड निष्पादन को सबसे दृढ़ हैकर्स के खिलाफ भी पूरी तरह से अभेद्य बनाया जा सके।
निष्कर्ष
MLCompete यह सिद्ध करता है कि भविष्यवाणियों को मेल की तरह और स्कोरिंग को एक फैक्ट्री असेंबली लाइन की तरह मानकर, आप एआई प्रतियोगिताओं के लिए एक विशाल, बहुभाषी, सुरक्षित और सस्ता प्लेटफॉर्म बना सकते हैं। यह कोई जादुई छड़ी नहीं है जो सभी एआई समस्याओं को हल करती है, लेकिन यह एक ठोस, काम करने वाला ब्लूप्रिंट है जो छात्रों को यह चिंता करने के बजाय सीखने और प्रतिस्पर्धा करने पर ध्यान केंद्रित करने देता है कि कहीं कंप्यूटर क्रैश न हो जाए। जैसा कि पेपर निष्कर्ष निकालता है, आर्किटेक्चर काम करता है, और डेटा इसका समर्थन करता है, जो एआई शिक्षा के भविष्य को चलाने का एक नया तरीका प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।