IndustryCode: A Benchmark for Industry Code Generation
यह शोध पत्र IndustryCode को प्रस्तुत करता है, जो वास्तविक दुनिया की औद्योगिक जटिलता को दर्शाने में मौजूदा कोड जनरेशन मूल्यांकनों की सीमाओं को संबोधित करने के लिए कई औद्योगिक डोमेन और प्रोग्रामिंग भाषाओं में फैला हुआ पहला व्यापक बेंचमार्क है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है जो कोड लिख सकता है। आपने इसे लाखों वेबसाइटों, ऐप्स और वीडियो गेम्स पर प्रशिक्षित किया है। यह एक साधारण कैलकुलेटर ऐप या एक बुनियादी गेम लिखने में माहिर है।
लेकिन अब, आप इस रोबोट को एक असली फैक्ट्री, एक रॉकेट लॉन्च सेंटर, या एक उच्च-जोखिम वाले बैंक में काम करने के लिए नियुक्त करना चाहते हैं। अचानक, रोबोट गलतियाँ करने लगता है। यह ऐसा कोड लिखता है जो देखने में तो ठीक लगता है लेकिन रॉकेट को क्रैश कर देता है, ईंधन की गलत गणना कर देता है, या बैंक के सख्त सुरक्षा नियमों को अनदेखा कर देता है।
यह वह समस्या है जिसे "IndustryCode" नामक पेपर हल करने की कोशिश कर रहा है।
यहाँ इसका विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "वीडियो गेम" बनाम "वास्तविक दुनिया"
मौजूदा कोड परीक्षणों (जैसे कि AI को प्रशिक्षित करने के लिए उपयोग किए जाने वाले परीक्षण) को वीडियो गेम लेवल के रूप में सोचें। वे साफ-सुथरे, अनुमानित और सरल नियमों का पालन करने वाले होते हैं। यदि आप लेवल पार कर लेते हैं, तो आपको हाई स्कोर मिलता है।
लेकिन वास्तविक औद्योगिक कार्य समुद्र में तूफान से बचने जैसा है।
- मौसम अजीब है: फाइनेंस (वित्त) में, दशमलव बिंदु की एक गलती लाखों का नुकसान कर सकती है। एयरोस्पेस में, एक गलत गणना उपग्रह को नष्ट कर सकती है।
- औजार पुराने हैं: कभी-कभी, आपको पुराने, विशिष्ट औजारों (जैसे MATLAB या Stata) का उपयोग करना पड़ता है जिन्हें AI ने बहुत कम देखा है क्योंकि वे इंटरनेट पर अधिक उपलब्ध नहीं हैं।
- काम जटिल है: आप केवल एक फंक्शन नहीं लिखते; आपको एक पूरा सिस्टम बनाना होता है जहाँ 10 अलग-अलग हिस्से एक-दूसरे से पूरी तरह तालमेल बिठाकर काम करें।
पेपर कहता है: "हमारे वर्तमान परीक्षण ऐसे हैं जैसे किसी पायलट को सिम्युलेटर में उड़ान भरने के लिए कहना, लेकिन हमें उन्हें तूफान में एक असली 747 उड़ाने की जरूरत है। हमें एक नए परीक्षण की आवश्यकता है।"
2. समाधान: "IndustryCode" (नया ड्राइविंग टेस्ट)
शोधकर्ताओं ने IndustryCode बनाया है, जो AI के लिए एक वास्तविक ड्राइविंग टेस्ट की तरह है।
- कोर्स: एक सीधे ट्रैक के बजाय, उन्होंने एक कोर्स बनाया जिसमें 125 विशाल "मिशन" (मुख्य समस्याएँ) हैं।
- चरण: प्रत्येक मिशन को 579 छोटे चरणों (उप-समस्याओं) में विभाजित किया गया है। कल्पना कीजिए कि आप एक घर बना रहे हैं: पहले आप नींव डालते हैं (चरण 1), फिर आप दीवारें खड़ी करते हैं (चरण 2), फिर आप बिजली की वायरिंग करते हैं (चरण 3)। AI को क्रम में ये सभी काम करने होते हैं।
- भाषाएँ: उन्होंने केवल Python (लोकप्रिय भाषा) का उपयोग नहीं किया। उन्होंने AI को MATLAB (वैज्ञानिकों के लिए), C++ (इंजीनियरों के लिए), और Stata (सांख्यिकीविदों के लिए) बोलना सिखाया। यह एक ड्राइवर को मोटरसाइकिल, सेमी-ट्रक और नाव पर टेस्ट करने जैसा है।
- स्रोत: उन्होंने काल्पनिक समस्याएँ नहीं बनाईं। उन्होंने वास्तविक इंजीनियरों से वास्तविक, जटिल कोड लिया और उसे AI को टेस्ट करने के लिए बस इतना साफ किया कि AI अपने प्रशिक्षण डेटा से उत्तर को केवल "रट" न सके।
3. परिणाम: AI स्मार्ट है, लेकिन अभी भी एक नौसिखिया है
उन्होंने दुनिया के सबसे अच्छे AI मॉडल (जैसे Claude, GPT-5, और Gemini) को इस टेस्ट के माध्यम से परखा। यहाँ क्या हुआ:
- "सब-प्रॉब्लम" स्कोर (ईंटें): जब केवल एक दीवार बनाने के लिए कहा गया, तो AI ने काफी अच्छा प्रदर्शन किया (लग लगभग 68% सफलता)। वह ईंटें बिछाना जानता है।
- "मेन प्रॉब्लम" स्कोर (पूरा घर): जब पूरे घर को बनाने के लिए कहा गया जिसमें प्लंबिंग और बिजली का कनेक्शन भी शामिल था, तो स्कोर गिरकर लगभग 42% हो गया।
- उपमा: AI एक अकेला वाक्य लिखने में बहुत अच्छा है, लेकिन वह पूरी कहानी लिखे बिना, प्लॉट को भूले बिना या टाइपो (गलतियों) के बिना एक पूरा उपन्यास लिखने में संघर्ष करता है।
- विजेता: मॉडल Claude 4.5 Opus शीर्ष पर आया, लेकिन कठिन कार्यों पर यह भी लगभग 60% बार विफल रहा। यह हमें बताता है कि हालांकि AI अद्भुत है, लेकिन यह अभी भी महत्वपूर्ण क्षेत्रों में मानव इंजीनियरों को बदलने के लिए तैयार नहीं है।
4. AI क्यों विफल हुआ? ("सोचने" का जाल)
शोधकर्ताओं ने पाया कि AI कैसे सोचता है, इसके बारे में कुछ दिलचस्प बात है।
- "थिंकिंग" मोड: कुछ AI में एक फीचर होता है जहाँ वे उत्तर देने से पहले "ज़ोर से सोचते हैं" (जैसे कोई इंसान गणित के सवाल हल करते समय रफ पेपर पर गणना करता है)।
- परिणाम: जब AI ने "सोचना" शुरू किया, तो वह लॉजिक (गणित) में बेहतर हो गया, लेकिन वह सिंटैक्स (कोड की संरचना) में कमजोर हो गया।
- उपमा: कल्पना कीजिए कि एक शेफ खाना पकाने के इतिहास के बारे में सोचने लगता है जबकि वह प्याज काट रहा है। वह रेसिपी को बेहतर समझ सकता है, लेकिन वह चाकू नीचे रखना या प्याज को सही आकार में काटना भूल सकता है। "सोचने" की प्रक्रिया ने वास्तविक लेखन में बाधा डाली।
5. बड़ी सीख
IndustryCode एक चेतावनी है।
- अच्छी खबर: AI कोडिंग में बहुत अच्छा होता जा रहा है। यह जटिल लॉजिक और विशिष्ट भाषाओं को पहले से कहीं बेहतर तरीके से संभाल सकता है।
- बुरी खबर: यह अभी "चीफ इंजीनियर" बनने के लिए तैयार नहीं है। उच्च दांव वाली स्थितियों में यह अभी भी मूर्खतापूर्ण गलतियाँ करता है, और एक विशाल प्रोजेक्ट में सभी कड़ियों को जोड़ने में संघर्ष करता है।
संक्षेप में: हमने एक प्रतिभाशाली प्रशिक्षु (apprentice) बनाया है जो बेहतरीन कोड स्निपेट्स लिख सकता है, लेकिन हमें अभी भी एक मानव मास्टर की आवश्यकता है जो ब्लूप्रिंट को थामे रखे, सुरक्षा की जाँच करे और यह सुनिश्चित करे कि पूरा सिस्टम मिलकर काम करे। यह नया बेंचमार्क हमें स्पष्ट रूप से दिखाता है कि प्रशिक्षु को और अधिक प्रशिक्षण की आवश्यकता कहाँ है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।