← नवीनतम पेपर
💬 NLP

IndustryCode: A Benchmark for Industry Code Generation

यह शोध पत्र IndustryCode को प्रस्तुत करता है, जो वास्तविक दुनिया की औद्योगिक जटिलता को दर्शाने में मौजूदा कोड जनरेशन मूल्यांकनों की सीमाओं को संबोधित करने के लिए कई औद्योगिक डोमेन और प्रोग्रामिंग भाषाओं में फैला हुआ पहला व्यापक बेंचमार्क है।

मूल लेखक: Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

प्रकाशित 2026-04-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है जो कोड लिख सकता है। आपने इसे लाखों वेबसाइटों, ऐप्स और वीडियो गेम्स पर प्रशिक्षित किया है। यह एक साधारण कैलकुलेटर ऐप या एक बुनियादी गेम लिखने में माहिर है।

लेकिन अब, आप इस रोबोट को एक असली फैक्ट्री, एक रॉकेट लॉन्च सेंटर, या एक उच्च-जोखिम वाले बैंक में काम करने के लिए नियुक्त करना चाहते हैं। अचानक, रोबोट गलतियाँ करने लगता है। यह ऐसा कोड लिखता है जो देखने में तो ठीक लगता है लेकिन रॉकेट को क्रैश कर देता है, ईंधन की गलत गणना कर देता है, या बैंक के सख्त सुरक्षा नियमों को अनदेखा कर देता है।

यह वह समस्या है जिसे "IndustryCode" नामक पेपर हल करने की कोशिश कर रहा है।

यहाँ इसका विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "वीडियो गेम" बनाम "वास्तविक दुनिया"

मौजूदा कोड परीक्षणों (जैसे कि AI को प्रशिक्षित करने के लिए उपयोग किए जाने वाले परीक्षण) को वीडियो गेम लेवल के रूप में सोचें। वे साफ-सुथरे, अनुमानित और सरल नियमों का पालन करने वाले होते हैं। यदि आप लेवल पार कर लेते हैं, तो आपको हाई स्कोर मिलता है।

लेकिन वास्तविक औद्योगिक कार्य समुद्र में तूफान से बचने जैसा है।

  • मौसम अजीब है: फाइनेंस (वित्त) में, दशमलव बिंदु की एक गलती लाखों का नुकसान कर सकती है। एयरोस्पेस में, एक गलत गणना उपग्रह को नष्ट कर सकती है।
  • औजार पुराने हैं: कभी-कभी, आपको पुराने, विशिष्ट औजारों (जैसे MATLAB या Stata) का उपयोग करना पड़ता है जिन्हें AI ने बहुत कम देखा है क्योंकि वे इंटरनेट पर अधिक उपलब्ध नहीं हैं।
  • काम जटिल है: आप केवल एक फंक्शन नहीं लिखते; आपको एक पूरा सिस्टम बनाना होता है जहाँ 10 अलग-अलग हिस्से एक-दूसरे से पूरी तरह तालमेल बिठाकर काम करें।

पेपर कहता है: "हमारे वर्तमान परीक्षण ऐसे हैं जैसे किसी पायलट को सिम्युलेटर में उड़ान भरने के लिए कहना, लेकिन हमें उन्हें तूफान में एक असली 747 उड़ाने की जरूरत है। हमें एक नए परीक्षण की आवश्यकता है।"

2. समाधान: "IndustryCode" (नया ड्राइविंग टेस्ट)

शोधकर्ताओं ने IndustryCode बनाया है, जो AI के लिए एक वास्तविक ड्राइविंग टेस्ट की तरह है।

  • कोर्स: एक सीधे ट्रैक के बजाय, उन्होंने एक कोर्स बनाया जिसमें 125 विशाल "मिशन" (मुख्य समस्याएँ) हैं।
  • चरण: प्रत्येक मिशन को 579 छोटे चरणों (उप-समस्याओं) में विभाजित किया गया है। कल्पना कीजिए कि आप एक घर बना रहे हैं: पहले आप नींव डालते हैं (चरण 1), फिर आप दीवारें खड़ी करते हैं (चरण 2), फिर आप बिजली की वायरिंग करते हैं (चरण 3)। AI को क्रम में ये सभी काम करने होते हैं।
  • भाषाएँ: उन्होंने केवल Python (लोकप्रिय भाषा) का उपयोग नहीं किया। उन्होंने AI को MATLAB (वैज्ञानिकों के लिए), C++ (इंजीनियरों के लिए), और Stata (सांख्यिकीविदों के लिए) बोलना सिखाया। यह एक ड्राइवर को मोटरसाइकिल, सेमी-ट्रक और नाव पर टेस्ट करने जैसा है।
  • स्रोत: उन्होंने काल्पनिक समस्याएँ नहीं बनाईं। उन्होंने वास्तविक इंजीनियरों से वास्तविक, जटिल कोड लिया और उसे AI को टेस्ट करने के लिए बस इतना साफ किया कि AI अपने प्रशिक्षण डेटा से उत्तर को केवल "रट" न सके।

3. परिणाम: AI स्मार्ट है, लेकिन अभी भी एक नौसिखिया है

उन्होंने दुनिया के सबसे अच्छे AI मॉडल (जैसे Claude, GPT-5, और Gemini) को इस टेस्ट के माध्यम से परखा। यहाँ क्या हुआ:

  • "सब-प्रॉब्लम" स्कोर (ईंटें): जब केवल एक दीवार बनाने के लिए कहा गया, तो AI ने काफी अच्छा प्रदर्शन किया (लग लगभग 68% सफलता)। वह ईंटें बिछाना जानता है।
  • "मेन प्रॉब्लम" स्कोर (पूरा घर): जब पूरे घर को बनाने के लिए कहा गया जिसमें प्लंबिंग और बिजली का कनेक्शन भी शामिल था, तो स्कोर गिरकर लगभग 42% हो गया।
    • उपमा: AI एक अकेला वाक्य लिखने में बहुत अच्छा है, लेकिन वह पूरी कहानी लिखे बिना, प्लॉट को भूले बिना या टाइपो (गलतियों) के बिना एक पूरा उपन्यास लिखने में संघर्ष करता है।
  • विजेता: मॉडल Claude 4.5 Opus शीर्ष पर आया, लेकिन कठिन कार्यों पर यह भी लगभग 60% बार विफल रहा। यह हमें बताता है कि हालांकि AI अद्भुत है, लेकिन यह अभी भी महत्वपूर्ण क्षेत्रों में मानव इंजीनियरों को बदलने के लिए तैयार नहीं है।

4. AI क्यों विफल हुआ? ("सोचने" का जाल)

शोधकर्ताओं ने पाया कि AI कैसे सोचता है, इसके बारे में कुछ दिलचस्प बात है।

  • "थिंकिंग" मोड: कुछ AI में एक फीचर होता है जहाँ वे उत्तर देने से पहले "ज़ोर से सोचते हैं" (जैसे कोई इंसान गणित के सवाल हल करते समय रफ पेपर पर गणना करता है)।
  • परिणाम: जब AI ने "सोचना" शुरू किया, तो वह लॉजिक (गणित) में बेहतर हो गया, लेकिन वह सिंटैक्स (कोड की संरचना) में कमजोर हो गया।
    • उपमा: कल्पना कीजिए कि एक शेफ खाना पकाने के इतिहास के बारे में सोचने लगता है जबकि वह प्याज काट रहा है। वह रेसिपी को बेहतर समझ सकता है, लेकिन वह चाकू नीचे रखना या प्याज को सही आकार में काटना भूल सकता है। "सोचने" की प्रक्रिया ने वास्तविक लेखन में बाधा डाली।

5. बड़ी सीख

IndustryCode एक चेतावनी है।

  • अच्छी खबर: AI कोडिंग में बहुत अच्छा होता जा रहा है। यह जटिल लॉजिक और विशिष्ट भाषाओं को पहले से कहीं बेहतर तरीके से संभाल सकता है।
  • बुरी खबर: यह अभी "चीफ इंजीनियर" बनने के लिए तैयार नहीं है। उच्च दांव वाली स्थितियों में यह अभी भी मूर्खतापूर्ण गलतियाँ करता है, और एक विशाल प्रोजेक्ट में सभी कड़ियों को जोड़ने में संघर्ष करता है।

संक्षेप में: हमने एक प्रतिभाशाली प्रशिक्षु (apprentice) बनाया है जो बेहतरीन कोड स्निपेट्स लिख सकता है, लेकिन हमें अभी भी एक मानव मास्टर की आवश्यकता है जो ब्लूप्रिंट को थामे रखे, सुरक्षा की जाँच करे और यह सुनिश्चित करे कि पूरा सिस्टम मिलकर काम करे। यह नया बेंचमार्क हमें स्पष्ट रूप से दिखाता है कि प्रशिक्षु को और अधिक प्रशिक्षण की आवश्यकता कहाँ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →