← नवीनतम पेपर
💬 NLP

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

यह शोधपत्र ClassEval-Pro को प्रस्तुत करता है, जो एक LLM एन्सेम्बल और उच्च-कवरेज टेस्ट सूट्स द्वारा सत्यापित 300 क्लास-लेवल कोड जनरेशन कार्यों का एक कठोर, क्रॉस-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर LLMs लॉजिक और डिपेंडेंसी त्रुटियों के कारण कंपोजिशनल कोड क्रिएशन में संघर्ष करते हैं, और केवल 45.6% का सर्वश्रेष्ठ Pass@1 प्राप्त करते हैं।

मूल लेखक: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को खाना बनाना सिखा रहे हैं।

पुराना तरीका (फंक्शन-लेवल):
अब तक, शोधकर्ताओं ने मुख्य रूप से इन AI शेफ का परीक्षण करने के लिए उनसे एक साधारण सामग्री बनाने के लिए कहा है, जैसे कि "प्याज काटें" या "पानी उबालें।" AI इसमें बहुत अच्छा है। यह 90% बार प्याज को पूरी तरह से काट सकता है। यह इस बात जैसा है कि क्या रोबोट एक अकेले उपकरण को संभाल सकता है।

कमी (क्लास-लेवल):
लेकिन वास्तविक दुनिया में, खाना बनाना केवल एक चीज़ काटने के बारे में नहीं है। यह एक पूरा व्यंजन बनाने के बारे में है जहाँ सामग्रियां एक साथ मिलकर काम करनी चाहिए। आपको एक ऐसा सॉस चाहिए जो जानता हो कि कितना नमक डाला गया था, एक ऐसा गार्निश जो मुख्य कोर्स से मेल खाता हो, और एक प्लेटिंग रणनीति जो सब कुछ एक साथ थामे रखे। इसे ही पेपर में "कंपोजिशनल कोड क्रिएशन" (compositional code creation) कहा गया है। यह एक पूर्ण, व्यवस्थित "क्लास" (सॉफ्टवेयर की एक आत्मनिर्भर इकाई) बनाने की क्षमता है जहाँ कई हिस्से एक-दूसरे से सही ढंग से बात करते हैं।

समस्या:
लेखकों का कहना है कि हमारे पास इस "पूरे व्यंजन" के कौशल के लिए कोई अच्छा परीक्षण नहीं था। पुराने परीक्षण बहुत सरल थे, और जो कुछ परीक्षण मौजूद थे वे मनुष्यों द्वारा बनाए गए थे, जो धीमा और महंगा है, और हो सकता है कि रेसिपी AI के प्रशिक्षण के दौरान लीक हो गई हो (जैसे कि AI टेस्ट के उत्तर याद करके चीटिंग कर रहा हो)।

समाधान: ClassEval-Pro
टीम ने एक नया, विशाल परीक्षण बनाया है जिसे ClassEval-Pro कहा जाता है। उन्होंने इसे कैसे बनाया, इसके लिए एक रचनात्मक उपमा का उपयोग किया गया है:

  1. सामग्रियां (डेटा): हाथ से रेसिपी लिखने के बजाय, वे एक विशाल डिजिटल लाइब्रेरी (GitHub) पर गए और जनवरी 2025 के बाद लिखी गई रेसिपी लीं। यह सुनिश्चित करता है कि AI ने उन्हें पहले न देखा हो, इसलिए यह एक निष्पक्ष परीक्षण है।
  2. मिक्सिंग बाउल (क्रॉस-डोमेन): उन्होंने केवल समान सामग्रियां ही नहीं मिलाईं। उन्होंने AI को पूरी तरह से अलग दुनिया को मिलाने के लिए मजबूर किया। कल्पना कीजिए कि रोबोट को एक "फाइनेंशियल कैलकुलेटर" बनाने के लिए कहना है जिसे एक "वीडियो गेम इन्वेंटरी" भी प्रबंधित करनी है। उसे पैसे के तर्क (logic) और गेम के तर्क को एक ही सुसंगत प्रोग्राम में एक साथ काम करना होगा।
  3. स्वाद परीक्षण (वैलिडेशन): परीक्षण शुरू होने से पहले, वे यह जांचने के लिए AI जजों के एक पैनल का उपयोग करते हैं कि क्या रेसिपी समझ में आती है और क्या टेस्ट "टेस्ट टेस्ट" (कोड टेस्ट) कम से कम 90% रेसिपी को कवर करते हैं। यदि रेसिपी खराब है, तो वे उसे फेंक देते हैं।

परिणाम: रोबोट शेफ संघर्ष करते हैं
उन्होंने पाँच सबसे स्मार्ट AI शेफ (जैसे GPT-5.1, Gemini, और Qwen) को ये जटिल व्यंजन बनाने के लिए कहा।

  • स्कोर: यहाँ तक कि सबसे अच्छे शेफ ने भी केवल लगभग 45% व्यंजन सही बनाए। यह उन सरल "प्याज काटने" वाले कार्यों से मिलने वाले 90% से बहुत बड़ी गिरावट है।
  • अंतर: सबसे अच्छे शेफ और सबसे कमजोर शेफ के बीच एक बड़ा अंतर था। सबसे अच्छे शेफ ने 45% सही बनाया, जबकि सबसे कमजोर ने केवल 28%। यह साबित करता है कि यह परीक्षण मजबूत शेफ को कमजोरों से अलग करने में सक्षम है।
  • "मेथड" का जाल: दिलचस्प बात यह है कि शेफ अक्सर व्यक्तिगत चरणों को सही ढंग से लिख सकते थे (जैसे "प्याज काटें" या "नमक डालें")। लेकिन जब उन्होंने उन सभी को एक काम करने वाले व्यंजन में जोड़ने की कोशिश की, तो सब बिखर गया। प्याज तो कट गया था, लेकिन नमक गलत बर्तन में डाल दिया गया था।

उन्होंने मदद करने की कोशिश कैसे की (रणनीतियाँ)
शोधकर्ताओं ने शेफ को अलग-अलग तरीकों से दृष्टिकोण अपनाने के लिए प्रेरित किया:

  • "बॉटम-अप" दृष्टिकोण: "पहले आधार सामग्री से शुरुआत करें, फिर सॉस बनाएं, फिर गार्निश।" इससे कमजोर शेफ में काफी सुधार हुआ।
  • "टॉप-डाउन" दृष्टिकोण: "पहले पूरा मेनू प्लान करें, फिर पकाएं।" इसने सबसे मजबूत शेफ की मदद की।
  • "कंपोजिशनल" दृष्टिकोण: "पहले सॉस की रेसिपी लिखें, फिर गार्निश की रेसिपी लिखें, फिर उन्हें आपस में जोड़ दें।" यह एक आपदा थी। शेफ टुकड़ों को जोड़ने में भ्रमित हो गए, और उनकी सफलता दर गिरकर लगभग शून्य (एक मॉडल के लिए 1.3%) हो गई।

क्या गलत हुआ? (त्रुटियाँ)
टीम ने 500 विफल व्यंजनों को देखा कि क्या गलत हुआ। उन्होंने दो मुख्य समस्याएं पाईं:

  1. लॉजिक एरर्स (56%): रोबोट शब्दों को समझता था लेकिन अर्थ को गलत समझ लेता था। (जैसे, "यदि उपयोगकर्ता ऑफलाइन है, तो सफलता का संदेश दें" बजाय विफलता के संदेश के)।
  2. डिपेंडेंसी एरर्स (38%): हिस्से आपस में फिट नहीं बैठे। (जैसे, सॉस की रेसिपी में ऐसी सामग्री मांगी गई जो गार्निश की रेसिपी में नहीं थी, या उन्होंने एक ही कटोरे के लिए अलग-अलग नाम इस्तेमाल किए)।

बड़ी सीख
पेपर निष्कर्ष निकालता है कि जबकि AI कोड के छोटे, अलग स्निपेट्स लिखने में अद्भुत है, यह एक पूरे सिस्टम को संचालित (orchestrate) करने में अभी भी बहुत बुरा है। सबसे कठिन काम एक एकल फंक्शन के लिए कोड लिखना नहीं है; बल्कि यह सुनिश्चित करना है कि वह फंक्शन अन्य फंक्शन्स के साथ सही ढंग से बात करे, सही डेटा साझा करे, और पूरे सिस्टम को तोड़ न दे।

ClassEval-Pro वह नया "कुकिंग कॉम्पिटिशन" है जो अंततः इन AI शेफ को यह साबित करने के लिए मजबूर करता है कि वे एक पूरी रसोई चला सकते हैं, न कि केवल एक सब्जी काट सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →