ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
यह शोधपत्र ClassEval-Pro को प्रस्तुत करता है, जो एक LLM एन्सेम्बल और उच्च-कवरेज टेस्ट सूट्स द्वारा सत्यापित 300 क्लास-लेवल कोड जनरेशन कार्यों का एक कठोर, क्रॉस-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर LLMs लॉजिक और डिपेंडेंसी त्रुटियों के कारण कंपोजिशनल कोड क्रिएशन में संघर्ष करते हैं, और केवल 45.6% का सर्वश्रेष्ठ Pass@1 प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को खाना बनाना सिखा रहे हैं।
पुराना तरीका (फंक्शन-लेवल):
अब तक, शोधकर्ताओं ने मुख्य रूप से इन AI शेफ का परीक्षण करने के लिए उनसे एक साधारण सामग्री बनाने के लिए कहा है, जैसे कि "प्याज काटें" या "पानी उबालें।" AI इसमें बहुत अच्छा है। यह 90% बार प्याज को पूरी तरह से काट सकता है। यह इस बात जैसा है कि क्या रोबोट एक अकेले उपकरण को संभाल सकता है।
कमी (क्लास-लेवल):
लेकिन वास्तविक दुनिया में, खाना बनाना केवल एक चीज़ काटने के बारे में नहीं है। यह एक पूरा व्यंजन बनाने के बारे में है जहाँ सामग्रियां एक साथ मिलकर काम करनी चाहिए। आपको एक ऐसा सॉस चाहिए जो जानता हो कि कितना नमक डाला गया था, एक ऐसा गार्निश जो मुख्य कोर्स से मेल खाता हो, और एक प्लेटिंग रणनीति जो सब कुछ एक साथ थामे रखे। इसे ही पेपर में "कंपोजिशनल कोड क्रिएशन" (compositional code creation) कहा गया है। यह एक पूर्ण, व्यवस्थित "क्लास" (सॉफ्टवेयर की एक आत्मनिर्भर इकाई) बनाने की क्षमता है जहाँ कई हिस्से एक-दूसरे से सही ढंग से बात करते हैं।
समस्या:
लेखकों का कहना है कि हमारे पास इस "पूरे व्यंजन" के कौशल के लिए कोई अच्छा परीक्षण नहीं था। पुराने परीक्षण बहुत सरल थे, और जो कुछ परीक्षण मौजूद थे वे मनुष्यों द्वारा बनाए गए थे, जो धीमा और महंगा है, और हो सकता है कि रेसिपी AI के प्रशिक्षण के दौरान लीक हो गई हो (जैसे कि AI टेस्ट के उत्तर याद करके चीटिंग कर रहा हो)।
समाधान: ClassEval-Pro
टीम ने एक नया, विशाल परीक्षण बनाया है जिसे ClassEval-Pro कहा जाता है। उन्होंने इसे कैसे बनाया, इसके लिए एक रचनात्मक उपमा का उपयोग किया गया है:
- सामग्रियां (डेटा): हाथ से रेसिपी लिखने के बजाय, वे एक विशाल डिजिटल लाइब्रेरी (GitHub) पर गए और जनवरी 2025 के बाद लिखी गई रेसिपी लीं। यह सुनिश्चित करता है कि AI ने उन्हें पहले न देखा हो, इसलिए यह एक निष्पक्ष परीक्षण है।
- मिक्सिंग बाउल (क्रॉस-डोमेन): उन्होंने केवल समान सामग्रियां ही नहीं मिलाईं। उन्होंने AI को पूरी तरह से अलग दुनिया को मिलाने के लिए मजबूर किया। कल्पना कीजिए कि रोबोट को एक "फाइनेंशियल कैलकुलेटर" बनाने के लिए कहना है जिसे एक "वीडियो गेम इन्वेंटरी" भी प्रबंधित करनी है। उसे पैसे के तर्क (logic) और गेम के तर्क को एक ही सुसंगत प्रोग्राम में एक साथ काम करना होगा।
- स्वाद परीक्षण (वैलिडेशन): परीक्षण शुरू होने से पहले, वे यह जांचने के लिए AI जजों के एक पैनल का उपयोग करते हैं कि क्या रेसिपी समझ में आती है और क्या टेस्ट "टेस्ट टेस्ट" (कोड टेस्ट) कम से कम 90% रेसिपी को कवर करते हैं। यदि रेसिपी खराब है, तो वे उसे फेंक देते हैं।
परिणाम: रोबोट शेफ संघर्ष करते हैं
उन्होंने पाँच सबसे स्मार्ट AI शेफ (जैसे GPT-5.1, Gemini, और Qwen) को ये जटिल व्यंजन बनाने के लिए कहा।
- स्कोर: यहाँ तक कि सबसे अच्छे शेफ ने भी केवल लगभग 45% व्यंजन सही बनाए। यह उन सरल "प्याज काटने" वाले कार्यों से मिलने वाले 90% से बहुत बड़ी गिरावट है।
- अंतर: सबसे अच्छे शेफ और सबसे कमजोर शेफ के बीच एक बड़ा अंतर था। सबसे अच्छे शेफ ने 45% सही बनाया, जबकि सबसे कमजोर ने केवल 28%। यह साबित करता है कि यह परीक्षण मजबूत शेफ को कमजोरों से अलग करने में सक्षम है।
- "मेथड" का जाल: दिलचस्प बात यह है कि शेफ अक्सर व्यक्तिगत चरणों को सही ढंग से लिख सकते थे (जैसे "प्याज काटें" या "नमक डालें")। लेकिन जब उन्होंने उन सभी को एक काम करने वाले व्यंजन में जोड़ने की कोशिश की, तो सब बिखर गया। प्याज तो कट गया था, लेकिन नमक गलत बर्तन में डाल दिया गया था।
उन्होंने मदद करने की कोशिश कैसे की (रणनीतियाँ)
शोधकर्ताओं ने शेफ को अलग-अलग तरीकों से दृष्टिकोण अपनाने के लिए प्रेरित किया:
- "बॉटम-अप" दृष्टिकोण: "पहले आधार सामग्री से शुरुआत करें, फिर सॉस बनाएं, फिर गार्निश।" इससे कमजोर शेफ में काफी सुधार हुआ।
- "टॉप-डाउन" दृष्टिकोण: "पहले पूरा मेनू प्लान करें, फिर पकाएं।" इसने सबसे मजबूत शेफ की मदद की।
- "कंपोजिशनल" दृष्टिकोण: "पहले सॉस की रेसिपी लिखें, फिर गार्निश की रेसिपी लिखें, फिर उन्हें आपस में जोड़ दें।" यह एक आपदा थी। शेफ टुकड़ों को जोड़ने में भ्रमित हो गए, और उनकी सफलता दर गिरकर लगभग शून्य (एक मॉडल के लिए 1.3%) हो गई।
क्या गलत हुआ? (त्रुटियाँ)
टीम ने 500 विफल व्यंजनों को देखा कि क्या गलत हुआ। उन्होंने दो मुख्य समस्याएं पाईं:
- लॉजिक एरर्स (56%): रोबोट शब्दों को समझता था लेकिन अर्थ को गलत समझ लेता था। (जैसे, "यदि उपयोगकर्ता ऑफलाइन है, तो सफलता का संदेश दें" बजाय विफलता के संदेश के)।
- डिपेंडेंसी एरर्स (38%): हिस्से आपस में फिट नहीं बैठे। (जैसे, सॉस की रेसिपी में ऐसी सामग्री मांगी गई जो गार्निश की रेसिपी में नहीं थी, या उन्होंने एक ही कटोरे के लिए अलग-अलग नाम इस्तेमाल किए)।
बड़ी सीख
पेपर निष्कर्ष निकालता है कि जबकि AI कोड के छोटे, अलग स्निपेट्स लिखने में अद्भुत है, यह एक पूरे सिस्टम को संचालित (orchestrate) करने में अभी भी बहुत बुरा है। सबसे कठिन काम एक एकल फंक्शन के लिए कोड लिखना नहीं है; बल्कि यह सुनिश्चित करना है कि वह फंक्शन अन्य फंक्शन्स के साथ सही ढंग से बात करे, सही डेटा साझा करे, और पूरे सिस्टम को तोड़ न दे।
ClassEval-Pro वह नया "कुकिंग कॉम्पिटिशन" है जो अंततः इन AI शेफ को यह साबित करने के लिए मजबूर करता है कि वे एक पूरी रसोई चला सकते हैं, न कि केवल एक सब्जी काट सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।