← नवीनतम पेपर
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

यह शोध पत्र SWE-Pro को प्रस्तुत करता है, जो 102 विशेषज्ञ अनुकूलनों (optimizations) से व्युत्पन्न एक कठोर रिपॉजिटरी-स्तरीय बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स वास्तविक दुनिया के सॉफ्टवेयर अनुकूलन में मानव-स्तर के प्रदर्शन के साथ मेल खाने में काफी विफल रहते हैं, और विशेषज्ञ इंजीनियरों द्वारा प्रदान की गई पर्याप्त गति वृद्धि (speedups) और मेमोरी कटौती की तुलना में नगण्य लाभ प्राप्त करते हैं।

मूल लेखक: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Evaluating LLMs on Real-World Software Performance Optimization" (SWE-Pro) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: "तेज़ शेफ" बनाम "मास्टर शेफ"

कल्पना कीजिए कि आपके पास एक बहुत बड़ा, व्यस्त रेस्टोरेंट किचन है (एक वास्तविक दुनिया का सॉफ्टवेयर कोडबेस)। आपने AI शेफ (लार्ज लैंग्वेज मॉडल्स या LLMs) की एक टीम को मास्टर शेफ (मानव विशेषज्ञों) की मदद करने के लिए काम पर रखा है, ताकि वे खाना तेज़ी से बना सकें और कम ऊर्जा का उपयोग कर सकें।

मास्टर शेफ जानते हैं कि सब्जियों को कुशलतापूर्वक कैसे काटना है, कदमों को बचाने के लिए पेंट्री को कैसे व्यवस्थित करना है, और ईंधन बचाने के लिए स्टोव के तापमान को कैसे समायोजित करना है। उनके पास वर्षों का अनुभव है।

AI शेफ अविश्वसनीय रूप से स्मार्ट हैं। वे रेसिपी पढ़ सकते हैं, सामग्री को समझ सकते हैं, और यहाँ तक कि ऐसी नई रेसिपी भी लिख सकते हैं जो कागज़ पर एकदम सही दिखती हैं। लेकिन यह पेपर जो सवाल पूछता है वह यह है: क्या ये AI शेफ वास्तव में वास्तविक दुनिया में किचन को तेज़ और कम ऊर्जा वाला बना सकते हैं, या वे केवल चीजों को अच्छा दिखाने के लिए करते हैं बिना वास्तव में गति में सुधार किए?

समस्या: पुराने परीक्षण बहुत सरल थे

पहले, शोधकर्ता AI शेफ का परीक्षण उन्हें एक छोटा सा कार्य देकर करते थे: "इस एक गाजर को काटो।"

  • दोष: वास्तविक किचन में, आप केवल एक गाजर नहीं काटते। आप 10, 1,000, या 100,000 गाजर काटते हैं। कभी गाजर गीली होती है; कभी जमी हुई (frozen) होती है।
  • परिणाम: पुराने परीक्षण ऐसे थे जैसे किसी शेफ को एक शांत कमरे में एक अकेली गाजर काटने की क्षमता के आधार पर आंकना। उन्होंने यह परीक्षण नहीं किया कि क्या शेफ भीड़ के समय (rush hour) में 1,000 ऑर्डर्स को संभाल सकता है, या क्या शेफ तेज़ होने की कोशिश में गलती से बहुत अधिक पानी (मेमोरी) का उपयोग कर देता है।

पेपर का तर्क है कि ये पुराने परीक्षण बहुत आसान थे और वे वास्तविक कंप्यूटरों में होने वाले "शोर" (noise - यादृच्छिक उतार-चढ़ाव) को पकड़ नहीं पाए।

समाधान: SWE-Pro (एक "असली किचन" सिम्युलेटर)

लेखकों ने एक नया, बहुत कठिन परीक्षण बनाया जिसे SWE-Bl कहा जाता है। इसे एक उच्च-तकनीकी, अराजक वास्तविक दुनिया के किचन के सिमुलेशन के रूप में समझें।

  1. असली रेसिपी: उन्होंने काल्पनिक कार्य नहीं बनाए। उन्होंने 102 वास्तविक उदाहरण देखे जहाँ मानव विशेषज्ञों ने प्रसिद्ध ओपन-सोर्स प्रोजेक्ट्स (जैसे pandas, scikit-learn, और xarray) में कोड को सफलतापूर्वक ऑप्टिमाइज़ किया था। ये "गोल्ड स्टैंडर्ड" रेसिपी हैं।
  2. स्ट्रेस टेस्ट: AI शेफ का परीक्षण केवल एक इनपुट पर करने के बजाय, SWE-Pro उन्हें कई अलग-अलग परिदृश्यों पर परखता है।
    • उपमा: यह केवल "10 गाजर काटो" नहीं है। यह है "10 गाजर काटो," फिर "100 गाजर काटो," फिर "10,000 गाजर काटो," और ऐसा करते हुए गीली गाजर, जमी हुई गाजर और अलग-अलग आकार की गाजरों के साथ काम करें।
  3. नॉइज़ फ़िल्टर (Noise Filter): कंप्यूटर अव्यवस्थित होते हैं। कभी-कभी कोई प्रोग्राम इसलिए धीमा हो जाता है क्योंकि कंप्यूटर किसी और चीज़ के बारे में सोच रहा होता है (जैसे वेटर का ट्रे गिरा देना)। SWE-Pro परीक्षणों को बार-बार चलाता है, एक विशेष सांख्यिकीय "नॉइज़ फ़िल्टर" का उपयोग करता है ताकि यह सुनिश्चित हो सके कि यदि AI कहता है "मैं तेज़ हूँ," तो वह वास्तव में सच है और केवल एक भाग्यशाली इत्तेफाक नहीं है।
  4. दो मेट्रिक्स: वे दो चीजें मापते हैं:
    • गति (Speed): खाना कितनी जल्दी परोसा जाता है (Runtime)।
    • मेमोरी (Memory): शेफ कितना काउंटर स्पेस और स्टोरेज उपयोग करता है (Peak Memory और Time-Weighted Memory Usage)।

परिणाम: AI शेफ संघर्ष करते हैं

जब उन्होंने शीर्ष AI मॉडल्स (जैसे GPT-5.2, Claude Sonnet 4.6, आदि) को इस कठोर "असली किचन" परीक्षण के माध्यम से डाला, तो परिणाम आश्चर्यजनक और निराशाजनक थे।

  • मानव विशेषज्ञ (Gold Standard): जब इंसानों ने कोड को ऑप्टिमाइज़ किया, तो उन्होंने भारी सुधार हासिल किए।
    • उपमा: मास्टर शेफ ने खाना पकाने के समय को 15 गुना कम कर दिया और आवश्यक काउंटर स्पेस को 171 गुना कम कर दिया। उन्होंने किचन को पुनर्गठित करने के चतुर तरीके खोजे जिससे भारी मात्रा में संसाधन बचे।
  • AI शेफ:
    • गति: AI मॉडल्स ने बहुत कम अंतर दिखाया। अधिकांश मामलों में, उनके "सुधार" इतने छोटे थे कि उन्हें रैंडम नॉइज़ से अलग नहीं किया जा सकता था।
    • मेमोरी: AI मॉडल्स ने लगभग कभी भी मेमोरी बचाने में सफलता नहीं पाई। वे इस क्षेत्र में लगभग नगण्य थे।
    • "नो सिग्नल" की समस्या: भले ही AI ने ऐसा कोड लिखा जो बुनियादी परीक्षणों में पास हो गया (खाना सही स्वाद का था), लेकिन उसने शायद ही कभी मापने योग्य गति (speedup) पैदा की। यह एक ऐसे शेफ की तरह था जिसने गाजरें तो सफाई से काटीं लेकिन उसे पहले जितना ही समय लगा।
    • रिग्रेशन (Regression): कभी-कभी, AI चीजों को वास्तव में धीमा कर देता है। एक मॉडल (GPT-5.2) ने औसतन कोड को 30% धीमा कर दिया!

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि AI कोड लिखने में बहुत अच्छा है जो सही दिखता है और नियमों का पालन करता है, लेकिन यह वर्तमान में वास्तविक दुनिया के परिदृश्यों में सॉफ्टवेयर को काफी तेज़ चलाने या कम मेमोरी उपयोग करने के लिए आवश्यक गहरे, जटिल इंजीनियरिंग में बहुत खराब है।

  • अंतराल (The Gap): आज जो AI कर सकता है और जो विशेषज्ञ मानव इंजीनियर कर सकते हैं, उसके बीच एक बहुत बड़ा अंतर है।
  • अवरोध (The Bottleneck): समस्या यह नहीं है कि AI बड़े सुधार नहीं कर सकता यदि उसे किस्मत मिल जाए (वह कर सकता है, दुर्लभ मामलों में)। समस्या यह है कि AI उन अवसरों को विश्वसनीय रूप से खोज नहीं सकता जो उन सुधारों को करने के लिए आवश्यक हैं।

संक्षेप में: यदि आप AI से कहें कि "इस सॉफ्टवेयर को तेज़ बनाओ," तो हो सकता है कि वह एक अच्छा दिखने वाला पैच लिख दे, लेकिन उम्मीद न करें कि वह वास्तव में आपके कंप्यूटर की गति बढ़ाएगा या आपकी मेमोरी बचाएगा। फिलहाल, वह काम अभी भी मानव विशेषज्ञों के पास है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →