← नवीनतम पेपर
🤖 AI

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

यह शोध पत्र मानव-स्तर के कोड रिफैक्टरिंग (code refactorings) को करने और पहचानने की LLM एजेंटों की क्षमता का मूल्यांकन करने के लिए CodeTaste पेश करता है, जो यह प्रकट करता है कि जबकि एजेंट स्वायत्त रूप से इष्टतम मानव विकल्पों की खोज करने में संघर्ष करते हैं, एक 'प्रपोज़-देन-इम्प्लीमेंट' (propose-then-implement) रणनीति वास्तविक दुनिया के रिफैक्टरिंग निर्णयों के साथ संरेखण में महत्वपूर्ण सुधार करती है।

मूल लेखक: Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

प्रकाशित 2026-03-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CODETASTE पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "बिखरा हुआ घर" वाली समस्या

कल्पना कीजिए कि आपने अपने घर की सफाई के लिए एक सुपर-स्मार्ट, अविश्वसनीय रूप से तेज़ रोबोट को काम पर रखा है।

  • अच्छी खबर: वह रोबोट विशिष्ट समस्याओं को ठीक करने में अद्भुत है। यदि आप कहते हैं, "रसोई का सिंक लीक हो रहा है, कृपया इसे ठीक करें," तो रोबोट लीकेज को ढूँढ लेता है, पाइप को कस देता है और पानी बहना रोक देता है। यह पूरी तरह से काम करता है।
  • बुरी खबर: समय के साथ, रोबोट घर में गंदगी फैलाना शुरू कर देता है। वह काउंटर पर औज़ार छोड़ देता है, लिविंग रूम में गंदे बर्तन ढेर कर देता है, और हॉलवे में एक अकेले जूते को रखने के लिए बक्सों का एक अजीब, डगमगाता हुआ टॉवर बना देता है। घर अभी भी काम कर रहा है (आप अभी भी वहां रह सकते हैं), लेकिन यह एक अराजक दुःस्वप्न बनता जा रहा है।

सॉफ्टवेयर की दुनिया में, यह रोबोट एक AI कोडिंग एजेंट (AI Coding Agent) है। यह बग्स को ठीक करने या नए फीचर्स जोड़ने के लिए कोड लिख सकता है, लेकिन अक्सर यह "तकनीकी ऋण" (technical debt) पैदा करता है—यानी बिखरा हुआ, दोहराया गया, या भ्रमित करने वाला कोड जो बाद में सॉफ्टवेयर को बनाए रखना कठिन बना देता है।

मानव डेवलपर्स के पास एक विशेष कौशल होता है जिसे रिफैक्टरिंग (Refactoring) कहते हैं। यह केवल एक टूटे हुए पाइप को ठीक करने के बारे में नहीं है; यह पूरी रसोई को पुनर्गठित करने के बारे में है ताकि बर्तन आसानी से मिल सकें, मसालों पर लेबल लगे हों, और फर्श साफ हो। यह घर को केवल कार्यात्मक बनाने के बारे में नहीं, बल्कि उसे बेहतर बनाने के बारे में है।

यह पेपर मुख्य सवाल यह पूछता है: क्या ये AI रोबोट खुद की गलतियों को सुधारना और घर को एक मानव विशेषज्ञ की तरह व्यवस्थित करना सीख सकते हैं?


समाधान: CODETASTE (कोड के लिए "टेस्ट ऑफ टेस्ट")

इसका उत्तर देने के लिए, शोधकर्ताओं ने CODETASTE नामक एक बेंचमार्क बनाया। इसे AI शेफ के लिए एक कठोर "टेस्ट ऑफ टेस्ट" (स्वाद परीक्षण) के रूप में समझें।

AI को केवल खाना पकाने के लिए कहने के बजाय, उन्होंने इसे एक विशिष्ट चुनौती दी: "यहाँ एक बिखरी हुई रसोई है। कृपया इसे ठीक वैसे ही व्यवस्थित करें जैसे एक मानव शेफ करेगा, बिना भोजन का स्वाद बदले।"

उन्होंने इस टेस्ट को कैसे बनाया

  1. स्रोत सामग्री (The Source Material): उन्होंने हजारों वास्तविक दुनिया के सॉफ्टवेयर प्रोजेक्ट्स (जैसे GitHub रिपॉजिटरी) को देखा और 100 ऐसे उदाहरण खोजे जहाँ मानव डेवलपर्स ने कोड का एक बड़ा, जटिल पुनर्गठन (refactoring) किया था।
  2. सेटअप: प्रत्येक उदाहरण के लिए, उन्होंने एक "सैंडबॉक्स" (एक सुरक्षित, अलग डिजिटल कमरा) बनाया जहाँ AI कोड को ठीक करने की कोशिश कर सके।
  3. नियम: उन्होंने केवल यह जाँच नहीं की कि कोड "काम कर रहा है या नहीं।" उन्होंने यह देखने के लिए विशेष "जासूसी नियमों" (static analysis) का उपयोग किया कि क्या AI ने वास्तव में खराब पैटर्न (जैसे बिखराव) को हटाया और अच्छे पैटर्न (जैसे संगठन) को जोड़ा।

खेल के दो राउंड

शोधकर्ताओं ने AI का दो अलग-अलग तरीकों से परीक्षण किया:

राउंड 1: "रेसिपी का पालन करें" ट्रैक (निर्देशित - Instructed)

  • परिदृश्य: आप AI को एक विस्तृत, चरण-दर-चरण रेसिपी देते हैं: "सभी मसालों को बाईं कैबिनेट में रखें, उन्हें वर्णानुक्रम (alphabetically) में लेबल करें, और टूटे हुए जार को फेंक दें।"
  • परिणाम: AI ने काफी अच्छा प्रदर्शन किया! सबसे अच्छे मॉडल्स (जैसे GPT-5) लगभग 70% बार निर्देशों का पालन कर पाए। यदि उन्हें ठीक से बताया जाए, तो वे योजना को लागू कर सकते थे।

राउंड 2: "इस गंदगी को साफ करें" ट्रैक (खुला - Open)

  • परिदृश्य: आप बिखरी हुई रसोई में जाते हैं और बस कहते हैं, "यह जगह बहुत खराब है। कृपया इसे बेहतर बनाएं।" आप उन्हें यह नहीं बताते कि कैसे करना है।
  • परिणाम: AI पूरी तरह से विफल रहा। इसका स्कोर 8% से भी कम रहा।
    • पूरी रसोई को व्यवस्थित करने के बजाय, AI शायद केवल एक काउंटर पोंछ देगा या लेबल पर एक छोटी सी टाइपो (typo) को ठीक कर देगा।
    • वह यह नहीं समझ पाया कि एक इंसान को क्या ठीक करने के लिए चुनना चाहिए। उसमें "निर्णय लेने की क्षमता" (judgment) की कमी थी कि बड़े चित्र (big picture) को कैसे देखा जाए।

मुख्य निष्कर्ष और आश्चर्य

1. "पहले योजना बनाएं" वाली ट्रिक (The "Plan First" Trick)
शोधकर्ताओं ने पाया कि यदि वे AI को काम शुरू करने से पहले एक योजना लिखने के लिए मजबूर करते हैं, तो यह बहुत बेहतर हो जाता है।

  • उपमा: कल्पना कीजिए कि आप रोबोट को कहते हैं, "बस बक्से इधर-उधर मत करो। पहले, एक नक्शा बनाओ कि रसोई कैसी दिखनी चाहिए, फिर मुझे वह नक्शा दिखाओ। यदि नक्शा अच्छा दिखता है, तभी बक्से हिलाना शुरू करना।"
  • इस "योजना-फिर-कार्य" (Plan-then-Act) दृष्टिकोण ने AI को लक्ष्य को बेहतर ढंग से समझने में मदद की, जिससे बिखरी हुई रसोई वाले परिदृश्य में इसकी सफलता दर दोगुनी हो गई।

2. पूर्णता की लागत (The Cost of Perfection)
जिस AI ने सबसे अच्छा काम किया (GPT-5), वह सबसे महंगा भी था। सटीक होने के लिए उसने बहुत अधिक "पैसा" (कंप्यूटिंग पावर) खर्च किया। सस्ते और तेज़ मॉडल्स आलसी थे और अक्सर केवल "सर्च एंड रिप्लेस" (जैसे एक ढीले पेंच को ठीक करने के लिए विशाल हथौड़े का उपयोग करना) करते थे, जिससे चीजें टूट जाती थीं।

3. "मानव अंतराल" (The "Human Gap")
भले ही सबसे स्मार्ट AI मॉडल भी, यह तय करने के मामले में मानव-स्तर के निर्णय से अभी भी बहुत दूर हैं कि क्या ठीक करने की आवश्यकता है। वे आदेशों का पालन करने में अच्छे हैं लेकिन खुद से समस्याओं को पहचानने में खराब हैं।


यह क्यों मायने रखता है?

यदि हम चाहते हैं कि AI सॉफ्टवेयर विकास में एक सच्चा साथी बने, तो यह केवल एक "ठीक करने वाला" बॉट नहीं हो सकता। इसे एक "माली" (gardener) होना चाहिए जो जानता है कि झाड़ियों की छंटाई कैसे करनी है, पौधों को पानी कैसे देना है, और बगीचे को लंबे समय तक सुंदर कैसे बनाए रखना है।

CODETASTE हमें दिखाता है कि:

  • वर्तमान AI वह करने में अच्छा है जो उसे बताया जाता है
  • वर्तमान AI यह तय करने में बुरा है कि क्या किया जाना चाहिए।

पेपर यह निष्कर्ष निकालता है कि लंबे समय में AI को वास्तव में मानव डेवलपर्स को बदलने या सहायता करने के लिए, हमें इसे केवल कोड लिखना ही नहीं, बल्कि एक वास्तुकार (architect) की तरह सोचना सिखाना होगा—बिखराव को देखना, संरचना को समझना, और सॉफ्टवेयर को वर्षों तक स्वस्थ रखने के लिए कठिन निर्णय लेना।

मुख्य बात (The Takeaway)

यह पेपर एक वास्तविकता की जाँच (reality check) है। AI एक शक्तिशाली उपकरण है, लेकिन अभी भी यह एक बहुत तेज़, बहुत आज्ञाकारी इंटर्न की तरह है जिसे यह बताने के लिए एक मैनेजर की आवश्यकता होती है कि क्या करना है। इसने अभी तक यह नहीं सीखा है कि एक बिखरे हुए कमरे को देखना, आह भरना, और खुद से कहना, "मुझे पता है कि इसे कैसे ठीक करना है।" CODETASTE हमें उस कौशल को सिखाने के लिए एक पैमाना प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →