← नवीनतम पेपर
💻 computer science

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

यह शोध पत्र दो LLM-आधारित क्यूरेशन पाइपलाइनों, जिसमें CuREV डेटासेट और एक एक्सेम्पलर-गाइडेड दृष्टिकोण शामिल है, का प्रस्ताव करता है, ताकि कोड समीक्षा टिप्पणियों की गुणवत्ता, स्पष्टता और यथार्थता को व्यवस्थित रूप से सुधारा जा सके, जिससे कमेंट जनरेशन और कोड रिफाइनमेंट जैसे डाउनस्ट्रीम ऑटोमेशन कार्यों के प्रदर्शन को बढ़ाया जा सके।

मूल लेखक: Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कोड रिव्यू की कल्पना एक विशाल, अराजक ग्रुप चैट के रूप में करें जहाँ डेवलपर्स एक विशाल, साझा लेगो (Lego) महल को ठीक करने की कोशिश कर रहे हैं। कभी-कभी फीडबैक शानदार होता है: "हे, वह नीला ईंट गलत जगह पर है; आइए इसे लाल रंग से बदल दें ताकि टावर स्थिर रहे।" लेकिन अक्सर, चैट शोर से भरी होती है: "उफ़, घिनौना है," "यहाँ भी ऐसा ही है lol," या बदतमीजी भरी भड़ास जो वास्तव में कुछ भी बनाने में मदद नहीं करती।

लंबे समय तक, वैज्ञानिकों ने रोबोट्स (विशेष रूप से, लार्ज लैंग्वेज मॉडल्स या LLMs) को एक सहायक समीक्षक के रूप में कार्य करने के लिए इस पूरी, अस्त-व्यस्त चैट हिस्ट्री को खिलाकर सिखाने की कोशिश की। समस्या यह थी कि रोबोट्स ने बुरी आदतें भी सीख लीं। वे अस्पष्ट, अशिष्ट या भ्रमित करने वाली टिप्पणियाँ उगलने लगे क्योंकि उन्होंने अपने ट्रेनिंग डेटा में यही देखा था। यह एक शेफ को स्वादिष्ट भोजन और जले हुए टोस्ट के मिश्रण को खिलाकर खाना सिखाने जैसा है; अंततः, शेफ बस जला हुआ टोस्ट ही परोसने लगेगा।

मुख्य खोज: रसोई की सफाई करना
इस शोध पत्र के लेखकों ने रोबोट्स को सिखाने से पहले "रसोई" को साफ करने का निर्णय लिया। उन्होंने केवल खराब डेटा को फेंका नहीं; बल्कि, उन्होंने दो अलग-अलग "क्यूरेशन पाइपलाइन्स" (सोचिए, एक अव्यवस्थित लाइब्रेरी को व्यवस्थित करने के दो अलग तरीके) बनाईं ताकि शोर भरी चैट लॉग्स को रोबोट्स के लिए एक उच्च-गुणवत्ता वाली पाठ्यपुस्तक में बदला जा सके।

पाइपलाइन 1: "सख्त संपादक" (CuREV)
पहला तरीका, जिसे CuREV कहा गया, एक सख्त संपादक को काम पर रखने जैसा था जो चैट में प्रत्येक टिप्पणी को फिर से लिखता है।

  • उन्होंने क्या किया: उन्होंने हर एक टिप्पणी को लिया, यहाँ तक कि अच्छी टिप्पणियों को भी, और उन्हें स्पष्ट, संक्षिप्त, विनम्र और सटीक बनाने के लिए मजबूर किया।
  • परिणाम: रोबल्स ने बहुत तेज़ी से सीखा क्योंकि निर्देश इतने एकसमान थे। जब समीक्षा लिखने के लिए पूछा जाता, तो रोबोट लगभग हमेशा एक ही वाक्यांश से शुरू करता: "विचार करें..." (Consider...)
  • कमी: हालांकि रोबोट "विचार करें..." नियम का पालन करने में बहुत अच्छा हो गया, लेकिन वे थोड़े रोबोटिक और दोहराव वाले लगने लगे। यह एक ऐसे गायक दल की तरह था जहाँ हर कोई बिल्कुल एक ही सुर को पूरी तरह से गाता है, लेकिन उसमें विविधता नहीं होती। पेपर दिखाता है कि इस विधि ने कमेंट जेनरेट करने की रोबोट की क्षमता में सुधार किया (BLEU नामक टेस्ट पर 11.26 का स्कोर, जो मूल अस्त-व्यस्त डेटा के 7.71 से अधिक है), लेकिन इसने रोबोट की आवाज़ को एक टेम्पलेट की तरह बना दिया।

पाइपलाइन 2: "स्मार्ट मेंटर" (CuREV+)
दूसरा तरीका, CuREV+, अधिक स्मार्ट था। सब कुछ फिर से लिखने के बजाय, लेखकों ने एक बुद्धिमान शिक्षक की तरह काम किया।

  • उन्होंने क्या किया: उन्होंने पहले टिप्पणियों को "अच्छी" और "बुरी" में वर्गीकृत किया।
    • अच्छी टिप्पणियाँ (स्पष्ट, विनम्र, सहायक) उन्हें बिल्कुल वैसा ही छोड़ दिया गया जैसा वे थीं। उन्हें "एग्जेम्पलर" (आदर्श उदाहरण) के रूप में रखा गया।
    • बुरी टिप्पणियाँ (अशिष्ट, अस्पष्ट या अस्त-व्यस्त) को रोबोट द्वारा फिर से लिखा गया, लेकिन इस बार, रोबोट को प्रेरित करने के लिए पहले "अच्छी" टिप्पणियों को दिखाया गया था।
  • परिणाम: अंतिम डेटासेट वास्तविक मानवीय आवाजों और पॉलिश किए गए, सहायक सुझावों का मिश्रण था। रोबोट्स ने मानवीय बातचीत की प्राकृतिक विविधता को खोए बिना स्पष्ट और विनम्र होना सीखा।
  • प्रमाण: कोड रिव्यू लिखने पर परीक्षण किए जाने पर, इस पद्धति ने BLEU टेस्ट पर 11.05 का स्कोर प्राप्त किया—मूल डेटा के लगभग बराबर, लेकिन एक बड़े बोनस के साथ: टिप्पणियाँ बहुत अधिक मानवीय लग रही थीं।
    • विविधता की जाँच: सख्त संपादक (CuREV) ने "विचार करें" (consider) शब्द का 142,000 से अधिक बार उपयोग किया। स्मार्ट मेंटर (CuREV+) ने इसका उपयोग केवल 10,000 बार किया, और इसमें "हम कर सकते हैं," "हमें करना चाहिए," और "मुझे लगता है" जैसे वाक्यांशों को मिलाया।
    • वास्तविक दुनिया का परीक्षण: जब रोबोट को टिप्पणियों के आधार पर वास्तव में कोड को ठीक करना था, तो CuREV+ विधि विजेता रही। इसने रोबोट को 0.49 (CodeBLEU) के स्कोर के साथ कोड ठीक करने में मदद की, जो सख्त संपादक के 0.44 और मूल अस्त-व्यस्त डेटा के 0.36 से बेहतर था।

यह पेपर किसे खारिज करता है
यह पेपर स्पष्ट रूप से इस विचार के खिलाफ तर्क देता है कि हमें केवल कच्चे, अस्त-व्यस्त डेटा को रोबोट्स को खिलाना चाहिए। वे दिखाते हैं कि अनियंत्रित डेटा पर प्रशिक्षण देने से रोबोट अप्रासंगिक, अस्पष्ट या यहाँ तक कि असभ्य टिप्पणियाँ उत्पन्न करते हैं। वे यह भी सुझाव देते हैं कि सब कुछ फिर से लिखना (जैसे कि पहली पाइपलाइन में) बहुत चरम हो सकता है, क्योंकि यह मानवीय बातचीत की स्वाभाविक विविधता को छीन लेता है। पेपर का तर्क है कि आपको एक संतुलन की आवश्यकता है: अच्छे मानवीय स्वरों को बनाए रखें, और केवल बुरे वाले को ठीक करें।

वे कितने आश्वस्त हैं?
लेखक अपने नंबरों को लेकर काफी आश्वस्त हैं, लेकिन वे अपनी बात कहने के तरीके में सावधान हैं।

  • उन्होंने एक परिष्कृत प्रणाली का उपयोग करके टिप्पणियों की गुणवत्ता को मापा, जहाँ एक शक्तिशाली AI (Llama-3.1-70B) एक न्यायाधीश के रूप में कार्य करता था, जो स्पष्टता, सभ्यता और प्रासंगिकता की जाँच करता था। उन्होंने इसकी दोबारा जाँच मानव समीक्षकों के साथ की और पाया कि AI लगभग पूरी तरह से मनुष्यों के साथ सहमत था (सहमति के लिए 0.88 का स्कोर)।
  • उन्होंने विशिष्ट कार्यों (टिप्पणियाँ लिखना और कोड ठीक करना) पर प्रशिक्षण देकर रोबोट्स के सीखने की प्रक्रिया को सिमुलेट (Simulate) किया। सुधार इन परीक्षणों में वास्तविक और मापने योग्य थे।
  • वे सुझाव देते हैं कि यह दृष्टिकोण "उपयोगिता" (काम पूरा करना) और "स्वाभाविकता" (इंसान की तरह लगना) के बीच एक बेहतर संतुलन बनाता है। वे यह दावा नहीं करते कि यह सभी समय के लिए एकमात्र पूर्ण समाधान है, लेकिन डेटा मजबूती से समर्थन करता है कि CuREV+ पुराने, अस्त-व्यस्त तरीके की तुलना में एक महत्वपूर्ण प्रगति है।

संक्षेप में, पेपर सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट एक महान कोड समीक्षक बने, तो उसे केवल पूर्ण वाक्यों का शब्दकोश न खिलाएं। इसके बजाय, उसे सबसे अच्छे मानवीय उदाहरण दिखाएं, बुरे वाले को ठीक करें, और उसे मिश्रण से सीखने दें। इस तरह, वह एक टूटे हुए रिकॉर्ड की तरह सुनाई दिए बिना मददगार बनना सीख जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →