← नवीनतम पेपर
💻 computer science

Not All Tokens Matter: Data-Centric Optimization for Efficient Code Summarization

यह शोध पत्र प्रदर्शित करता है कि कुशल कोड सारांशीकरण (code summarization) के लिए समान न्यूनीकरण (uniform reduction) के बजाय भाषा-विशिष्ट टोकन क्यूरेशन रणनीतियों की आवश्यकता होती है, जो यह प्रकट करता है कि एब्स्ट्रैक्ट सिंटैक्स ट्री (Abstract Syntax Trees) जावा में प्रदर्शन को महत्वपूर्ण रूप से बढ़ाते हैं जबकि फंक्शन सिग्नेचर (Function Signatures) पायथन के लिए इष्टतम हैं, जो डेटा-केंद्रित अनुकूलन में क्रॉस-लैंग्वेज ट्रांसफ़रेबिलिटी की धारणा को चुनौती देता है।

मूल लेखक: Saima Afrin, Zaiyu Cheng, Tushar Sharma, Alexander Serebrenik, Massimiliano Di Penta, Antonio Mastropaolo

प्रकाशित 2026-07-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saima Afrin, Zaiyu Cheng, Tushar Sharma, Alexander Serebrenik, Massimiliano Di Penta, Antonio Mastropaolo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को लाखों किताबों की लाइब्रेरी पढ़ना और उनमें से प्रत्येक के लिए एक छोटा सारांश लिखना सिखाने की कोशिश कर रहे हैं। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो उन AI इंजनों के पीछे की शक्ति है जो कोड लिख सकते हैं, सवालों के जवाब दे सकते हैं, और यहाँ तक कि चुटकुले भी सुना सकते हैं। लेकिन यहाँ एक पेंच है: ये रोबोट अविश्वसनीय रूप से भूखे होते हैं। सीखने के लिए, उन्हें टेक्स्ट की विशाल मात्रा चबाने की आवश्यकता होती है, जिसके लिए विशाल, महंगे कंप्यूटर और बहुत अधिक बिजली की आवश्यकता होती है। यह एक ड्रैगन को "हैलो" कहने के लिए पूरा जंगल खिलाने की कोशिश करने जैसा है।

सॉफ्टवेयर की दुनिया में, इस रोबate का काम कोड सारांशीकरण (code summarization) है: कंप्यूटर निर्देशों (कोड) के एक ब्लॉक को एक सरल वाक्य में बदलना जो बताता है कि वह क्या करता है। इसे एक जटिल रेसिपी को "केक बनाएं" जैसे त्वरित शीर्षक में अनुवाद करने के रूप में सोचें। समस्या यह है कि कंप्यूटर कोड अक्सर दोहराव वाले, उबाऊ शब्दों और प्रतीकों से भरा होता है जो वास्तव में रेसिपी का अर्थ नहीं बदलते हैं। यदि आप रोबोट को हर एक शब्द, जिसमें "and", "the", और "if" शामिल हैं, खिलाकर सिखाने की कोशिश करते हैं, तो आप समय और ऊर्जा बर्बाद करते हैं। बड़ा सवाल जो शोधकर्ताओं ने पूछा है, वह यह है: क्या हम रोबोट को केवल महत्वपूर्ण हिस्से सिखा सकते हैं, फालतू चीजों को छोड़ सकते हैं, और फिर भी एक सटीक सारांश प्राप्त कर सकते हैं?

यह शोध पत्र, जिसका शीर्षक "Not All Tokens Matter" है, सीधे इसी सवाल में उतरता है। लेखकों ने, जो कंप्यूटर वैज्ञानिकों की एक टीम है, एक साहसी विचार का परीक्षण करने का निर्णय लिया: क्या होगा अगर हमें रोबोट को पूरा कोड खिलाने की आवश्यकता ही न हो? क्या होगा अगर हम रोबोट के देखने से पहले ही उबाऊ हिस्सों को काट सकें? उन्होंने केवल अनुमान नहीं लगाया; उन्होंने यह देखने के लिए तीन अलग-अलग प्रयोग चलाए कि "फालतू चर्बी" को काटने का कौन सा तरीका सबसे अच्छा काम करता है। उन्होंने कोड को एक संरचनात्मक आरेख (structural diagram) में बदलने, इसे केवल फंक्शन नामों तक सीमित करने, और सामान्य, बेकार शब्दों को हटाने के लिए एक स्मार्ट फ़िल्टर का उपयोग करने का प्रयास किया।

यहाँ एक मोड़ आया जो उन्होंने खोजा, और यह एक जादू के खेल जैसा है जो केवल कुछ विशेष दिनों पर ही काम करता है। उन्होंने पाया कि कोड को काटने का कोई एक "सर्वश्रेष्ठ" तरीका नहीं है। यह पूरी तरह से इस पर निर्भर करता है कि कोड किस भाषा में लिखा गया है।

जब उन्होंने Java (एक ऐसी भाषा जो बहुत सख्त है और सरल चीजों को कहने के लिए बहुत सारे शब्दों का उपयोग करती है) के साथ काम किया, तो सबसे अच्छी रणनीति कोड को एक संरचनात्मक आरेख (जिसे एब्स्ट्रैक्ट सिंटैक्स ट्री कहा जाता है) में बदलना था। इस पद्धति ने लगभग 56% से 73% शब्दों को काट दिया लेकिन वास्तव में रोबोट को सारांश बनाने में बेहतर बनाया, जिससे इसके स्कोर में 37% का सुधार हुआ। यह एक घने, शब्दबहुल उपन्यास को एक स्पष्ट, व्यवस्थित रूपरेखा में बदलने जैसा था—रोबोट इसे पूरी तरह से समझ गया।

हालाँकि, जब उन्होंने Python (एक ऐसी भाषा जो संक्षिप्त और सरल होने के लिए जानी जाती है) पर स्विच किया, तो वही संरचनात्मक आरेख एक आपदा बन गया। इसने रोबोट के प्रदर्शन को लगभग 50% तक गिरा दिया। क्यों? क्योंकि पायथन चीजों को समझने के लिए विशिष्ट नामों पर बहुत अधिक निर्भर करता है। जब उन्होंने आरेख का उपयोग किया, तो उन्होंने अनजाने में उन्हीं सुरागों को फेंक दिया जिनकी रोबोट को आवश्यकता थी। इसके बजाय, पायथन के लिए, जीतने वाली रणनीति यह थी कि फंक्शन सिग्नेचर (कोड का शीर्षक और सामग्री सूची) के अलावा बाकी सब कुछ फेंक दिया जाए। इस पद्धति ने भारी 83% टोकन हटा दिए लेकिन गुणवत्ता को उच्च बनाए रखा। यह पता चला कि पायथन के लिए, "शीर्षक" ही वह सब कुछ है जो आपको जानने की आवश्यकता है।

एक तीसरा तरीका भी था, जिसे CrystalBLEU कहा जाता है, जो एक स्मार्ट इरेज़र की तरह काम करता था, जो उन सामान्य शब्दों को हटा देता है जो हर जगह दिखाई देते हैं लेकिन अर्थ नहीं जोड़ते। यह एक विश्वसनीय "मध्यम मार्ग" था, जो दोनों भाषाओं के लिए अच्छी तरह से काम करता था और बिना परिणामों को नुकसान पहुँचाए लगभग 60% से 72% टेक्स्ट को काट देता था।

टीम ने पायथन कोड सारांशों का एक नया, उच्च-गुणवत्ता वाला टेस्ट सेट PyBench भी बनाया ताकि वे सुनिश्चित कर सकें कि उनके परिणाम वास्तविक हैं, और उन्होंने यह जांचने के लिए एक नया टूल SIDEpy बनाया कि क्या कोड और सारांश वास्तव में अर्थ में मेल खाते हैं, न कि केवल शब्दों में। उन्होंने पाया कि केवल शब्दों को हटाना पर्याप्त नहीं है; आपको सही शब्दों को हटाना होगा। यदि आप गलत शब्दों को काट देते हैं, तो रोबोट भ्रमित हो जाता है।

अंत में, यह पेपर सुझाव देता है कि पुराना विचार कि "बड़ा ही बेहतर है" गलत है। आपको रोबोट को पूरा जंगल खिलाने की आवश्यकता नहीं है। यदि आप भाषा जानते हैं, तो आप उसे सावधानीपूर्वक क्यूरेट की गई पत्तियों की एक मुट्ठी दे सकते हैं, और वह उतना ही अच्छा, या उससे भी बेहतर सीखेगा। मुख्य बात यह है कि "एक आकार सभी के लिए उपयुक्त नहीं है": जो जावा के लिए काम करता है वह पायथन को तोड़ देगा, और इसके विपरीत। AI को कुशल बनाने के लिए, हमें केवल बड़े फीडर नहीं, बल्कि सावधानीपूर्वक संपादक बनने की आवश्यकता है, जो हमारे दृष्टिकोण को कोड की विशिष्ट शैली के अनुरूप ढाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →