💬 NLP

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो "इंस्ट्रक्शन-ट्यूनिंग टैक्स" (Instruction-Tuning Tax) को उजागर करता है, जो एक महत्वपूर्ण ट्रेड-ऑफ है जहाँ लार्ज लैंग्वेज मॉडल्स को इंस्ट्रक्शन-ट्यून करने से प्राकृतिक भाषा के कमांड्स का पालन करने की उनकी क्षमता तो बढ़ जाती है, लेकिन साथ ही कोड इनफिलिंग कार्यों में उनके प्रदर्शन में गिरावट आती है, जिससे प्रभावी एआई कोडिंग असिस्टेंट विकसित करने के लिए एक संतुलित दृष्टिकोण की आवश्यकता होती है।

Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo2026-06-09
🤖 AI

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

यह शोध पत्र 2,700 से अधिक लीटकोड (LeetCode) समस्याओं पर नौ ओपन कोड एलएलएम (LLMs) का एक बड़े पैमाने पर, बहुभाषी, निष्पादन-आधारित (execution-grounded) मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान मॉडल मानव प्रदर्शन से काफी पीछे हैं और उनकी रैंकिंग एवं विफलता के स्वरूप विभिन्न भाषाओं और समस्या की कठिनाइयों के आधार पर काफी भिन्न होते हैं, जिससे एकल-मीट्रिक लीडरबोर्ड की सीमाओं पर प्रकाश पड़ता है।

Sayed Erfan Arefin2026-06-09
🤖 AI

Context Rot in AI-Assisted Software Development: Repurposing Documentation Consistency for AI Configuration Artifacts

यह शोध पत्र "कॉन्टेक्स्ट रॉट" (context rot) को एक महत्वपूर्ण समस्या के रूप में पहचानता है जहाँ सॉफ़्टवेयर विकसित होने के साथ AI कॉन्फ़िगरेशन फ़ाइलें पुरानी या अप्रासंगिक हो जाती हैं, यह तर्क देता है कि स्थापित दस्तावेज़ीकरण निरंतरता उपकरणों (documentation consistency tools) को इन विसंगतियों का पता लगाने के लिए तुरंत पुन: उपयोग किया जा सकता है और इस समस्या के समाधान के लिए एक अनुसंधान रोडमैप की रूपरेखा तैयार करता है।

Christoph Treude, Sebastian Baltes2026-06-09
💻 computer science

Understanding How Enterprises Adopt the Model Context Protocol for LLM-Driven Software Engineering

यह शोध पत्र आठ उद्यमों के 20 पेशेवरों के एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) को LLM-संचालित सॉफ्टवेयर इंजीनियरिंग में क्रॉस-सिस्टम सहयोग और टास्क डिकपलिंग को बढ़ाने के लिए सराहा जाता है, इसका व्यापक रूप से अपनाया जाना वर्तमान में इकोसिस्टम विखंडन, समन्वय चुनौतियों और स्टेट मैनेजमेंट एवं फॉल्ट डायग्नोसिस में अनसुलझे मुद्दों के कारण बाधित है।

Kehui Chen, Yicheng Sun, Jacky Keung, Zhenyu Mao, Xiaoxue Ma2026-06-09
💬 NLP

Code Is More Than Text: Uncertainty Estimation for Code Generation

यह शोध पत्र कोड जनरेशन के लिए एक नवीन तीन-अक्षीय अनिश्चितता अनुमान ढांचा प्रस्तावित करता है जो टोकन नाजुकता (token fragility), इरादा-कोड अंतराल (intent-code gaps) और निष्पादन क्षमता (executability) जैसे कोड-विशिष्ट गुणों का लाभ उठाता है ताकि अविश्वसनीय आउटपुट का पता लगाने में प्राकृतिक भाषा-व्युत्पन्न बेसलाइन से काफी बेहतर प्रदर्शन किया जा सके।

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu2026-06-09
💻 computer science

Modeling Components and Connections in Cyber-Physical Systems

यह शोध पत्र ROSLaunchVisual प्रस्तुत करता है, जो WebGME पर निर्मित एक मॉडल-एकीकृत दृश्य वातावरण है जो टेक्स्ट-आधारित कॉन्फ़िगरेशन को एक सहज ग्राफिकल इंटरफ़ेस से बदलकर साइबर-फिजिकल सिस्टम में विकास दक्षता और सिस्टम की समझ में सुधार करके ROS लॉन्च फ़ाइलों के डिज़ाइन, सत्यापन और प्रबंधन को बढ़ाता है।

Kate Sanborn, Tanuj Kenchannavar, Vakul Nath, Jonathan Sprinkle2026-06-09
💻 computer science

The Development of Reflective Practice on a Work-Based Software Engineering Program: A Longitudinal Study

यह अनुदैर्ध्य अध्ययन प्रदर्शित करता है कि चार वर्षीय कार्य-आधारित सॉफ्टवेयर इंजीनियरिंग कार्यक्रम के छात्र समय के साथ परिष्कृत चिंतनशील क्षमताओं को महत्वपूर्ण रूप से विकसित करते हैं, जो अभ्यास के पुनर्निर्माण और भविष्य के व्यावसायिक कार्यों को सूचित करने के लिए कार्यस्थल के अनुभव को शैक्षणिक शिक्षण के साथ प्रभावी ढंग से एकीकृत करते हैं।

Matthew Barr, Syed Waqar Nabi, Oana Andrei2026-06-08
💻 computer science

SWR-Bench: Assessing LLM Performance in Real-World Code Review Comment Generation

यह शोध पत्र SWR-Bench को प्रस्तुत करता है, जिसमें पूर्ण प्रोजेक्ट संदर्भ के साथ 1000 मैन्युअल रूप से सत्यापित पुल रिक्वेस्ट (Pull Requests) और एक वस्तुनिष्ठ LLM-आधारित मूल्यांकन पद्धति शामिल है, ताकि वर्तमान स्वचालित कोड समीक्षा प्रणालियों की सीमाओं को उजागर किया जा सके और यह प्रदर्शित किया जा सके कि एक मल्टी-रिव्यू एग्रीगेशन रणनीति उनके प्रदर्शन में महत्वपूर्ण सुधार कर सकती है।

Zhengran Zeng, Ruikai Shi, Keke Han, Yixin Li, Kaicheng Sun, Yidong Wang, Zhuohao Yu, Rui Xie, Wei Ye, Shikun Zhang2026-06-08
🤖 AI

Secure Code Generation at Scale with Reflexion

यह शोध पत्र पांच निर्देश-अनुकूलित (instruction-tuned) बड़े भाषा मॉडलों द्वारा जनरेट किए गए कोड की सुरक्षा को बढ़ाने में रिफ्लेक्सन प्रॉम्प्टिंग (reflexion prompting) की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया कि जबकि ज़ीरो-शॉट बेसलाइन 25-33% मामलों में असुरक्षित कोड उत्पन्न करते हैं, एक तीन-चरण वाली रिफ्लेक्सन प्रक्रिया सुरक्षा मेट्रिक्स में महत्वपूर्ण सुधार करती है जिसमें सबसे अधिक लाभ पहले दौर में होता है।

Arup Datta, Ahmed Aljohani, Hyunsook Do2026-06-08