💻 computer science

Agentic Repository Mining: A Multi-Task Evaluation

यह शोध पत्र प्रदर्शित करता है कि बाश (bash) कमांड के माध्यम से सॉफ्टवेयर रिपॉजिटरीज़ को गतिशील रूप से एक्सप्लोर करने में सक्षम एलएलएम (LLM) एजेंट, पूर्व-अभियांत्रित संदर्भ दृष्टिकोणों की तुलना में प्रतिस्पर्धी वर्गीकरण सटीकता प्राप्त करते हैं, जबकि संदर्भ-विंडो (context-window) की सीमाओं के विरुद्ध बेहतर मजबूती और आर्टिफैक्ट के आकार से स्वतंत्र रूप से स्केलिंग की क्षमता भी प्रदान करते हैं।

Johannes Härtel2026-05-07
💻 computer science

SynConfRoute: Syntax-Aware Routing for Efficient Code Completion with Small CodeLLMs

यह शोध पत्र SynConfRoute का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त रूटिंग विधि है जो टोकन कॉन्फिडेंस (token confidence) को सिंटैक्स वैलिडेशन (syntax validation) के साथ जोड़कर कोड पूर्णता (code completion) अनुरोधों को छोटे स्थानीय मॉडलों और बड़े स्वयं-होस्टेड मॉडलों के बीच कुशलतापूर्वक निर्देशित करता है, जिससे बिना किसी कस्टम मॉडल प्रशिक्षण के सटीकता में उल्लेखनीय सुधार होता है और कम्प्यूटेशनल लागत कम होती है।

Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan2026-05-07
💻 computer science

Conflict Essences for Transformation Rules with Nested Application Conditions -- Long Version

यह शोध पत्र ग्राफ ट्रांसफॉर्मेशन सिस्टम में मनमाने नेस्टेड एप्लिकेशन कंडीशंस को सपोर्ट करने के लिए डिसेबलिंग एसेन्सेस (disabling essences) की अवधारणा का विस्तार करता है, जिसमें सिम्बोलिक कॉन्फ्लिक्ट एसेन्सेस (symbolic conflict essences) पेश किए गए हैं जो समानांतर निर्भरताओं को स्पष्ट करते हैं और एडहेसिव एचएलआर (adhesive HLR) श्रेणियों के भीतर प्रारंभिक संघर्षों से संबंधित हैं।

Alexander Lauer, Jens Kosiol, Leen Lambers, Gabriele Taentzer2026-05-07
🤖 AI

Towards Agentic Runtime Healing

यह शोध पत्र "Healer" को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो वास्तविक समय में अनुकूलित त्रुटि-निवारण कोड (error-handling code) को गतिशील रूप से उत्पन्न करने और निष्पादित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे अप्रत्याशित रनटाइम त्रुटियों से उबरने में उच्च सफलता दर प्राप्त होती है और यह एजेंटिक, स्व-उपचार (self-healing) सॉफ्टवेयर प्रणालियों की दिशा में एक महत्वपूर्ण कदम है।

Zhensu Sun, Haotian Zhu, Bowen Xu, Xiaoning Du, Li Li, David Lo2026-05-06
🤖 machine learning

ReCode: Reinforcing Code Generation with Reasoning-Process Rewards

यह शोध पत्र ReCode को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कंट्रास्टिव लर्निंग के माध्यम से एक रीजनिंग-प्रोसेस रिवॉर्ड मॉडल को प्रशिक्षित करके और रिवॉर्ड हैकिंग को कम करने के लिए इसे निष्पादन-आधारित गेटिंग (execution-based gating) के साथ एकीकृत करके कोड जनरेशन को बेहतर बनाता है, जिसके परिणामस्वरूप GPT-4-Turbo के तुलनीय महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।

Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu2026-05-06
🤖 AI

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level

यह शोधपत्र RepoReason प्रस्तुत करता है, जो निष्पादन-संचालित उत्परिवर्तन (execution-driven mutation) और गतिशील प्रोग्राम स्लाइसिंग (dynamic program slicing) का उपयोग करने वाला एक व्हाइट-बॉक्स बेंचमार्क है, जो रिपॉजिटरी-स्तरीय एजेंटिक कोड तर्क (repository-level agentic code reasoning) के निदान के लिए है, और यह प्रकट करता है कि एकीकरण की चौड़ाई (integration width) सीमांत मॉडलों (frontier models) के लिए प्राथमिक संज्ञानात्मक बाधा है।

Jia Li, Yuxin Su, Michael R. Lyu2026-05-06
🤖 AI

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

यह शोध पत्र "इमोटिकॉन सिमेंटिक कन्फ्यूजन" (emoticon semantic confusion) की पहचान और व्यवस्थित मूल्यांकन करता है, जो लार्ज लैंग्वेज मॉडल्स में एक व्यापक भेद्यता है जहाँ ASCII-आधारित इमोटिकॉन्स की गलत व्याख्या के कारण मौन विफलताएं और विनाशकारी क्रियाएं होती हैं, जिससे यह पता चलता है कि वर्तमान शमन रणनीतियां काफी हद तक अप्रभावी हैं।

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu2026-05-06
💻 computer science

RubberDuckBench: A Benchmark for AI Coding Assistants

यह शोध पत्र RubberDuckBench को प्रस्तुत करता है, जो AI कोडिंग सहायकों का मूल्यांकन करने के लिए वास्तविक दुनिया के GitHub पुल रिक्वेस्ट से व्युत्पन्न एक बहुभाषी बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी निरंतरता और शुद्धता के साथ संघर्ष करते हैं और बार-बार मतिभ्रम (hallucination) का शिकार होते हैं, जबकि लागत और प्रदर्शन के बीच कोई देखा गया संबंध नहीं है।

Ferida Mohammed, Fatma Ayad, Petros Maniatis, Satish Chandra, Elizabeth Dinella2026-05-06
🤖 AI

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

यह शोध पत्र MCP-Atlas प्रस्तुत करता है, जो 36 वास्तविक MCP सर्वरों और 220 टूल्स के माध्यम से 1,000 कार्यों वाला एक बड़े पैमाने का बेंचमार्क है, जिसे क्लेम्स-आधारित स्कोरिंग रूब्रिक का उपयोग करके वास्तविक, बहु-चरणीय वर्कफ़्लो में लार्ज लैंग्वेज मॉडल्स की टूल-उपयोग क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Chaithanya Bandi, Ben Hertzberg, Geobio Boo, Tejas Polakam, Jeff Da, Sami Hassaan, Manasi Sharma, Andrew Park, Ernesto H (…)2026-05-06
🤖 AI

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

यह शोध पत्र एक महत्वपूर्ण "मिराज" (Mirage) घटना को प्रकट करता है जिसमें मल्टीमॉडल मॉडल विजुअल सर्किट डायग्राम को दरकिनार कर केवल टेक्स्ट आइडेंटिफायर के आधार पर कोड उत्पन्न करते हैं, और वेरीग्राउंड (VeriGround) को पेश करता है, जो कि एक 4B-पैरामीटर वाला मॉडल है जिसे गुमनामी (anonymization) और प्रेफरेंस अलाइनमेंट के साथ प्रशिक्षित किया गया है ताकि सर्किट डायग्राम से वेरिलॉग (Verilog) का विश्वसनीय और वास्तव में ग्राउंडेड रूपांतरण प्राप्त किया जा सके।

Guang Yang, Xing Hu, Xiang Chen, Xin Xia2026-05-06