💬 NLP

RECAP: An End-to-End Platform for Capturing, Replaying, and Analyzing AI-Assisted Programming Interactions

यह शोध पत्र RECAP का परिचय देता है, जो एक ओपन-सोर्स प्लेटफॉर्म है जो डेवलपर-AI इंटरैक्शन पैटर्न के इंटरैक्टिव रिप्ले और उन्नत विश्लेषण को सक्षम करने के लिए सूक्ष्म-स्तरीय (fine-grained) कोड संपादन के साथ AI चैट सत्रों को निष्क्रिय रूप से कैप्चर और एकीकृत करता है, जैसा कि 41 छात्रों के शामिल एक परिनियोजन द्वारा सत्यापित किया गया है।

Keyu He, Qianou Ma, Valerie Chen, Wayne Chi, Tongshuang Wu2026-05-06
🤖 AI

The Productivity-Reliability Paradox: Specification-Driven Governance for AI-Augmented Software Development

यह शोध पत्र एआई-संवर्धित सॉफ्टवेयर विकास में देखे जाने वाले "उत्पादकता-विश्वसनीयता विरोधाभास" (Productivity-Reliability Paradox) को यह तर्क देकर सुलझाता है कि मॉडल क्षमता के बजाय विनिर्देश अनुशासन (specification discipline), निर्भरता के लिए महत्वपूर्ण कारक है, और यह लेनदेन लागत अर्थशास्त्र (Transaction Cost Economics) पर आधारित एक विनिर्देश शासन मॉडल (Specification Governance Model) प्रस्तावित करता है ताकि इस समझौते (trade-off) को व्यवस्थित रूप से प्रबंधित किया जा सके।

Sabry E. Farrag2026-05-06
🤖 AI

Using LLMs in Software Design: An Empirical Study of GitHub and A Practitioner Survey

यह शोध पत्र 291 GitHub संवादों के खनन विश्लेषण और 65 पेशेवरों के सर्वेक्षण को संयोजित करते हुए एक मिश्रित-पद्धतिगत अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह लक्षणित करता है कि डेवलपर्स सॉफ्टवेयर डिज़ाइन कार्यों के लिए LLMs का उपयोग कैसे करते हैं, जिससे नौ विशिष्ट अनुप्रयोग श्रेणियाँ, सात प्रमुख लाभ और छह महत्वपूर्ण सीमाएँ प्रकट होती हैं जो तकनीक की क्षमता और उसकी व्यावहारिक चुनौतियों के बीच वर्तमान तनाव को उजागर करती हैं।

Yifei Wang, Ruiyin Li, Peng Liang, Yangxiao Cai, Zengyang Li, Mojtaba Shahin, Arif Ali Khan, Qiong Feng2026-05-06
🤖 AI

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

यह शोध पत्र LiveFMBench पेश करता है, जो 630 C प्रोग्रामों का एक संदूषण-जागरूक (contamination-aware) बेंचमार्क है, जो LLM और एजेंट-आधारित औपचारिक विनिर्देश (formal specification) पीढ़ी का व्यवस्थित रूप से मूल्यांकन करता है, यह प्रकट करते हुए कि अनैतिक मॉडल व्यवहारों के कारण सरल मूल्यांकन प्रदर्शन को काफी अधिक बढ़ा-चढ़ाकर दिखाते हैं और जबकि एजेंटिक पाइपलाइन और रीजनिंग मोड सटीकता में सुधार करते हैं, वर्तमान दृष्टिकोण मानव-लिखित विनिर्देशों को प्रतिस्थापित करने से अभी भी बहुत दूर हैं।

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheu (…)2026-05-06
🤖 AI

Neuro-Symbolic Agents for Hallucination-Free Requirements Reuse

यह शोध पत्र एक न्यूरो-सिम्बोलिक मल्टी-एजेंट सिस्टम प्रस्तुत करता है जो OOMRAM फ्रेमवर्क के भीतर भ्रम-मुक्त (hallucination-free) और संरचनात्मक रूप से वैध आवश्यकताओं के पुन: उपयोग को सक्षम करने के लिए हीयुरिस्टिक्स (heuristics) के रूप में लार्ज लैंग्वेज मॉडल्स को एक नियतात्मक सिम्बोलिक वैलिडेटर के साथ जोड़ता है, जिससे 100% कवरेज और शून्य के करीब बाधा उल्लंघन (constraint violations) प्राप्त होता है।

Ahmed Ibrahim2026-05-06
🤖 AI

A Language for Describing Agentic LLM Contexts

यह शोध पत्र एजेंटिक कॉन्टेक्स्ट डिस्क्रिप्शन लैंग्वेज (ACDL) को प्रस्तुत करता है, जो एक मानकीकृत औपचारिक भाषा और विज़ुअलाइज़ेशन टूल है जिसे एजेंटिक LLM सिस्टम में इनपुट कॉन्टेक्स्ट की संरचना, गतिशीलता और विकास को सटीक रूप से वर्णित करने और संप्रेषित करने के लिए डिज़ाइन किया गया है, जो कॉन्टेक्स्ट इंजीनियरिंग के लिए एक एकीकृत मानक की वर्तमान कमी को संबोधित करता है।

Noga Peleg Pelc, Gal A. Kaminka, Yoav Goldberg2026-05-06
🤖 AI

Conventional Commit Classification using Large Language Models and Prompt Engineering

यह शोध पत्र प्रदर्शित करता है कि प्रशिक्षण-मुक्त लार्ज लैंग्वेज मॉडल्स, विशेष रूप से फ्यू-शॉट प्रॉम्प्टिंग का उपयोग करते हुए DeepSeek-R1-32B, कोड डिफ्स (code diffs) से पारंपरिक कमिट्स को प्रभावी ढंग से वर्गीकृत कर सकते हैं, जो पारंपरिक सुपरवाइज्ड मशीन लर्निंग दृष्टिकोणों के लिए एक व्यावहारिक विकल्प प्रदान करता है।

H. M. Sazzad Quadir, Sakib Al Hasan, Md. Nurul Ahad Tawhid2026-05-06✓ Author reviewed
💻 computer science

Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation

यह शोध पत्र यह प्रकट करता है कि LLM-आधारित कोड अनुवाद में रिपोर्ट की गई विफलताओं का एक महत्वपूर्ण हिस्सा वास्तव में मॉडल की त्रुटियों के बजाय दोषपूर्ण मूल्यांकन सेटअप के कारण होने वाले फॉल्स नेगेटिव (false negatives) हैं, जो कई भाषाओं और बेंचमार्क में अनुवाद की प्रगति का सटीक आकलन करने के लिए पारदर्शी, कॉन्फ़िगरेशन-जागरूक मानकों को अपनाने का आग्रह करता है।

Fazle Rabbi, Soumit Kanti Saha, Jinqiu Yang2026-05-06
💻 computer science

HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair

यह शोध पत्र HEJ-Robust को प्रस्तुत करता है, जो अर्थ-संरक्षण करने वाले कोड रूपांतरणों (semantics-preserving code transformations) का उपयोग करने वाला एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान LLM-आधारित स्वचालित प्रोग्राम रिपेयर मॉडल मामूली सिंटैक्टिक विविधताओं का सामना करने पर 50% से अधिक की महत्वपूर्ण प्रदर्शन गिरावट का शिकार होते हैं, जो मौजूदा दृष्टिकोणों में मजबूती (robustness) की गंभीर कमी को उजागर करता है।

Fazle Rabbi, Jinqiu Yang2026-05-06
🤖 AI

Causal Software Engineering: A Vision and Roadmap

यह शोध पत्र "कॉज़ल सॉफ्टवेयर इंजीनियरिंग" (Causal Software Engineering) को एक नए प्रतिमान के रूप में प्रस्तावित करता है जो सहसंबंधी एआई (correlational AI) से आगे बढ़कर उच्च-जोखिम वाले निर्णय लेने के लिए कारण संबंधी मॉडलों और तर्क को व्यवस्थित रूप से लागू करता है, जो सॉफ्टवेयर जीवनचक्र में महत्वपूर्ण "क्या-होता-यदि" (what-if) वाले प्रश्नों के उत्तर देने के लिए उपकरणों, कार्यप्रवाहों और बेंचमार्क का एक रोडमैप प्रदान करता है।

Roberto Pietrantuono, Luca Giamattei, Stefano Russo, Julien Siebert, Neil Walkinshaw2026-05-06