🤖 AI

LTLGuard: Formalizing LTL Specifications with Compact Language Models and Lightweight Symbolic Reasoning

LTLGuard एक मॉड्यूलर फ्रेमवर्क है जो संसाधन-कुशल ओपन-वेट लैंग्वेज मॉडल्स (4B–14B पैरामीटर्स) को इटरेटिव कंसिस्टेंसी चेकिंग और रिफाइनमेंट के लिए लाइटवेट सिम्बॉलिक रीजनिंग के साथ कंस्ट्रेंड जनरेशन को जोड़कर, अनौपचारिक आवश्यकताओं से सही और संघर्ष-मुक्त लीनियर टेम्पोरल लॉजिक (LTL) स्पेसिफिकेशन जेनरेट करने में सक्षम बनाता है।

Medina Andresel, Cristinel Mateis, Dejan Nickovic, Spyridon Kounoupidis, Panagiotis Katsaros, Stavros Tripakis2026-03-09
💬 NLP

CodeScout: Contextual Problem Statement Enhancement for Software Agents

यह शोध पत्र CodeScout को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो कोडबेस के हल्के प्री-एक्सप्लोरेशन (pre-exploration) को करके सॉफ्टवेयर एजेंट के प्रदर्शन को बढ़ाता है ताकि कम स्पष्ट उपयोगकर्ता अनुरोधों को व्यापक, कार्रवाई योग्य समस्या विवरणों में बदला जा सके, जिसके परिणामस्वरूप SWEBench-Verified बेंचमार्क पर रेजोल्यूशन रेट में 20% का सुधार होता है।

Manan Suri, Xiangci Li, Mehdi Shojaie, Songyang Han, Chao-Chun Hsu, Shweta Garg, Aniket Anand Deshmukh, Varun Kumar2026-03-09
🤖 AI

XAI for Coding Agent Failures: Transforming Raw Execution Traces into Actionable Insights

यह शोध पत्र एक व्यवस्थित व्याख्यात्मक एआई (explainable AI) फ्रेमवर्क प्रस्तुत करता है जो कच्चे कोडिंग एजेंट निष्पादन ट्रेसेस (execution traces) को संरचित, दृश्य और प्राकृतिक भाषा की व्याख्याओं में परिवर्तित करता है, जो कच्चे ट्रेसेस या एड-हॉक मॉडल व्याख्याओं की तुलना में तकनीकी और गैर-तकनीकी दोनों उपयोगकर्ताओं के लिए मूल कारण की पहचान करने की गति को महत्वपूर्ण रूप से बढ़ाता है और सुधार की सटीकता में वृद्धि करता है।

Arun Joshi2026-03-09
💻 computer science

Story Point Estimation Using Large Language Models

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल बिना किसी प्रशिक्षण डेटा के या केवल कुछ उदाहरणों के साथ सॉफ्टवेयर स्टोरी पॉइंट्स की प्रभावी ढंग से भविष्यवाणी कर सकते हैं, जो पारंपरिक पर्यवेक्षित डीप लर्निंग मॉडलों से बेहतर प्रदर्शन करते हैं, और साथ ही यह भी पाता है कि तुलनात्मक निर्णय, हालांकि स्वाभाविक रूप से भविष्यवाणी करने में आसान नहीं होते हैं, अनुमान सटीकता को और बढ़ाने के लिए प्रभावी फ्यू-शॉट उदाहरणों के रूप में कार्य कर सकते हैं।

Pranam Prakash Shetty, Adarsh Balakrishnan, Mengqiao Xu, Xiaoyin Xi, Zhe Yu2026-03-09
💻 computer science

A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management

यह शोध पत्र LoCoEval को प्रस्तुत करता है, जो रिपॉजिटरी-उन्मुख विकास में दीर्घ-अवधि के संवादात्मक संदर्भ प्रबंधन का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो मौजूदा विधियों की महत्वपूर्ण सीमाओं को प्रकट करता है और एक एकीकृत मेमोरी दृष्टिकोण प्रस्तावित करता है जो वर्तमान बेसलाइनों से बेहतर प्रदर्शन करता है।

Yang Liu, Li Zhang, Fang Liu, Ping Lin, Xinyi Li2026-03-09
💻 computer science

Real-Time BDI Agents: a model and its implementation

यह शोध पत्र एक पुनर्गठित नियंत्रण लूप (control loop) का प्रस्ताव करके वास्तविक समय के वातावरण में मौजूदा BDI एजेंटों की सीमाओं को संबोधित करता है जो स्पष्ट रूप से अस्थायी बाधाओं और संसाधनों का प्रबंधन करता है, जिसे फिर एक संसाधन-संग्रहण वीडियो गेम के कार्यान्वयन के माध्यम से मान्य किया गया है।

Andrea Traldi, Francesco Bruschetti, Marco Robol, Davide Calvaresi, Marco Roveri, Paolo Giorgini2026-03-06
💻 computer science

Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models

यह शोध पत्र फॉल्ट लोकलाइजेशन (fault localization) में लार्ज लैंग्वेज मॉडल्स की मजबूती का आकलन करने के लिए एक बड़े पैमाने के, म्यूटेशन-आधारित मूल्यांकन ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि उनका तर्क अक्सर नाजुक होता है और गहरे अर्थपूर्ण बोध के बजाय सिंटैक्टिक संकेतों पर निर्भर करता है, जैसा कि अर्थ-संरक्षण करने वाले कोड परिवर्तनों के अधीन होने पर 78% विफलता दर से प्रमाणित होता है।

Sabaat Haroon, Ahmad Faraz Khan, Ahmad Humayun, Waris Gill, Abdul Haddi Amjad, Ali R. Butt, Mohammad Taha Khan, Muhammad (…)2026-03-06
💻 computer science

MioHint: LLM-assisted Mutation for Whitebox API Testing

MioHint एक नवीन व्हाइट-बॉक्स API टेस्टिंग दृष्टिकोण है जो पूरे कोडबेस का विश्लेषण करने में लार्ज लैंग्वेज मॉडल्स (LLMs) की सीमाओं को दूर करने के लिए स्टैटिक डेटा-डिपेंडेंसी एनालिसिस के साथ LLMs को सिनर्जाइज़ करता है ताकि प्रासंगिक कोड प्राप्त किया जा सके, जिससे मौजूदा बेसलाइन्स की तुलना में क्लाउड एप्लिकेशन के लिए लाइन कवरेज और म्यूटेशन सटीकता में महत्वपूर्ण सुधार होता है।

Jia Li, Jiacheng Shen, Yuxin Su, Michael R. Lyu2026-03-06
💻 computer science

Vision Language Model-based Testing of Industrial Autonomous Mobile Robots

यह शोध पत्र RVSG प्रस्तुत करता है, जो PAL Robotics के साथ विकसित एक विजन लैंग्वेज मॉडल-आधारित परीक्षण ढांचा है, जो औद्योगिक स्वायत्त मोबाइल रोबोटों की अप्रत्याशित व्यवहारों के विरुद्ध मजबूती (robustness) को सुरक्षित और प्रभावी ढंग से जांचने के लिए सिमुलेशन में विविध, आवश्यकता-उल्लंघन करने वाले मानव संपर्क परिदृश्यों को स्वचालित रूप से उत्पन्न करता है।

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali, Thomas Peyrucain2026-03-06
💻 computer science

Toward architecting self-coding information systems

यह विस्तारित सार 'सेल्फ-कोडिंग इंफॉर्मेशन सिस्टम्स' के नवीन शोध विषय का प्रस्ताव और परिभाषा प्रस्तुत करता है, जो कि एजेंटिक एआई (agentic AI) हैं जो फीचर डिलीवरी को गतिशील रूप से अनुकूलित करने और त्वरित करने के लिए रनटाइम पर अपने स्वयं के सोर्स कोड का स्वायत्त रूप से मूल्यांकन, निर्माण, परीक्षण और पुन: परिनियोजन करने में सक्षम हैं।

Rodrigo Falcão, Frank Elberzhager, Karthik Vaidhyanathan2026-03-06