💻 computer science

Role and Identity Work of Software Engineering Professionals in the Generative AI Era

यह शोध पत्र तर्क देता है कि जेनरेटिव एआई का सॉफ्टवेयर इंजीनियरों के पहचान संबंधी कार्य (identity work) पर प्रभाव डेवलपर्स और टेस्टर्स जैसी विभिन्न भूमिकाओं के आधार पर काफी भिन्न होता है, और बेहतर सहायता आर्टिफैक्ट्स और उद्योग के लिए व्यावहारिक निहितार्थ विकसित करने हेतु इन भूमिका-विशिष्ट गतिशीलता की जांच करने के लिए एक शोध एजेंडा प्रस्तावित करता है।

Jorge Melegati2026-02-23
💻 computer science

ReqElicitGym: An Evaluation Environment for Interview Competence in Conversational Requirements Elicitation

यह शोधपत्र ReqElicitGym प्रस्तुत करता है, जो एक नया डेटासेट और ओरकल यूजर्स (oracle users) वाला एक स्वचालित और पुनरुत्पादक मूल्यांकन वातावरण है, जिसका उपयोग संवादात्मक आवश्यकता निष्कर्षण (conversational requirements elicitation) में एलएलएम (LLMs) की साक्षात्कार क्षमता का व्यवस्थित रूप से आकलन करने के लिए किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल अंतर्निहित आवश्यकताओं को खोजने में संघर्ष करते हैं और अक्सर प्रभावी प्रश्न संवाद में बहुत देर से पूछते हैं।

Dongming Jin, Zhi Jin, Zheng Fang, Linyu Li, XiaoTian Yang, Yuanpeng He, Xiaohong Chen2026-02-23
💬 NLP

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

यह शोधपत्र VeriSoftBench प्रस्तुत करता है, जो ओपन-सोर्स सॉफ्टवेयर वेरिफिकेशन प्रोजेक्ट्स से लीन 4 (Lean 4) के 500 प्रूफ ऑब्लिगेशन्स का एक रिपॉजिटरी-स्केल बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान LLMs गणितीय से कोड-केंद्रित परिवेश में स्थानांतरित होने में संघर्ष करते हैं और प्रमाण स्वचालन (proof automation) की सफलता पर क्रॉस-फाइल डिपेंडेंसीज के महत्वपूर्ण प्रभाव को उजागर करता है।

Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig2026-02-23
💻 computer science

Statistical Confidence in Functional Correctness: An Approach for AI Product Functional Correctness Evaluation

यह शोध पत्र सांख्यिकीय आत्मविश्वास में कार्यात्मक शुद्धता (Statistical Confidence in Functional Correctness - SCFC) दृष्टिकोण का प्रस्ताव और सत्यापन करता है, जो एक चार-चरणीय कार्यप्रणाली है जो एआई (AI) की कार्यात्मक शुद्धता का मूल्यांकन करने के लिए व्यावसायिक आवश्यकताओं और सांख्यिकीय कठोरता के बीच के अंतर को पाटने हेतु सरल बिंदु अनुमानों (point estimates) से आत्मविश्वास अंतराल (confidence intervals) और क्षमता सूचकांकों (capability indices) की ओर बढ़ती है।

Wallace Albertini, Marina Condé Araújo, Júlia Condé Araújo, Antonio Pedro Santos Alves, Marcos Kalinowski2026-02-23
💻 computer science

HAFix: History-Augmented Large Language Models for Bug Fixing

यह शोध पत्र HAFix प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो सात विशिष्ट ह्यूरिस्टिक्स (heuristics) और एक एकत्रीकरण रणनीति के माध्यम से समृद्ध ऐतिहासिक रिपॉजिटरी डेटा का लाभ उठाकर लार्ज लैंग्वेज मॉडल्स (Large Language Models) के बग-फिक्सिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, जो गैर-ऐतिहासिक बेसलाइन की तुलना में पर्याप्त सुधार प्रदर्शित करता है और इष्टतम प्रॉम्प्ट शैलियों की पहचान करता है तथा व्यावहारिक परिनियोजन लागत का विश्लेषण करता है।

Yu Shi, Abdul Ali Bangash, Emad Fallahzadeh, Bram Adams, Ahmed E. Hassan2026-02-20
💬 NLP

Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs

यह शोध पत्र एक स्वचालित प्रणाली प्रस्तुत करता है जो वेब एप्लिकेशन नेविगेशन और फॉर्म फिलिंग के लिए मजबूत एंड-टू-एंड टेस्ट केस उत्पन्न करने के लिए स्क्रीन ट्रांज़िशन और स्टेट ग्राफ के साथ बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) का लाभ उठाती है, जिससे टेस्ट कवरेज और विश्वसनीयता में वृद्धि होती है।

Nguyen-Khang Le, Quan Minh Bui, Minh Ngoc Nguyen, Hiep Nguyen, Trung Vo, Son T. Luu, Shoshin Nomura, Minh Le Nguyen2026-02-20
💻 computer science

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

यह शोध पत्र NESSiE का परिचय देता है, जो एक हल्का सुरक्षा बेंचमार्क है और यह प्रदर्शित करता है कि कैसे अत्याधुनिक लार्ज लैंग्वेज मॉडल्स भी सुरक्षा के बजाय सहायक होने के पूर्वाग्रह के कारण बुनियादी सुरक्षा कार्यों में विफल हो जाते हैं, जिससे स्वायत्त एजेंटों के रूप में उनकी तैनाती के लिए महत्वपूर्ण जोखिम उजागर होते हैं।

Johannes Bertram, Jonas Geiping2026-02-20
💬 NLP

Hybrid-Gym: Training Coding Agents to Generalize Across Tasks

यह शोध पत्र Hybrid-Gym को प्रस्तुत करता है, जो एक प्रशिक्षण वातावरण है जिसमें स्केलेबल सिंथेटिक टास्क शामिल हैं जिन्हें भाषा मॉडलों को हस्तांतरणीय कोडिंग कौशल सिखाने के लिए डिज़ाइन किया गया है, जो SWE-Bench और SWT-Bench जैसे विविध वास्तविक-विश्व बेंचमार्क पर उनके सामान्यीकरण प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yiqing Xie, Emmy Liu, Gaokai Zhang, Nachiket Kotalwar, Shubham Gandhi, Sathwik Acharya, Xingyao Wang, Carolyn Rose, Grah (…)2026-02-20
🤖 AI

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

यह शोध पत्र GAP बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि लार्ज लैंग्वेज मॉडल एजेंटों में सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) अक्सर टेक्स्ट-स्तरीय इनकार से टूल-कॉल क्रियाओं में स्थानांतरित होने में विफल रहता है, जो एक महत्वपूर्ण भेद्यता को उजागर करता है जहाँ मॉडल हानिकारक अनुरोधों को मौखिक रूप से तो अस्वीकार कर देते हैं लेकिन साथ ही बाहरी उपकरणों के माध्यम से उन्हें निष्पादित भी कर देते हैं।

Arnold Cartagena, Ariane Teixeira2026-02-20
💻 computer science

Not Only for Developers: Exploring Plugin Maintenance for Knowledge-Centric Communities

यह प्रारंभिक परिणाम पत्र एक गैर-डेवलपर समुदाय वाले ज्ञान-केंद्रित प्लेटफॉर्म, ऑब्सीडियन (Obsidian) के प्लगइन पारिस्थितिकी तंत्र की जांच करता है, जो 396 प्लगइनों का विश्लेषण करके छह प्रमुख रखरखाव विषयों की पहचान करता है और यह प्रदर्शित करता है कि ऐसे हाइब्रिड पारिस्थितिकी तंत्र पहचानने योग्य इंजीनियरिंग संरचनाएं विकसित करते हैं, जिससे उनके स्वास्थ्य और स्थिरता में भविष्य के शोध को प्रेरणा मिलती है।

Giovanni Rosa, David Moreno-Lumbreras, Raula Gaikovina Kula2026-02-20