💻 computer science

Test vs Mutant: Adversarial LLM Agents for Robust Unit Test Generation

यह शोध पत्र AdverTest का प्रस्ताव करता है, जो एक एडवरसेरियल फ्रेमवर्क है जिसमें दो परस्पर क्रिया करने वाले LLM एजेंट—एक टेस्ट जनरेटर और एक म्यूटेंट जनरेटर—शामिल हैं, जो स्वचालित यूनिट टेस्ट जनरेशन में कोड कवरेज और बग डिटेक्शन क्षमताओं दोनों को सुधारने के लिए सह-विकसित (co-evolve) होते हैं।

Pengyu Chang, Yixiong Fang, Silin Chen, Yuling Shi, Beijun Shen, Xiaodong Gu2026-02-11
🤖 AI

RuleFlow : Generating Reusable Program Optimizations with LLMs

RuleFlow एक हाइब्रिड ऑप्टिमाइज़ेशन फ्रेमवर्क है जो प्रोग्राम-विशिष्ट अनुकूलनों (optimizations) को खोजने के लिए LLMs का उपयोग करता है, उन्हें सामान्यीकृत रीराइट नियमों (rewrite rules) में परिवर्तित करता है, और Pandas बेंचमार्क पर अत्याधुनिक स्पीडअप प्राप्त करने के लिए उन्हें एक कंपाइलर में एकीकृत करता है।

Avaljot Singh, Dushyant Bharadwaj, Stefanos Baziotis, Kaushik Varadharajan, Charith Mendis2026-02-11
💻 computer science

Towards an OSF-based Registered Report Template for Software Engineering Controlled Experiments

यह शोध पत्र सॉफ्टवेयर इंजीनियरिंग नियंत्रित प्रयोगों में कठोरता और पुनरुत्पादकता में सुधार के लिए ओपन साइंस फ्रेमवर्क (OSF)-आधारित रजिस्टर्ड रिपोर्ट्स के उपयोग की जांच करता है, जिसमें यह पाया गया है कि हालांकि वे आशाजनक हैं, वर्तमान टेम्पलेट अभी भी स्थापित दस्तावेज़ीकरण दिशानिर्देशों को पूरी तरह से संतुष्ट नहीं करते हैं।

Ana B. M. Bett, Thais S. Nepomuceno, Edson OliveiraJr, Maria Teresa Baldassarre, Valdemar V. Graciano Neto, Marcos Kalin (…)2026-02-11
💬 NLP

BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation

यह शोध पत्र **BiasScope** का प्रस्ताव करता है, जो LLM-as-a-judge मूल्यांकनों में अज्ञात पूर्वाग्रहों को सक्रिय रूप से खोजने के लिए डिज़ाइन किया गया एक स्वचालित LLM-संचालित फ्रेमवर्क है, और **JudgeBench-Pro** का परिचय देता है, जो एक अधिक चुनौतीपूर्ण बेंचमार्क है जो सबसे शक्तिशाली वर्तमान मूल्यांकनकर्ताओं में भी महत्वपूर्ण विश्वसनीयता अंतराल को प्रकट करता है।

Peng Lai, Zhihao Ou, Yong Wang, Longyue Wang, Jian Yang, Yun Chen, Guanhua Chen2026-02-11
💻 computer science

SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?

यह शोध पत्र **SWE-Bench Mobile** को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे जटिल, उद्योग-स्तर के iOS विकास कार्यों को संभालने के लिए LLM एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक (state-of-the-art) एजेंट अभी भी वास्तविक दुनिया के मोबाइल सॉफ्टवेयर इंजीनियरिंग के साथ काफी संघर्ष करते हैं।

Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan (…)2026-02-11
💻 computer science

JMigBench: A Benchmark for Evaluating LLMs on Source Code Migration (Java 8 to Java 11)

यह शोध पत्र JMigBench को प्रस्तुत करता है, जो जावा 8 कोड को जावा 11 में माइग्रेट करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि Mistral Codestral जैसे मॉडल्स सरल API प्रतिस्थापनों (substitutions) को संभाल सकते हैं, वे अभी भी जटिल माइग्रेशन में संघर्ष करते हैं और अभी तक मानव डेवलपर्स का स्थान नहीं ले सकते।

Nishil Amin, Zhiwei Fei, Xiang Li, Justyna Petke, He Ye2026-02-11
💻 computer science

Environment-in-the-Loop: Rethinking Code Migration with LLM-based Agents

यह शोध पत्र तर्क देता है कि सफल स्वचालित कोड माइग्रेशन के लिए एक समग्र "एनवायरनमेंट-इन-द-लूप" दृष्टिकोण की आवश्यकता होती है जो केवल स्टैटिक एनालिसिस पर निर्भर रहने की सीमाओं को दूर करने के लिए कोड अपडेट के साथ स्वचालित वातावरण इंटरैक्शन को एकीकृत करता है।

Xiang Li, Zhiwei Fei, Ying Ma, Jerry Zhang, Sarro Federica, He Ye2026-02-11
💻 computer science

An Autonomous RL Agent Methodology for Dynamic Web UI Testing in a BDD Framework

यह शोध पत्र एक BDD ढांचे के भीतर एकीकृत एक स्वायत्त सुदृढीकरण लर्निंग (reinforcement learning) एजेंट का प्रस्ताव करता है ताकि वेब UI परीक्षण परिदृश्यों को गतिशील रूप से उत्पन्न और परिष्कृत किया जा सके, जिससे मैन्युअल प्रयास को कम करते हुए दोष पहचान और परीक्षण कवरेज में सुधार किया जा सके।

Ali Hassaan Mughal2026-02-10
💻 computer science

Hierarchical Knowledge Injection for Improving LLM-based Program Repair

यह शोध पत्र एक लेयर्ड नॉलेज इंजेक्शन फ्रेमवर्क प्रस्तावित करता है जो स्वचालित प्रोग्राम रिपेयर (automated program repair) को बेहतर बनाने के लिए एलएलएम (LLMs) को बग, रिपॉजिटरी और प्रोजेक्ट-स्तरीय संदर्भ के साथ क्रमिक रूप से संवर्धित करता है, जिससे विभिन्न प्रकार के बग्स में फिक्स दरों में महत्वपूर्ण वृद्धि प्राप्त होती है।

Ramtin Ehsani, Esteban Parra, Sonia Haiduc, Preetha Chatterjee2026-02-10
💻 computer science

On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub

Claude Code एजेंट द्वारा 157 ओपन-सोर्स प्रोजेक्ट्स में जेनरेट किए गए 567 GitHub पुल रिक्वेस्ट्स का यह अनुभवजन्य अध्ययन यह प्रकट करता है कि हालांकि 83.8% एजेंट-सहायता प्राप्त योगदान स्वीकार किए जाते हैं—अक्सर बिना किसी संशोधन के—फिर भी उन्हें बग फिक्स, दस्तावेज़ीकरण और प्रोजेक्ट मानकों के पालन के लिए अक्सर मानवीय निरीक्षण की आवश्यकता होती है।

Miku Watanabe, Hao Li, Yutaro Kashiwa, Brittany Reid, Hajimu Iida, Ahmed E. Hassan2026-02-10