💻 computer science

Breaking the Dependency Chaos: A Constraint-Driven Python Dependency Resolution Strategy with Selective LLM Imputation

यह शोध पत्र SMT-LLM को प्रस्तुत करता है, जो एक हाइब्रिड डिपेंडेंसी रेज़ोल्यूशन सिस्टम है जो PLLM जैसे केवल LLM आधारित दृष्टिकोणों की तुलना में काफी उच्च सफलता दर और तेज़ रेज़ोल्यूशन समय प्राप्त करने के लिए डिटर्मिनिस्टिक AST विश्लेषण, PyPI क्वेरीज़ और चयनात्मक LLM इम्प्यूटेशन को एक Z3 SMT सॉल्वर के साथ जोड़ता है।

Kowshik Chowdhury, Dipayan Banik, Shazibul Islam Shamim2026-05-13
💻 computer science

An Extensive Replication Study of the ABLoTS Approach for Bug Localization

ABLoTS बग लोकलाइजेशन दृष्टिकोण का यह प्रतिकृति अध्ययन विस्तारित डेटासेट पर इसके मुख्य TraceScore घटक की प्रभावशीलता की पुष्टि करता है, लेकिन यह भी प्रकट करता है कि गलत तरीके से चुने गए कट-ऑफ दिनांक के कारण डेटा लीकेज की वजह से मूल शोध पत्र में रिपोर्ट किया गया प्रदर्शन काफी बढ़ा-चढ़ाकर दिखाया गया था।

Feifei Niu, Enshuo Zhang, Christoph Mayr-Dorn, Wesley Klewerton Guez Assunção, Liguo Huang, Jidong Ge, Bin Luo, Alexande (…)2026-05-13
🤖 AI

It's Not the Size: Harness Design Determines Operational Stability in Small Language Models

यह शोध पत्र प्रदर्शित करता है कि छोटे भाषा मॉडलों (2-3B पैरामीटर्स) के लिए, एक संरचित 4-चरणों वाला हार्नेस पाइपलाइन, रॉ प्रॉम्प्टिंग या न्यूनतम रैपर्स की तुलना में परिचालन स्थिरता और कार्य सफलता में काफी बेहतर प्रदर्शन करता है, जबकि यह भी प्रकट करता है कि अपर्याप्त स्कैफोल्डिंग कुछ मॉडलों में संरचनात्मक प्रारूप पतन (structural format collapse) का कारण बन सकती है।

Yong-eun Cho2026-05-13✓ Author reviewed
💻 computer science

ReproBreak: A Dataset of Reproducible Web Locator Breaks

यह शोध पत्र ReproBreak को प्रस्तुत करता है, जो 359 ओपन-सोर्स रिपॉजिटरीज़ में पहचाने गए 449 पुनरुत्पादनीय (reproducible) वेब लोकेटर ब्रेक्स वाला एक नवीन डेटासेट है, जिसे Cypress और Playwright जैसे स्वचालित GUI टेस्टिंग फ्रेमवर्क्स में टेस्ट फ्रैजिलिटी (test fragility) और रिपेयर पर अनुसंधान का समर्थन करने के लिए डिज़ाइन किया गया है।

Thiago Santos de Moura, Leon Adamietz, Samra Mehboob, Yannic Noller2026-05-13
🤖 AI

Uncertainty Quantification for LLM-based Code Generation

यह शोध पत्र RisCoSet को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो LLM-आधारित कोड जनरेशन के लिए जोखिम-नियंत्रित भविष्यवाणी सेट (risk-controlling prediction sets) बनाने के लिए मल्टीपल हाइपोथीसिस टेस्टिंग का लाभ उठाता है, जो कई वैध आउटपुट को समायोजित करके और उच्च सटीकता के विश्वास को बनाए रखते हुए अनावश्यक कोड हटाने को काफी कम करके मौजूदा विधियों की सीमाओं को प्रभावी ढंग से दूर करता है।

Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma2026-05-13
💻 computer science

Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues

यह शोध पत्र वास्तविक दुनिया के GitHub इश्यूज़ को हल करने वाले अत्याधुनिक LLMs में विफलता के तरीकों (failure modes) का एक व्यापक वर्गीकरण प्रस्तुत करता है, जो 243 विफलताओं के मैनुअल विश्लेषण के माध्यम से यह प्रकट करता है कि रणनीति निर्माण (strategy formulation) सबसे अधिक त्रुटि-प्रवण चरण है जबकि दोष स्थानीयकरण (fault localization) आश्चर्यजनक रूप से सुदृढ़ है, साथ ही मूल्यांकन हारनेस (evaluation harness) की सीमाओं की पहचान करता है और शमन रणनीतियों (mitigation strategies) का प्रस्ताव देता है।

Yanjie Jiang, Yian Huang, Guancheng Wang, Junjie Chen, Hui Liu, Lionel Briand2026-05-13
🤖 AI

Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt Engineering Quality Assurance

यह शोध पत्र AEGIS मल्टी-एजेंट सिस्टम पर लागू एक पुनरावृत्ति, एजेंट-संचालित ऑडिटिंग प्रक्रिया का एक केस स्टडी प्रस्तुत करता है, जिसने 51 प्रॉम्प्ट-स्पेसिफिकेशन दोषों की पहचान करने, एक नया दोष वर्गीकरण (टैक्सोनॉमी) स्थापित करने और एक उत्पादन वातावरण में गैर-एकदिष्ट अभिसरण (नॉन-मोनोटोनिक कन्वर्जेंस) को प्रदर्शित करने के लिए LLM-आधारित निरीक्षणों के नौ क्रमिक दौरों का उपयोग किया।

Elias Calboreanu2026-05-13
⚡ electrical engineering

Basilisk and Docker for Reproducible GN&C Simulation: A Workflow Reference

यह शोध पत्र बेसिलिस्क (Basilisk) एस्ट्रोडायनामिक्स फ्रेमवर्क के लिए एक डॉकर-आधारित कंटेनराइजेशन वर्कफ़्लो प्रस्तुत करता है जो विषम प्रणालियों (heterogeneous systems) में पुनरुत्पादनीय और पोर्टेबल GN&C सिमुलेशन वातावरण सुनिश्चित करता है, जिसे ऑर्बिटल डायनेमिक्स से लेकर मोंटे कार्लो एटीट्यूड कंट्रोल विश्लेषण तक बढ़ते हुए जटिल परिदृश्यों के माध्यम से प्रदर्शित किया गया है।

Anubhav Gupta2026-05-13
🤖 AI

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स, विशेष रूप से डीपसीक-आर1 (DeepSeek-R1) जैसे तर्क-अनुकूलित मॉडल्स, सुरक्षा कोड समीक्षा में अत्याधुनिक स्टैटिक एनालिसिस टूल्स की तुलना में काफी बेहतर प्रदर्शन करते हैं, जबकि यह भी पहचानते हैं कि प्रॉम्प्ट इंजीनियरिंग रणनीतियाँ, कोड जटिलता और फ़ाइल का आकार उनकी पहचान सटीकता और प्रतिक्रिया गुणवत्ता को प्रभावित करने वाले महत्वपूर्ण कारक हैं।

Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai2026-05-12
💻 computer science

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation

यह शोध पत्र इस बात की जांच करता है कि जब प्रॉम्प्ट्स में गणितीय रूप से समान लेकिन सिंटैक्टिक रूप से भिन्न सूत्र होते हैं तो LLM-आधारित कोड जनरेशन में सिंटैक्टिक मजबूती (syntactic robustness) का अभाव क्यों होता है, यह प्रदर्शित करता है कि कैसे हमला रणनीतियाँ (attack strategies) इस विफलता को बढ़ाती हैं, और एक फॉर्मूला रिडक्शन प्री-प्रोसेसिंग तकनीक प्रस्तावित करता है जो मजबूती को 54.05% से बढ़ाकर 74.42% कर देता है।

Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan2026-05-12