🤖 machine learning

Investigating Test Overfitting on SWE-bench

यह शोध पत्र SWE-bench में टेस्ट ओवरफिटिंग की समस्या की जांच करने वाला पहला अनुभवजन्य अध्ययन प्रस्तुत करता है, जहाँ कोड समाधान ऑटो-जेनरेटेड या पुनरावृत्ति द्वारा परिष्कृत किए गए टेस्ट पास कर लेते हैं लेकिन अंतर्निहित समस्याओं को सही ढंग से हल करने में विफल रहते हैं।

Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel2026-04-06
🧬 biology

DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery

यह शोध पत्र DrugPlayGround प्रस्तुत करता है, जो एक नवीन ढांचा है जिसे बड़े भाषा मॉडलों (LLMs) और एम्बेडिंग्स को सटीक दवा-संबंधी विवरण उत्पन्न करने और भौतिक-रासायनिक विशेषताओं, सहक्रियात्मकता (synergism), अंतःक्रियाओं और शारीरिक प्रतिक्रियाओं के लिए विशेषज्ञ-तर्कसंगत स्पष्टीकरण प्रदान करने की उनकी क्षमता पर वस्तुनिष्ठ रूप से बेंचमार्क करने के लिए डिज़ाइन किया गया है, जिससे दवा की खोज (drug discovery) में वर्तमान मानकीकृत मूल्यांकन की कमी को दूर किया जा सके।

Tianyu Liu, Sihan Jiang, Fan Zhang, Kunyang Sun, Teresa Head-Gordon, Hongyu Zhao2026-04-06
🤖 AI

Improving MPI Error Detection and Repair with Large Language Models and Bug References

यह शोध पत्र एक ऐसी तकनीक का प्रस्ताव करता है जो फ्यू-शॉट लर्निंग (Few-Shot Learning), चेन-ऑफ-थॉट (Chain-of-Thought) रीजनिंग और बग संदर्भों के साथ रिट्रीवल ऑगमेंटेड जनरेशन (Retrieval Augmented Generation) को एकीकृत करके MPI त्रुटियों का पता लगाने और उन्हें सुधारने के लिए लार्ज लैंग्वेज मॉडल्स (Large Language Models) को उन्नत करता है, जिससे सीधे LLM अनुप्रयोग की तुलना में 44% से 77% तक की महत्वपूर्ण सटीकता वृद्धि प्राप्त होती है।

Scott Piersall, Yang Gao, Shenyang Liu, Liqiang Wang2026-04-06
🤖 AI

A Synthesis Method of Safe Rust Code Based on Pushdown Colored Petri Nets

यह शोध पत्र पुशडाउन कलर्ड पेट्री नेट्स (PCPN) का उपयोग करके ओनरशिप (ownership), बरोइंग (borrowing) और लाइफटाइम (lifetime) बाधाओं को मॉडल करने के माध्यम से सुरक्षित रस्ट (Rust) कोड को स्वचालित रूप से संश्लेषित करने के लिए एक नवीन विधि प्रस्तावित करता है, जो कि रस्ट के कंपाइल-टाइम चेक्स के साथ सुसंगत सिद्ध हुई है और एक ऐसे टूल द्वारा मान्य की गई है जो सार्वजनिक API हस्ताक्षरों (signatures) से सही कोड उत्पन्न करता है।

Kaiwen Zhang, Guanjun Liu2026-04-06
💬 NLP

IndustryCode: A Benchmark for Industry Code Generation

यह शोध पत्र IndustryCode को प्रस्तुत करता है, जो वास्तविक दुनिया की औद्योगिक जटिलता को दर्शाने में मौजूदा कोड जनरेशन मूल्यांकनों की सीमाओं को संबोधित करने के लिए कई औद्योगिक डोमेन और प्रोग्रामिंग भाषाओं में फैला हुआ पहला व्यापक बेंचमार्क है।

Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zh (…)2026-04-06
🤖 AI

AI-Assisted Unit Test Writing and Test-Driven Code Refactoring: A Case Study

यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि कैसे AI-सहायता प्राप्त वर्कफ़्लो सुरक्षित, बड़े पैमाने पर कोड रिफैक्टरिंग को सक्षम करने के लिए हज़ारों लाइनों के विश्वसनीय यूनिट टेस्ट तेज़ी से उत्पन्न कर सकते हैं, जिससे सॉफ्टवेयर इंजीनियरिंग को एक ऐसे अनुभवजन्य विज्ञान में बदला जा सके जो गति और रखरखाव क्षमता के बीच संतुलन बनाता है।

Ema Smolic, Mario Brcic, Luka Hobor, Mihael Kovac2026-04-06
💻 computer science

Foundation Models for Autonomous Driving System: An Initial Roadmap

यह शोध पत्र बुनियादी ढांचे, इन-व्हीकल एकीकरण और व्यावहारिक परिनियोजन को कवर करने वाले एक संरचित ढांचे के माध्यम से महत्वपूर्ण सुरक्षा और इंजीनियरिंग चुनौतियों को संबोधित करते हुए, धारणा (परसेप्शन) और निर्णय लेने की क्षमता में उनकी क्षमता का विश्लेषण करके स्वायत्त ड्राइविंग प्रणालियों में फाउंडेशन मॉडल्स को एकीकृत करने के लिए एक प्रारंभिक रोडमैप प्रस्तुत करता है।

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, L (…)2026-04-03
💻 computer science

NaturalEdit: Code Modification through Direct Interaction with Adaptive Natural Language Representation

यह शोध पत्र NaturalEdit प्रस्तुत करता है, जो एक संवादात्मक प्रणाली है जो संज्ञानात्मक भार को कम करने और डेवलपर के आत्मविश्वास, बोधगम्यता और नियंत्रण में सुधार करने के लिए द्विदिश सिंक्रनाइज़ेशन (bidirectional synchronization) के साथ अनुकूलन योग्य, बहुआयामी प्राकृतिक भाषा सारांशों का उपयोग करके कोड संशोधन को बेहतर बनाता है।

Ningzhi Tang, David Meininger, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Toby Jia-Jun Li2026-04-03
💻 computer science

Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools

यह शोध पत्र AndroidBuildBench का परिचय देता है, जो 1,019 एंड्रॉइड बिल्ड विफलताओं का एक बेंचमार्क है, और GradleFixer, जो एक LLM एजेंट है जो तर्क-निष्पादन अंतराल (reasoning-execution gap) को पाटने के लिए डोमेन-विशिष्ट उपकरणों का लाभ उठाता है, और सामान्य-उद्देश्य वाले शेल कमांड्स को विशिष्ट, API-जैसे एब्स्ट्रैक्शन से बदलकर 81.4% बिल्ड रिपेयर दर प्राप्त करता है।

Ha Min Son, Huan Ren, Xin Liu, Zhe Zhao2026-04-03
💻 computer science

HAFixAgent: History-Aware Program Repair Agent

HAFixAgent एक इतिहास-जागरूक (history-aware) स्वचालित प्रोग्राम रिपेयर एजेंट है जो मौजूदा अत्याधुनिक प्रणालियों की तुलना में मरम्मत प्रभावशीलता, शोर वाले दोष स्थानीयकरण (noisy fault localization) के विरुद्ध मजबूती और जटिल मल्टी-हंक बग्स के लिए दक्षता में उल्लेखनीय सुधार करने के लिए रिपॉजिटरी ब्लेम ह्यूरिस्टिक्स का लाभ उठाता है।

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan2026-04-03