💻 computer science

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

यह शोध पत्र SWE-Manager को प्रस्तुत करता है, जो एक 8B सुदृढीकरण लर्निंग (reinforcement learning) मॉडल है जो तकनीकी प्रबंधकों की नकल करते हुए सॉफ्टवेयर समस्याओं के लिए सबसे अच्छे उम्मीदवार प्रस्ताव को चुनता है और कोड निष्पादित किए बिना एक "गोल्डन" समाधान संश्लेषित करता है, जिससे SWE-Lancer Manager बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun2026-07-07
💻 computer science

The Reciprocal Impact of Science and Software: A Cross-Corpus Analysis of How Research Shapes Software and Software Enables Research

यह अध्ययन वैज्ञानिक साहित्य और सॉफ़्टवेयर रिपॉजिटरी को जोड़ने वाला एक बड़े पैमाने का क्रॉस-कॉर्पस ग्राफ़ निर्मित करता है ताकि यह प्रकट किया जा सके कि जबकि विज्ञान और सॉफ़्टवेयर प्रभाव के विशिष्ट, पूरक परतों के माध्यम से सह-विकसित होते हैं, वर्तमान मापन विधियाँ अभी भी विरल और पद्धतिगत विकल्पों के प्रति संवेदनशील बनी हुई हैं, जो उनके पारस्परिक प्रभाव के बारे में निर्णायक निष्कर्ष निकालने से रोकती हैं।

Audris Mockus2026-07-07
🤖 AI

AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation

AutoResearch एक निष्पादन-आधारित (execution-grounded) मल्टी-एजेंट फ्रेमवर्क है जो सैंडबॉक्स्ड कोड निष्पादन, पुनरावृत्ति सुधार (iterative repair), और कठोर उद्धरण एवं दावे के सत्यापन को एकीकृत करके जनरेट किए गए वैज्ञानिक आर्टिफैक्ट्स को फ़िल्टर करने और सुधारने के माध्यम से स्वचालित अनुसंधान वर्कफ़्लो की विश्वसनीयता को बढ़ाता है।

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Abdullah Aman Khan, Shaoning Zeng2026-07-07
💻 computer science

Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation

यह शोध पत्र चार प्रमुख टूल-कॉलिंग बेंचमार्क का एक व्यवस्थित वैधता ऑडिट प्रस्तुत करता है, जो महत्वपूर्ण मूल्यांकनकर्ता-मानव मिसअलाइनमेंट और पुनरुत्पादकता संबंधी मुद्दों को प्रकट करता है जो वर्तमान लीडरबोर्ड स्कोर को कमजोर करते हैं, और अधिक कठोर, ऑडिट करने योग्य और मानव-संरेखित मूल्यांकन मानकों को स्थापित करने के लिए नए टूल्स जैसे कि Tool-Veritas और Harness Lab के साथ विफलताओं के एक एकीकृत वर्गीकरण का प्रस्ताव करता है।

Vishvesh Bhat, Jay Vaghasiya, Muhammad Ahmed Mohsin, Asad Aali2026-07-07
💻 computer science

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

यह शोध पत्र GovMem को प्रस्तुत करता है, जो सहसंबद्ध ट्रैसेस (correlated traces) और निर्भरता आर्टिफैक्ट्स (dependency artifacts) का पता लगाकर एजेंट मेमोरी राइट्स को नियंत्रित करने के लिए एक रूढ़िवादी नैदानिक ढांचा है, जिससे गलत प्रोमोशनों को महत्वपूर्ण रूप से कम किया जा सके, और अंततः यह तर्क देता है कि व्यापक सत्यापन प्राप्त होने तक मेमोरी सिस्टम को कुशल स्वचालित लेखकों के बजाय जोखिम-नियंत्रित साक्ष्य-शासन तंत्र के रूप में माना जाना चाहिए।

Yijiashun Qi, Xiang Xu, Yuxuan Li2026-07-07
💻 computer science

Better Together, in the Right Order: Classical-then-LLM Optimization for SE

यह शोध पत्र SNAP2 को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो सॉफ्टवेयर इंजीनियरिंग कॉन्फ़िगरेशन कार्यों में स्टैंडअलोन लार्ज लैंग्वेज मॉडल्स और क्लासिकल-ऑप्टिमाइज़र-आधारित हाइब्रिड विधियों, दोनों से बेहतर प्रदर्शन करता है, क्योंकि यह पहले एक सस्ते क्लासिकल लर्नर का उपयोग करके एक LLM को सीड (seed) करता है, जिससे कम लागत और तेज़ निष्पादन के साथ श्रेष्ठ परिणाम प्राप्त होते हैं।

Srinath Srinivasan, Tim Menzies2026-07-07
🤖 machine learning

Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

यह शोध पत्र तर्क देता है कि एआई (AI) मॉडलों के लिए विक्षोभ-आधारित (perturbation-based) रचना-वैधता ऑडिट (construct-validity audits) नाजुक हैं और मौन कार्यान्वयन विफलताओं के प्रति संवेदनशील हैं, जो गैर-पुष्टिपरक साक्ष्य को रोकने के लिए एक छह-बिंदु ड्यू-डिलिजेंस गेट का प्रस्ताव करता है और साथ ही यह प्रदर्शित करता है कि सुरक्षा बेंचमार्क और ओपन-वेट मॉडलों का एक विशिष्ट केस स्टडी ऑडिट विफलता के पांच मोड के इस नए वर्गीकरण के तहत पुष्टि मानकों को पूरा करने में विफल रहता है।

Yanhang Li, Zhichao Fan, Zexin Zhuang2026-07-07
🤖 machine learning

The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

यह शोध पत्र चार ओपन-सोर्स एलएलएम (LLM) रिलीज़ लाइनों के एक अनुदैर्ध्य ऑडिट (longitudinal audit) के माध्यम से यह प्रदर्शित करता है कि विश्वसनीयता स्कोर (trustworthiness scores) क्रमिक चेकपॉइंट्स के दौरान महत्वपूर्ण रूप से विचलित होते हैं, और यह तर्क देता है कि ऐसे मेट्रिक्स को पुनर्मूल्यांकन के बिना आगे ले जाए जाने वाले स्थिर गुणों के बजाय, दिनांकित और चेकपॉइंट-विशिष्ट आर्टिफ़ैक्ट्स के रूप में माना जाना चाहिए।

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang2026-07-07
💻 computer science

Attributing Structured-Output Gains in Function Calling: Interface Alignment versus Procedural Transfer

यह शोध पत्र एक चार-स्तरीय एट्रिब्यूशन प्रोटोकॉल प्रस्तुत करता है जो यह प्रदर्शित करता है कि संरचित-आउटपुट फंक्शन कॉलिंग में कई स्पष्ट लाभ मुख्य रूप से वास्तविक प्रक्रियात्मक हस्तांतरण के बजाय इंटरफ़ेस संरेखण और प्रारूप अनुपालन द्वारा संचालित होते हैं, जो कौशल इंजेक्शन का सटीक मूल्यांकन करने के लिए कैनोनिकलकृत मेट्रिक्स और प्रारूप-मात्र बेसलाइन के लिए एक आह्वान प्रस्तुत करते हैं।

Wanyi Chen, Daoyuan Chen, Fang Kong2026-07-07
💻 computer science

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

यह शोध पत्र ChainSWE को प्रस्तुत करता है, जो एक साझा कोडबेस के भीतर अनुक्रमिक, आश्रित बग सुधारों (sequential, dependent bug fixes) पर कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि पारंपरिक पृथक बग-फिक्सिंग मूल्यांकनों की तुलना में चेन की लंबाई बढ़ने के साथ एजेंटों का प्रदर्शन काफी कम हो जाता है।

Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai (…)2026-07-07