💻 computer science

TSCG: Deterministic Tool-Schema Compilation for Agentic LLM Deployments

TSCG एक नियत (deterministic), निर्भरता-मुक्त (dependency-free) टूल-स्कीमा कंपाइलर है जो अक्षम JSON स्कीमा को टोकन-कुशल संरचित टेक्स्ट में परिवर्तित करके उत्पादन परिवेशों (production environments) में छोटे और उन्नत LLMs के लिए टूल-उपयोग सटीकता में महत्वपूर्ण सुधार करता है, जिससे उस फॉर्मेट मिसमैच को हल किया जाता है जो वर्तमान में टूल-उपयोग की अधिकांश त्रुटियों का कारण बनता है।

Furkan Sakizli2026-05-07
💻 computer science

Semantic Reverse Engineering Legacy Software Applications with ChatGPT, Gemini AI, and Claude AI

यह शोध पत्र लीगेसी डेटाबेस सॉफ्टवेयर अनुप्रयोगों को सिमेंटिक रूप से रिवर्स इंजीनियर करने के लिए ChatGPT, Gemini और Claude AI का उपयोग करने पर निष्कर्ष प्रस्तुत करता है।

Christian Mancas, Diana Christina Mancas2026-05-07
💻 computer science

A Multi-Agent Consensus Protocol for Stable Software Remodularization

यह शोध पत्र 'एसिमेट्रिक मोनोटोनिक कॉनसेसन प्रोटोकॉल' (AMCP) नामक एक नवीन मल्टी-एजेंट कंसेंसस प्रोटोकॉल प्रस्तावित करता है जो संरचनात्मक सामंजस्य और विकासवादी स्थिरता को प्रभावी ढंग से संतुलित करने के लिए सॉफ्टवेयर रीमॉड्यूलराइजेशन को एक वितरित बातचीत की समस्या के रूप में पुनर्गठित करता है, जो उन स्थितियों में पारंपरिक अनुकूलन विधियों से बेहतर प्रदर्शन करता है जहाँ सख्त स्थिरता बाधाओं की आवश्यकता होती है।

Ahmed F. Ibrahim2026-05-07
💻 computer science

Exploring the Output of Software Testing Tools through a Visual Comparative Analysis

यह शोध पत्र चार प्रोग्रामिंग भाषाओं में 50 सॉफ़्टवेयर परीक्षण उपकरणों का एक दृश्य तुलनात्मक विश्लेषण प्रस्तुत करता है ताकि CLI और GUI आउटपुट दोनों में सामान्य इंटरफ़ेस तत्वों, विज़ुअलाइज़ेशन पैटर्न और स्वरूपण प्रवृत्तियों की पहचान की जा सके, जिसका उद्देश्य भविष्य के टूल विकास को मार्गदर्शन देना है।

Brandon Lit, Anthony Maocheia-Ricci, Thomas Driscoll2026-05-07
💻 computer science

EngThrive: Make It Fast and Easy to Do Great Work

यह शोध पत्र EngThrive को प्रस्तुत करता है, जो माइक्रोसॉफ्ट में विकसित एक बहुआयामी मापन और सुधार प्रणाली है जो वेलबीइंग (wellbeing) को प्राथमिकता देते हुए डेवलपर उत्पादकता को गति (Speed), सुगमता (Ease) और गुणवत्ता (Quality) के इर्द-गिर्द व्यवस्थित करती है, और मेट्रिक्स को वास्तविक परिणामों के साथ संरेखित करने के लिए टेलीमेट्री और सर्वेक्षणों के संयोजन का उपयोग करती है न कि केवल गतिविधि के।

Brian Houck, Tim Bozarth, David Liu, Dean Carignan2026-05-07
💻 computer science

Reproduction Test Generation for Java SWE Issues

यह शोध पत्र TDD-Bench-Java को पेश करके जावा के लिए रिप्रोडक्शन टेस्ट जनरेशन टूल्स की कमी को संबोधित करता है, जो ओपन-सोर्स रिपॉजिटरीज़ से 250 इंस्टेंस के साथ इस कार्य के लिए पहला बेंचमार्क है, और एक अनुकूलित समाधान e-Otter++ को प्रस्तुत करता है जो इस बेंचमार्क और एक प्रोप्रायटरी इंडस्ट्री डेटासेट दोनों पर उच्च प्रदर्शन प्रदर्शित करता है।

Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel2026-05-07
🤖 AI

When Context Hurts: The Crossover Effect of Knowledge Transfer on Multi-Agent Design Exploration

यह शोध पत्र इस धारणा को चुनौती देता है कि मल्टी-एजेंट सॉफ्टवेयर डिज़ाइन में अधिक संदर्भ (context) हमेशा फायदेमंद होता है, यह प्रदर्शित करते हुए कि एक क्रॉसओवर प्रभाव मौजूद है जहाँ ज्ञान का हस्तांतरण कार्य के आधारभूत प्रदर्शन (baseline performance) के आधार पर डिज़ाइन अन्वेषण को महत्वपूर्ण रूप से सुधार या खराब कर सकता है, जो यह सुझाव देता है कि एक सरल बिना-संदर्भ वाला परीक्षण यह अनुमान लगा सकता है कि आर्टिफैक्ट्स जोड़ने से मदद मिलेगी या नुकसान होगा।

Saranyan Vigraham2026-05-07
🤖 AI

Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

यह शोध पत्र तर्क देता है कि परिनियोजन-प्रासंगिक संरेखण (deployment-relevant alignment) को केवल मॉडल-स्तरीय मूल्यांकनों से निष्कर्षित नहीं किया जा सकता है, जो ऑडिट और स्ट्रेस टेस्ट के माध्यम से यह प्रदर्शित करता है कि वर्तमान बेंचमार्क में उपयोगकर्ता-केंद्रित सत्यापन और प्रक्रियात्मक नियंत्रण (process steerability) का अभाव है, जिससे अंततः उन सिस्टम-स्तरीय मूल्यांकन ढांचों की ओर बढ़ने की आवश्यकता उत्पन्न होती है जो स्पष्ट रूप से संवादात्मक संदर्भों और स्कैफोल्ड निर्भरताओं (scaffold dependencies) को ध्यान में रखते हैं।

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais2026-05-07
🤖 AI

Beyond Retrieval: A Multitask Benchmark and Model for Code Search

यह शोध पत्र \textsc{CoREB} प्रस्तुत करता है, जो एक कंटैमिनेशन-लिमिटेड (contamination-limited), मल्टीटास्क बेंचमार्क और एक फाइन-ट्यून्ड रीरैंकर है जिसे पूर्ण कोड सर्च पाइपलाइन का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि मौजूदा मॉडल वास्तविक लघु क्वेरीज़ के साथ संघर्ष करते हैं और केवल उनका विशिष्ट रीरैंकर ही टेक्स्ट-टू-कोड, कोड-टू-टेक्स्ट, और कोड-टू-कोड कार्यों में निरंतर सुधार प्राप्त करता है।

Siqiao Xue, Zihan Liao, Jin Qin, Ziyin Zhang, Yixiang Mu, Fan Zhou, Hang Yu2026-05-07
🤖 AI

AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair

यह शोधपत्र AuditRepairBench प्रस्तुत करता है, जो एक बड़े पैमाने का युग्मित-निष्पादन ट्रेस संग्रह (paired-execution trace corpus) और एक मॉड्यूलर स्क्रीनिंग आर्किटेक्चर है जिसे इवैल्यूएटर-चैनल कपलिंग के कारण एजेंट-रिपेयर लीडरबोर्ड में रैंकिंग अस्थिरता का पता लगाने और उसे कम करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि लक्षित, कम लागत वाले ब्लाइंडिंग पैच रैंडम या जेनेरिक रिट्रेनिंग दृष्टिकोणों की तुलना में रैंक विस्थापन को काफी कम कर देते हैं।

Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song2026-05-07