🤖 AI

Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents

इंजीनियरिंग रीजनिंग एंड इंस्ट्रक्शन (ERI) बेंचमार्क एक विशाल, वर्गीकरण-संचालित डेटासेट है जो नौ इंजीनियरिंग क्षेत्रों और विभिन्न कठिनाई स्तरों में फैला हुआ है, जिसे फाउंडेशन मॉडल और एजेंटों को प्रशिक्षित करने और उनका मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें एक कठोर सत्यापन प्रोटोकॉल है जो फ्रंटियर और छोटे मॉडलों के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रदर्शित करता है और मतिभ्रम (hallucination) के जोखिम को 1.7% तक सीमित करता है।

MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, J (…)2026-03-04
🤖 AI

AgentAssay: Token-Efficient Regression Testing for Non-Deterministic AI Agent Workflows

AgentAssay एक नवीन, टोकन-कुशल ढांचा है जो गैर-नियत (non-deterministic) AI एजेंट वर्कफ़्लो के रिग्रेशन टेस्टिंग के लिए स्टोकेस्टिक वर्डिक्ट्स (stochastic verdicts), व्यवहारिक फिंगरप्रिंटिंग (behavioral fingerprinting) और एडेप्टिव बजट ऑप्टिमाइज़ेशन को संयोजित करता है ताकि व्यवहारिक रिग्रेशन का पता लगाने के लिए कठोर सांख्यिकीय गारंटी बनाए रखते हुए 100% तक लागत में कमी लाई जा सके।

Varun Pratap Bhardwaj2026-03-04
💻 computer science

It's Alive! What a Live Object Environment Changes in Software Engineering Practice

यह शोध पत्र तर्क देता है कि फ्यारो (Pharo) जैसे विस्तार योग्य, लाइव ऑब्जेक्ट वातावरण—जो कस्टम इंस्पेक्टर्स, माइक्रोकमिट्स और ऑब्जेक्ट-केंद्रित ब्रेकपॉइंट्स जैसे विशेष उपकरण प्रदान करते हैं और डेवलपर्स को सीधे चलते हुए ऑब्जेक्ट्स के साथ इंटरैक्ट करने की अनुमति देते हैं—तत्काल फीडबैक के माध्यम से सॉफ्टवेयर इंजीनियरिंग को बेहतर बनाते हैं, जिससे अन्य IDEs को डेवलपर वर्कफ़्लो में सुधार करने के लिए अपनी विशेषताओं पर पुनर्विचार करने के लिए प्रेरित किया जा सके।

Julián Grigera, Steven Costiou, Juan Cruz Gardey, Stéphane Ducasse2026-03-04
🤖 AI

REGAL: A Registry-Driven Architecture for Deterministic Grounding of Agentic AI in Enterprise Telemetry

यह शोध पत्र REGAL को प्रस्तुत करता है, जो एक रजिस्ट्री-संचालित आर्किटेक्चर है जो टेलीमेट्री कंप्यूटेशन को एक प्रथम-श्रेणी के प्रिमिटिव (first-class primitive) के रूप में मानकर और संदर्भ सीमाओं, सिमेंटिक संरेखण और मेट्रिक विकास की चुनौतियों को संबोधित करने के लिए डिक्लेरेटिव मेट्रिक परिभाषाओं से वर्ज़न-नियंत्रित टूल्स को संश्लेषित करके एंटरप्राइज टेलीमेट्री में एजेंटिक एआई (agentic AI) के नियत ग्राउंडिंग (deterministic grounding) को सुनिश्चित करता है।

Yuvraj Agrawal2026-03-04
💬 NLP

BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?

यह शोधपत्र BeyondSWE प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जो सिंगल-रेपो बग फिक्सिंग से परे जटिल, वास्तविक दुनिया के कार्यों को संभालने में वर्तमान कोड एजेंटों की क्षमता में महत्वपूर्ण सीमाओं को उजागर करता है, और डेवलपर वर्कफ़्लो का अनुकरण करने में सर्च ऑग्मेंटेशन (search augmentation) के असंगत लाभों की जांच करने के लिए SearchSWE का प्रस्ताव करता है।

Guoxin Chen, Fanzhe Meng, Jiale Zhao, Minghao Li, Daixuan Cheng, Huatong Song, Jie Chen, Yuzhi Lin, Hui Chen, Xin Zhao (…)2026-03-04
🤖 AI

CASCADE: LLM-Powered JavaScript Deobfuscator at Google

यह शोध पत्र CASCADE को पेश करता है, जो गूगल में तैनात एक नवीन हाइब्रिड डीऑबफस्केशन सिस्टम है जो क्रिटिकल प्रिल्यूड फंक्शन्स की पहचान करने के लिए जेमिनी एलएलएम (Gemini LLM) की क्षमता को एक जावास्क्रिप्ट इंटरमीडिएट रिप्रेजेंटेशन (JavaScript Intermediate Representation) के साथ जोड़ता है ताकि नियत कोड ट्रांसफॉर्मेशन (deterministic code transformation) किया जा सके, जिससे व्यापक हार्डकोडेड नियमों की आवश्यकता को समाप्त करते हुए सिमेंटिक तत्वों और प्रोग्राम व्यवहारों को प्रभावी ढंग से पुनर्प्राप्त किया जा सके।

Shan Jiang, Pranoy Kovuri, David Tao, Zhixun Tan2026-03-03
💻 computer science

Git Context Controller: Manage the Context of LLM-based Agents like Git

यह शोध पत्र Git-Context-Controller (GCC) को प्रस्तुत करता है, जो एक वर्ज़न-कंट्रोल-प्रेरित ढांचा है जो LLM एजेंट संदर्भ प्रबंधन को Git-समान ऑपरेशन्स का उपयोग करके एक निरंतर, नेविगेबल मेमोरी सिस्टम में परिवर्तित करता है, जिससे कुशल दीर्घकालिक तर्क (long-term reasoning), सत्र रिकवरी (session recovery) और मल्टी-ट्रैजेक्टरी समन्वय (multi-trajectory coordination) को सक्षम बनाकर सॉफ्टवेयर इंजीनियरिंग और अनुसंधान बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।

Junde Wu, Minhao Hu, Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Min Xu, Yueming Jin2026-03-03
🤖 AI

OBsmith: LLM-Powered JavaScript Obfuscator Testing

यह शोध पत्र OBsmith प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो सिमेंटिक संरक्षण (semantic preservation) के लिए जावास्क्रिप्ट ऑब्फस्केटर्स (JavaScript obfuscators) का व्यवस्थित रूप से परीक्षण करने के लिए लार्ज लैंग्वेज मॉडल्स और वास्तविक-दुनिया के प्रोग्राम एक्सट्रैक्शन का लाभ उठाता है, और सफलतापूर्वक 11 पहले से अज्ञात शुद्धता संबंधी बग्स (correctness bugs) को उजागर करता है जिन्हें मौजूदा फज़र्स (fuzzers) खोजने में विफल रहे थे।

Shan Jiang, Chenguang Zhu, Sarfraz Khurshid2026-03-03
🤖 AI

LSPRAG: LSP-Guided RAG for Language-Agnostic Real-Time Unit Test Generation

LSPRAG एक भाषा-अज्ञेय (language-agnostic) फ्रेमवर्क है जो बड़े भाषा मॉडल (Large Language Models) के लिए वास्तविक समय में, सटीक सिंबल संदर्भ प्रदान करने हेतु लैंग्वेज सर्वर प्रोटोकॉल का लाभ उठाता है, जो मौजूदा रिट्रीवल-ऑगमेंटेड अप्रोच की तुलना में Java, Go और Python में स्वचालित यूनिट टेस्ट जनरेशन कवरेज को महत्वपूर्ण रूप से सुधारता है।

Gwihwan Go, Quan Zhang, Chijin Zhou, Zhao Wei, Yu Jiang2026-03-03
💻 computer science

Integrative Analysis of Risk Management Methodologies in Data Science Projects

यह अध्ययन उभरते हुए नैतिक और सामाजिक-तकनीकी जोखिमों के संबंध में उनकी सीमाओं को पहचानने के लिए पारंपरिक और डेटा विज्ञान-विशिष्ट जोखिम प्रबंधन पद्धतियों की तुलना करते हुए एक एकीकृत साहित्य समीक्षा करता है, और अंततः तकनीकी दक्षता के साथ जिम्मेदार डेटा प्रथाओं को संतुलित करने वाले हाइब्रिड फ्रेमवर्क के विकास का प्रस्ताव देता है।

Sabrina Delmondes da Costa Feitosa2026-03-03