🤖 AI

Empirical Computation: Prompting versus Programming

यह विजन पेपर "एम्पिरिकल कंप्यूटेशन" (अनुभवजन्य गणना) को एक नए प्रतिमान के रूप में प्रस्तावित करता है जहाँ लार्ज लैंग्वेज मॉडल्स पारंपरिक प्रोग्रामिंग के बजाय प्रॉम्प्टिंग के माध्यम से कम्प्यूटेशनल समस्याओं को हल करते हैं, और यह तर्क देता है कि इसकी अनूठी क्षमताओं और सीमाओं के लिए सॉफ्टवेयर इंजीनियरिंग समुदाय को शुद्धता और मौलिक सीमाओं का विश्लेषण करने के लिए नए मौलिक सिद्धांतों और तकनीकों को विकसित करने की आवश्यकता है।

Eric Tang, Jing Liu, Marcel Böhme2026-07-08
🤖 AI

StepShield: When, Not Whether to Intervene on Rogue Agents

StepShield एक नया बेंचमार्क और अर्ली इंटरवेंशन रेट (EIR) मेट्रिक पेश करता है ताकि यह उजागर किया जा सके कि जबकि मौजूदा पैटर्न-आधारित मॉनिटर्स उच्च रिकॉल प्राप्त करते हैं, वे समयपूर्व अलर्ट के "फोरेंसिक्स ट्रैप" के कारण वास्तविक समय में हस्तक्षेप करने में विफल रहते हैं, जो यह सिद्ध करता है कि वर्तमान विधियाँ उच्च रिकॉल, कम फाल्स पॉजिटिव और रोगी एजेंटों के समय पर पता लगाने को एक साथ सुनिश्चित नहीं कर सकती हैं।

Gloria Felicia, Zitha Sasindran, Jinfeng He, Michael Eniolade, Hemant Kumar, Milan Hussain Angati2026-07-08
💻 computer science

AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates

यह शोध पत्र AIDev-pop डेटासेट का अनुभवजन्य विश्लेषण करता है ताकि यह प्रकट किया जा सके कि समवर्ती (concurrent) AI एजेंट सबमिशन अत्यधिक प्रचलित हैं, जिनमें मुख्य रूप से एक ही एजेंट शामिल होता है, और इनके परिणामस्वरूप इंट्रा-एजेंट जोड़ों की तुलना में क्रॉस-एजेंट जोड़ों के लिए मर्ज संघर्ष (merge conflict) की दर काफी अधिक होती है।

George Xu, Arjun Subramanian, Nithilan Karthik2026-07-08
💻 computer science

Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

यह शोध पत्र 5,264 नासा (NASA) वैज्ञानिक रिपॉजिटरीज़ के एक क्यूरेटेड संग्रह और रिपॉजिटरी एवं कोड स्निपेट रिट्रीवल (code snippet retrieval) के लिए दो नवीन बेंचमार्क पेश करके वैज्ञानिक सॉफ़्टवेयर की खोज की चुनौती को संबोधित करता है, जो विभिन्न डोमेन और प्रोग्रामिंग भाषाओं में प्रदर्शन के महत्वपूर्ण अंतर को प्रकट करते हैं।

Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale, Pushwitha Krishnappa, Muthukumaran Ramasubramanian, Nidhi Jha, Emily F (…)2026-07-08
💻 computer science

TypeGo: An OS Runtime for Embodied Agents

यह शोध पत्र TypeGo को प्रस्तुत करता है, जो एम्बोडीड एजेंटों (embodied agents) के लिए एक ऑपरेटिंग सिस्टम-शैली का रनटाइम है, जो विलंबता (latency) को काफी कम करने और वास्तविक समय के नियंत्रण को सक्षम करने के लिए सिंक्रोनस LLM अनुरोध/प्रतिक्रिया चक्रों को एसिंक्रोनस, मल्टी-टाइमस्केल प्लानिंग और समवर्ती कार्य प्रबंधन (concurrent task management) से बदल देता है।

Guojun Chen, Alex Schott, Lin Zhong2026-07-08
💻 computer science

Agents with Feelings? Personality and Emotion in Multi-Agent Software Teams

यह शोध पत्र प्रदर्शित करता है कि सॉफ्टवेयर इंजीनियरिंग के लिए मल्टी-एजेंट एलएलएम (LLM) सिस्टम में व्यक्तित्व और भावना प्रोफाइल्स को शामिल करना टीम के प्रदर्शन और सहयोग दक्षता पर महत्वपूर्ण प्रभाव डालता है, जिसमें मिश्रित-प्रोफाइल कॉन्फ़िगरेशन अक्सर साझा प्रोफाइल्स की तुलना में बेहतर प्रदर्शन करते हैं, जबकि डर और उच्च कर्तव्यनिष्ठा जैसे विशिष्ट गुण बिना किसी निरंतर लाभ के लागत बढ़ा सकते हैं।

Yunyan Ding, Thomas Zimmermann, Iftekhar Ahmed2026-07-08
🤖 AI

Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations

यह शोध पत्र प्रदर्शित करता है कि मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) में एक महत्वपूर्ण अप्रूवल-व्यू फिडेलिटी गैप (approval-view fidelity gap) मौजूद है जहाँ यूनिकोड TAG-ब्लॉक एनकोडिंग हमलावरों को टूल मेटाडेटा के भीतर दुर्भावनापूर्ण पेलोड को छिपाने की अनुमति देता है, जिससे वे मानव समीक्षा और क्लाइंट-साइड सैनिटाइज़र को बायपास करते हुए छिपे हुए कंटेंट को कई स्वतंत्र सर्वर कार्यान्वयनों के माध्यम से सीधे मॉडल के कॉन्टेक्स्ट तक पहुँचा सकते हैं।

Mohammadreza Rashidi2026-07-08
⚛️ high-energy experiments

Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition

यह शोध पत्र एक मल्टी-एजेंट फ्रेमवर्क पेश करता है जो उपयोगकर्ता के निर्देशों और कार्यान्वयन संबंधी धारणाओं में अस्पष्टताओं को स्पष्ट रूप से पहचानने और उन्हें हल करने के माध्यम से, टास्क डिकंपोजिशन (कार्य अपघटन) और क्वांटिटी-ग्राउंडेड सिमेंटिक डिफरेंसिंग (मात्रा-आधारित अर्थगत अंतर) का उपयोग करके LLMs द्वारा उत्पन्न वैज्ञानिक विश्लेषणों की पारदर्शिता, पुनरुत्पादकता और विश्वसनीयता को बढ़ाने के लिए है।

Ahmed Hammad, Mihoko Nojiri2026-07-08
💻 computer science

Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents

यह शोध पत्र VIC-RAGENT को प्रस्तुत करता है, जो एक LLM-आधारित मल्टी-एजेंट फ्रेमवर्क है जो मौजूदा विधियों की तुलना में भेद्यता-प्रेरित (vulnerability-inducing) कमिट्स के पता लगाने और व्याख्यात्मकता (explainability) में महत्वपूर्ण सुधार करने के लिए मल्टी-स्टेज रीजनिंग और विशिष्ट एजेंटों का उपयोग करता है।

Liyou Chen, Hailong Sun, Xiang Gao, Yue Pan2026-07-08
💻 computer science

SCOPE: Leveraging Subgoal Critiques for Code Generation

SCOPE एक नवीन कोड जनरेशन फ्रेमवर्क है जो लाइवकोडबेंच (LiveCodeBench) और बिगकोडबेंच (BigCodeBench) जैसे बेंचमार्क पर बेहतर तरीके से सिमेंटिक बाधाओं को संबोधित करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग के माध्यम से स्ट्रक्चर्ड फीडबैक (सबगोल्स, गैप एनालिसिस और रोबस्टनेस चेकलिस्ट) उत्पन्न करने हेतु एक प्रूवर-इनिशियलाइज्ड सबगोल क्रिटिक का लाभ उठाता है, जो रिफ्लेक्शन (Reflexion) जैसे मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Yueke Zhang, Yifan Zhang, Zihan Fang, Kevin Leach, Wei Zhang, Yu Huang2026-07-08