🤖 AI

Context: Proactive Goal-Directed Intelligence via Composable Sandboxed Programs, Declarative Wiring, and Structured Interaction

यह शोधपत्र 'कॉन्टेक्स्ट' (Context) को प्रस्तुत करता है, जो मगरशक आर्किटेक्चर (Magarshak Architecture) के भीतर एक सक्रिय इंटेलिजेंस लेयर है जो कैश दक्षता के लिए राइट-टाइम कॉन्टेक्स्ट असेंबली, नियत निष्पादन के लिए कंपोजेबल सैंडबॉक्स्ड प्रोग्राम्स और स्वायत्त इंटरैक्शन के लिए स्टेट मशीनों का लाभ उठाकर रिएक्टिव चैटबॉट्स को लक्ष्य-निर्देशित एजेंट्स से प्रतिस्थापित करता है, जो लागत में कमी, शुद्धता और प्रदर्शन श्रेष्ठता के औपचारिक प्रमाणों द्वारा समर्थित है।

Gregory Magarshak2026-05-26
🤖 AI

Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs

यह शोध पत्र प्रदर्शन मॉडल पेश करके और एक 'वॉटर-फिलिंग टोकन एलोकेशन पॉलिसी' सहित इष्टतम डिज़ाइन रणनीतियों को व्युत्पन्न करके, दिए गए बाधाओं के तहत विश्वसनीयता को अधिकतम करने के लिए, LLM-सक्षम एजेंटिक वर्कफ़्लो में लेटेंसी (latency), विश्वसनीयता और लागत के बीच मौलिक ट्रेडऑफ़ का विश्लेषण करता है।

Ya-Ting Yang, Quanyan Zhu2026-05-26
🤖 AI

BODHI: Precise OS Kernel Specification Inference

यह शोध पत्र BODHI को प्रस्तुत करता है, जो एक डोमेन नॉलेज प्रॉम्प्टिंग विधि है जो एक संरचित C-से-पायथन अनुवाद गाइड को शामिल करके ऑपरेटिंग सिस्टम कर्नेल के लिए सटीक औपचारिक विनिर्देशों (formal specifications) को स्वचालित रूप से उत्पन्न करने में लार्ज लैंग्वेज मॉडल्स की सटीकता में महत्वपूर्ण सुधार करती है, जिससे OSV-Bench बेंचमार्क पर 96.73% तक Pass@1 प्राप्त होता है।

Zhiming Chang, Ziyang Li2026-05-26
🤖 AI

Operationalizing Reconstructive Authority: Runtime Construction, Dependency Resolution, and Execution Gating in Autonomous Agent Systems

यह शोध पत्र एक तीन-अवस्था वाली निष्पादन मॉडल और एक रिकवरी लूप को पेश करके, स्वायत्त एजेंटों के लिए एक रनटाइम प्रवर्तन तंत्र के रूप में रिकंस्ट्रक्टिव अथॉरिटी (RAM) को संचालित करता है, जो वर्तमान अवलोकन क्षमता से अधिकार का निर्माण नहीं होने पर कार्यों को निलंबित करके सुरक्षा और सशर्त जीवंतता (liveness) की गारंटी देता है।

Marcelo Fernandez - TraslaIA2026-05-26
🤖 AI

Stop Comparing LLM Agents Without Disclosing the Harness

यह स्थिति पत्र (position paper) तर्क देता है कि दीर्घ-अवधि वाले कार्यों (long-horizon tasks) के लिए, एजेंट निष्पादन हारनेस (agent execution harness) अक्सर अंतर्निहित भाषा मॉडल की तुलना में प्रदर्शन का एक अधिक मजबूत निर्धारक होता है, जो समुदाय से बुनियादी ढांचे के सुधारों को मॉडल सुधारों के रूप में व्यवस्थित रूप से गलत तरीके से आरोपित करने से रोकने के लिए हारनेस-जागरूक मूल्यांकन प्रोटोकॉल अपनाने का आग्रह करता है।

Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy2026-05-26
🤖 AI

The Time is Here for Just-in-Time Systems: Challenges and Opportunities

यह शोध पत्र Jitskit को प्रस्तुत करता है, जो एक LLM-आधारित सिंथेसिस पाइपलाइन है जो विशिष्ट वर्कलोड और बाधाओं के लिए अनुकूलित अत्यधिक विशिष्ट, जस्ट-इन-टाइम की-वैल्यू स्टोर्स जनरेट करती है, जो सभी परीक्षण किए गए विनिर्देशों में अत्याधुनिक सामान्य-उद्देश्य वाले सिस्टमों से 4.6 गुना तक बेहतर प्रदर्शन करती है।

Shu Liu, Alexander Krentsel, Shubham Agarwal, Mert Cemri, Ziming Mao, Soujanya Ponnapalli, Alexandros G. Dimakis, Sylvia (…)2026-05-26
🤖 AI

Empirical Analysis and Detection of Hallucinations in LLM-Generated Bug Report Summaries

यह शोध पत्र एक सेक्शन-अवेयर डिटेक्शन फ्रेमवर्क और BugsRepo डेटासेट से व्युत्पन्न एक सिंथेटिक बेंचमार्क पेश करके LLM-जनित बग रिपोर्ट सारांशों में मतिभ्रम (hallucinations) के महत्वपूर्ण मुद्दे को संबोधित करता है, जो स्वचालित सॉफ्टवेयर रखरखाव उपकरणों की विश्वसनीयता में सुधार करने के लिए मतिभ्रम वाली सामग्री की पहचान करने, उसे खोजने और वर्गीकृत करने में उत्कृष्ट प्रदर्शन प्राप्त करता है।

Hinduja Nirujan, Shreyas Patil, Abdallah Ayoub, Ahmad Abdel Latif, Gouri Ginde2026-05-26
🤖 AI

Understanding Conversational Patterns in Multi-agent Programming: A Case Study on Fibonacci Game Development

यह शोध पत्र एक फाइबोनैकी गेम डेवलपमेंट टास्क के दौरान डिज़ाइनर और प्रोग्रामर LLM एजेंटों के बीच संवादात्मक पैटर्न का 12 मॉडल संयोजनों में व्यवस्थित रूप से विश्लेषण करता है, जो दक्षता, निरंतरता और प्रभावशीलता के प्रमुख आयामों की पहचान करते हुए यह प्रकट करता है कि कैसे विशिष्ट मॉडल जोड़े स्थिर अभिसरण (convergence) प्राप्त करते हैं जबकि अन्य भूमिका के गलत संरेखण या कार्य को हल करने में विफलता का सामना करते हैं।

Srijita Basu, Viktor Kjellberg, Simin Sun, Bengt Haraldsson, Md. Abu Ahammed Babu, Wilhelm Meding, Farnaz Fotrousi, Miro (…)2026-05-26
🤖 AI

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

यह शोध पत्र पैलेट (Palette) को प्रस्तुत करता है, जो एक मॉड्यूलर और कुशल ढांचा है जो सामान्य सुरक्षा से समझौता किए बिना या महंगी पुनरप्रशिक्षण की आवश्यकता के बिना, विशिष्ट व्यावसायिक डोमेन में बड़े भाषा मॉडलों (LLMs) के लिए सुरक्षा निषेधों (safety refusals) के ऑन-डिमांड, अधिकृत शिथिलन को सक्षम बनाता है।

Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng (…)2026-05-26
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

यह शोध पत्र 57 मशीन लर्निंग इवैल्यूएशन हार्नेस (evaluation harnesses) का एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो स्पेसिफिकेशन (Specification) चरण को परिचालन संबंधी चुनौतियों के प्राथमिक स्रोत के रूप में पहचानता है, 16,560 समस्याओं को उनके मूल कारण के आधार पर वर्गीकृत करता है जिससे यह पता चलता है कि अनिरुद्ध (unimplemented) विशेषताएं, दस्तावेज़ीकरण अंतराल और लुप्त इनपुट सत्यापन 60% से अधिक समस्याओं के लिए उत्तरदायी हैं, और मूल्यांकन इंजीनियरिंग (evaluation engineering) को एक विशिष्ट सॉफ्टवेयर इंजीनियरिंग अनुशासन के रूप में मानने के लिए एक आधार स्थापित करता है।

Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan2026-05-26