🤖 AI

Minimal Oversight: Uncertainty-Aware Governance for Delegated AI Systems

यह शोध पत्र न्यूनतम पर्याप्त निरीक्षण (Minimum Sufficient Oversight - MSO) सिद्धांत का प्रस्ताव करता है, जो एक वेरिएशनल फ्रेमवर्क है जो प्रदर्शन संबंधी बाधाओं के तहत शासन के बोझ को कम करके एआई प्रणालियों में स्वायत्तता प्रत्यायोजन को अनुकूलित करता है, जिससे क्षमता और हस्तक्षेप के समय पर सैद्धांतिक सीमाओं को प्राप्त किया जाता है और साथ ही 'मास्किंग' को एक महत्वपूर्ण विकृति के रूप में पहचाना जाता है जो विश्वास अंशांकन (trust calibration) को कमजोर करती है।

Carlos R. B. Azevedo2026-06-16
🤖 AI

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

यह शोध पत्र "बेस सीक्वेंस एनालिसिस" (Base Sequence Analysis) प्रस्तुत करता है, जो एक जीनोमिक-प्रेरित ढांचा है जो उच्च-जोखिम वाले पैटर्न और सत्यापन संबंधी कमियों की पहचान करने के लिए LLM एजेंट व्यवहारों को प्रतीकात्मक अनुक्रमों (symbolic sequences) में एनकोड करता है, जिससे "गवर्नर" (Governor) का विकास होता है, जो एक रनटाइम गवर्नेंस सिस्टम है जो स्वायत्त एजेंटों में कार्य सफलता दर में उल्लेखनीय सुधार करता है और टोकन खपत को कम करता है।

Sidi Deng2026-06-16✓ Author reviewed
🤖 AI

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

यह शोध पत्र ARVRE को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो वैध समीकरण श्रृंखलाओं के निर्माण के लिए ऑफलाइन टेम्पोरल-डिफरेंस लर्निंग को एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन और एलएलएम (LLMs) के साथ जोड़ता है ताकि नवीन, जटिल और गणितीय रूप से सही भौतिकी शब्द समस्याएँ (Physics Word Problems) उत्पन्न की जा सकें।

Tirthankar Mittra2026-06-16
🤖 AI

AI-Driven Framework for Adaptive Water Network Management with Proof-of-Concept Implementation: Addressing Non-Revenue Water in Jordan

यह शोध पत्र एक प्रूफ-ऑफ-कॉन्सेप्ट एआई-संचालित ढांचे को प्रस्तुत और मान्य करता है जो जॉर्डन के अम्मान जिला नेटवर्क में गैर-राजस्व जल को कम करने के लिए अनुकूलनशील, वास्तविक समय की निगरानी और बर्स्ट डिटेक्शन को सक्षम करने हेतु ईपानेट (EPANET) हाइड्रोलिक मॉडलिंग, डिजिटल ट्विन तकनीक और ऑफलाइन लार्ज लैंग्वेज मॉडल्स को एकीकृत करता है।

Mohammed Fasha, Nahel Al-Maayta, Bilal Sowan, Mohammad Athamneh, Husam Barham2026-06-16
🤖 AI

DeepRoot: A KG-Coordinated Multi-Agent System for Therapeutic Reasoning over Historical Medical Texts

डीपरूट (DeepRoot) एक मल्टी-एजेंट एलएलएम (LLM) प्रणाली है जो ज्ञान ग्राफ निर्माण को तर्क के साथ एकीकृत करती है ताकि असंरचित ऐतिहासिक चिकित्सा ग्रंथों से प्रभावी रूप से सत्यापन योग्य ड्रग-डिस्कवरी लीड्स निकाले जा सकें, जो 'शेन नोंग बेन काओ जिंग' (Shen Nong Ben Cao Jing) में छिपे हुए चिकित्सीय संबंधों को पुनः प्राप्त करते हुए सटीकता में बेसलाइन मॉडल से काफी बेहतर प्रदर्शन करती है और मतिभ्रम (hallucinations) को कम करती है।

Zijian Carl Ma, Sean J. Wang, Sijbren Kramer, Li Erran Li2026-06-16
🤖 AI

Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDP

यह शोध पत्र "ऑर्केस्ट्रेटेड रियलिटी" (Orchestrated Reality) का प्रस्ताव करता है, जो एक LLM-संचालित ढांचा है जो गेम वर्ल्ड्स को एक सिंगलटन ऑर्केस्ट्रेशन एजेंट के माध्यम से एक कैनोनिकल JSON स्टेट को मैनेज करने वाले पैरामीट्राइज्ड-एक्शन POMDPs के रूप में औपचारिक रूप देता है, जिससे मुक्त-रूप नैरेटिव और कठोर, निरंतर विश्व सिमुलेशन के बीच के अंतर को पाटा जा सके।

Yuhang Huang, Chenmiao Li, Chaowei Fang2026-06-16
🤖 AI

The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs

यह शोध पत्र AEGIS को प्रस्तुत करता है, जो एक प्रदाता-पारदर्शी (provider-transparent) API राउटर है जो प्लेनटेक्स्ट LLM इंटरैक्शन को एक हार्डवेयर एनक्लेव के भीतर सीमित करने के लिए प्रमाणित विश्वसनीय निष्पादन वातावरण (attested TEEs) का लाभ उठाता है, जिससे मौजूदा प्रदाता APIs के साथ कम विलंबता और अनुकूलता बनाए रखते हुए दुर्भावनापूर्ण राउटरों को एजेंट टूल कॉल्स में हेरफेर करने, डिपेंडेंसी बदलने या रहस्यों को चुराने से रोका जा सके।

Sipeng Xie, Qianhong Wu, Hengrun Lu, Ziliang Sun, Qi Wu, Bo Qin, Qin Wang2026-06-16
💬 NLP

Misinformation Propagation in Benign Multi-Agent Systems

यह शोध पत्र इस बात की जांच करता है कि कैसे इरादतन भ्रामक सूचनाएं (intent-based misinformation) सौहार्दपूर्ण बहु-एजेंट प्रणालियों (benign multi-agent systems) के माध्यम से प्रसारित होती हैं, और यह पाता है कि हालांकि ऐसी भ्रामक सूचनाएं प्रदर्शन को कम करती हैं और एजेंटों की परस्पर क्रियाओं में बनी रहती हैं, बहु-एजेंट बहस आम तौर पर एकल-एजेंट प्रॉम्प्टिंग की तुलना में अधिक मजबूती प्रदान करती है, जिसके परिणाम समूह की संरचना, निर्णय प्रोटोकॉल और अंतर्निहित मॉडलों पर अत्यधिक निर्भर करते हैं।

Jonas Becker, Jan Philip Wahle, Terry Ruas, Bela Gipp2026-06-16
💻 computer science

Human-on-the-Bridge: Scalable Evaluation for AI Agents

यह शोध पत्र ह्यूमन-ऑन-द-ब्रिज (HOB) को प्रस्तुत करता है, जो एक स्केलेबल मूल्यांकन प्रतिमान (पैराडाइम) है जो एआई एजेंटों के लागत प्रभावी, मल्टी-टर्न एडवरसैरियल परीक्षण को सक्षम करने के लिए विशेषज्ञ निर्णय को पुन: प्रयोज्य बुद्धिमत्ता में एनकोड करता है, जिससे उन महत्वपूर्ण व्यवहारिक विफलताओं का पता चलता है जो अक्सर स्टैटिक बेंचमार्क और सिंगल-इवैल्यूएटर विधियों द्वारा छूट जाती हैं।

Fouad Bousetouane2026-06-16
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

यह शोध पत्र वर्कबेंच (WorkBench) बेंचमार्क का इसके प्रारंभिक मूल्यांकन के दो वर्ष बाद पुनरावलोकन करता है, जो यह प्रदर्शित करता है कि क्लॉड ओपस 4.8 (Claude Opus 4.8) जैसे फ्रंटियर एजेंटों ने काफी उच्च कार्य पूर्णता दर (89% बनाम 43%) और नाटकीय रूप से कम हानिकारक त्रुटियां (2.5% बनाम 26%) प्राप्त कर ली हैं, जबकि यह भी दिखाता है कि क्षमता और सुरक्षा एक साथ सुधरते हैं, ओपन-वेट मॉडलों ने उच्च-प्रदर्शन पहुंच का लोकतंत्रीकरण किया है, और कुछ बुनियादी त्रुट के प्रकार जो अपूरणीय क्षति की ओर ले जाते हैं, अभी भी बने हुए हैं।

Olly Styles2026-06-15