🤖 AI

MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation

यह शोध पत्र MCP-Persona को प्रस्तुत करता है, जो विविध सामाजिक और उद्यम उपकरणों के साथ बातचीत का अनुकरण करके वास्तविक दुनिया के व्यक्तिगत अनुप्रयोगों पर लार्ज लैंग्वेज मॉडल एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो वर्तमान अत्याधुनिक प्रणालियों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Wenhao Wang, Peizhi Niu, Gongyi Zou, Xiyuan Yang, Jingxing Wang, Haoting Shi, Yaxin Du, Jingyi Chai, Xianghe Pang, Shuo (…)2026-06-02
💬 NLP

Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools

यह शोध पत्र "घोस्ट टूल कॉल्स" (ghost tool calls) को एक गोपनीयता भेद्यता के रूप में पहचानता है जहाँ अनुमानित टूल इनवोकेशन्स (speculative tool invocations), किसी एजेंट द्वारा किसी शाखा (branch) को प्रतिबद्ध करने से पहले बाहरी पर्यवेक्षकों को उपयोगकर्ता के इरादे को लीक कर देते हैं, और "स्पेक्टिव टूल प्राइवेसी कॉन्ट्रैक्ट्स" (Speculative Tool Privacy Contracts) को एक रनटाइम एब्स्ट्रैक्शन के रूप में प्रस्तावित करता है जो डिस्पैच से पूर्व तर्कों (arguments) और गंतव्यों (destinations) को बदलने या दबाने के लिए इश्यू-टाइम नीतियों को लागू करके इस जोखिम को कम करता है।

Bardia Mohammadi, Lars Klein, Akhil Arora, Laurent Bindschaedler2026-06-02
🤖 AI

Iteris: Agentic Research Loops for Computational Mathematics

यह शोध पत्र इटेरिस (Iteris) को प्रस्तुत करता है, जो कम्प्यूटेशनल गणित की खुली समस्याओं के लिए डिज़ाइन किया गया एक एजेंटिक एआई (agentic AI) सिस्टम है, जिसने सफलतापूर्वक दो जटिल शोध चुनौतियों के लिए संख्यात्मक साक्ष्य, निर्माण और प्रमाण के प्रारूप तैयार किए जिन्हें बाद में मानव विशेषज्ञों द्वारा सत्यापित किया गया।

Leheng Chen, Zihao Liu, Wanyi He, Bin Dong2026-06-02
🤖 AI

Monitoring Agentic Systems Before They're Reliable

यह शोध पत्र एजेंटिक सिस्टम के लिए एक परिपक्वता-चरणबद्ध निगरानी ढांचे का प्रस्ताव करता है जो कार्य-स्तरीय त्रुटियों के बजाय संरचनात्मक दोषों का पता लगाने को प्राथमिकता देता है, जिसमें मूल्यांकन को विचरणात्मक (within-run), अंतर-विचरणात्मक (cross-run) और संरचनात्मक स्कोप के माध्यम से गुणवत्ता, उपयुक्तता और दक्षता आयामों में विभाजित किया गया है, तथा मानव ध्यान को सबसे महत्वपूर्ण एकीकरण अंतराल की ओर निर्देशित करने के लिए विचरण (variance) और FMEA-आधारित ट्राइएज का उपयोग किया गया है।

Marisa Ferrara Boston, Glen Hanson, Effi Georgala, JD Hudgens, Heather Frase2026-06-02
🤖 AI

Tracking the Behavioral Trajectories of Adapting Agents

यह शोध पत्र एजेंट व्यवहारिक लक्षणों को टेक्स्ट एम्बेडिंग स्पेस में दिशाओं के रूप में परिभाषित करके उन्हें मापने के लिए एक ढांचे का परिचय देता है, जो कौशल फ़ाइल संपादन (skill file edits) को मापने में सक्षम बनाता है और एक विश्वसनीय मध्यस्थ के माध्यम से व्यवहारिक परिवर्तनों के सुरक्षित एजेंट-से-एजेंट मूल्यांकन की सुविधा प्रदान करता है।

Jonah Leshin, Manish Shah, Ian Timmis2026-06-02
💬 NLP

SimSD: Simple Speculative Decoding in Diffusion Language Models

यह शोध पत्र SimSD को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त स्पेक्युलेटिव डिकोडिंग एल्गोरिदम है जो डिफ्यूजन लैंग्वेज मॉडल्स को एक नवीन मास्किंग रणनीति का उपयोग करके 7.46x तक तेज़ इन्फरेंस थ्रूपुट प्राप्त करने में सक्षम बनाता है, जो आमतौर पर द्विदिशीय अटेंशन (bidirectional attention) के साथ असंगत टोकन-स्तरीय सत्यापन क्षमताओं को बहाल करता है।

Junxia Cui, Haotian Ye, Runchu Tian, Hongcan Guo, Jinya Jiang, Haoru Li, Chaojie Ren, Yiming Huang, Kaijie Zhu, Zhongkai (…)2026-06-02
🤖 AI

Modeling Depth Ambiguity: A Mixture-Density Representation for Flying-Point-Free Depth Estimation

यह शोध पत्र MDA को प्रस्तुत करता है, जो एक मिश्रण-घनत्व (mixture-density) प्रतिनिधित्व है जो प्रति पिक्सेल कई गहराई परिकल्पनाओं (depth hypotheses) को मॉडल करके 'फ्लाइंग पॉइंट्स' जैसे डेप्थ एस्टीमेशन आर्टिफैक्ट्स को हल करता है, जिससे बिना किसी महत्वपूर्ण रनटाइम ओवरहेड के अस्पष्ट सीमाओं, पारदर्शी वस्तुओं और आकाश के क्षेत्रों को सटीक रूप से कैप्चर किया जा सकता है।

Siyuan Bian, Congrong Xu, Jun Gao2026-06-02
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

यह शोधपत्र SubFit को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग एलएलएम (LLM) संपीड़न विधि है जो व्यक्तिगत रूप से फिट किए गए रेसिडुअल बायपास के साथ अटेंशन (Attention) और फीडफॉरवर्ड (FeedForward) घटकों के गैर-निरंतर, सबमॉड्यूल-स्तर के चयन को सक्षम करके मौजूदा लेयर-आधारित दृष्टिकोणों की सीमाओं को दूर करता है, जिससे विभिन्न मॉडलों और स्पर्सिटी (sparsity) स्तरों में बेहतर सटीकता-परप्लेक्सिटी (accuracy-perplexity) ट्रेड-ऑफ और इन्फरेंस दक्षता प्राप्त होती है।

Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca2026-06-02
🤖 AI

LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenarios

यह शोध पत्र चार प्रमुख 2024 लार्ज लैंग्वेज मॉडल्स में व्यावसायिक और अपराध परिदृश्यों के माध्यम से लिंग, नस्लीय और आयु संबंधी पूर्वाग्रहों का मूल्यांकन करता है, जो वास्तविक दुनिया के डेटा से महत्वपूर्ण विचलन को प्रकट करता है और यह दर्शाता है कि वर्तमान डीबायसिंगिंग (पूर्वाग्रह निवारण) प्रयास अक्सर नए निष्पक्षता व्यापार-समझौतों को जन्म देते हैं जिन्हें "डीबायसिंगिंग विरोधाभास" के रूप में जाना जाता है।

Vishal Mirza, Rahul Kulkarni, Aakanksha Jadhav2026-06-01
💬 NLP

Breaking Information Cocoons: A Hyperbolic Framework for Balancing Exploration and Exploitation in Recommender Systems

यह शोध पत्र HERec का प्रस्ताव करता है, जो एक हाइपरबोलिक फ्रेमवर्क है जो अनुशंसा प्रणालियों (recommender systems) में सूचनात्मक कोकून (information cocoons) को कम करने के लिए अन्वेषण (exploration) और दोहन (exploitation) को प्रभावी ढंग से संतुलित करने हेतु स्वचालित क्लस्टरिंग के साथ अर्थ-संवर्धित पदानुक्रमित मॉडलिंग (semantic-enhanced hierarchical modeling) को जोड़ता है, जिससे यह मौजूदा यूक्लिडियन और हाइपरबोलिक बेसलाइन से बेहतर प्रदर्शन करता है।

Qiyao Ma, Menglin Yang, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying2026-06-01