🤖 AI

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

यह शोधपत्र DecisionBench को प्रस्तुत करता है, जो विविध मॉडलों और कार्यों में दीर्घ-क्षितिज (long-horizon) एजेंटिक वर्कफ़्लो के उभरते हुए डेलीगेशन (delegation) के मूल्यांकन के लिए एक व्यापक बेंचमार्क सबस्ट्रेट है, जो यह प्रकट करता है कि जबकि जागरूकता स्थितियों (awareness conditions) में कार्य की गुणवत्ता स्थिर रहती है, रूटिंग फिडेलिटी (routing fidelity) और समग्र ऑर्केस्ट्रेशन प्रदर्शन को सुधारने के लिए महत्वपूर्ण अप्राप्त क्षमता मौजूद है।

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu2026-05-20
🤖 AI

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

यह शोध पत्र POLAR-Bench को प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो यह मूल्यांकन करता है कि LLM एजेंट प्रतिकूल प्रोबिंग (adversarial probing) के विरुद्ध उपयोगकर्ता-निर्धारित गोपनीयता नीतियों का कितनी अच्छी तरह पालन करते हैं, जिससे यह पता चलता है कि जहाँ फ्रंटियर मॉडल निजी डेटा की प्रभावी ढंग से रक्षा करते हैं, वहीं ऑन-डिवाइस इन्फरेंस के लिए आमतौर पर उपयोग किए जाने वाले छोटे ओपन-वेट मॉडल महत्वपूर्ण गोपनीयता रिसाव से ग्रस्त होते हैं।

Qiaoyuan Zheng, Yiqu Yang, Qi Gao, Imanol Schlag2026-05-20
🤖 AI

Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints

यह शोध पत्र इंटरफ़ेस बाधाओं के तहत संचालित मल्टी-एजेंट वर्कफ़्लो के लिए एक विकेंद्रीकृत QQ-लर्निंग एल्गोरिदम, IC-QQ को प्रस्तुत करता है, और त्रुटि को फंक्शन-एप्रोक्सिमेशन, रिप्रेजेंटेशन और मिक्सिंग-टाइम घटकों में विभाजित करके इस सेटिंग में न्यूरल QQ-लर्निंग के लिए पहला परिमित-नमूना अभिसरण (फाइनाइट-सैंपल कन्वर्जेंस) गारंटी स्थापित करता है, जबकि संयुक्त प्रक्षेप पथों (जॉइंट ट्रेजेक्टरीज) तक पहुंच के बिना केंद्रीकृत ओरेकल प्रदर्शन के साथ इसकी क्षमता को अनुभवजन्य रूप से मान्य करता है।

Jiayu Li, Enpei Zhang, Dawei Zhou, Elynn Chen, Yujun Yan2026-05-20
🤖 machine learning

Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

यह शोध पत्र Flash PD-SSM को प्रस्तुत करता है, जो एक मेमोरी-अनुकूलित स्ट्रक्चर्ड स्पार्स स्टेट-स्पेस मॉडल है जो अनस्ट्रक्चर्ड मॉडल्स की उच्च अभिव्यंजनाशीलता (expressivity) प्राप्त करने के लिए ट्रेन करने योग्य स्पार्स मैट्रिसेस के एक सेट में से गतिशील रूप से चयन करता है, जबकि बड़े पैमाने पर प्रशिक्षण और लंबी अनुक्रमों (sequences) पर अत्याधुनिक प्रदर्शन के लिए आवश्यक कम्प्यूटेशनल दक्षता बनाए रखता है।

Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet, Yannick Biehl, Michael Hersche, Thomas Hofmann, Abbas Rahimi2026-05-20
🤖 AI

How Far Are We From True Auto-Research?

यह शोधपत्र रिसर्चएरिना (ResearchArena) का परिचय देता है, जो स्वायत्त अनुसंधान एजेंटों के मूल्यांकन के लिए एक ढांचा है, और यह पाता है कि हालांकि वे ऐसे पांडुलिपियां तैयार कर सकते हैं जो सतही समीक्षा के तहत प्रतिस्पर्धी प्रतीत होती हैं, लेकिन वे अंततः प्रयोगात्मक कठोरता से जुड़ी महत्वपूर्ण समस्याओं, जिनमें फर्जी परिणाम और योजना-कार्यान्वयन विसंगतियां शामिल हैं, के कारण शीर्ष स्तर का अनुसंधान करने में विफल रहते हैं।

Zhengxin Zhang, Ning Wang, Sainyam Galhotra, Claire Cardie2026-05-20
🤖 AI

Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

यह शोध पत्र PLACES को प्रस्तुत करता है, जो एक सहभागी रेड टीमिंग पहल है जो ग्लोबल साउथ के समुदायों के साथ सहयोग करके 26,000 से अधिक स्थानीयकृत विफलता उदाहरणों का एक विविध डेटासेट तैयार करती है, जिससे टेक्स्ट-टू-इमेज सुरक्षा में पश्चिमी-केंद्रित पूर्वाग्रहों को संबोधित किया जाता है, अद्वितीय सांस्कृतिक नुकसानों को उजागर किया जाता है और संदर्भ-जागरूक सुरक्षा ढांचों की वकालत की जाती है।

Charvi Rastogi, Mukul Bhutani, Minsuk Kahng, Shamsuddeen Hassan Muhammad, Evgeniia Razumovskaia, Priyanka Suresh, Ibrahi (…)2026-05-20
🤖 AI

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

यह शोध पत्र एविडेंस-कैरिंग मल्टीमॉडल एजेंट्स (ECA) को पेश करता है, जो एक सुरक्षित आर्किटेक्चर है जो मॉडल के अपुष्ट संवेदी दावों पर भरोसा करने के बजाय टूल कॉल्स को टाइप किए गए, बाहरी साक्ष्य प्रमाणपत्रों के विरुद्ध मान्य करने की आवश्यकता के माध्यम से मतिभ्रम-जनित (hallucination-driven) प्राधिकरण विफलताओं को रोकता है।

Guijia Zhang, Hao Zheng, Harry Yang2026-05-20
🔢 mathematics

Aerial Inspection Behaviors via RL-based Quadrotor Control for Under-canopy Forest Environments

यह शोध पत्र अंडर-कैनोपी (वृक्षों के नीचे) वन निरीक्षण के लिए एक स्वायत्त क्वाड्रोटर प्रणाली प्रस्तुत करता है जो सटीक व्यू-पोज़ ट्रैकिंग के लिए डीप रीइन्फोर्समेंट लर्निंग-आधारित लो-लेवल कंट्रोलर को एक हाई-लेवल नेविगेशन स्टैक के साथ जोड़ता है, जिसमें सुरक्षित और लंबी दूरी के मिशन निष्पादन सुनिश्चित करने के लिए TSP और RRT* प्लानर्स का उपयोग किया गया है।

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, Viswa Narayanan Sankaranarayanan, George Nikolakopoulos2026-05-20
🤖 AI

Quantized Machine Learning Models for Medical Imaging in Low-Resource Healthcare Settings

यह शोध पत्र ब्रेन ट्यूमर वर्गीकरण के लिए एक मल्टी-स्ट्रेटजी कंप्रेशन फ्रेमवर्क प्रस्तुत करता है जो, एक Float16 क्वांटाइज्ड MobileNetV2 मॉडल के पूर्ण प्रयोगात्मक सत्यापन के माध्यम से, मॉडल के आकार में 6.14x की कमी लाने और नगण्य सटीकता हानि के साथ, कम संसाधनों वाले स्वास्थ्य सेवा परिवेशों में नैदानिक रूप से व्यवहार्य परिनियोजन को सक्षम करने की क्षमता प्रदर्शित करता है।

Sumanth Meenan Kanneti, Aryan Shah2026-05-20
🤖 AI

Not all uncertainty is alike: volatility, stochasticity, and exploration

यह शोध पत्र प्रदर्शित करता है कि पर्यावरणीय अनिश्चितता के विशिष्ट स्रोत—विशेष रूप से अस्थिरता (volatility) और स्टोकेस्टिसिटी (stochasticity)—इष्टतम अन्वेषण (optimal exploration) को विपरीत दिशाओं में संचालित करते हैं, जिससे CAUSE एल्गोरिदम का विकास होता है जो इस विषमता का लाभ उठाकर मानक रणनीतियों से बेहतर प्रदर्शन करता है और मनोरोग संबंधी स्थितियों में रोगजनक शोर अनुमान (pathological noise inference) के संबंध में नई अंतर्दृष्टि प्रदान करता है।

Payam Piray2026-05-20