💬 NLP

M3^3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

यह शोध पत्र M3^3Eval प्रस्तुत करता है, जो विशेष वीडियो कार्यों के माध्यम से मल्टी-मोडल मॉडल्स में मेमोरी क्षमताओं का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला संज्ञानात्मक रूप से आधारित (cognitively-grounded) बेंचमार्क है, जो समानांतर स्ट्रीम्स में खराब डिसेंटैंगलमेंट और सीमित प्रतीकात्मक स्मृति (symbolic memory) जैसी महत्वपूर्ण कमजोरियों को उजागर करता है जो बेहतर मेमोरी तंत्र की आवश्यकता को रेखांकित करती हैं।

Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong2026-06-04
💬 NLP

DAR: Deontic Reasoning with Agentic Harnesses

यह शोध पत्र डियोन्टिक एजेंटिक रीजनिंग (DAR) प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को जटिल डियोन्टिक रीजनिंग कार्यों पर प्रदर्शन सुधारने के लिए मांग पर कानूनों (statutes) के साथ इंटरैक्ट करने में सक्षम बनाता है, हालांकि यह उल्लेख करता है कि ये लाभ समान नहीं हैं और कमजोर मॉडल्स में संख्यात्मक प्रदर्शन में गिरावट और अधिक टोकन खपत का कारण बन सकते हैं।

Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme2026-06-04
🤖 AI

Strabo: Declarative Specification and Implementation of Agentic Interaction Protocols

यह शोध पत्र स्ट्रैबो (Strabo) का परिचय देता है, जो एक ऐसा ढांचा है जो लैंगशॉ (Langshaw) विशिष्टता और पीच (Peach) कार्यान्वयन का उपयोग करके गूगल के यूनिवर्सल कॉमर्स प्रोटोकॉल (UCP) चेकआउट प्रक्रिया को मॉडल करते हुए, डिक्लेरेटिव इंटरेक्शन प्रोटोकॉल की व्यावहारिक प्रासंगिकता को उद्योग-स्तर के एजेंटिक एआई (Agentic AI) के लिए प्रदर्शित करता है, जो गूगल के एजेंटों के साथ इंटरऑपरेबिलिटी को सफलतापूर्वक सत्यापित करके पारंपरिक परिवेश में औपचारिक विधियों (formal methods) को क्रमिक रूप से अपनाने में सक्षम बनाता है।

Samuel H. Christie V, Amit K. Chopra, Munindar P. Singh2026-06-04
🤖 AI

UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

यह शोधपत्र UniCAD प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और एक सार्वभौमिक बहु-मोडल लार्ज लैंग्वेज मॉडल (UniCAD-MLLM) है जो कई इनपुट मोडैलिटीज के माध्यम से पुनर्निर्माण, पीढ़ी और प्रश्नोत्तर सहित विविध CAD कार्यों को एकीकृत करता है, और एक एंड-टू-एंड फ्रेमवर्क में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jingyuan Chen, Sheng Jin, Haopeng Sun, Wentao Liu, Chen Qian2026-06-04
🤖 AI

Knowledge Index of Noah's Ark

यह शोधपत्र KINA को प्रस्तुत करता है, जो 261 विषयों में फैला एक कठोरता से डिज़ाइन किया गया 899-आइटम वाला ज्ञान बेंचमार्क है, जो प्रतिनिधित्व के लिए ग्रीडी एप्रोक्सिमेशन (greedy approximation) और एनोटेशन गुणवत्ता के लिए बोनस-ऑन-बार टूर्नामेंट का उपयोग करता है, जो 42 अग्रणी मॉडलों के बीच एक श्रेणीबद्ध प्रदर्शन परिदृश्य को प्रकट करता है जिसमें संतृप्ति (saturation) से नीचे सुधार की काफी गुंजाइश है।

Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yi (…)2026-06-04
🤖 AI

Who Needs Labels? Adapting Vision Foundation Models With the Metadata You Already Have

यह शोध पत्र FINO को प्रस्तुत करता है, जो एक लेबल-मुक्त विधि है जो मौजूदा मेटाडेटा का स्व-पर्यवेक्षित (self-supervised) तरीके से लाभ उठाकर विजन फाउंडेशन मॉडल्स को विशिष्ट वैज्ञानिक डोमेन के अनुकूल बनाती है, जिससे यह विविध इमेजिंग अनुप्रयोगों में मानक अनसुपरवाइज्ड और पूर्णतः सुपरवाइज्ड अनुकूलन तकनीकों दोनों से बेहतर प्रदर्शन करती है।

Elouan Gardès, Seung Eun Yi, Kartik Ahuja, Théo Moutakanni, Huy V. Vo, Piotr Bojanowski, Wolfgang M. Pernice, Loïc Landr (…)2026-06-04
💬 NLP

Continual Visual and Verbal Learning Through a Child's Egocentric Input

यह शोध पत्र BabyCL को प्रस्तुत करता है, जो एक निरंतर बहुविध शिक्षण (continual multimodal learning) ढांचा है जो शब्द-संदर्भ मैपिंग (word-referent mappings) को प्रभावी ढंग से सीखने के लिए बाल-केंद्रित वीडियो डेटा को एक एकल कालानुक्रमिक पास (single chronological pass) में संसाधित करता है, जो ऑफलाइन प्रशिक्षण के साथ प्रदर्शन के अंतर को काफी कम करता है और साथ ही एक बच्चे के स्वाभाविक सीखने के अनुभव की बेहतर नकल करता है।

Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman, Brenden Lake, Mengye Ren2026-06-04
⚡ electrical engineering

Audio Interaction Model

यह शोध पत्र ऑडियो इंटरेक्शन मॉडल और इसके कार्यान्वयन, ऑडियो-इंटरेक्शन को प्रस्तुत करता है, जो एक एकीकृत स्ट्रीमिंग फ्रेमवर्क है जो साउंडफ्लो सिस्टम और स्ट्रीमऑडियो-2एम कॉर्पस के माध्यम से ऑफलाइन टास्क निष्पादन को ऑनलाइन जनरल ऑडियो इंस्ट्रक्शन फॉलोइंग के साथ एकीकृत करके रीयल-टाइम, प्रोएक्टिव ऑडियो अंडरस्टैंडिंग और रिस्पॉन्स को सक्षम बनाता है।

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Ch (…)2026-06-04
🤖 machine learning

Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent

यह शोध पत्र AgentMob का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) LLM-संचालित एजेंट फ्रेमवर्क है जो अस्पष्ट मामलों को हल करने के लिए पुनरावृत्ति टूल उपयोग (iterative tool use) के माध्यम से अनुकूल रूप से साक्ष्य एकत्र करके व्यक्तिगत-स्तर के गतिशीलता पूर्वानुमान (mobility prediction) को बढ़ाता है, और कई डेटासेटों में प्रशिक्षण-मुक्त विधियों के बीच अत्याधुनिक प्रदर्शन प्राप्त करता है।

Linyao Chen, Qinlao Zhao, Zechen Li, Mingming Li, Likun Ni, Jinyu Chen, Yuhao Yao, Xuan Song, Noboru Koshizuka, Hiroki K (…)2026-06-04
💬 NLP

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

यह शोधपत्र एक प्रशिक्षण-मुक्त विधि प्रस्तावित करता है जो रिकवरेबल (recoverable) और स्ट्रक्चरल (structural) विफलताओं के बीच अंतर करने के लिए विफल तर्क ट्रेसेस (reasoning traces) के वितरण संबंधी हस्ताक्षरों का विश्लेषण करती है, जिससे एक ऐसा रूटिंग नियम सक्षम होता है जो मॉडल वेट्स (model weights) तक पहुंच की आवश्यकता के बिना कठिन समस्याओं के लिए रेस्क्यू दरों में महत्वपूर्ण सुधार करता है।

Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller2026-06-04