💬 NLP

Self-Distilled Agentic Reinforcement Learning

यह शोध पत्र SDAR को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो लंबी अवधि के एजेंटिक कार्यों (long-horizon agentic tasks) के लिए स्थिर, सघन टोकन-स्तरीय मार्गदर्शन प्रदान करने हेतु ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (On-Policy Self-Distillation) को एक गेटेड ऑक्जिलरी ऑब्जेक्टिव के रूप में सुदृढीकरण शिक्षण (Reinforcement Learning) में एकीकृत करता है, जो कई बेंचमार्क और मॉडल स्केल्स में मानक RL और नाइव हाइब्रिड बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang (…)2026-05-15
💬 NLP

MeMo: Memory as a Model

यह शोध पत्र MeMo को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो नए ज्ञान को एक समर्पित मेमोरी मॉडल में एनकोड करता है ताकि फ्रोजन (frozen) LLMs के साथ प्लग-एंड-प्ले एकीकरण सक्षम हो सके, जो कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) या मॉडल वेट्स पर निर्भरता के बिना जटिल क्रॉस-डॉक्यूमेंट जानकारी की सुदृढ़ रिट्रीवल प्रदान करता है।

Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low (…)2026-05-15
💬 NLP

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड मल्टीमॉडल अलाइनमेंट फ्रेमवर्क प्रस्तुत करता है जो अर्थपूर्ण रूप से समृद्ध लेकिन सामयिक रूप से अस्पष्ट असंरचित नैरेटिव्स को संरचनात्मक रूप से सटीक लेकिन अपूर्ण EHR डेटा के साथ एकीकृत करके सटीक क्लिनिकल टाइमलाइन्स का पुनर्निर्माण करता है, जिससे टाइमस्टैम्प सटीकता में महत्वपूर्ण सुधार होता है और केवल सारणीबद्ध रिकॉर्ड द्वारा छूटे हुए आयोजनों को कैप्चर किया जाता है।

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss2026-05-15
💬 NLP

MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

यह शोधपत्र MetaBackdoor को प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) पर एक नवीन बैकडोर हमला है जो इनपुट टेक्स्ट की अर्थ संबंधी सामग्री (semantic content) में किसी भी संशोधन की आवश्यकता के बिना, सिस्टम प्रॉम्प्ट्स को लीक करने या टूल कॉल्स को प्रेरित करने जैसे दुर्भावनापूर्ण व्यवहारों को सक्रिय करने के लिए पोजीशनल एनकोडिंग (positional encoding) का उपयोग एक ट्रिगर के रूप में करता है।

Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem2026-05-15
💬 NLP

Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि एजेंटिक खोज प्रणालियों में grep-आधारित पुनर्प्राप्ति अक्सर वेक्टर पुनर्प्राप्ति से बेहतर प्रदर्शन करती है, जबकि यह भी रेखांकित करता है कि समग्र प्रदर्शन विशिष्ट एजेंट हार्नेस और टूल-कॉलिंग प्रतिमान से महत्वपूर्ण रूप से प्रभावित होता है, भले ही अंतर्निहित डेटा स्थिर बना रहे।

Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah2026-05-15
💬 NLP

FutureSim: Replaying World Events to Evaluate Adaptive Agents

यह शोधपत्र FutureSim को प्रस्तुत करता है, जो वास्तविक दुनिया की घटनाओं को कालानुक्रमिक रूप से पुन: प्रस्तुत करने वाला एक बेंचमार्क है ताकि भविष्य की घटनाओं का पूर्वानुमान लगाने और लंबी समयावधि में अनुकूलित होने की AI एजेंटों की क्षमता का मूल्यांकन किया जा सके, जो फ्रंटियर मॉडल्स के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और बेहतर टेस्ट-टाइम अनुकूलन, मेमोरी और रीजनिंग क्षमताओं की आवश्यकता को रेखांकित करता है।

Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Gei (…)2026-05-15
💬 NLP

Task Prompt Vectors: Effective Initialization through Multi-Task Soft-Prompt Transfer

यह शोध पत्र "टास्क प्रॉम्प्ट वेक्टर्स" (Task Prompt Vectors) प्रस्तुत करता है, जो एक ऐसी विधि है जो पूर्ण पुनरप्रशिक्षण की आवश्यकता के बिना प्रॉम्प्ट ट्यूनिंग में प्रभावी मल्टी-टास्क इनिशियलाइजेशन और ट्रांसफर को सक्षम करने के लिए कार्य-विशिष्ट अंतरों से प्राप्त सॉफ्ट-प्रॉम्प्ट्स पर अंकगणितीय संचालन का लाभ उठाती है।

Robert Belanec, Simon Ostermann, Ivan Srba, Maria Bielikova2026-05-14
💬 NLP

BEAVER: An Enterprise Benchmark for Text-to-SQL

यह शोध पत्र BEAVER को प्रस्तुत करता है, जो निजी उद्यम डेटा वेयरहाउस से प्राप्त पहला टेक्स्ट-टू-SQL बेंचमार्क है जिसमें 19 डोमेन के 9,128 वास्तविक दुनिया के प्रश्न शामिल हैं, जो अत्याधुनिक मॉडलों के लिए एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और डोमेन ज्ञान एवं उन्नत फंक्शन उपयोग जैसी जटिल चुनौतियों का निदान करने के लिए एक सूक्ष्म मूल्यांकन ढांचे का प्रस्ताव करता है।

Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Mich (…)2026-05-14
💬 NLP

A3 : an Analytical Low-Rank Approximation Framework for Attention

यह शोधपत्र A³, एक पोस्ट-ट्रेनिंग लो-रैंक एप्रोक्सिमेशन फ्रेमवर्क का प्रस्ताव करता है जो कार्यात्मक हानि (फंक्शनल लॉस) को न्यूनतम करने के लिए ट्रांसफॉर्मर घटकों (QK, OV, और MLP) के हिडन डायमेंशन को विश्लेषणात्मक रूप से कम करता है, जिससे मौजूदा विधियों की तुलना में शून्य रनटाइम ओवरहेड के साथ बेहतर संपीड़न और प्रदर्शन प्राप्त होता है।

Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk (…)2026-05-14
💬 NLP

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

यह शोध पत्र ReVisiT को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) डिकोडिंग विधि है जो विज़न टोकन से प्रासंगिक दृश्य अर्थों (visual semantics) को टेक्स्ट जनरेशन प्रक्रिया में गतिशील रूप से प्रोजेक्ट करके लार्ज विजन लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करती है, और कम कम्प्यूटेशनल लागत के साथ बेहतर प्रदर्शन प्राप्त करती है।

Beomsik Cho, Jaehyung Kim2026-05-14