📊 statistics

Logging Policy Design for Off-Policy Evaluation

यह शोध पत्र एक ऐसा एकीकृत ढांचा प्रस्तावित करता है जो एक मौलिक रिवॉर्ड-कवरेज ट्रेडऑफ (reward-coverage tradeoff) को स्पष्ट करते हुए और विभिन्न सूचनात्मक व्यवस्थाओं (informational regimes) में इष्टतम रणनीतियों को व्युत्पन्न करते हुए ऑफ-पॉलिसी मूल्यांकन त्रुटि को न्यूनतम करने वाली लॉगिंग नीतियों को डिजाइन करने का प्रस्ताव देता है ताकि उच्च-दांव वाले प्रयोगों के लिए उपचार नीतियां चुनने में फर्मों का मार्गदर्शन किया जा सके।

Connor Douglas, Joel Persson, Foster Provost2026-05-15
🤖 machine learning

Learning from Language Feedback via Variational Policy Distillation

यह शोध पत्र वेरिएशनल पॉलिसी डिस्टिलेशन (VPD) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एक वेरिएशनल एक्सपेक्टेशन-मैक्सिमाइजेशन प्रक्रिया के माध्यम से दोनों नीतियों को सह-विकसित करके पैसिव टीचर-स्टूडेंट सेल्फ-डिस्टिलेशन की सीमाओं को दूर करता है, जिससे जटिल रीजनिंग और कोड जनरेशन कार्यों पर प्रदर्शन बढ़ाने के लिए भाषाई फीडबैक से क्रियाशील संकेतों को निकालने में निरंतर सुधार सक्षम होता है।

Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Rayhan Joty2026-05-15
🤖 machine learning

Training ML Models with Predictable Failures

यह शोध पत्र सीमित मूल्यांकन सेटों से एमएल (ML) मॉडल की विफलता दरों के अनुमान में निहित पूर्वाग्रह का विश्लेषण करता है, उन स्थितियों की पहचान करता है जहाँ ऐसे पूर्वानुमान जोखिमों को कम करके आंकते हैं, और एक "पूर्वानुमेयता हानि" (forecastability loss) फाइन-ट्यूनिंग उद्देश्य प्रस्तावित करता है जो कार्य प्रदर्शन और सुरक्षा को बनाए रखते हुए पूर्वानुमान त्रुटि को काफी कम करता है।

Will Schwarzer, Scott Niekum2026-05-15
📊 statistics

RoSHAP: A Distributional Framework and Robust Metric for Stable Feature Attribution

यह शोधपत्र RoSHAP को प्रस्तुत करता है, जो एक वितरण ढांचा (distributional framework) है जो बूटस्ट्रैप रीसैंपलिंग और एसिम्प्टोटिक गॉसियनिटी (asymptotic Gaussianity) का लाभ उठाकर एक सुदृढ़ फीचर एट्रिब्यूशन मीट्रिक बनाता है, जिससे विभिन्न डेटा स्प्लिट्स और मॉडल कॉन्फ़िगरेशन में लगातार सक्रिय, मजबूत और विश्वसनीय फीचर्स की पहचान करके मशीन लर्निंग मॉडल्स की स्थिरता और व्याख्यात्मकता में सुधार होता है।

Lanxin Xiang, Liang Shi, Youhui Ye, Boyu Jiang, Dawei Zhou, Feng Guo2026-05-15
💬 NLP

Self-Distilled Agentic Reinforcement Learning

यह शोध पत्र SDAR को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो लंबी अवधि के एजेंटिक कार्यों (long-horizon agentic tasks) के लिए स्थिर, सघन टोकन-स्तरीय मार्गदर्शन प्रदान करने हेतु ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (On-Policy Self-Distillation) को एक गेटेड ऑक्जिलरी ऑब्जेक्टिव के रूप में सुदृढीकरण शिक्षण (Reinforcement Learning) में एकीकृत करता है, जो कई बेंचमार्क और मॉडल स्केल्स में मानक RL और नाइव हाइब्रिड बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang (…)2026-05-15
💬 NLP

MeMo: Memory as a Model

यह शोध पत्र MeMo को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो नए ज्ञान को एक समर्पित मेमोरी मॉडल में एनकोड करता है ताकि फ्रोजन (frozen) LLMs के साथ प्लग-एंड-प्ले एकीकरण सक्षम हो सके, जो कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) या मॉडल वेट्स पर निर्भरता के बिना जटिल क्रॉस-डॉक्यूमेंट जानकारी की सुदृढ़ रिट्रीवल प्रदान करता है।

Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low (…)2026-05-15
💬 NLP

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड मल्टीमॉडल अलाइनमेंट फ्रेमवर्क प्रस्तुत करता है जो अर्थपूर्ण रूप से समृद्ध लेकिन सामयिक रूप से अस्पष्ट असंरचित नैरेटिव्स को संरचनात्मक रूप से सटीक लेकिन अपूर्ण EHR डेटा के साथ एकीकृत करके सटीक क्लिनिकल टाइमलाइन्स का पुनर्निर्माण करता है, जिससे टाइमस्टैम्प सटीकता में महत्वपूर्ण सुधार होता है और केवल सारणीबद्ध रिकॉर्ड द्वारा छूटे हुए आयोजनों को कैप्चर किया जाता है।

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss2026-05-15
🤖 machine learning

When Are Two Networks the Same? Tensor Similarity for Mechanistic Interpretability

यह शोध पत्र "टेंसर समानता" (tensor similarity) प्रस्तुत करता है, जो वेट-स्पेस सिमिट्रीज़ के प्रति इनवेरिएंट एक वेट-आधारित मीट्रिक है जो टेंसर-आधारित न्यूरल नेटवर्क के बीच वैश्विक कार्यात्मक तुल्यता को कुशलतापूर्वक सत्यापित करता है, जिससे मैकेनिस्टिक इंटरप्रिटेबिलिटीता (mechanistic interpretability) अनुभवजन्य सन्निकटन से एक हल किए गए बीजगणितीय समस्या में बदल जाती है।

ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms2026-05-15
💬 NLP

FutureSim: Replaying World Events to Evaluate Adaptive Agents

यह शोधपत्र FutureSim को प्रस्तुत करता है, जो वास्तविक दुनिया की घटनाओं को कालानुक्रमिक रूप से पुन: प्रस्तुत करने वाला एक बेंचमार्क है ताकि भविष्य की घटनाओं का पूर्वानुमान लगाने और लंबी समयावधि में अनुकूलित होने की AI एजेंटों की क्षमता का मूल्यांकन किया जा सके, जो फ्रंटियर मॉडल्स के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और बेहतर टेस्ट-टाइम अनुकूलन, मेमोरी और रीजनिंग क्षमताओं की आवश्यकता को रेखांकित करता है।

Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Gei (…)2026-05-15