📊 statistics

Logging Policy Design for Off-Policy Evaluation

यह शोध पत्र एक ऐसा एकीकृत ढांचा प्रस्तावित करता है जो एक मौलिक रिवॉर्ड-कवरेज ट्रेडऑफ (reward-coverage tradeoff) को स्पष्ट करते हुए और विभिन्न सूचनात्मक व्यवस्थाओं (informational regimes) में इष्टतम रणनीतियों को व्युत्पन्न करते हुए ऑफ-पॉलिसी मूल्यांकन त्रुटि को न्यूनतम करने वाली लॉगिंग नीतियों को डिजाइन करने का प्रस्ताव देता है ताकि उच्च-दांव वाले प्रयोगों के लिए उपचार नीतियां चुनने में फर्मों का मार्गदर्शन किया जा सके।

Connor Douglas, Joel Persson, Foster Provost2026-05-15
💻 computer science

CLOVER: Closed-Loop Value Estimation \& Ranking for End-to-End Autonomous Driving Planning

CLOVER एक क्लोज्ड-लूप वैल्यू एस्टिमेशन और रैंकिंग फ्रेमवर्क है जो सूडो-एक्सपर्ट ट्रेजेक्टरीज और कंजर्वेटिव सेल्फ-डिस्टिलेशन का उपयोग करके एंड-टू-एंड ऑटोनॉमस ड्राइविंग में ट्रेनिंग-इवैल्यूएशन मिसमैच को संबोधित करता है, जिससे NAVSIM बेंचमार्क पर स्टेट-ऑफ-द-आर्ट परफॉर्मेंस प्राप्त होती है।

Sining Ang, Yuguang Yang, Canyu Chen, Yan Wang2026-05-15
💻 computer science

Understanding How International Students in the U.S. Are Using Conversational AI to Support Cross-Cultural Adaptation

यह शोध पत्र इस बात की जांच करता है कि अमेरिका में अंतर्राष्ट्रीय छात्र अंतर-सांस्कृतिक अनुकूलन चुनौतियों से निपटने के लिए संवादात्मक एआई (conversational AI) का उपयोग कैसे करते हैं, जो इसके वर्तमान भूमिका को एक तत्काल "प्रथम-सहायता" (first-aid) उपकरण के रूप में प्रकट करता है और अनुकूलित डिज़ाइन अनुशंसाओं के माध्यम से इसे एक दीर्घकालिक सहायता साथी के रूप में विकसित करने के अवसरों की पहचान करता है।

Laleh Nourian, Anisa Callis, Stephanie Patterson, Jadeline Miao, Jamison Heard, Garreth W. Tigwell2026-05-15
💬 NLP

Self-Distilled Agentic Reinforcement Learning

यह शोध पत्र SDAR को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो लंबी अवधि के एजेंटिक कार्यों (long-horizon agentic tasks) के लिए स्थिर, सघन टोकन-स्तरीय मार्गदर्शन प्रदान करने हेतु ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (On-Policy Self-Distillation) को एक गेटेड ऑक्जिलरी ऑब्जेक्टिव के रूप में सुदृढीकरण शिक्षण (Reinforcement Learning) में एकीकृत करता है, जो कई बेंचमार्क और मॉडल स्केल्स में मानक RL और नाइव हाइब्रिड बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang (…)2026-05-15
💬 NLP

MeMo: Memory as a Model

यह शोध पत्र MeMo को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो नए ज्ञान को एक समर्पित मेमोरी मॉडल में एनकोड करता है ताकि फ्रोजन (frozen) LLMs के साथ प्लग-एंड-प्ले एकीकरण सक्षम हो सके, जो कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) या मॉडल वेट्स पर निर्भरता के बिना जटिल क्रॉस-डॉक्यूमेंट जानकारी की सुदृढ़ रिट्रीवल प्रदान करता है।

Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low (…)2026-05-15
💬 NLP

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड मल्टीमॉडल अलाइनमेंट फ्रेमवर्क प्रस्तुत करता है जो अर्थपूर्ण रूप से समृद्ध लेकिन सामयिक रूप से अस्पष्ट असंरचित नैरेटिव्स को संरचनात्मक रूप से सटीक लेकिन अपूर्ण EHR डेटा के साथ एकीकृत करके सटीक क्लिनिकल टाइमलाइन्स का पुनर्निर्माण करता है, जिससे टाइमस्टैम्प सटीकता में महत्वपूर्ण सुधार होता है और केवल सारणीबद्ध रिकॉर्ड द्वारा छूटे हुए आयोजनों को कैप्चर किया जाता है।

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss2026-05-15
💻 computer science

OpenDeepThink: Parallel Reasoning via Bradley--Terry Aggregation

OpenDeepThink एक जनसंख्या-आधारित टेस्ट-टाइम कंप्यूट फ्रेमवर्क है जो उम्मीदवार समाधानों को चुनने, उत्परिवर्तित करने और विकसित करने के लिए पेयरवाइज ब्रैडली-टेरी (pairwise Bradley-Terry) तुलनाओं को एकत्रित करके LLM तर्क क्षमता को बढ़ाता है, जिससे मॉडल रिट्यूनिंग की आवश्यकता के बिना Codeforces जैसे ऑब्जेक्टिव बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang2026-05-15
💻 computer science

VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction

VGGT-Edit एक फीड-फॉरवर्ड फ्रेमवर्क है जो टेक्स्ट-कंडीशन्ड नेटिव 3D सीन एडिटिंग के लिए डेप्थ-सिंक्रोनाइज्ड टेक्स्ट इंजेक्शन और एक रेसिडुअल ट्रांसफॉर्मेशन हेड का उपयोग करता है ताकि सीधे ज्यामितीय विस्थापन (geometric displacements) की भविष्यवाणी की जा सके, जिससे मौजूदा 2D-लिफ्टिंग विधियों की विसंगतियों और धुंधलेपन को दूर करते हुए लगभग-तत्काल अनुमान (near-instant inference) के साथ उच्च-निष्ठा (high-fidelity) और मल्टी-व्यू सुसंगत परिणाम प्राप्त किए जा सकें।

Kaixin Zhu, Yiwen Tang, Yifan Yang, Renrui Zhang, Bohan Zeng, Ziyu Guo, Ruichuan An, Zhou Liu, Qizhi Chen, Delin Qu, Jae (…)2026-05-15
💬 NLP

FutureSim: Replaying World Events to Evaluate Adaptive Agents

यह शोधपत्र FutureSim को प्रस्तुत करता है, जो वास्तविक दुनिया की घटनाओं को कालानुक्रमिक रूप से पुन: प्रस्तुत करने वाला एक बेंचमार्क है ताकि भविष्य की घटनाओं का पूर्वानुमान लगाने और लंबी समयावधि में अनुकूलित होने की AI एजेंटों की क्षमता का मूल्यांकन किया जा सके, जो फ्रंटियर मॉडल्स के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और बेहतर टेस्ट-टाइम अनुकूलन, मेमोरी और रीजनिंग क्षमताओं की आवश्यकता को रेखांकित करता है।

Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Gei (…)2026-05-15
🤖 AI

Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy

यह शोध पत्र एक मल्टी-मोडल वर्ल्ड मॉडल प्रस्तावित करता है जो स्पर्श संबंधी और दृश्य सूचनाओं को एकीकृत करता है ताकि भौतिक रूप से अस्पष्ट वातावरण में रोबोटिक एक्शन प्रेडिक्शन की सटीकता और मजबूती में महत्वपूर्ण सुधार किया जा सके, जिसे मैग्नेटिक-आधारित टैक्टाइल सेंसर का उपयोग करके एकत्र किए गए दो नवीन डेटासेट्स द्वारा समर्थित किया गया है।

Willow Mandil, Amir Ghalamzan-E2026-05-14