🤖 machine learning

DriftWorld: Fast World Modeling through Drifting

DriftWorld एक अभिनव एक्शन-कंडीशन्ड वर्ल्ड मॉडल पेश करता है जो भविष्य के फ्रेम को सिंगल फॉरवर्ड पास में जेनरेट करने के लिए ड्रिफ्टिंग जनरेटिव मॉडल्स का लाभ उठाता है, जिससे डिफ्यूजन-आधारित बेसलाइन्स की तुलना में 17 गुना तेज़ इन्फरेंस प्राप्त होता है और साथ ही रोबोटिक प्लानिंग और पॉलिसी इवैल्यूएशन में स्टेट-ऑफ-द-आर्ट प्रदर्शन बनाए रखा जाता है।

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du2026-07-17
🤖 machine learning

Kernel weighted importance sampling for off-policy evaluation in contextual bandits

यह शोध पत्र Kernel-WIS को प्रस्तुत करता है, जो कॉन्टेक्स्टुअल बैंडिट्स (contextual bandits) के लिए एक नवीन ऑफ-पॉलिसी इवैल्यूएशन एस्टीमेटर है, जो भारित इम्पोर्टेंस सैंपलिंग (weighted importance sampling) की सीमाबद्धता (boundedness) को वैनिला इम्पोर्टेंस सैंपलिंग की रैखिकता (linearity) के साथ प्रभावी ढंग से जोड़कर, व्यवहार नीति मिसस्पेसिफिकेशन (behavior policy misspecification) वाले परिदृश्यों में भी एसिम्प्टोटिक कंसिस्टेंसी (asymptotic consistency) और मौजूदा बेसलाइनों पर बेहतर अनुभवजन्य प्रदर्शन प्राप्त करने के लिए ऑफलाइन डेटा का लाभ उठाता है।

Joshua Spear, Matthieu Komorowski, Rebecca Pope, Neil J Sebire, Erica E. M. Moodie2026-07-17
🤖 machine learning

Evaluating covariate balance for long time horizon Markov decision processes

यह शोध पत्र तर्क देता है कि उपचार अनुशंसाओं (treatment recommendations) के लिए मौजूदा ऑफलाइन सुदृढीकरण शिक्षण (offline reinforcement learning) अध्ययन संभावित छिपे हुए कन्फाउंडिंग (hidden confounding) या मॉडल मिसस्पेसिफिकेशन (model misspecification) के कारण सांख्यिकीय सुदृढ़ता की कमी रखते हैं, जैसा कि वर्तमान कोवेरिएट बैलेंस डायग्नोस्टिक्स (covariate balance diagnostics) द्वारा वैध परिणाम सुनिश्चित करने में विफलता से सिद्ध होता है।

Joshua Spear, Rebecca Pope, Neil J Sebire2026-07-17
🤖 machine learning

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

AlphaWiSE एक पोस्ट-हॉक वेट इंटरपोलेशन विधि है जो निरंतर मल्टीमॉडल रिप्रेजेंटेशन लर्निंग को बेहतर बनाने के लिए एम्पलर मेमोरी पर फिट किए गए एक एकल स्केलर गुणांक का उपयोग करके दो फ्रोजन चेकपॉइंट्स को अनुकूल रूप से संयोजित करती है, जिससे इन्फरेंस समय या मॉडल के आकार में वृद्धि नहीं होती है।

Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu2026-07-17
🤖 machine learning

Learning in Infinitesimal Non-Compositional Sketches

यह शोधपत्र LINCS प्रस्तुत करता है, जो एक श्रेणीगत ढांचा (categorical framework) है जो मशीन लर्निंग को टेंटेंट-लिफ्टेड स्केचेस (tangent-lifted sketches) के एक टॉवर के भीतर एक को-अलिजेब्रिक फिक्स्ड पॉइंट (coalgebraic fixed point) की खोज के रूप में पुनर्परिभाषित करता है, जिससे गैर-संयोजकता (non-compositionality) को अंकगणितीय त्रुटि के बजाय सार्वभौमिक गुणनखंडन (universal factorization) की विफलता के रूप में संबोधित किया जाता है।

Sridhar Mahadevan2026-07-17
🤖 machine learning

On-Policy Delta Distillation

यह शोध पत्र ऑन-पॉलिसी डेल्टा डिस्टिलेशन (OPD2^2) को प्रस्तुत करता है, जो सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन पोस्ट-ट्रेनिंग विधि है, जो एक "डेल्टा सिग्नल" का लाभ उठाती है—जो एक शिक्षक मॉडल और रीजनिंग ट्यूनिंग से पूर्व उसके बेस के बीच के अंतर को दर्शाता है—ताकि रीजनिंग क्षमताओं को अधिक प्रभावी ढंग से स्थानांतरित किया जा सके और न्यूनतम पोस्ट-ट्रेनिंग के साथ गणित, विज्ञान और कोड बेंचमार्क में मजबूत प्रदर्शन प्राप्त किया जा सके।

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han2026-07-17
⚡ electrical engineering

RTS Smoother-Guided Learning of Physics-Based Neural Differential Models

यह शोध पत्र एक दो-चरणीय हाइब्रिड न्यूरल-फिजिक्स फ्रेमवर्क प्रस्तावित करता है जो आंशिक अवस्था अवलोकनों से साधारण अवकल समीकरणों (ordinary differential equations) के लुप्त घटकों को सीखने के लिए राउच-टुंग-स्ट्रिएबेल (RTS) स्मूदर-आधारित अवस्था अनुमान और न्यूरल नेटवर्क पैरामीटर अनुकूलन के बीच बारी-बारी से कार्य करता है, जबकि व्याख्या योग्य यांत्रिक संरचना को संरक्षित रखता है।

Ahmet Demirkaya, Georgios Stratis, Tales Imbiriba, Zachary D. Danziger, Deniz Erdogmus2026-07-17
📊 statistics

Subjective Risk Decomposition: A New View for Uncertainty Quantification

यह शोध पत्र अनिश्चितता परिमाणीकरण (uncertainty quantification) के लिए एक नवीन ढांचे का प्रस्ताव करता है जहाँ एपिस्टेमिक (epistemic) और एलियटोरिक (aleatoric) अनिश्चितता मापों को एक स्ट्रिक्टली प्रॉपर लॉस (strictly proper loss) पर आधारित व्यक्तिपरक जोखिम के अपघटन के परिणाम के रूप में व्युत्पन्न किया गया है, जिससे मौजूदा मेट्रिक्स का एकीकरण होता है और यूक्यू (UQ) के लिए एक लर्निंग-थ्योरेटिक दृष्टिकोण की नींव स्थापित होती है।

Raghad Alamri, Michele Caprio, Gavin Brown2026-07-17
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

यह शोध पत्र मास्क-अवेयर पॉलिसी ग्रेडिएंट्स (Mask-Aware Policy Gradients) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल जनरेशन को टोकन चयन और स्थिति मास्किंग को संयुक्त रूप से अनुकूलित करने के लिए एक दो-चरणीय निर्णय प्रक्रिया के रूप में औपचारिक रूप देता है, जिससे लॉग-लाइक्लीहुड (log-likelihood) की जटिलता को दूर किया जा सकता है और गणितीय तर्क एवं कोडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl2026-07-17
🤖 machine learning

BadWAM: When World-Action Models Dream Right but Act Wrong

यह शोध पत्र BadWAM प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो यह प्रदर्शित करता है कि वर्ल्ड-एक्शन मॉडल्स (WAMs) उन प्रतिकूल हमलों के प्रति संवेदनशील हैं जहाँ छोटे दृश्य व्यवधान (visual perturbations) मॉडल की कल्पित भविष्य और उसके द्वारा निष्पादित कार्यों को अलग कर सकते हैं, जिससे महत्वपूर्ण कार्य विफलताओं का कारण बनता है, भले ही मॉडल के आंतरिक अनुमान तर्कसंगत बने रहें।

Qi Li, Xingyi Yang, Xinchao Wang2026-07-17