🤖 AI

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

StressDream एक नवीन ढांचा है जो डिफ्यूजन-आधारित वीडियो वर्ल्ड मॉडल्स को उच्च-प्रभाव वाले, प्रशंसनीय भविष्य के परिणामों की ओर निर्देशित करता है, जो सिमेंटिक रीजनिंग और संभाव्यता बाधाओं के संयोजन के माध्यम से प्रारंभिक शोर (initial noise) को अनुकूलित करके किया जाता है, जिससे स्वायत्त प्रणालियों के लिए मजबूत नीति मूल्यांकन और सुधार सक्षम होता है।

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Ba (…)2026-06-02
🤖 AI

Robust Shielding for Safe Reinforcement Learning

यह शोध पत्र रोबस्ट मार्कोव निर्णय प्रक्रियाओं (Markov decision processes) के लिए एक नवीन, सुदृढ़ और इष्टतम शिल्डिंग फ्रेमवर्क प्रस्तुत करता है जो सैंपलिंग विधियों के साथ संयोजन करते हुए, सीखी गई मॉडलों के लिए प्रोबेबली एप्रोक्सिमेटली करेक्ट (PAC) सुरक्षा गारंटी प्रदान करने के लिए, सबसे खराब स्थिति वाली ट्रांज़िशन अनिश्चितताओं के तहत सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों की सुरक्षा सुनिश्चित करता है।

Edwin Hamel-De le Court, Thom Badings, Alessandro Abate, Francesco Belardinelli, Francesco Fabiano2026-06-02
🤖 AI

Evaluating Bivariate Causal Statements Based on Mutual Compatibility

यह शोध पत्र एक ऐसे ढांचे (फ्रेमवर्क) को प्रस्तुत करता है जो ग्राउंड ट्रुथ पर निर्भर किए बिना द्विचरीय (बाइवैरिएट) कारण संबंधी कथनों की संभाव्यता और निरंतरता का मूल्यांकन करने के लिए अनुकूलता और असंगति स्कोर का उपयोग करता है, ताकि उन परिदृश्यों में विशेषज्ञों या एआई द्वारा किए गए कारण संबंधी दावों को मान्य किया जा सके जहाँ पारंपरिक सत्यापन उपलब्ध नहीं है।

Erik Jahn, Dominik Janzing2026-06-02
🤖 AI

Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion

Real2SAM2Real एक ऐसा फ्रेमवर्क है जो 3D लिफ्टिंग का लाभ उठाकर वीडियो डिफ्यूजन मॉडल्स को बेहतर बनाता है ताकि स्पष्ट, संपादन योग्य (editable) 3D कैश्स को मजबूत ज्यामितीय मचान (geometric scaffolds) के रूप में बनाया जा सके, जिससे जटिल गतिकी (dynamics) और अवरोधों (occlusions) के दौरान स्पैटियोटेम्पोरल निरंतरता बनाए रखते हुए सटीक कैमरा और दृश्य नियंत्रण सक्षम हो सके।

Jiayi Wu, Haoming Cai, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos2026-06-02
💬 NLP

Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance

यह शोध पत्र ट्रैजेक्टरी-अवेयर ऑन-पॉलिसी डिस्टिलेशन (TOPD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो वास्तविक तर्क संबंधी विचलन (reasoning divergences) को सतही स्तर के टोकन बेमेल (token mismatches) से अलग करने और कई टोकनों में मार्गदर्शन वितरित करने के लिए निकट-भविष्य की ट्रैजेक्टरी जानकारी का लाभ उठाती है, जिससे मानक टोकन-स्तरीय OPD की तुलना में छात्र मॉडल के तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

Yuxuan Jiang, Francis Ferraro2026-06-02
🤖 machine learning

Rethinking the Role of Temperature in Large Language Model Distillation

यह शोध पत्र यह प्रदर्शित करके LLM डिस्टिलेशन में रिवर्स KL डाइवर्जेंस (Reverse KL divergence) के प्रति प्रचलित प्राथमिकता को चुनौती देता है कि टेम्परेचर स्केलिंग (temperature scaling) को शामिल करना प्रदर्शन परिदृश्य को मौलिक रूप से बदल देता है, जिससे फॉरवर्ड KL (Forward KL), उच्च तापमान पर लगातार रिवर्स KL से बेहतर प्रदर्शन करने में सक्षम होता है और सरल KL-आधारित तरीकों को अत्याधुनिक दृष्टिकोणों के बराबर लाने में सक्षम बनाता है।

Hoang-Chau Luong, Lingwei Chen2026-06-02
🤖 AI

LLMs Need Encoders for Semantic IDs Too

यह शोध पत्र PrefixMem का प्रस्ताव करता है, जो एक हल्का (lightweight) प्रिफिक्स n-ग्राम मेमोरी एनकोडर है जो जनरेटिव रिकमेंडेशन में सिमेंटिक आईडी (SIDs) के लिए संरचित, संदर्भ-जागरूक प्रतिनिधित्व प्रदान करता है, और यह प्रदर्शित करता है कि अन्य गैर-भाषा मोडैलिटीज की तरह, SIDs को मानक शब्दावली-आधारित दृष्टिकोणों की तुलना में रिट्रीवल सटीकता में महत्वपूर्ण सुधार करने के लिए समर्पित एनकोडर्स की आवश्यकता होती है।

Xiangyi Chen, Zelun Wang, Xinyi Li, Yi-Ping Hsu, Jaewon Yang, Jiajing Xu2026-06-02
🤖 AI

From Noise to Control: Parameterized Diffusion Policies

यह शोधपत्र पैरामीट्राइज़्ड डिफ्यूज़न पॉलिसी (PDP) पेश करता है, जो एक ऐसा फ्रेमवर्क है जो कम-आयामी निरंतर मापदंडों (low-dimensional continuous parameters) को एक सीखे हुए व्यवहार मैनिफोल्ड (behavior manifold) में समाहित करता है ताकि डिफ्यूज़न मॉडल्स को स्टोकेस्टिक जनरेटरों से बदलकर रोबोटिक व्यवहारों को निर्देशित करने और बिना पुन: प्रशिक्षण के नवीन बाधाओं के अनुकूल होने के लिए सटीक, अनुकूलन योग्य उपकरणों में रूपांतरित किया जा सके।

Renhao Zhang, Haotian Fu, Mingxi Jia, George Konidaris, Yilun Du, Bruno Castro da Silva2026-06-02
🤖 machine learning

Drift Q-Learning

DriftQL एक नवीन ऑफलाइन सुदृढीकरण लर्निंग (reinforcement learning) विधि है जो एक ही नेटवर्क में ड्रिफ्ट-आधारित व्यवहारिक रेगुलराइज़र (behavioral regularizer) और क्रिटिक-संचालित नीति सुधार (critic-driven policy improvement) को जोड़कर एक ही फॉरवर्ड पास में कुशलतापूर्वक क्रियाएं उत्पन्न करती है, जो D4RL और OGBench पर अत्याधुनिक प्रदर्शन प्राप्त करती है और डिफ्यूजन एवं फ्लो-आधारित दृष्टिकोणों की तुलना में घटिया डेटा गुणवत्ता के प्रति बेहतर मजबूती प्रदर्शित करती है।

Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh, Scott Fujimoto, Hsiu-Chin Lin, David Meger2026-06-02
🤖 AI

From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging

यह शोध पत्र प्रेफरेंस डेल्टा एग्रीगेशन (PDA) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो कमजोर-कमजोर मॉडल युग्मों से कई "कमजोर" पर्यवेक्षण संकेतों को LoRA एडेप्टर में परिवर्तित करके और उन्हें एक नवीन ज्योमेट्रिक एलाइनमेंट मर्जिंग (GAM) विधि के माध्यम से संयोजित करके उन्हें एकत्रित करता है, जिससे एकल संकेतों या मौजूदा बेसलाइन की तुलना में मजबूत लार्ज लैंग्वेज मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

Qi Sun, Siyue Zhang, Yulin Chen, Yuxiang Xue, Ru Peng, Chen Zhao2026-06-02