🤖 machine learning

SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion

SHRED एक नवीन, रिटेन-सेट-मुक्त (retain-set-free) मशीन अनलर्निंग विधि है जो बड़े भाषा मॉडलों के लिए, सेल्फ-डिस्टिलेशन के माध्यम से उच्च-सूचना वाले टोकनों की पहचान और उन्हें डिमोट करके याद किए गए कंटेंट को चुनिलेक्टिव रूप से हटाती है, जिससे बिना किसी क्यूरेटेड रिटेन सेट की आवश्यकता के, भूलने की प्रभावकारिता और मॉडल उपयोगिता के बीच श्रेष्ठ संतुलन प्राप्त किया जाता है।

Zizhao Hu, Ameya Godbole, Johnny Tian-Zheng Wei, Mohammad Rostami, Jesse Thomason, Robin Jia2026-05-11
🤖 machine learning

Does Your Neural Network Extrapolate? Feature Engineering as Identifiability Bias for OOD Generalization

यह शोध पत्र तर्क देता है कि न्यूरल नेटवर्क में आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन (out-of-distribution generalization), फीचर इंजीनियरिंग और संरचनात्मक प्रतिबद्धताओं (structural commitments) के माध्यम से उत्पन्न "आइडेंटिफिएबिलिटी बायस" (identifiability bias) पर निर्भर करता है, जो केवल इन-डिस्ट्रीब्यूशन डेटा से डेटा-जनरेटिंग प्रक्रियाओं की नॉन-आइडेंटिफिएबिलिटी (non-identifiability) को हल करते हैं, जिससे तब सफल एक्सट्रपलेशन (extrapolation) सक्षम होता है जब चुने गए निरूपण (representations) अंतर्निहित कारण संरचना (underlying causal structure) को सही ढंग से कैप्चर करते हैं।

Leonel Aguilar, Jan Nagler, Christoph Hoelscher, Nino Antulov-Fantulin2026-05-11
🤖 AI

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

यह शोध पत्र LiteGUI का प्रस्ताव करता है, जो एक नवीन SFT-मुक्त प्रशिक्षण प्रतिमान है जो गाइडेड ऑन-पॉलिसी डिस्टिलेशन और एक मल्टी-सॉल्यूशन ड्यूल-लेवल GRPO फ्रेमवर्क को जोड़ता है ताकि हल्के, ऑन-डिवाइस GUI एजेंटों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे 2B/3B स्केल के मॉडल बहुत बड़े मॉडलों के बराबर अत्याधुनिक परिणाम प्राप्त करने में सक्षम हो सकें।

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen2026-05-11
🤖 AI

Model-Driven Policy Optimization in Differentiable Simulators via Stochastic Exploration

यह शोध पत्र मॉडल-ड्रिवन पॉलिसी ऑप्टिमाइज़ेशन (MDPO) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो एक्शन स्पेस में समय-निर्भर स्टोकेस्टिक शोर (stochastic noise) को अनुकूल रूप से इंजेक्ट करके चुनौतीपूर्ण नॉनलीनियर और हाइब्रिड डोमेन में डिफरेंशिएबल प्लानिंग को बेहतर बनाता है, जिससे यह दोनों नियतात्मक (deterministic) डिफरेंशिएबल विधियों और अत्याधुनिक मॉडल-फ्री बेसलाइनों की तुलना में अन्वेषण (exploration) और समाधान की गुणवत्ता में सुधार करता है।

Yuval Aroosh, Ayal Taitler2026-05-11
🤖 AI

From Feasible to Practical: Pareto-Optimal Synthesis Planning

यह शोध पत्र MORetro* को प्रस्तुत करता है, जो एक बहु-उद्देश्यीय खोज एल्गोरिदम है जो लागत और स्थिरता जैसे प्रतिस्पर्धी मानदंडों के बीच संतुलन बनाकर पारेटो-इष्टतम (Pareto-optimal) संश्लेषण मार्ग उत्पन्न करता है, जिससे कंप्यूटर-सहायता प्राप्त संश्लेषण नियोजन को वास्तविक दुनिया के औद्योगिक निर्णय लेने की प्रक्रिया के साथ संरेखित किया जा सके।

Friedrich Hastedt, Dongda Zhang, Antonio del Rio Chanona2026-05-11
🤖 machine learning

Why Self-Inconsistency Arises in GNN Explanations and How to Exploit It

यह शोधपत्र ग्राफ न्यूरल नेटवर्क स्पष्टीकरणों में आत्म-असंगति के कारणों की जांच करता है, एज संवेदनशीलता (edge sensitivity) को समझाने के लिए एक लेटेंट सिग्नल असाइनमेंट परिकल्पना प्रस्तावित करता है और एक प्रशिक्षण-मुक्त सेल्फ-डीनॉइजिंग रणनीति पेश करता है जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ स्पष्टीकरणों को प्रभावी ढंग से कैलिब्रेट करती है।

Wenxin Tai, Yaqian Liu, Ting Zhong, Fan Zhou2026-05-11
🤖 AI

Multi-Environment POMDPs with Finite-Horizon Objectives

यह शोध पत्र परिमित-क्षितिज उद्देश्यों वाले मल्टी-एनवायरनमेंट POMDPs के लिए इष्टतम नीतियों की गणना करने की PSPACE-पूर्णता स्थापित करता है और एक व्यावहारिक एल्गोरिदम पेश करता है जो शास्त्रीय बेंचमार्क पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Léonard Brice, Filip Cano, Krishnendu Chatterjee, Thomas A. Henzinger, Stefanie Muroya2026-05-11
🤖 AI

Implicit Preference Alignment for Human Image Animation

यह शोध पत्र इम्प्लिसिट प्रेफरेंस अलाइनमेंट (IPA) का प्रस्ताव करता है, जो एक डेटा-कुशल पोस्ट-ट्रेनिंग फ्रेमवर्क है जो महंगे पेयर्ड प्रेफरेंस डेटा की आवश्यकता के बिना, मॉडल को स्वयं-निर्मित उच्च-गुणवत्ता वाले नमूनों के साथ संरेखित करके ह्यूमन इमेज एनिमेशन में हाई-फिडेलिटी हैंड मोशन जनरेशन को बढ़ाता है।

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui2026-05-11
📊 statistics

Ensemble Distributionally Robust Bayesian Optimisation

यह शोध पत्र 'एन्सेम्बल डिस्ट्रीब्यूशनली रोबस्ट बेयसियन ऑप्टिमाइज़ेशन' के लिए एक गणनात्मक रूप से सुलभ एल्गोरिदम प्रस्तावित करता है जो वितरण संबंधी अनिश्चितता के तहत निरंतर संदर्भ (कंटीन्यूअस कॉन्टेक्स्ट) को संभालता है, जिससे बेहतर सैद्धांतिक उप-रैखिक रिग्रेट बाउंड्स प्राप्त होते हैं और मजबूत अनुभवजन्य प्रदर्शन प्रदर्शित होता है।

Tigran Ramazyan, Denis Derkach2026-05-11
🤖 AI

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

Response-G1 एक नवीन, फाइन-ट्यूनिंग-मुक्त फ्रेमवर्क है जो सीन ग्राफ्स के माध्यम से संचित वीडियो साक्ष्यों और क्वेरी स्थितियों के बीच संरेखण को स्पष्ट रूप से मॉडल करके प्रोएक्टिव स्ट्रीमिंग वीडियो समझ को बढ़ाता है, जिससे अधिक सटीक और व्याख्या योग्य रिस्पॉन्स टाइमिंग निर्णय सक्षम होते हैं।

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Li (…)2026-05-11