🤖 AI

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

यह शोध पत्र LiteGUI का प्रस्ताव करता है, जो एक नवीन SFT-मुक्त प्रशिक्षण प्रतिमान है जो गाइडेड ऑन-पॉलिसी डिस्टिलेशन और एक मल्टी-सॉल्यूशन ड्यूल-लेवल GRPO फ्रेमवर्क को जोड़ता है ताकि हल्के, ऑन-डिवाइस GUI एजेंटों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे 2B/3B स्केल के मॉडल बहुत बड़े मॉडलों के बराबर अत्याधुनिक परिणाम प्राप्त करने में सक्षम हो सकें।

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen2026-05-11
🤖 AI

Model-Driven Policy Optimization in Differentiable Simulators via Stochastic Exploration

यह शोध पत्र मॉडल-ड्रिवन पॉलिसी ऑप्टिमाइज़ेशन (MDPO) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो एक्शन स्पेस में समय-निर्भर स्टोकेस्टिक शोर (stochastic noise) को अनुकूल रूप से इंजेक्ट करके चुनौतीपूर्ण नॉनलीनियर और हाइब्रिड डोमेन में डिफरेंशिएबल प्लानिंग को बेहतर बनाता है, जिससे यह दोनों नियतात्मक (deterministic) डिफरेंशिएबल विधियों और अत्याधुनिक मॉडल-फ्री बेसलाइनों की तुलना में अन्वेषण (exploration) और समाधान की गुणवत्ता में सुधार करता है।

Yuval Aroosh, Ayal Taitler2026-05-11
🤖 AI

From Feasible to Practical: Pareto-Optimal Synthesis Planning

यह शोध पत्र MORetro* को प्रस्तुत करता है, जो एक बहु-उद्देश्यीय खोज एल्गोरिदम है जो लागत और स्थिरता जैसे प्रतिस्पर्धी मानदंडों के बीच संतुलन बनाकर पारेटो-इष्टतम (Pareto-optimal) संश्लेषण मार्ग उत्पन्न करता है, जिससे कंप्यूटर-सहायता प्राप्त संश्लेषण नियोजन को वास्तविक दुनिया के औद्योगिक निर्णय लेने की प्रक्रिया के साथ संरेखित किया जा सके।

Friedrich Hastedt, Dongda Zhang, Antonio del Rio Chanona2026-05-11
🤖 machine learning

Why Self-Inconsistency Arises in GNN Explanations and How to Exploit It

यह शोधपत्र ग्राफ न्यूरल नेटवर्क स्पष्टीकरणों में आत्म-असंगति के कारणों की जांच करता है, एज संवेदनशीलता (edge sensitivity) को समझाने के लिए एक लेटेंट सिग्नल असाइनमेंट परिकल्पना प्रस्तावित करता है और एक प्रशिक्षण-मुक्त सेल्फ-डीनॉइजिंग रणनीति पेश करता है जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ स्पष्टीकरणों को प्रभावी ढंग से कैलिब्रेट करती है।

Wenxin Tai, Yaqian Liu, Ting Zhong, Fan Zhou2026-05-11
🤖 AI

Multi-Environment POMDPs with Finite-Horizon Objectives

यह शोध पत्र परिमित-क्षितिज उद्देश्यों वाले मल्टी-एनवायरनमेंट POMDPs के लिए इष्टतम नीतियों की गणना करने की PSPACE-पूर्णता स्थापित करता है और एक व्यावहारिक एल्गोरिदम पेश करता है जो शास्त्रीय बेंचमार्क पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Léonard Brice, Filip Cano, Krishnendu Chatterjee, Thomas A. Henzinger, Stefanie Muroya2026-05-11
🤖 AI

Implicit Preference Alignment for Human Image Animation

यह शोध पत्र इम्प्लिसिट प्रेफरेंस अलाइनमेंट (IPA) का प्रस्ताव करता है, जो एक डेटा-कुशल पोस्ट-ट्रेनिंग फ्रेमवर्क है जो महंगे पेयर्ड प्रेफरेंस डेटा की आवश्यकता के बिना, मॉडल को स्वयं-निर्मित उच्च-गुणवत्ता वाले नमूनों के साथ संरेखित करके ह्यूमन इमेज एनिमेशन में हाई-फिडेलिटी हैंड मोशन जनरेशन को बढ़ाता है।

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui2026-05-11
📊 statistics

Ensemble Distributionally Robust Bayesian Optimisation

यह शोध पत्र 'एन्सेम्बल डिस्ट्रीब्यूशनली रोबस्ट बेयसियन ऑप्टिमाइज़ेशन' के लिए एक गणनात्मक रूप से सुलभ एल्गोरिदम प्रस्तावित करता है जो वितरण संबंधी अनिश्चितता के तहत निरंतर संदर्भ (कंटीन्यूअस कॉन्टेक्स्ट) को संभालता है, जिससे बेहतर सैद्धांतिक उप-रैखिक रिग्रेट बाउंड्स प्राप्त होते हैं और मजबूत अनुभवजन्य प्रदर्शन प्रदर्शित होता है।

Tigran Ramazyan, Denis Derkach2026-05-11
🤖 AI

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

Response-G1 एक नवीन, फाइन-ट्यूनिंग-मुक्त फ्रेमवर्क है जो सीन ग्राफ्स के माध्यम से संचित वीडियो साक्ष्यों और क्वेरी स्थितियों के बीच संरेखण को स्पष्ट रूप से मॉडल करके प्रोएक्टिव स्ट्रीमिंग वीडियो समझ को बढ़ाता है, जिससे अधिक सटीक और व्याख्या योग्य रिस्पॉन्स टाइमिंग निर्णय सक्षम होते हैं।

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Li (…)2026-05-11
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

यह शोध पत्र POISE प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक पॉलिसी मॉडल की आंतरिक अवस्थाओं पर प्रशिक्षित एक हल्के प्रोब (lightweight probe) का लाभ उठाकर नगण्य लागत पर वैल्यू बेसलाइन का अनुमान लगाता है, जिससे अलग क्रिटिक्स या कई रोलआउट्स के कम्प्यूटेशनल ओवरहेड के बिना स्थिर और कुशल पॉलिसी अनुकूलन प्राप्त होता है।

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
📊 statistics

Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

यह शोध पत्र कॉज़ल एनर्जी मिनिमाइजेशन (CEM) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ट्रांसफॉर्मर परतों को सशर्त ऊर्जा फलनों (conditional energy functions) पर अनुकूलन चरणों के रूप में पुनर्व्याख्या करता है ताकि भाषा मॉडलिंग कार्यों में मानक बेसलाइन के अनुरूप बाधित, पैरामीटर-कुशल आर्किटेक्चर प्राप्त किए जा सकें।

Jin Xu, Camille Couturier, Victor Rühle, Saravan Rajmohan, James Hensman2026-05-11