📊 statistics

One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL

यह शोध पत्र 'वन-स्टेप बेलमैन अलाइनमेंट' और एक 'री-वेटेड टारगेटिंग (RWT)' ढांचे को पेश करके ऑनलाइन ट्रांसफर रिइन्फोर्समेंट लर्निंग में व्यवस्थित पूर्वाग्रह की चुनौती का समाधान करता है, जो चेंज-ऑफ-मेजर ऑपरेटर्स के माध्यम से ट्रांज़िशन मिसमैच को ठीक करता है, जिससे लक्ष्य MDP के आकार के बजाय टास्क शिफ्ट जटिलता के अनुरूप स्केलिंग वाले रिग्रेट बाउंड्स के साथ प्रमाणित रूप से कुशल ट्रांसफर सक्षम होता है।

Elynn Chen, Enpei Zhang, Jinhang Chai, Yujun Yan2026-05-26
🤖 machine learning

Stochastic Linear Bandits with Parameter Noise

यह शोध पत्र पैरामीटर शोर (parameter noise) वाले स्टोकेस्टिक लीनियर बैंडिट्स के लिए टाइट रिग्रेट बाउंड्स स्थापित करता है, यह प्रदर्शित करते हुए कि एक सरल एक्सप्लोर-एक्सप्लोइट एल्गोरिदम विशिष्ट एक्शन सेट्स के लिए Θ~(dT)\widetilde{\Theta}(\sqrt{dT}) का मिनिमैक्स रिग्रेट प्राप्त करता है, जो क्लासिक एडिटिव नॉइज़ मॉडल्स में पाए जाने वाले dTd\sqrt{T} ऑर्डर में महत्वपूर्ण सुधार करता है।

Daniel Ezer, Alon Peled-Cohen, Yishay Mansour2026-05-26
🤖 machine learning

Generative Visual Code Mobile World Models

यह शोध पत्र gWorld को पेश करता है, जो मोबाइल GUI वर्ल्ड मॉडल के लिए एक नया प्रतिमान (पैराडाइम) है जो अगले इंटरफ़ेस स्टेट को कच्चे पिक्सेल के बजाय निष्पादन योग्य वेब कोड के रूप में भविष्यवाणी करने के लिए एक एकल विजन-लैंग्वेज मॉडल का लाभ उठाता है, जिससे उच्च-निष्ठा वाला दृश्य रेंडरिंग और सटीक टेक्स्ट जनरेशन प्राप्त होता है और साथ ही यह सटीकता में बहुत बड़े मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है।

Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin2026-05-26
🤖 machine learning

Logic-Guided Vector Fields for Constrained Generative Modeling

यह शोध पत्र लॉजिक-गाइडेड वेक्टर फील्ड्स (LGVF) प्रस्तुत करता है, जो एक न्यूरो-सिंबोलिक फ्रेमवर्क है जो फ्लो मैचिंग जनरेटिव मॉडल्स में डिफरेंशिएबल लॉजिकल कंस्ट्रेंट्स को ट्रेनिंग-टाइम पेनल्टी लॉस और इन्फरेंस-टाइम ग्रेडिएंट एडजस्टमेंट्स के संयोजन के माध्यम से एकीकृत करता है, जिससे विविध कंस्ट्रेंड जनरेशन कार्यों में डिस्ट्रिब्यूशनल फिडेलिटी को बनाए रखते हुए या उसमें सुधार करते हुए कंस्ट्रेंट उल्लंघनों को काफी कम किया जाता है।

Ali Baheri2026-05-26
💬 NLP

MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents

MemSkill LLM एजेंटों के लिए एक स्व-विकसित (self-evolving) फ्रेमवर्क पेश करता है जो स्थिर, हस्त-निर्मित मेमोरी ऑपरेशन्स को सीखने योग्य और अनुकूलन योग्य कौशलों से बदल देता है, जिसमें कंट्रोलर्स, एक्जीक्यूटर्स और डिजाइनर्स का एक क्लोज्ड-लूप सिस्टम उपयोग किया जाता है ताकि मेमोरी प्रबंधन रणनीतियों को गतिशील रूप से परिष्कृत किया जा सके और विविध बेंचमार्क में कार्य प्रदर्शन में सुधार किया जा सके।

Haozhen Zhang, Quanyu Long, Jianzhu Bao, Tao Feng, Weizhi Zhang, Haodong Yue, Wenya Wang2026-05-26
🤖 machine learning

SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models

यह शोध पत्र SPA-Cache को प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन कैशिंग फ्रेमवर्क है, जो कुशल अपडेट पहचान के लिए एक लो-डायमेंशनल सिंगुलर प्रॉक्सी और नॉन-कॉज़ल सीमाओं को दूर करने के लिए एक एडेप्टिव बजट एलोकेशन स्ट्रैटेजी का उपयोग करता है, जिससे वैनिला डिकोडिंग की तुलना में 8x तक थ्रूपुट सुधार और मौजूदा बेसलाइन्स की तुलना में 2-4x की गति वृद्धि प्राप्त होती है।

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Yongcheng Jing, Dacheng Tao2026-05-26
🤖 machine learning

Counterfactual Explanations for Hypergraph Neural Networks

यह शोध पत्र CF-HyperGNNExplainer प्रस्तुत करता है, जो हाइपरग्राफ न्यूरल नेटवर्क के लिए एक काउंटरफैक्टुअल स्पष्टीकरण विधि है जो मॉडल भविष्यवाणियों को बदलने और उच्च-क्रम की अंतःक्रियाओं में व्याख्यात्मक अंतर्दृष्टि प्रदान करने के लिए नोड-हाइपरएज घटनाओं को हटाने या हाइपरएज को हटाने जैसे न्यूनतम संरचनात्मक परिवर्तनों की पहचान करता है।

Fabiano Veglianti, Lorenzo Antonelli, Gabriele Tolomei2026-05-26
📊 statistics

Discrete diffusion samplers and bridges: Off-policy algorithms and applications in latent spaces

यह शोधपत्र ऑफ-पॉलिसी प्रशिक्षण तकनीकों और डिस्क्रीट डिफ्यूजन सैंपलर्स के लिए एक नवीन डेटा-टू-एनर्जी श्रोडिंगर ब्रिज फ्रेमवर्क प्रस्तुत करता है, जो सिंथेटिक बेंचमार्क पर सैंपलिंग प्रदर्शन में सुधार करने और इमेज जेनरेटिव मॉडल्स के डिस्क्रीट लेटेंट स्पेस के भीतर डेटा-फ्री पोस्टीरियर सैंपलिंग को सक्षम करने में उनकी प्रभावशीलता को प्रदर्शित करता है।

Arran Carter, Sanghyeok Choi, Kirill Tamogashev, Víctor Elvira, Nikolay Malkin2026-05-26
🤖 machine learning

LLM-SAA: LLM-persona Generated Distributions for Decision-making

यह शोध पत्र "LLM-SAA" ढांचे को प्रस्तुत और मूल्यांकित करता है, जो यह प्रदर्शित करता है कि LLM व्यक्तित्वों (personas) द्वारा उत्पन्न वितरण असॉर्टमेंट (assortment), मूल्य निर्धारण (pricing) और न्यूसवेंडर (newsvendor) समस्याओं में निर्णयों को अनुकूलित करने के लिए व्यावहारिक रूप से प्रभावी हैं—विशेष रूप से कम-डेटा वाले परिदृश्यों में—जबकि यह चेतावनी भी देता है कि उनकी उपयोगिता का आकलन करने के लिए वासेरस्टीन दूरी (Wasserstein distance) जैसे निर्णय-अज्ञेय (decision-agnostic) मेट्रिक्स भ्रामक हो सकते हैं।

Jackie Baek, Yunhan Chen, Ziyu Chi, Will Ma2026-05-26
🤖 machine learning

F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

यह शोधपत्र F-GRPO का प्रस्ताव करता है, जो एक कठिनाई-जागरूक (difficulty-aware) सुदृढीकरण शिक्षण विधि है जो उच्च-सफलता वाले अपडेट को कम भार देकर मानक समूह-आधारित एल्गोरिदम की सामान्य समाधानों पर ओवरफिट होने और दुर्लभ सही प्रक्षेप पथों (trajectories) की उपेक्षा करने की प्रवृत्ति को कम करती है, जिससे बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के विभिन्न बेसलाइनों में गणितीय तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gav (…)2026-05-26