🤖 machine learning

Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning

यह शोध पत्र CFHRL प्रस्तुत करता है, जो एक पूर्णतः ऑफलाइन लक्ष्य-सशर्त सुदृढीकरण शिक्षण (goal-conditioned reinforcement learning) ढांचा है जो एक मोटे-से-सूक्ष्म (coarse-to-fine) पदानुक्रमित प्रक्रिया के माध्यम से दूरस्थ लक्ष्यों को स्थानीय रूप से निष्पादनीय उप-लक्ष्यों में अनुकूल रूप से परिष्कृत करता है, जिससे बूटस्ट्रैपिंग त्रुटियों को प्रभावी ढंग से कम किया जाता है और लंबी अवधि के कार्यों पर प्रदर्शन में सुधार होता है।

Kaiqiang Ke, Shenghong He, Chengdong Xu, Yuheng Luo, Xiangyuan Lan, Chao Yu2026-05-28
📊 statistics

Learning to Bid in Repeated Second-Price Auctions with Dynamic Values and Aggregated Feedback

यह शोध पत्र पिछले परिणामों और संचित फीडबैक पर निर्भर गतिशील मूल्यों वाले बार-बार होने वाले सेकंड-प्राइस ऑक्शन्स (second-price auctions) में बोली लगाना सीखने की चुनौती को संबोधित करता है, जो एक कॉन्फिडेंस-बाउंड एल्गोरिदम का प्रस्ताव देता है जो बिना किसी स्पष्ट रैंडमाइजेशन (randomization) के, क्रमशः पीसवाइज लीनियर (piecewise linear) और सामान्य स्मूथ प्रिमिटिव्स (general smooth primitives) के लिए O~(logN)\widetilde{O}(\log N) और O~(N1/3)\widetilde{O}(N^{1/3}) के निकट-इष्टतम रिग्रेट बाउंड्स (regret bounds) प्राप्त करता है।

Benjamin Heymann, Otmane Sakhi2026-05-28
🤖 machine learning

No Safe Dose: How Training Data Drives Unsafe Image Generation

यह शोध पत्र यह प्रदर्शित करता है कि टेक्स्ट-टू-इमेज मॉडलों में असुरक्षित आउटपुट को सीधे और निरंतर रूप से प्रशिक्षण डेटा में असुरक्षित छवियों की पूर्ण संख्या के बजाय उनकी आनुपातिकता संचालित करती है, साथ ही यह भी दिखाता है कि सुरक्षा फ़िल्टरिंग छवि की गुणवत्ता को कम किए बिना मॉडल की सुरक्षा में सुधार करती है और टेक्स्ट एनकोडर भी अवशिष्ट जोखिम में महत्वपूर्ण योगदान देता है।

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting2026-05-28
🤖 machine learning

Self-Consistency via Marginal Sharpening

यह शोध पत्र "सेल्फ-कंसिस्टेंसी वाया मार्जिनल शार्पनिंग" प्रस्तावित करता है, जो एक कुशल इन्फरेंस-टाइम सैंपलिंग एल्गोरिदम है जो पूर्ण आउटपुट पूर्णताओं के बजाय उत्तर मार्जिनल्स पर एक शार्पेंड वितरण को लक्षित करके तर्क प्रदर्शन में सुधार करता है, जिससे गणित और कोडिंग बेंचमार्क पर काफी कम कम्प्यूटेशनल लागत के साथ मानक पावर सैंपलिंग से बेहतर प्रदर्शन करता है।

Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin2026-05-28
🤖 machine learning

Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations

यह शोध पत्र साइन-अवेयर गेटेड स्पार्स ऑटोएनकोडर (SA-GSAE) को प्रस्तुत करता है, जो एक नवीन Bi-Jump-ReLU एक्टिवेशन और टू-साइडेड गेटिंग का उपयोग करता है ताकि साझा लेटेंट्स के भीतर एंटीकोरिलेटेड फीचर्स को कुशलतापूर्वक मॉडल किया जा सके, जिससे विभिन्न LLM आर्किटेक्चर में मानक नॉन-नेगेटिव SAEs की तुलना में डेड न्यूरॉन्स को काफी कम किया जा सके और पुनर्निर्माण प्रदर्शन में सुधार किया जा सके।

Bartosz Wieciech, Zmnako Awrahman, Marcin Czelej, Victor Hugo Jaramillo Velasquez, Wioletta Stobieniecka2026-05-28
🤖 machine learning

Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

यह शोध पत्र तर्क देता है कि एलएलएम (LLM) के लिए बड़े पैमाने पर सुदृढीकरण शिक्षण (reinforcement learning) में ऑफ-पॉलिसी लर्निंग की सफलता एक अंतर्निहित निराशावाद (implicit pessimism) से उत्पन्न होती है जो अधिक रूढ़िवादी लक्ष्य नीतियों (target policies) के लिए अनुकूलित करती है, और यह बेहतर प्रदर्शन के लिए इस प्रेरित वितरण को स्थिर करने हेतु एक सिद्धांत-आधारित संशोधन का प्रस्ताव करता है।

Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali, Flavian Vasile2026-05-28
🤖 machine learning

Temporal Hyperbolic Graph Representation Learning for Scale-Free Internet Routing and Delay Prediction

यह शोध पत्र HERMIT का प्रस्ताव करता है, जो एक हाइब्रिड फ्रेमवर्क है जो स्केल-फ्री इंटरनेट टोपोलॉजी को प्रभावी ढंग से मॉडल करने और मौजूदा यूक्लिडियन (Euclidean) और हाइपरबोलिक (hyperbolic) बेसलाइनों की तुलना में राउंड-ट्रिप टाइम (round-trip time) भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार करने के लिए हाइपरबोलिक टेम्पोरल ग्राफ न्यूरल नेटवर्क को रैंडम फॉरेस्ट रिग्रेशन (Random Forest regression) के साथ जोड़ता है।

Yi-Ling Kuo, Hao-Yu Tien, Shih-Yu Tsai2026-05-28
🤖 machine learning

Unification and Optimization of Robust Supervised Learning

यह शोध पत्र एक एकीकृत ढांचे का प्रस्ताव करता है जो तीन डिज़ाइन अक्षों के माध्यम से विविध सुदृढ़ पर्यवेक्षित शिक्षण विधियों को एक क्रमिक प्रशिक्षण प्रक्रिया में व्यवस्थित करता है, जिससे अभ्यासकर्ताओं के लिए विभिन्न बेंचमार्क में अज्ञात विफलता मोड के लिए सुदृढ़ता रणनीतियों को स्वचालित रूप से अनुकूलित और संयोजित करना सक्षम हो जाता है।

Jonas Hanselle, Valentin Margraf, Clemens Damke, Eyke Hüllermeier2026-05-28
🤖 machine learning

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

यह शोध पत्र ऑप्टिमल कोएफिशिएंट कैलिब्रेशन (OCC) का प्रस्ताव करता है, जो ग्रेडिएंट इंटरैक्शन के अनुकूलन विश्लेषण से व्युत्पन्न एक अनुकूली योजना है, ताकि मल्टी-टोकन प्रेडिक्शन और वेरीफिएबल रिवार्ड्स से सुदृढ़ीकरण लर्निंग (RLVR) के प्रभावी संयुक्त प्रशिक्षण को सक्षम बनाया जा सके, जिससे पिछले प्रदर्शन ह्रास को दूर किया जा सके और गणितीय तर्क संबंधी बेंचमार्क पर बेहतर परिणाम प्राप्त किए जा सकें।

Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin2026-05-28
🤖 machine learning

Hierarchical Synthetic Tabular Data Generation: A Hybrid Top-Down and Bottom-Up Framework

यह शोध पत्र एक पदानुक्रमित हाइब्रिड टॉप-डाउन और बॉटम-अप (H-TDBU) ढांचे का प्रस्ताव करता है जो मौजूदा विशुद्ध रूप से जनरेटिव या LLM-आधारित दृष्टिकोणों की तुलना में बेहतर तार्किक निरंतरता, दुर्लभ-घटना कवरेज और सांख्यिकीय निष्ठा के साथ सिंथेटिक सारणीबद्ध डेटा उत्पन्न करने के लिए सिमेंटिक संरचनाओं को स्टोकेस्टिक बनावट (stochastic textures) से अलग करता है।

Junfeng Nie, Alvin Jin, Xiaohui Chen2026-05-28