💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

यह सर्वेक्षण एल्गोरिदम डिज़ाइन को MDP निर्माण, अन्वेषण और शिक्षण चरणों में वर्गीकृत करके LLMs में सुदृढीकरण अधिगम (Reinforcement Learning) के लिए एक मॉड्यूलर ढांचा प्रस्तुत करता है, जो क्रिटिक-मुक्त पॉलिसी ग्रेडिएंट्स और मोंटे कार्लो विधियों की ओर एक महत्वपूर्ण अनुसंधान पूर्वाग्रह को प्रकट करता है, जबकि वैल्यू-आधारित, ऑफ-पॉलिसी और बूटस्ट्रैपिंग तकनीकों में अनछुए अवसरों को उजागर करता है।

Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin (…)2026-06-23
💻 computer science

On the Curse of Dimensionality in Private Sparse Covariance Estimation and PCA

यह शोध पत्र यह प्रदर्शित करता है कि जबकि मानक धारणाओं के तहत विभेदक रूप से निजी (डिफरेंशियल प्राइवेट) विरल सहप्रसरण अनुमान (स्पार्स कोवेरिएंस एस्टिमेशन) और पीसीए (PCA), उनके गैर-निजी समकक्षों की तुलना में एक अंतर्निहित घातीय नमूना जटिलता अंतराल (एक्सपोनेंशियल सैंपल कॉम्प्लेक्सिटी गैप) से ग्रस्त होते हैं, इस आयामीता के अभिशाप (कर्स ऑफ डायमेंशनलिटी) को पीसीए के लिए तब दूर किया जा सकता है यदि मुख्य आइजनवेक्टर (लीडिंग आइजनवेक्टर) को भी विरल (स्पार्स) होने का माना जाए।

Syamantak Kumar, Shourya Pandey, Purnamrita Sarkar, Kevin Tian2026-06-23
💻 computer science

Learning by Shifting: Temporal View Construction for Time Series Contrastive Learning

यह शोध पत्र ShiFT को प्रस्तुत करता है, जो टाइम सीरीज़ (time series) के लिए एक सेल्फ-सुपरवाइज्ड कंट्रास्टिव लर्निंग फ्रेमवर्क है, जो जटिल, हस्तनिर्मित ऑगमेंटेशन (augmentations) को टेम्पोरल शिफ्ट इनवेरिएंस (temporal shift invariance) पर आधारित एक सरल, डिटरमिनिस्टिक व्यू कंस्ट्रक्शन से बदलकर विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Abdul-Kazeem Shamba, Kerstin Bach, Gavin Taylor2026-06-23
💻 computer science

SPOTR: Spatio-temporal Pooling One-Token Reconstruction for Universal Physiological Signal Self-supervised Learning

SPOTR एक नवीन स्व-पर्यवेक्षित शिक्षण (self-supervised learning) ढांचा है जो विविध शारीरिक संकेतों को पुनर्निर्माण के लिए एकल-टोकन प्रतिनिधित्व में संकुचित करने हेतु स्थानिक-कालिक पूलिंग (spatio-temporal pooling) का उपयोग करता है, जिससे मौजूदा विधियों की तुलना में गणना संबंधी लागतों को काफी कम करते हुए कई मोडैलिटीज में बेहतर प्रदर्शन प्राप्त होता है।

Yiyu Gui, Mingzhi Chen, Yuesheng Zhu, Guibo Luo, Yuchao Yang2026-06-23
💻 computer science

Load Testing for Machine Learning Model Serving Systems at Scale

यह शोध पत्र \sys को प्रस्तुत करता है, जो एक औद्योगिक लोड टेस्टिंग फ्रेमवर्क है जो ML सर्विंग सिस्टम के लिए GPU क्षमता को व्यवस्थित रूप से अनुमानित करने हेतु एक अनुकूली, फीडबैक-संचालित खोज रणनीति का उपयोग करता है, और 14 केस स्टडीज के माध्यम से यह प्रदर्शित करता है कि यह अनुमान त्रुटियों को कम करके और SLO उल्लंघनों को रोककर संसाधन दक्षता और परिचालन विश्वसनीयता में महत्वपूर्ण सुधार करता है।

Amr S. Abdelfattah, Nakul Tirumalai, Indu Mohanan, Xiao Li, Pengchao Wang, Dinakar Dhurjati, Eric Sung2026-06-23
💻 computer science

Channel Location Constrains the Auditability of Subliminal Learning

यह शोध पत्र यह प्रदर्शित करता है कि अवचेतन शिक्षण (subliminal learning) की ऑडिटेबिलिटी (auditability) मौलिक रूप से उस विशिष्ट "चैनल स्थान" (channel location) द्वारा निर्धारित होती है जिसके माध्यम से छिपे हुए गुणों को स्थानांतरित किया जाता है, जो यह प्रकट करता है कि इनिशियलाइज़ेशन-आधारित प्री-ट्रेनिंग स्क्रीन केवल शरीर-निर्भर गुणों के लिए प्रभावी हैं जबकि शब्दावली-ज्यामिति (vocabulary-geometry) या कंडीशनल-पॉलिसी हस्तांतरण के लिए विफल रहती हैं जिनके लिए पोस्ट-हॉक डिटेक्शन या लक्षित आर्किटेक्चरल मिटिगेशन की आवश्यकता होती है।

Tamas Madl2026-06-23
💻 computer science

Nous: A Predictive World Model for Long-Term Agent Memory

Nous एक नवीन एजेंट मेमोरी आर्किटेक्चर पेश करता है जो पारंपरिक तथ्य भंडारण को श्रेणीगत संभाव्यता वितरणों (categorical probability distributions) के एक भविष्य कहने वाले विश्व मॉडल से बदल देता है, जहाँ सूचना को विश्वास अपडेट (डेल्टा) के रूप में बनाए रखा जाता है और विस्मरण स्वाभाविक रूप से एंट्रॉपी क्षय (entropy decay) के माध्यम से होता है, जिससे बिना किसी बाहरी वेक्टर डेटाबेस या ग्राफ इंजन की आवश्यकता के दीर्घकालिक संवादात्मक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Pranav Singh2026-06-23
💻 computer science

A Completion-Aware Framework for Impactful Counterfactual Explainability in Graph Neural Networks

यह शोध पत्र तथ्यात्मक व्याख्यात्मकता (factual explainability) को लुप्त किनारा भविष्यवाणी मॉडल (missing edge prediction models) के साथ एकीकृत करके ग्राफ न्यूरल नेटवर्क में उच्च-गुणवत्ता वाले प्रतितथ्यात्मक स्पष्टीकरण (counterfactual explanations) उत्पन्न करने के लिए एक नवीन, मॉडल-अज्ञेयवादी (model-agnostic) ढांचे का प्रस्ताव करता है, जो विविध ग्राफ वर्गीकरण बेंचमार्क पर अत्याधुनिक बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Maria Myrto Villia, Filippos Gouidis, Theodore Patkos, Panos Trahanias2026-06-23
⚡ electrical engineering

Anticipating the Optimism Gap: Predicting Distribution-Shift Degradation of RF-Impairment Detectors from In-Distribution Statistics

यह शोध पत्र यह प्रदर्शित करता है कि वितरण परिवर्तनों (distribution shifts) के तहत GNSS दोष डिटेक्टरों (impairment detectors) के प्रदर्शन में गिरावट का पूर्वानुमान केवल इन-डिस्ट्रीब्यूशन सांख्यिकी से लगाया जा सकता है, जो यह प्रकट करता है कि "ऑप्टिमिज्म गैप" (optimism gap) सीखने की विधि के बजाय उपयोग किए गए अवलोकनीय तत्वों (observables) की संख्या से प्रेरित है, एक ऐसा निष्कर्ष जिसे सिंथेटिक बेंचमार्क और वास्तविक दुनिया के फील्ड डेटा दोनों पर मान्य किया गया है।

Chakshu Baweja2026-06-23
💻 computer science

Provably Efficient Policy-Reward Co-Pretraining for Adversarial Imitation Learning

यह शोध पत्र CoPT-AIL को प्रस्तुत करता है, जो एक सिद्धांत-आधारित पॉलिसी-रिवॉर्ड को-प्रीट्रेनिंग एल्गोरिदम है जो मानक प्रीट्रेनिंग दृष्टिकोणों की सीमाओं को दूर करने के लिए व्यवहार क्लोनिंग (behavioral cloning) के माध्यम से पॉलिसी और रिवॉर्ड दोनों को संयुक्त रूप से प्रीट्रेन करके एडवर्सरियल इमिटेशन लर्निंग को त्वरित करने के लिए पहला सैद्धांतिक आश्वासन प्रदान करता है।

Tian Xu, Zexuan Chen, Zhilong Zhang, Yi-Chen Li, Chenyang Wang, Lei Yuan, Yang Yu2026-06-23