🔢 mathematics

Solving the Offline and Online Min-Max Problem of Non-smooth Submodular-Concave Functions: A Zeroth-Order Approach

यह शोधपत्र एक ज़ीरो-ऑर्डर एल्गोरिदम का प्रस्ताव और विश्लेषण करता है जो सबमॉड्यूलर-कॉन्केव (submodular-concave) फलनों से जुड़ी नॉन-स्मूथ मिन-मैक्स समस्याओं को हल करने के लिए लोवाज़ एक्सटेंशन (Lovász extension) सबग्रेडिएंट्स और गॉसियन स्मूथिंग (Gaussian smoothing) को संयोजित करता है, जो ऑफलाइन सेटिंग में ϵ\epsilon-सैडल पॉइंट (saddle point) की अभिसरण (convergence) को सिद्ध करता है और O(NPˉN)O(\sqrt{N\bar{P}_N}) ऑनलाइन डुअलिटी गैप बाउंड स्थापित करता है।

Amir Ali Farzin, Yuen-Man Pun, Philipp Braun, Tyler Summers, Iman Shames2026-05-29
🤖 machine learning

Representation Unlearning: Forgetting through Information Compression

यह शोध पत्र 'रिप्रेजेंटेशन अनलर्निंग' (Representation Unlearning) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्रतिनिधित्व स्थान (representation space) में एक रूपांतरण सीखकर कुशल और विश्वसनीय मशीन अनलर्निंग प्राप्त करता है ताकि रिटेंड डेटा (retained data) के लिए उपयोगिता को संरक्षित करते हुए फॉरगॉटन डेटा (forgotten data) के बारे में जानकारी को संकुचित किया जा सके, जो पारंपरिक पैरामीटर संशोधन विधियों की तुलना में एक अधिक स्थिर और गणनात्मक रूप से कुशल विकल्प प्रदान करता है।

Antonio Almudévar, Alfonso Ortega2026-05-29
🤖 machine learning

Bridging Functional and Representational Similarity via Usable Information

यह शोध पत्र एक एकीकृत रूपरेखा प्रस्तुत करता है जो उपयोगी सूचना के दृष्टिकोण से प्रतिनिधित्व समानता को परिमाणित करता है, स्टिचिंग प्रदर्शन और सशर्त पारस्परिक सूचना के बीच औपचारिक संबंध स्थापित करता है और यह प्रदर्शित करता है कि प्रतिनिधित्व समानता भविष्य कहने वाली क्षमता के सापेक्ष होती है और कार्यात्मक समानता के लिए पर्याप्त है लेकिन आवश्यक नहीं है।

Antonio Almudévar, Alfonso Ortega2026-05-29
🤖 machine learning

Procedural Pretraining: Warming Up Language Models with Abstract Data

यह शोध पत्र यह प्रदर्शित करता है कि "प्रक्रियात्मक प्रीट्रेनिंग" (procedural pretraining), जिसमें भाषा मॉडलों को औपचारिक भाषाओं और एल्गोरिदम द्वारा उत्पन्न अमूर्त संरचित डेटा के एक छोटे अंश के संपर्क में शुरू में लाया जाता है, मानक प्राकृतिक भाषा प्रीट्रेनिंग की तुलना में उनकी तर्क करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, अभिसरण (convergence) को तेज करता है, और कम्प्यूटेशनल लागत को कम करता है।

Liangze Jiang, Zachary Shinnick, Anton van den Hengel, Hemanth Saratchandran, Damien Teney2026-05-29
🤖 machine learning

Learn from A Rationalist: Distilling Intermediate Interpretable Rationales

यह शोध पत्र REKD का प्रस्ताव करता है, जो एक ज्ञान आसवन (knowledge distillation) ढांचा है जो अधिक सक्षम शिक्षक मॉडल के तर्क (rationales) और भविष्यवाणियों से सीखने के लिए छोटे छात्र नेटवर्क को प्रशिक्षित करके तर्क निष्कर्षण (rationale extraction) मॉडलों के भविष्य कहनेवाला प्रदर्शन और व्याख्यात्मकता को बढ़ाता है, जिससे रिमोट सुपरविजन के तहत फीचर उपसमुच्चयों (feature subsets) को सीखने की कम्प्यूटेशनल चुनौतियों पर विजय प्राप्त होती है।

Jiayi Dai, Randy Goebel2026-05-29
🤖 machine learning

Unsupervised Hierarchical Skill Discovery

यह शोध पत्र माइनक्राफ्ट (Minecraft) जैसे उच्च-आयामी वातावरणों में प्रक्षेप पथों (trajectories) को विभाजित करने और पदानुक्रमित कौशल संरचनाओं (hierarchical skill structures) की खोज करने के लिए एक व्याकरण-आधारित अनसुपरवाइज्ड विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि परिणामी अर्थपूर्ण पदानुक्रम मौजूदा बेसलाइनों से बेहतर प्रदर्शन करते हैं और डाउनस्ट्रीम सुदृढीकरण शिक्षण (reinforcement learning) को त्वरित करते हैं।

Damion Harvey, Geraud Nangue Tasse, Benjamin Rosman, Branden Ingram, Steven James2026-05-29
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

यह शोध पत्र PEAR को पेश करता है, जो एक SFT-चरण की विधि है जो ऑफलाइन डेटा और भविष्य की RL नीतियों के बीच बेमेल (mismatch) के आधार पर प्रशिक्षण नुकसान (training losses) को पुन: भारित (reweight) करने के लिए इम्पॉर्टेंस सैंपलिंग का उपयोग करती है, जिससे मानक SFT की तुलना में रीजनिंग कार्यों पर डाउनस्ट्रीम सुदृढीकरण शिक्षण (reinforcement learning) प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng2026-05-29
🔬 condensed matter

Rare Event Analysis of Large Language Models

यह शोधपत्र लार्ज लैंग्वेज मॉडल्स में दुर्लभ लेकिन महत्वपूर्ण घटनाओं के व्यवस्थित विश्लेषण के लिए एक एंड-टू-एंड फ्रेमवर्क प्रस्तुत करता है, जो मॉडल्स के विशाल पैमाने और संभाव्य प्रकृति से उत्पन्न चुनौतियों का समाधान करने के लिए उनके सृजन, प्रायिकता अनुमान और त्रुटि विश्लेषण हेतु व्यावहारिक उपकरण प्रदान करता है।

Jake McAllister Dorman, Edward Gillman, Dominic C. Rose, Jamie F. Mair, Juan P. Garrahan2026-05-29
🤖 machine learning

Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation

यह शोध पत्र एक ग्रेडिएंट प्रीकंडीशनिंग विधि प्रस्तावित करता है जो एक-चरणीय जनरेटिव मॉडलों के लिए कुशल, विश्वसनीय और हैक-मुक्त टेस्ट-टाइम ऑप्टिमाइज़ेशन को सक्षम करने हेतु रिवॉर्ड ग्रेडिएंट्स को व्हाइट गौसियन नॉइज़ फजीबल सेट पर प्रोजेक्ट करता है, जिससे काफी कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jisung Hwang, Minhyuk Sung2026-05-29
📊 statistics

Coarse-Grained Boltzmann Generators

यह शोध पत्र कोर्स-ग्रेन्ड बोल्ट्ज़मैन जनरेटर्स (CG-BGs) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो फ्लो-आधारित जनरेटिव मॉडल्स को सीखे गए पोटेंशियल ऑफ मीन फोर्स के साथ जोड़ता है ताकि कम किए गए कोर्स-ग्रेन्ड कोऑर्डिनेट स्पेस में बड़े आणविक सिस्टम के कुशल, एसिम्प्टोटिक रूप से सही इक्विलिब्रियम सैंपलिंग को सक्षम बनाया जा सके।

Weilong Chen, Bojun Zhao, Jan Eckwert, Julija Zavadlav2026-05-29