🤖 machine learning

Accelerated Multiple Wasserstein Gradient Flows for Multi-objective Distributional Optimization

यह शोध पत्र A-MWGraD का प्रस्ताव करता है, जो एक त्वरित मल्टीपल वासरस्टीन ग्रेडिएंट डिसेंट एल्गोरिदम है जो वासरस्टीन स्पेस में मल्टी-ऑब्जेक्टिव डिस्ट्रीब्यूशनल ऑप्टिमाइजेशन के लिए बेहतर अभिसरण दर प्राप्त करने हेतु नेस्टरोव मोमेंटम का लाभ उठाता है, जो सैद्धांतिक गारंटियों और व्यावहारिक सैंपलिंग दक्षता दोनों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Dai Hai Nguyen, Duc Dung Nguyen, Atsuyoshi Nakamura, Hiroshi Mamitsuka2026-06-01
🤖 machine learning

From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Data-Free Online Backdoor Defense

यह शोध पत्र PRISM का प्रस्ताव करता है, जो एक नवीन डेटा-मुक्त ऑनलाइन बैकडोर डिफेंस फ्रेमवर्क है जो गतिशील प्रोटोटाइप रिफाइनमेंट और एडेप्टिव सांख्यिकीय निगरानी के साथ यूनिवर्सल विजन-लैंग्वेज मॉडल्स का लाभ उठाकर नाजुक आंतरिक मॉडल निदान से मजबूत बाहरी सिमेंटिक ऑडिटिंग की ओर स्थानांतरित होता है ताकि विविध डेटासेट्स और हमले के प्रकारों में अत्याधुनिक सुरक्षा प्राप्त की जा सके।

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang2026-06-01
📊 statistics

To Grok Grokking: Provable Grokking in Ridge Regression

यह शोध पत्र यह सिद्ध करके "ग्रोकिंग टाइम" (grokking time) पर पहले कठोर मात्रात्मक मानक प्रदान करता है कि ग्रेडिएंट डिसेंट और वेट डिके (weight decay) के साथ प्रशिक्षित ओवर-पैरामीटराइज्ड लीनियर रिग्रेशन मॉडल अनिवार्य रूप से ओवरफिटिंग से पूर्ण सामान्यीकरण (perfect generalization) की ओर संक्रमण करते हैं, जो यह प्रदर्शित करता है कि यह घटना डीप लर्निंग की एक अंतर्निहित विफलता के बजाय प्रशिक्षण स्थितियों का एक नियंत्रणीय परिणाम है।

Mingyue Xu, Gal Vardi, Itay Safran2026-06-01
💬 NLP

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data

यह शोध पत्र Gap-K% का प्रस्ताव करता है, जो एक नवीन विधि है बड़े भाषा मॉडलों (Large Language Models) में प्रीट्रेनिंग डेटा का पता लगाने के लिए, जो बेंचमार्क डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए टॉप-1 प्रेडिक्शन और टारगेट टोकन के बीच लॉग प्रोबेबिलिटी गैप को एक स्लाइडिंग विंडो रणनीति के साथ जोड़ता है।

Minseo Kwak, Jaehyung Kim2026-06-01
🔬 materials science

Global Plane Waves From Local Gaussians: Periodic Charge Densities in a Blink

यह शोध पत्र ELECTRAFI को प्रस्तुत करता है, जो एक तेज़ और अवकलनीय (differentiable) मॉडल है जो क्रिस्टलीय पदार्थों में आवधिक आवेश घनत्वों (periodic charge densities) की भविष्यवाणी करने के लिए अनिसोट्रोपिक गौसियन के क्लोज्ड-फॉर्म फूरियर ट्रांसफॉर्म का लाभ उठाता है ताकि अत्याधुनिक सटीकता के साथ 633 गुना तक तेज़ इन्फरेंस प्राप्त किया जा सके, जिससे DFT गणनाओं की कुल कम्प्यूटेशनल लागत काफी कम हो जाती है।

Jonas Elsborg, Felix Ærtebjerg, Luca Thiede, Alán Aspuru-Guzik, Tejs Vegge, Arghya Bhowmik2026-06-01
🔢 mathematics

Randomized Feasibility Methods for Constrained Optimization with Adaptive Step Sizes

यह शोध पत्र बाधाओं वाले अनुकूलन (constrained optimization) के लिए अनुकूली स्टेप साइज़ (adaptive step sizes) के साथ एक रैंडमाइज्ड फिएसिबिलिटी एल्गोरिदम प्रस्तावित करता है जो स्ट्रॉन्गली कॉनवेक्स स्मूथ ऑब्जेक्टिव्स के लिए लीनियर कन्वर्जेंस और कॉनवेक्स नॉनस्मूथ ऑब्जेक्टिव्स के लिए O(1/T)O(1/\sqrt{T}) दर प्राप्त करता है, जबकि इनफीसिबिलिटी का ज्यामितीय क्षय (geometric decay) सुनिश्चित करता है और QCQP, SVM और फेयर लॉजिस्टिक रिग्रेशन जैसी समस्याओं पर बेहतर कम्प्यूटेशनल दक्षता प्रदर्शित करता है।

Abhishek Chakraborty, Angelia Nedić2026-06-01
🤖 machine learning

When More Data Doesn't Help: Limits of Adaptation in Multitask Learning

यह शोध पत्र मल्टीटास्क लर्निंग के लिए एक अधिक सुदृढ़ असंभवता परिणाम स्थापित करता है, जो यह प्रदर्शित करता है कि प्रत्येक कार्य के लिए मनमाना विशाल डेटा होने के बावजूद, वितरण संबंधी जानकारी (distributional information) तक पहुँच के बिना इष्टतम अनुकूलन (optimal adaptation) की गारंटी नहीं दी जा सकती।

Steve Hanneke, Mingyue Xu2026-06-01
💬 NLP

SERA: Soft-Verified Efficient Repository Agents

यह शोध पत्र SERA को प्रस्तुत करता है, जो सॉफ्ट वेरीफाइड जनरेशन का उपयोग करने वाली एक लागत प्रभावी विधि है, जिसका उपयोग निजी कोडबेस के लिए विशेष रूप से प्रशिक्षित ओपन-सोर्स कोडिंग एजेंटों को सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रशिक्षित करने के लिए किया जाता है, जो सुदृढीकरण लर्निंग (reinforcement learning) या पिछले सिंथेटिक डेटा दृष्टिकोणों की तुलना में बहुत कम लागत पर अग्रणी ओपन-वेट मॉडल्स के समान प्रदर्शन प्राप्त करता है।

Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers2026-06-01
🔢 mathematics

Identifiable Equivariant Networks are Layerwise Equivariant

यह शोध पत्र यह स्थापित करता है कि पहचान योग्य (identifiable) न्यूरल नेटवर्क के लिए, कोई भी एंड-टू-एंड इक्विवैरिएंट (equivariant) फलन एक ऐसे पैरामीटर विन्यास द्वारा साकार किया जा सकता है जहाँ व्यक्तिगत परतें भी इक्विवैरिएंट होती हैं, जिससे प्रशिक्षण के दौरान इक्विवैरिएंट संरचनाओं के उद्भव के लिए एक गणितीय स्पष्टीकरण प्राप्त होता है।

Vahid Shahverdi, Giovanni Luca Marchetti, Georg Bökman, Kathlén Kohn2026-06-01
🤖 machine learning

Don't be so Stief! Learning KV Cache low-rank approximation over the Stiefel manifold

यह शोधपत्र Stiefel मैनिफोल्ड पर सीधे डिकोडर-लेयर आउटपुट पुनर्निर्माण त्रुटि न्यूनीकरण के माध्यम से ऑर्थोनॉर्मल प्रोजेक्शन बेस को सीखकर, एक पोस्ट-ट्रेनिंग KV-कैश संपीड़न विधि, StiefelAttention को प्रस्तुत करता है, जो आइसो-कंप्रेशन स्थितियों के तहत परप्लेक्सिटी और सटीकता में EigenAttention जैसे मौजूदा SVD-आधारित दृष्टिकोणों से काफी बेहतर प्रदर्शन करता है।

Luca Benfenati, Matteo Risso, Andrea Vannozzi, Ahmet Caner Yüzügüler, Lukas Cavigelli, Enrico Macii, Daniele Jahier Pagl (…)2026-06-01