🤖 machine learning

Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

यह शोध पत्र एडजॉइंट मैचिंग (adjoint matching) का लाभ उठाकर डिफ्यूजन पॉलिसीज़ को ऑनलाइन सुदृढीकरण लर्निंग (reinforcement learning) में प्रशिक्षित करने के लिए एक कुशल, सिम्युलेशन-मुक्त एल्गोरिदम पेश करता है ताकि मानक स्कोर मैचिंग की सीमाओं को दूर किया जा सके और लागतपूर्ण लाइकलीहुड एस्टीमेशन (likelihood estimation) या डिफ्यूजन प्रक्रिया के माध्यम से बैकप्रोपैगेशन की आवश्यकता को समाप्त किया जा सके।

Serge Thilges, Onur Celik, Denis Blessing, Emiliyan Gospodinov, Gerhard Neumann2026-06-23
⚡ electrical engineering

MaRS: Robust Out-of-Distribution Detection via Mahalanobis Residual Scoring

यह शोध पत्र MaRS को प्रस्तुत करता है, जो एक लेबल-मुक्त, पोस्ट-हॉक आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्टर है जो विभिन्न मेडिकल इमेजिंग मोडैलिटीज़ और डिस्ट्रीब्यूशन शिफ्ट्स के बीच बेहतर प्रदर्शन प्राप्त करने के लिए रिकंस्ट्रक्शन रेसिडुअल्स पर महालानोबिस डिस्टेंस का उपयोग करके वेरिएंस-अवेयर विचलन (variance-aware deviations) को कैप्चर करता है, जिससे यह मानक रिकंस्ट्रक्शन-आधारित विधियों की सीमाओं को दूर करता है।

Francesco Di Salvo, Sebastian Doerrich, Christian Ledig2026-06-23
💻 computer science

Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift

यह शोधपत्र प्रकट करता है कि वर्तमान प्रॉम्प्ट-इंजेक्शन डिटेक्टर, मानक बेंचमार्क पर सुव्यवस्थित दिखने के बावजूद, विस्थापित हमले के वितरण (shifted attack distributions) का सामना करते समय खतरनाक रूप से अति-आत्मविश्वासी हो जाते हैं, और संरचनात्मक विश्लेषण के बजाय कंटेंट-कीइंग (content-keying) पर निर्भरता के कारण छूटे हुए, उच्च-गंभीरता वाले हमलों को लगातार लगभग पूर्ण आत्मविश्वास स्कोर प्रदान करते हैं।

Md Anas Biswas2026-06-23
⚡ electrical engineering

LSTM Variants for Chaotic Dynamical Systems: An Empirical Study on the Lorenz Attractor

यह अनुभवजन्य अध्ययन लोरेन्ज़ अट्रैक्टर के पूर्वानुमान के लिए सात आवर्ती (recurrent) और कनवल्शनल आर्किटेक्चर का मूल्यांकन करता है, जिससे यह स्पष्ट होता है कि हबर लॉस (Huber loss) के साथ प्रशिक्षित एक द्विदिश एलएसटीएम (Bidirectional LSTM), अटेंशन मैकेनिज्म या सीएनएन फ्रंट-एंड्स वाली अन्य कॉन्फ़िगरेशन की तुलना में बेहतर प्रदर्शन करता है, क्योंकि यह अराजक व्यवस्थाओं (chaotic regimes) के प्रति बेहतर सामान्यीकरण करता है।

Ruslan Gokhman2026-06-23
🤖 machine learning

Clipping the Price of Adaptivity at the Tail

यह शोधपत्र एक ऐसी विधि प्रस्तावित करता है जो टेल इवेंट्स (tail events) में मॉडल आउटपुट्स को क्लिप करके स्टोकेस्टिक कॉनवेक्स ऑप्टिमाइज़ेशन में मौलिक "प्राइस ऑफ एडेप्टिविटी" (price of adaptivity) बाधा को दरकिनार करती है, जिससे अनुकूलता के प्रारंभिक अंतर और लिप्सचिट्ज़ स्थिरांक (Lipschitz constant) दोनों में बड़ी अनिश्चितता के बावजूद लॉगरिदमिक कारकों तक इष्टतम अभिसरण दर (optimal convergence rates) प्राप्त की जा सकती है।

Itai Kreisler, Yair Carmon, Oliver Hinder2026-06-23
💻 computer science

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

यह शोध पत्र कॉन्ट्रास्टिव लॉजिट स्टीयरिंग (CLS) प्रस्तुत करता है, जो एक ज़ीरो-ऑप्टिमाइज़ेशन फ्रेमवर्क है जो LLMs में सुरक्षा संरेखण (सेफ्टी एलाइनमेंट) को एक हेरफेर योग्य रैखिक विशेषता (लीनियर फीचर) के रूप में प्रकट करता है, जो आउटपुट वितरणों को स्टीयर करके उच्च-सफलता वाले जेलब्रेक्स और बिना पुनरप्रशिक्षण के वेक्टर इनवर्जन के माध्यम से उन्नत रक्षा दोनों को सक्षम बनाता है।

Shivam Ratnakar, Kartikeya Vats2026-06-23
💻 computer science

GARIP: A Running-Average Moving Reference for Last-Iterate Self-Play in Two-Player Zero-Sum Games

यह शोध पत्र GARIP को प्रस्तुत करता है, जो एक सेल्फ-प्ले विधि है जो पॉलिसी अपडेट को रनिंग एवरेज रेफरेंस के साथ एंकर करती है ताकि विशिष्ट रूप से रेफरेंस लैग को कम किया जा सके और स्थानीय लास्ट-इटरेट कन्वर्जेंस सुनिश्चित किया जा सके, जो विभिन्न टू-प्लेयर ज़ीरो-सम गेम्स में फिक्स्ड या स्नैपशॉट-आधारित बेसलाइन्स की तुलना में बेहतर मजबूती और स्थिरता प्रदर्शित करता है।

Can Savcı2026-06-23
🤖 machine learning

Subspace-Constrained Federated Learning with Low-Rank Adaptation

यह शोध पत्र LoRA फाइन-ट्यूनिंग के दौरान विषम क्लाइंट डेटा में ज्यामितीय मिसअलाइनमेंट (geometric misalignment) को कम करने के लिए एक सबस्पेस-रेगुलराइज्ड फेडरेटेड लर्निंग ऑब्जेक्टिव का प्रस्ताव करता है, जो RoBERTa-large और SmolLM-360M पर व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण क्लाइंट्स के बीच लगभग पूर्ण आधार ओवरलैप (near-perfect basis overlap) को लागू करके अभिसरण (convergence) और सटीकता में महत्वपूर्ण सुधार करता है।

Neranjan Senarath, Rohit Muralitharan, Sadia Asif2026-06-23
🌀 nonlinear sciences

Evolutionary Optimization Reveals Structural Constraints on Reservoir Architecture for Spatiotemporal Chaos

कुरामोटो-सिवाशिंस्की समीकरण पर विकासवादी अनुकूलन (evolutionary optimization) को लागू करके, यह अध्ययन प्रदर्शित करता है कि भविष्यवाणी सटीकता के लिए रिज़र्वोइर आर्किटेक्चर का चयन करने से व्याख्या योग्य संरचनात्मक बाधाओं—जैसे कि संरक्षित स्पेक्ट्रल लिफाफे (spectral envelopes) और मध्यवर्ती मॉडुलैरिटी—को प्रकट करता है, जो कार्य-उपयुक्त गतिशील वर्गों को स्थिर करते हैं और सरल लागत-दक्षता समझौतों के बिना उच्च प्रदर्शन प्राप्त करते हैं।

Nima Dehghani2026-06-23
🤖 machine learning

Factored Gossip DiLoCo: Reducing Blocking Communication in DiLoCo

यह शोध पत्र Factored Gossip DiLoCo को प्रस्तुत करता है, जो एक वितरित प्रशिक्षण ढांचा (distributed training framework) है जो सटीक बाहरी सिंक्रनाइज़ेशन (exact outer synchronization) को गैर-अवरोधक गॉसिप (non-blocking gossip) और अवरोधक चरणों (blocking steps) के एक ट्यूनेबल मिश्रण से बदलकर बड़े पैमाने पर कम-बैंडविड्थ सेटिंग्स में ब्लॉकिंग संचार को कम करता है, जिससे DiLoCo के तुलनीय प्रशिक्षण प्रगति को बनाए रखते हुए कंप्यूट उपयोगिता और विफलताओं के प्रति मजबूती में सुधार होता है।

Chamin Hewa Koneputugodage, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Hadi Mohaghegh Dolatabadi, Shamane Siriwardhana (…)2026-06-23