📊 statistics

Optimizer Memory Makes Shuffle Order a First-Order Source of Fine-Tuning Noise

यह शोध पत्र प्रकट करता है कि AdamW जैसे एल्गोरिदम में फिक्स्ड-क्लॉक ऑप्टिमाइज़र मेमोरी, शफल ऑर्डर (shuffle order) को एक नगण्य द्वितीय-क्रम के प्रभाव से बदलकर फाइन-ट्यूनिंग शोर (fine-tuning noise) के एक प्रमुख प्रथम-क्रम के स्रोत के रूप में ऊपर उठा देती है, जिससे इस परिवर्तनशीलता के सटीक और फिट-मुक्त परिमाणीकरण को सक्षम बनाया जा सके ताकि A/B तुलनाओं की विश्वसनीयता में सुधार किया जा सके।

John Sweeney2026-06-30
🤖 machine learning

Bilevel Optimization for Neural Architecture Search

यह शोध पत्र बाइलेवल ऑप्टिमाइज़ेशन (bilevel optimization) के दृष्टिकोण से न्यूरल आर्किटेक्चर सर्च (NAS) का एक संरचित अवलोकन प्रस्तुत करता है, जो मौजूदा विधियों को सैंपलिंग-आधारित और सिद्धांत-आधारित दृष्टिकोणों में वर्गीकृत करता है और एक नवीन सहायक गणितीय प्रोग्रामिंग ढांचे की वकालत करता है जो पारंपरिक सैंपलिंग विधियों की तुलना में बेहतर सटीकता और दक्षता प्राप्त करने के लिए सेकंड-ऑर्डर जानकारी का लाभ उठाता है।

Abhishek Shukla, Ankur Sinha, Faiz Hamid2026-06-30
🔬 materials science

Geometric Algebra Meets Cartesian Tensors: Higher-Order Equivariance for Interatomic Potentials

यह शोध पत्र CliffordSTF प्रस्तुत करता है, जो एक नवीन अंतर-परमाणु विभव (interatomic potential) है जो मल्टीवेक्टर्स को सममित-ट्रेसलेस टेंसर ट्रैक्स (symmetric-traceless tensor tracks) के साथ युग्मित करके मानक Cl(3,0)\mathrm{Cl}(3,0) ज्यामितीय बीजगणित मॉडलों की दिशात्मक अशुद्धि पर विजय प्राप्त करता है, जिससे क्लेबश-गोर्डन गुणांकों (Clebsch–Gordan coefficients) या विग्नर-DD मैट्रिसेस (Wigner-DD matrices) पर निर्भर किए बिना आणविक और उत्प्रेरक बेंचमार्क में बल दिशा और ऊर्जा भविष्यवाणी में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban2026-06-30
🔬 atomic physics

STEMGym: Benchmarking Sequential Decision-Making under Dose Budgets in Autonomous Electron Microscopy

यह शोध पत्र STEMGym प्रस्तुत करता है, जो यह प्रदर्शित करता है कि स्वायत्त स्कैनिंग ट्रांसमिशन इलेक्ट्रॉन माइक्रोस्कोपी में, उन्नत अनुकूली नेविगेशन रणनीतियों को अपनाने के बजाय धारणा पाइपलाइन (perception pipeline) को अनुकूलित करने से काफी अधिक डोज़ दक्षता प्राप्त होती है, जिससे यह पुनर्परिभाषित होता है कि मशीन लर्निंग प्रयासों को प्राथमिकता कहाँ दी जानी चाहिए।

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban2026-06-30
📊 statistics

How AI settled the complexity of the oldest SGD algorithm

यह शोध पत्र इस बात का विवरण देता है कि कैसे आधुनिक एआई मॉडलों का उपयोग अंततः स्टिफन काज़मार्स द्वारा 1937 में प्रस्तावित एक मौलिक स्टोकेस्टिक ग्रेडिएंट डिसेंट पद्धति, काज़मार्स एल्गोरिदम की वर्स्ट-केस जटिलता (worst-case complexity) को निर्धारित करने के लिए किया गया था।

Michał Dereziński, Xiaoyu Dong2026-06-30
🤖 machine learning

Mechanistically Eliciting Latent Behaviors in Language Models

यह शोध पत्र कॉज़ल पर्टर्बेटिव एलिसिटेशन (CPE) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised), डेटा-कुशल विधि है जो विविध लेटेंट व्यवहारों (latent behaviors) को उजागर करने में सक्षम व्याख्या योग्य लो-रैंक एडेप्टर्स (low-rank adapters) की खोज के लिए टेंसर डिकंपोजिशन का उपयोग करता है, जिसमें जटिल तर्क और सैंडबैगिंग (sandbagging) या अलाइनमेंट-फेकिंग (alignment-faking) जैसे छिपे हुए विफलता मोड शामिल हैं, जिससे यह एआई सुरक्षा मूल्यांकन और अलाइनमेंट के लिए एक शक्तिशाली उपकरण प्रदान करता है।

Andrew Mack, Nina Panickssery, Alexander Matt Turner2026-06-30
🤖 machine learning

Does Role Specialization Matter for Explanation Faithfulness in Mixture-of-Experts?

यह शोध पत्र यह प्रदर्शित करता है कि जबकि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर में संरचनात्मक भूमिका अपघटन (structural role decomposition) निष्ठापूर्ण स्पष्टीकरण की गारंटी नहीं देता है, विशेषज्ञों के बीच ओवरलैप को कम करने के लिए प्रतिनिधित्व-स्तर के डिकोरिलेशन नियमितीकरण (representation-level decorrelation regularization) को पेश करने से कार्य प्रदर्शन से समझौता किए बिना मल्टीमॉडल बेंचमार्क में स्पष्टीकरण की निष्ठा में महत्वपूर्ण सुधार होता है।

Yeji Kim, Housam Babiker, Mi-Young Kim, Randy Goebel2026-06-30
⚛️ quantum physics

Lie Group Diffusion Models for Hardware-Aware Quantum Circuit Synthesis

यह शोध पत्र एक हार्डवेयर-जागरूक क्वांटम सर्किट संश्लेषण ढांचे को प्रस्तुत करता है जो उच्च-सटीक, बाधा-अनुपालन क्वांटम सर्किट उत्पन्न करने के लिए एक डिस्क्रीट सर्किट स्केलेटन सेलेक्टर को SU(2)SU(2) मैनिफोल्ड पर एक निरंतर ली ग्रुप डिफ्यूजन मॉडल के साथ जोड़ता है, जो मौजूदा बेसलाइन से बेहतर प्रदर्शन करते हैं।

Jyotirmai Singh2026-06-30
🤖 machine learning

t-STEP: An interpretable model for Total Electron Content predictions and irregularities estimations

यह शोध पत्र t-STEP को प्रस्तुत करता है, जो एक व्याख्यात्मक मशीन लर्निंग मॉडल है जो आयनमंडलीय अनियमितताओं को सटीक रूप से पकड़ने के लिए 30-सेकंड के रिज़ॉल्यूशन पर कुल इलेक्ट्रॉन सामग्री (Total Electron Content) की भविष्यवाणी करता है और विशेष रूप से भू-चुंबकीय तूफानों के दौरान IRI-2020 और अटेंशन-आधारित LSTM जैसे मौजूदा बेंचमार्क से बेहतर प्रदर्शन करता है।

Stephen Tete, Carl Shneider, Maxime Cordy, Claudio Cesaroni, Andreas Hein, Vasily Petrov2026-06-30
🤖 machine learning

Fuzzing Large Language Models to Elicit Hidden Behaviours

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में छिपे हुए "स्लीपर एजेंट" व्यवहारों को उजागर करने के लिए वेट्स (weights) या एक्टिवेशन्स (activations) में शोर (noise) इंजेक्ट करके एक व्यवस्थित फज़िंग दृष्टिकोण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह टेम्परेचर सैंपलिंग से बेहतर प्रदर्शन करता है और एक सस्ते प्रॉक्सी कार्य के माध्यम से हाइपरपैरामीटर चयन, यूनिफॉर्म स्वीप की तुलना में इलिकिटेशन रेट (elicitation rates) में महत्वपूर्ण सुधार करता है।

Mohammed Abu Baker, Lakshmi Babu-Saheer2026-06-30