🤖 machine learning

When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures

यह शोध पत्र तीन 1B-श्रेणी के भाषा मॉडलों में अटेंशन सर्किट के विकासात्मक प्रक्षेपवक्रों (developmental trajectories) का पता लगाता है, जो यह प्रकट करता है कि इंडक्शन सर्किट और अटेंशन सिंक का निर्माण एक एकल घटना के बजाय अलग-अलग, समयबद्ध रूप से पृथक संक्रमण हैं, और विशिष्ट सर्किट क्षमताओं को अंतिम मॉडल की आवश्यकता के बिना प्रशिक्षण के शुरुआती चरणों में ही पहचाना जा सकता है।

Yongzhong Xu2026-06-02
🧬 biology

How Optimality Structures Sparse Dictionaries: A Theory for Understanding SAE Representations

यह शोध पत्र विशिष्ट डेटा-जनरेटिंग मॉडलों पर निर्भर किए बिना इष्टतम डिक्शनरी फीचर्स (optimal dictionary features) पर बाधाओं को व्युत्पन्न करके स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders) को समझने के लिए एक सैद्धांतिक ढांचा स्थापित करता है, जिससे पदानुक्रमित विभाजन (hierarchical splitting) और सघन प्रतिपक्षी विशेषताओं (dense antipodal features) जैसी देखी गई घटनाओं को L1 रेगुलराइजेशन और गैर-नकारात्मकता (non-negativity) के स्वाभाविक परिणामों के रूप में समझाया जा सकता है।

William Dorrell2026-06-02
💬 NLP

A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

यह शोध पत्र एक स्थानीय विक्षोभ सिद्धांत (local perturbation theory) प्रस्तावित करता है जो यह स्पष्ट करता है कि मल्टी-डोमेन आरएल (multi-domain RL) में क्रॉस-डोमेन हस्तक्षेप एक निम्न-आयामी साझा संघर्ष उप-स्थान (low-dimensional shared conflict subspace) के भीतर द्वितीय-क्रम की क्षति (second-order damage) से उत्पन्न होता है, जो यह प्रदर्शित करता है कि लक्षित डोमेन रिफ्रेश या प्रशिक्षण-मुक्त रोलबैक अन्य क्षमताओं को संरक्षित करते हुए निम्नीकृत प्रदर्शन को चुनिंदा रूप से पुनः प्राप्त कर सकते हैं।

Lei Yang, Siyu Ding, Deyi Xiong2026-06-02
💬 NLP

Investigating and Alleviating Harm Amplification in LLM Interactions

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में मल्टी-टर्न हार्म एम्प्लीफिकेशन (बहु-चरण हानिकारक वृद्धि) के मूल्यांकन के लिए एक बेंचमार्क के रूप में HarmAmp पेश करता है, और TrajSafe का प्रस्ताव देता है जो एक सक्रिय निगरानी प्रणाली है जो हानिकारक प्रक्षेप पथों (harmful trajectories) का पूर्वानुमान लगाकर और मॉडल की उपयोगिता से समझौता किए बिना हस्तक्षेप करके इन जोखिमों को प्रभावी ढंग से कम करती है।

Ruohao Guo, Wei Xu, Alan Ritter2026-06-02
💬 NLP

ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning

यह शोध पत्र ODTQA-FoRe को प्रस्तुत करता है, जो रियल एस्टेट डेटा का उपयोग करके भविष्य के डेटा पूर्वानुमान और तर्क पर केंद्रित पहला ओपन-डोमेन टेबुलर क्वेश्चन अनस्वर्सिंग डेटासेट है, साथ ही इसमें TimeFore भी शामिल है, जो एक LLM एजेंट फ्रेमवर्क है जो भविष्य-उन्मुख संख्यात्मक भविष्यवाणियों को संभालने में वर्तमान मॉडलों की सीमाओं को दूर करने के लिए डेटा रिट्रीवल, बाहरी टाइम-सीरीज फोरकास्टिंग और विश्लेषणात्मक संश्लेषण को एकीकृत करता है।

Zhensheng Wang, Xiaole Liu, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia2026-06-02
🔬 materials science

Speculative Sampling For Faster Molecular Dynamics

यह शोध पत्र लैंगिवियन स्पेक्युलेटिव डायनेमिक्स (LSD) को प्रस्तुत करता है, जो एक वितरित और मॉडल-अज्ञेय (model-agnostic) स्पेक्युलेटिव सैंपलिंग विधि है जो एक तेज़ ड्राफ्ट मॉडल और समानांतर सत्यापन का उपयोग करके आणविक गतिशीलता (molecular dynamics) सिमुलेशन को 3–9x तक त्वरित करता है, बिना किसी सापेक्ष त्रुटि को पेश किए या लक्षित मॉडल के वितरण की सटीकता से समझौता किए।

Arthur Kosmala, Stephan Günnemann, Meng Gao, Brandon Wood2026-06-02
🔢 mathematics

Physics-Informed Residuals for Adaptive Mesh Refinement in Finite-Difference PDE Solvers

यह शोध पत्र एक ऐसी हाइब्रिड रणनीति का प्रस्ताव और मूल्यांकन करता है जो शास्त्रीय परिमित-अंतर (फाइनाइट-डिफरेंस) सॉल्वर के लिए एडेप्टिव मेश रिफाइनमेंट को निर्देशित करने हेतु एक ऑफ-ग्रिड रेसिडुअल प्रोब के रूप में भौतिकी-सूचित तंत्रिका नेटवर्क (फिजिक्स-इन्फॉर्म्ड न्यूरल नेटवर्क) का उपयोग करती है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण पारंपरिक संख्यात्मक विधियों की विश्वसनीयता को बनाए रखते हुए समान रिफाइनमेंट की तुलना में समाधान की सटीकता और दक्षता में महत्वपूर्ण सुधार कर सकता है।

Henry Kasumba, Ronald Katende2026-06-02
🤖 AI

Iteris: Agentic Research Loops for Computational Mathematics

यह शोध पत्र इटेरिस (Iteris) को प्रस्तुत करता है, जो कम्प्यूटेशनल गणित की खुली समस्याओं के लिए डिज़ाइन किया गया एक एजेंटिक एआई (agentic AI) सिस्टम है, जिसने सफलतापूर्वक दो जटिल शोध चुनौतियों के लिए संख्यात्मक साक्ष्य, निर्माण और प्रमाण के प्रारूप तैयार किए जिन्हें बाद में मानव विशेषज्ञों द्वारा सत्यापित किया गया।

Leheng Chen, Zihao Liu, Wanyi He, Bin Dong2026-06-02
🤖 machine learning

Expressivity of congruence-based architectures for DNNs on positive-definite matrices

यह शोध पत्र यह प्रदर्शित करता है कि सममित धनात्मक-निश्चित (symmetric positive-definite) मैट्रिसेस के लिए न्यूरल नेटवर्क में कॉंग्रुएंस-समान (congruence-like) परतों पर अर्ध-ऑर्थोगोनैलिटी (semi-orthogonality) बाधाएं लगाने से स्पेक्ट्रल विविधता की हानि और आर्किटेक्चर का एक एकल छिपी हुई परत (single hidden layer) में सिमट जाना जैसे कारणों से उनकी अभिव्यक्ति क्षमता (expressivity) गंभीर रूप से सीमित हो जाती है, और साथ ही यह परिणामी फीचर मैप्स के साथ विभिन्न रीमैनियन क्लासिफायर (Riemannian classifiers) की अनुकूलता का भी मूल्यांकन करता है।

Antonin Oswald, Estelle Massart2026-06-02
🤖 machine learning

Drifting Preference Optimization for One-Step Generative Models

यह शोध पत्र ड्रिफ्टिंग प्रेफरेंस ऑप्टिमाइज़ेशन (DrPO) का प्रस्ताव करता है, जो एक ऑनलाइन फाइनट्यूनिंग विधि है जो गैर-डिफरेंशिएबल रिवॉर्ड्स का उपयोग करके डिटर्मिनिस्टिक टेक्स्ट-टू-इमेज जनरेटर्स के कुशल, सिंगल-स्टेप अलाइनमेंट को सक्षम बनाता है, जो रिवॉर्ड-मॉडल बैकप्रोपैगेशन की आवश्यकता के बिना रैंक किए गए सैंपल्स से फीचर-स्पेस अपडेट दिशाओं को संश्लेषित करता है।

Zhou Jiang, Yandong Wen, Zhen Liu2026-06-02