🤖 machine learning

Prism Transformer: Progressive Head Schedules for Hierarchical Attention Processing

प्रिज्म ट्रांसफार्मर एक पैरामीटर- और कंप्यूट-न्यूट्रल वास्तुशिल्प प्रतिमान पेश करता है जो मानक समान हेड आवंटन के स्थान पर एक प्रगतिशील हेड शेड्यूल को प्रतिस्थापित करता है, जिससे एक स्थानीय-से-वैश्विक प्रतिनिधित्व पदानुक्रम स्थापित होता है जो कई मॉडल स्केल्स और बेंचमार्क में लगातार प्रदर्शन में सुधार करता है।

Shubham Aggarwal2026-06-29
📊 statistics

Directed Graph Topology Inference via Graph Filter Identification

यह शोध पत्र लीनियर डिफ्यूजन डायनेमिक्स द्वारा उत्पन्न नोडल मापों से निर्देशित ग्राफ टोपोलॉजी (directed graph topologies) का अनुमान लगाने के लिए एक नवीन रूपरेखा प्रस्तावित करता है, जो पहले द्विघातीय आव्यूह समीकरणों (quadratic matrix equations) के माध्यम से एक ग्राफ कनवल्शनल फ़िल्टर की पहचान करता है और फिर उस स्पार्स ग्राफ-शिफ्ट ऑपरेटर को पुनर्प्राप्त करता है जो फ़िल्टर के साथ कम्यूट (commute) करता है, एक ऐसी विधि जिसे सिंथेटिक और वास्तविक दुनिया के डेटासेट दोनों पर मान्य किया गया है।

Rasoul Shafipour, Andrei Buciulea, Santiago Segarra, Antonio G. Marques, Gonzalo Mateos2026-06-29
💬 NLP

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

यह शोध पत्र LLM एजेंटों में एक विशिष्ट "मेमोरी-अपडेट गैप" (स्मृति-अद्यतन अंतराल) की पहचान करता है जहाँ मॉडल के पैमाने की परवाह किए बिना, जैसे-जैसे बातचीत की लंबाई बढ़ती है, तथ्य-प्रतिस्थापन (fact-supersession) कार्यों पर प्रदर्शन काफी कम हो जाता है, और यह प्रदर्शित करता है कि 'सुपरसीड' (Supersede) नामक एक नए पेश किए गए प्रशिक्षण वातावरण में सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से इस अंतराल को प्रभावी ढंग से कम किया जा सकता है।

Vedant Patel2026-06-29
⚛️ lattice

Sampling the Schwinger Model with Gauge-Equivariant Diffusion

यह शोध पत्र एक प्रथम अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि एक U(1)-इक्विवेरिएंट स्कोर-आधारित डिफ्यूजन मॉडल Nf=2N_f = 2 लैटिस श्विंगर मॉडल के लिए गेज लिंक कॉन्फ़िगरेशन को प्रभावी ढंग से सैंपल कर सकता है, जिससे क्रिटिकल पैरामीटर्स के पास टोपोलॉजिकल फ्रीजिंग को कम करते हुए MCMC के तुलनीय अनबायस्ड ऑब्जर्वेबल्स प्राप्त होते हैं।

Octavio Vega, Aida X. El-Khadra2026-06-29
🤖 machine learning

The Curse of Multiple Mediators: Hidden Interaction Effects in Activation Patching

यह शोध पत्र प्रकट करता है कि मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) में एक्टिवेशन पैचिंग अनुमान स्वाभाविक रूप से प्राकृतिक अप्रत्यक्ष प्रभावों को अन्य घटकों की अवस्थाओं पर निर्भर अंतःक्रिया प्रभावों के साथ मिला देते हैं, और यह तर्क देता है कि इस अंतःक्रिया को समाप्त करने के बजाय, शोधकर्ताओं को प्रॉम्प्ट-निर्भर कारण तंत्रों और लालची घटक रैंकिंग (greedy component ranking) की सीमाओं की पहचान करने के लिए एक नैदानिक उपकरण के रूप में इसका लाभ उठाना चाहिए।

Sankaran Vaidyanathan, David Arbour, Aaron Mueller, Scott Niekum, David Jensen2026-06-29
🤖 machine learning

Boundary condition fidelity for bottom-hole pressure and CO2 plume prediction in geological carbon storage

यह अध्ययन प्रदर्शित करता है कि ट्रंकेटेड-डोमेन सिमुलेशन में कॉर्नर पोर वॉल्यूम को सटीक रूप से संरक्षित करना और क्रमिक ट्रांसमिसिबिलिटी संशोधक लागू करना, होमोजेनियस और हेटेरोजेनियस दोनों भूगर्भीय कार्बन भंडारण जलाशयों में बॉटम-होल प्रेशर त्रुटियों को कम करने और CO2 प्लूम भविष्यवाणी की निष्ठा को अधिकतम करने के लिए महत्वपूर्ण है।

Romal Ramadhan, Seyyed A. Hosseini, Larry W. Lake2026-06-29
🤖 AI

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

मौजूदा सोशल मीडिया लोकप्रियता भविष्यवाणी अनुसंधान में विखंडन को संबोधित करने के लिए, यह शोध पत्र MMG-Pop पेश करता है, जो मानकीकृत मूल्यांकन प्रोटोकॉल के साथ एक एकीकृत बेंचमार्क है, और MMG-PopNet का प्रस्ताव करता है, जो एक मल्टी-मोडल ग्राफ-आधारित नेटवर्क है जो पाठ्य, दृश्य, टेम्पोरल और इंटरेक्शन संकेतों को संयुक्त रूप से मॉडल करके विविध डेटासेट और प्लेटफार्मों पर बेहतर प्रदर्शन प्रदर्शित करता है।

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang2026-06-29
💬 NLP

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP एक प्रशिक्षण-मुक्त (training-free) शेड्यूलर है जो आउटपुट गुणवत्ता बनाए रखते हुए इन्फरेंस थ्रूपुट को अधिकतम करने के लिए स्थानीय जनरेशन एंट्रॉपी के आधार पर मल्टी-टोकन प्रेडिक्शन डेप्थ को गतिशील रूप से समायोजित करता है, जिससे मौजूदा बेसलाइनों की तुलना में 1.36x तक की गति वृद्धि प्राप्त होती है।

Carrie Chen2026-06-29
🤖 machine learning

Quantum Generative Diffusion Model for Real-World Time Series

यह शोध पत्र QDiffusion-TS को प्रस्तुत करता है, जो एक IQM क्वांटम प्रोसेसर पर कार्यान्वित एक हाइब्रिड क्वांटम-क्लासिकल जनरेटिव डिफ्यूजन मॉडल है, जो वित्तीय टाइम सीरीज़ (financial time series) के संश्लेषण में क्लासिकल समकक्षों से बेहतर प्रदर्शन करते हुए और डाउनस्ट्रीम फोरकास्टिंग सटीकता को बढ़ाते हुए, प्रशिक्षित पैरामीटर्स को महत्वपूर्ण रूप से कम करता है।

Jack Waller, Filippo Caruso, Dimitrios Makris, Rajagopal Nilavalan, Xing Liang2026-06-29
🤖 AI

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

यह शोधपत्र सिद्ध करता है कि साझा-एम्बेडिंग अनुक्रम मॉडल (shared-embedding sequence models) में पूर्ण प्रॉम्प्ट-इंजेक्शन रोकथाम गणितीय रूप से असंभव है क्योंकि निर्देश और डेटा की संरचनात्मक पृथक्करणीयता नहीं है, और यह तर्क देता है कि सुदृढ़ सुरक्षा के लिए इन-पाइपलाइन सुरक्षाओं के सुधार के बजाय नियंत्रण और सामग्री चैनलों के वास्तुशिल्प पृथक्करण की आवश्यकता है।

Dewank Pant, Shruti Lohani, Avijit Kumar2026-06-29