🤖 machine learning

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

यह शोध पत्र तर्क देता है कि ट्रांसफॉर्मर-आधारित जनरेटिव मॉडल्स में टोकन रिडक्शन को केवल एक दक्षता रणनीति से विकसित होकर एक मौलिक डिजाइन सिद्धांत बनना चाहिए जो विजन, लैंग्वेज और मल्टीमॉडल सिस्टम में मल्टीमॉडल अलाइनमेंट को बढ़ाता है, मतिभ्रम (hallucinations) को कम करता है, लॉन्ग-कॉन्टेक्स्ट कोहेरेंस सुनिश्चित करता है और ट्रेनिंग स्टेबिलिटी में सुधार करता है।

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik2026-06-16
🌀 nonlinear sciences

Multiple Descents in Deep Learning as a Sequence of Order-Chaos Transitions in LSTM Networks

यह शोध पत्र प्रकट करता है कि LSTM प्रशिक्षण में "मल्टीपल-डेसेंट" (multiple-descent) घटना, जहाँ ओवरट्रेनिंग के बाद प्रदर्शन उतार-चढ़ाव प्रदर्शित करता है, बार-बार होने वाले ऑर्डर-केऑस (order-chaos) चरण संक्रमणों द्वारा संचालित होती है, जिसमें मॉडल पहले महत्वपूर्ण संक्रमण बिंदु पर इष्टतम प्रदर्शन प्राप्त करता है जहाँ "एज ऑफ केऑस" (edge of chaos) सबसे विस्तृत होता है, जो भार विन्यासों (weight configurations) के सबसे प्रभावी अन्वेषण को सक्षम बनाता है।

Wenbo Wei, Fan Xu, Nicholas Chong Jia Le, Choy Heng Lai, Ling Feng2026-06-16
🤖 machine learning

Federated Foundation Language Model Post-Training Should Focus on Open-Source Models

यह शोध पत्र तर्क देता है कि फाउंडेशन लैंग्वेज मॉडल्स के फेडरेटेड पोस्ट-ट्रेनिंग को ब्लैक-बॉक्स दृष्टिकोणों के बजाय ओपन-सोर्स मॉडल्स को प्राथमिकता देनी चाहिए, क्योंकि बाद वाले डेटा गोपनीयता और स्वायत्तता जैसे मूल फेडरेटेड लर्निंग सिद्धांतों का मौलिक रूप से विरोध करते हैं।

Nikita Agrawal, Ruben Mayer2026-06-16
💬 NLP

LoLA: Low-Rank Linear Attention With Sparse Caching

यह शोध पत्र LoLA को प्रस्तुत करता है, जो लीनियर अटेंशन (linear attention) के लिए एक प्रशिक्षण-मुक्त संवर्धन (training-free augmentation) है जो की-वैल्यू पेयर्स (key-value pairs) को एक स्थानीय स्लाइडिंग विंडो, कठिन पेयर्स के लिए एक स्पार्स ग्लोबल कैश और एक रिकरेंट हिडन स्टेट में वितरित करके एसोसिएटिव रिकॉल (associative recall) और लाइफलॉग इन-कॉन्टेक्स्ट लर्निंग (lifelong in-context learning) को बढ़ाता है, जिससे मानक ट्रांसफॉर्मर की तुलना में काफी कम मेमोरी ओवरहेड के साथ लगभग पूर्ण पास-की रिट्रीवल (pass-key retrieval) सटीकता प्राप्त होती है।

Luke McDermott, Robert W. Heath Jr., Rahul Parhi2026-06-16
🤖 machine learning

Neuromorphic Wireless Split Computing with Resonate-and-Fire Neurons

यह शोध पत्र ट्यूनेबल स्पेक्ट्रल रेजोनेंस के साथ स्ट्रीमिंग टाइम-डोमेन सिग्नल्स को सीधे प्रोसेस करने के लिए रेसोनेट-एंड-फायर न्यूरॉन्स का उपयोग करने वाला एक न्यूरोमॉर्फिक वायरलेस स्प्लिट कंप्यूटिंग आर्किटेक्चर प्रस्तावित करता है, जो पारंपरिक मॉडलों के समान सटीकता प्राप्त करते हुए गणना और ट्रांसमिशन दोनों में स्पाइक दरों और ऊर्जा खपत को काफी कम करता है।

Dengyu Wu, Jiechen Chen, H. Vincent Poor, Bipin Rajendran, Osvaldo Simeone2026-06-16
🧬 biology

MegaFold: Efficient Training of Next-Generation 3D Attention Protein Models on Cross-Platform GPUs

MegaFold एक नवीन क्रॉस-प्लेटफ़ॉर्म सिस्टम है जो मेमोरी-कुशल कर्नेल, अनुकूलित शार्डिंग, फ्यूज्ड ऑपरेटर्स और एक डिटरमिनिज्म-अवेयर पाइपलाइन को जोड़कर अगली पीढ़ी के 3D अटेंशन प्रोटीन मॉडल्स को प्रशिक्षित करने में आने वाली मेमोरी और कंप्यूटेशनल बाधाओं को दूर करता है, जिससे NVIDIA और AMD दोनों GPU पर काफी लंबी सीक्वेंस लंबाई और तेज़ प्रशिक्षण समय प्राप्त होता है।

Hoa La, Ahan Gupta, Alex Morehead, Jianlin Cheng, Minjia Zhang2026-06-16
🤖 machine learning

Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization

यह शोध पत्र एक नवीन डोमेन जनरलाइजेशन फ्रेमवर्क प्रस्तावित करता है जो विजुअल प्रॉम्प्ट ट्यूनिंग को निर्देशित करने के लिए टेक्स्ट प्रॉम्प्ट्स को अलग करने हेतु लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसे आगे रोबस्ट क्रॉस-डोमेन रिप्रेजेंटेशन लर्निंग के लिए एब्स्ट्रैक्ट प्रॉम्प्ट्स और स्टाइलइज्ड ऑगमेंटेशन्स को सम्मिलित करने हेतु वर्स्ट एक्सप्लिसिट रिप्रेजेंटेशन एलाइनमेंट (WERA) द्वारा उन्नत किया गया है।

De Cheng, Zhipeng Xu, Xinyang Jiang, Dongsheng Li, Nannan Wang, Xinbo Gao2026-06-16
⚛️ phenomenology

On the Energy Distribution of the Galactic Center Excess' Sources

स्थानिक और स्पेक्ट्रमी डेटा का संयुक्त रूप से विश्लेषण करने के लिए न्यूरल नेटवर्क सिमुलेशन-आधारित अनुमान दृष्टिकोण का उपयोग करते हुए, यह अध्ययन प्रदर्शित करता है कि गैलेक्टिक सेंटर एक्सस (Galactic Center Excess) एक विसरित डार्क मैटर सिग्नल या मंद बिंदु स्रोतों की एक असाधारण रूप से बड़ी आबादी के अनुरूप है, जो उन पिछले निष्कर्षों को चुनौती देता है जिन्होंने कम संख्या में चमकीले स्रोतों का पक्ष लिया था।

Florian List, Yujin Park, Nicholas L. Rodd, Eve Schoen, Florian Wolf2026-06-16
🤖 machine learning

Communication-Efficient Distributed Training for Collaborative Flat Optima Recovery in Deep Learning

यह शोध पत्र डिस्ट्रीब्यूटेड पुल-पुश फ़ोर्स (DPPF) एल्गोरिदम को प्रस्तुत करता है, जो केंद्रीकृत वितरित प्रशिक्षण में एक नवीन "इनवर्स मीन वैली" रेगुलराइज़र को शामिल करता है ताकि श्रमिकों को सहयोगात्मक रूप से सपाट मिनिमा (flatter minima) की ओर निर्देशित किया जा सके, जिससे मौजूदा स्थानीय ग्रेडिएंट और सिंक्रोनस एवरेजिंग विधियों की तुलना में बेहतर सामान्यीकरण और संचार दक्षता प्राप्त की जा सके।

Tolga Dimlioglu, Anna Choromanska2026-06-16
🤖 machine learning

Beyond Rebalancing: Benchmarking Binary Classifiers Under Class Imbalance Without Rebalancing Techniques

यह अध्ययन बिना किसी स्पष्ट पुनर्संतुलन तकनीकों को लागू किए, गंभीर वर्ग असंतुलन के तहत विभिन्न बाइनरी क्लासिफायर की मजबूती का व्यवस्थित रूप से मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि डेटा जटिलता बढ़ने और अल्पसंख्यक वर्ग के आकार में कमी आने के साथ प्रदर्शन आम तौर पर घटता है, TabPFN और बूस्टिंग-आधारित एन्सेम्बल्स जैसे उन्नत मॉडल पारंपरिक क्लासिफायर की तुलना में बेहतर सामान्यीकरण बनाए रखते हैं।

Ali Nawaz, Amir Ahmad, Shehroz S. Khan2026-06-16