🧬 biology

Features have life history. And we should care

यह शोध पत्र प्रकट करता है कि भाषा मॉडलों में लगभग 50 विरल विशेषताओं (sparse features) का एक निरंतर "कैरियर स्कैफोल्ड" (carrier scaffold) होता है जो प्रशिक्षण के पहले 1% के भीतर तेजी से विकसित होता है, जो एक भार-वहन करने वाले आधार के रूप में कार्य करता है जो मॉडल की आगामी संरचनात्मक और विकासात्मक रूपरेखा को निर्धारित करता है।

Philipp Stecher, Sandro Radovanović, Vlasta Sikimić, Reinhard Kahle2026-05-20
🤖 machine learning

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

यह शोध पत्र HELLoRA का प्रस्ताव करता है, जो Mixture-of-Experts मॉडल्स के लिए एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है, जो केवल सबसे अधिक सक्रिय होने वाले विशेषज्ञों (experts) से ही लो-रैंक अडैप्टेशन (LoRA) मॉड्यूल को जोड़ता है, जिससे मानक LoRA की तुलना में प्रशिक्षण योग्य मापदंडों और कम्प्यूटेशनल लागत को कम करते हुए डाउनस्ट्रीम प्रदर्शन में महत्वपूर्ण सुधार होता है।

Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang2026-05-20
🤖 machine learning

Simply Stabilizing the Loop via Fully Looped Transformer

यह शोध पत्र फुली लूप्ड ट्रांसफॉर्मर (Fully Looped Transformer) का प्रस्ताव देता है, जो एक पैरामीटर-मुक्त आर्किटेक्चर है जो पुनरावृत्त रूप से पुन: उपयोग किए जाने वाले ट्रांसफॉर्मर ब्लॉक्स में ग्रेडिएंट ऑसिलेशन (gradient oscillation) और रेसिडुअल एक्सप्लोजन (residual explosion) को कम करने के लिए एक पूर्ण लूप वाली संरचना और अटेंशन इंजेक्शन (attention injection) पेश करके प्रशिक्षण गतिशीलता को स्थिर करता है और डाउनस्ट्रीम प्रदर्शन में सुधार करता है।

Rao Fu, Zixuan Yang, Jiankun Zhang, Jing Ma, Hechang Chen, Yu Li, Yi Chang2026-05-20
🤖 machine learning

Theory-optimal Quantization Based on Flatness

यह शोध पत्र बिडायरेक्शनल डायगोनल क्वांटाइजेशन (BDQ) को प्रस्तुत करता है, जो एक नवीन पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो एक्टिवेशन आउटलेयर्स को प्रभावी ढंग से बिखेरने के लिए एक नए "फ्लैटनेस" मीट्रिक पर आधारित एक थ्योरी-ऑप्टिमल समाधान प्राप्त करता है, जिससे लो-बिट लार्ज लैंग्वेज मॉडल क्वांटाइजेशन में स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त होती है।

Xiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang, Yequan Wang, Dong Li, Emad Barsoum, Kang Liu2026-05-20
🤖 AI

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

यह शोध पत्र व्यवस्थित "डेटा प्रोब्स" (data probes)—जो परिभाषित यादृच्छिक प्रक्रियाओं से व्युत्पन्न सिंथेटिक अनुक्रम हैं—विकसित करने का समर्थन करता है ताकि कंप्यूट-गहन अनुभवजन्य ह्यूरिस्टिक्स (empirical heuristics) से आगे बढ़ा जा सके और एक सैद्धांतिक समझ प्राप्त की जा सके कि कैसे विशिष्ट डेटा विशेषताएँ विभिन्न वर्कफ़्लो चरणों में लार्ज लैंग्वेज मॉडल के प्रदर्शन, सामान्यीकरण (generalization) और सुदृढ़ता (robustness) को मौलिक रूप से प्रभावित करती हैं।

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji2026-05-20
🤖 machine learning

Adaptive Multi-Scale Goodness Aggregation for Forward-Forward Learning

यह शोध पत्र एडेप्टिव मल्टी-स्केल गुडनेस एग्रीगेशन (AMSGA) को प्रस्तुत करता है, जो फॉरवर्ड-फॉरवर्ड एल्गोरिदम का एक नवीन विस्तार है जो मल्टी-स्केल रिप्रजेंटेशन एग्रीगेशन और एडेप्टिव ट्रेनिंग रणनीतियों के माध्यम से स्थिरता, मजबूती और सामान्यीकरण को बढ़ाता है, और जैविक संभाव्यता एवं मेमोरी दक्षता बनाए रखते हुए MNIST और Fashion-MNIST पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

Salar Beigzad, Vansh Verma2026-05-20
💻 computer science

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

यह शोध पत्र RecoAtlas प्रस्तुत करता है, जो एक बेंचमार्क और टूलकिट है जो सिमेंटिक कोहेरेंस (semantic coherence) के साथ व्यवहार-आधारित उपयोगिता मेट्रिक्स का उपयोग करके LLM शॉपिंग एजेंटों का मूल्यांकन करता है, यह प्रदर्शित करते हुए कि प्रशंसनीय स्पष्टीकरण प्रभावी अनुशंसा सेटों की गारंटी नहीं देते हैं और प्रदर्शन मॉडल क्षमता और टूल अलाइनमेंट के साथ बढ़ता है।

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann2026-05-20
🤖 machine learning

Block-Based Double Decoders

यह शोध पत्र "ब्लॉक-आधारित डबल डिकोडर्स" (Block-Based Double Decoders) का परिचय देता है, जो एक नवीन ट्रांसफॉर्मर आर्किटेक्चर है जो बेहतर स्केलिंग प्रदर्शन प्राप्त करने के लिए 'डबली-कॉज़ल ब्लॉक-आधारित अटेंशन मास्क' का उपयोग करके डिकोडर-ओनली मॉडल्स की प्रशिक्षण दक्षता को एनकोडर-डिकोडर की अनुमान दक्षता के साथ जोड़ता है, जिससे मेमोरी और कंप्यूट लागत में महत्वपूर्ण कमी आती है।

Asher Labovich, Benjamin Bradley, Vanessa Alexander, Chaitanya Harsha2026-05-20
🤖 machine learning

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

यह शोध पत्र स्पार्स ऑटोएनकोडर्स (sparse autoencoders) का उपयोग करते हुए, इंस्ट्रक्शन-ट्यून्ड एलएलएम (Llama 3.1 और Gemma 2) के भीतर साहित्यिक प्रिमिटिव्स (literary primitives)—जिसमें नेमिंग-गेट्स (naming-gates), सेल्फ-फीचर्स (self-features) और स्टाइलिस्टिक मोड्युलेटर्स (stylistic modulators) शामिल हैं—की एक कंपोजिशनल आर्किटेक्चर की पहचान और सत्यापन करता है, जो यह प्रदर्शित करता है कि लक्षित फीचर स्टीयरिंग (feature steering) न्यूनतम कम्प्यूटेशनल लागत के साथ विभिन्न मॉडल आर्किटेक्चर में विशिष्ट भावनात्मक और शैलीगत आउटपुट को विश्वसनीय रूप से उत्पन्न कर सकती है।

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira2026-05-20
🤖 machine learning

Metric-Gradient Projection for Stable Multi-Agent Policy Learning

यह शोध पत्र HPML (हॉज-प्रोजेक्टेड मल्टी-एजेंट लर्निंग) प्रस्तुत करता है, जो एक ऐसी विधि है जो हॉज डिकंपोजिशन (Hodge decomposition) के माध्यम से संयुक्त नीति अपडेट क्षेत्र को एक मेट्रिक-ग्रेडिएंट घटक पर प्रोजेक्ट करके जनरल-सम मल्टी-एजेंट सुदृढीकरण लर्निंग को स्थिर करती है, जिससे चक्रीय गतिकी को कम किया जा सके और ल्यपुनोव पोटेंशियल (Lyapunov potential) के माध्यम से अभिसरण में सुधार किया जा सके।

Zuyuan Zhang, Sizhe Tang, Mahdi Imani, Tian Lan2026-05-20