🤖 AI

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

यह शोध पत्र व्यवस्थित "डेटा प्रोब्स" (data probes)—जो परिभाषित यादृच्छिक प्रक्रियाओं से व्युत्पन्न सिंथेटिक अनुक्रम हैं—विकसित करने का समर्थन करता है ताकि कंप्यूट-गहन अनुभवजन्य ह्यूरिस्टिक्स (empirical heuristics) से आगे बढ़ा जा सके और एक सैद्धांतिक समझ प्राप्त की जा सके कि कैसे विशिष्ट डेटा विशेषताएँ विभिन्न वर्कफ़्लो चरणों में लार्ज लैंग्वेज मॉडल के प्रदर्शन, सामान्यीकरण (generalization) और सुदृढ़ता (robustness) को मौलिक रूप से प्रभावित करती हैं।

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji2026-05-20
🤖 machine learning

Adaptive Multi-Scale Goodness Aggregation for Forward-Forward Learning

यह शोध पत्र एडेप्टिव मल्टी-स्केल गुडनेस एग्रीगेशन (AMSGA) को प्रस्तुत करता है, जो फॉरवर्ड-फॉरवर्ड एल्गोरिदम का एक नवीन विस्तार है जो मल्टी-स्केल रिप्रजेंटेशन एग्रीगेशन और एडेप्टिव ट्रेनिंग रणनीतियों के माध्यम से स्थिरता, मजबूती और सामान्यीकरण को बढ़ाता है, और जैविक संभाव्यता एवं मेमोरी दक्षता बनाए रखते हुए MNIST और Fashion-MNIST पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

Salar Beigzad, Vansh Verma2026-05-20
💻 computer science

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

यह शोध पत्र RecoAtlas प्रस्तुत करता है, जो एक बेंचमार्क और टूलकिट है जो सिमेंटिक कोहेरेंस (semantic coherence) के साथ व्यवहार-आधारित उपयोगिता मेट्रिक्स का उपयोग करके LLM शॉपिंग एजेंटों का मूल्यांकन करता है, यह प्रदर्शित करते हुए कि प्रशंसनीय स्पष्टीकरण प्रभावी अनुशंसा सेटों की गारंटी नहीं देते हैं और प्रदर्शन मॉडल क्षमता और टूल अलाइनमेंट के साथ बढ़ता है।

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann2026-05-20
🤖 machine learning

Block-Based Double Decoders

यह शोध पत्र "ब्लॉक-आधारित डबल डिकोडर्स" (Block-Based Double Decoders) का परिचय देता है, जो एक नवीन ट्रांसफॉर्मर आर्किटेक्चर है जो बेहतर स्केलिंग प्रदर्शन प्राप्त करने के लिए 'डबली-कॉज़ल ब्लॉक-आधारित अटेंशन मास्क' का उपयोग करके डिकोडर-ओनली मॉडल्स की प्रशिक्षण दक्षता को एनकोडर-डिकोडर की अनुमान दक्षता के साथ जोड़ता है, जिससे मेमोरी और कंप्यूट लागत में महत्वपूर्ण कमी आती है।

Asher Labovich, Benjamin Bradley, Vanessa Alexander, Chaitanya Harsha2026-05-20
🤖 machine learning

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

यह शोध पत्र स्पार्स ऑटोएनकोडर्स (sparse autoencoders) का उपयोग करते हुए, इंस्ट्रक्शन-ट्यून्ड एलएलएम (Llama 3.1 और Gemma 2) के भीतर साहित्यिक प्रिमिटिव्स (literary primitives)—जिसमें नेमिंग-गेट्स (naming-gates), सेल्फ-फीचर्स (self-features) और स्टाइलिस्टिक मोड्युलेटर्स (stylistic modulators) शामिल हैं—की एक कंपोजिशनल आर्किटेक्चर की पहचान और सत्यापन करता है, जो यह प्रदर्शित करता है कि लक्षित फीचर स्टीयरिंग (feature steering) न्यूनतम कम्प्यूटेशनल लागत के साथ विभिन्न मॉडल आर्किटेक्चर में विशिष्ट भावनात्मक और शैलीगत आउटपुट को विश्वसनीय रूप से उत्पन्न कर सकती है।

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira2026-05-20
🤖 machine learning

Metric-Gradient Projection for Stable Multi-Agent Policy Learning

यह शोध पत्र HPML (हॉज-प्रोजेक्टेड मल्टी-एजेंट लर्निंग) प्रस्तुत करता है, जो एक ऐसी विधि है जो हॉज डिकंपोजिशन (Hodge decomposition) के माध्यम से संयुक्त नीति अपडेट क्षेत्र को एक मेट्रिक-ग्रेडिएंट घटक पर प्रोजेक्ट करके जनरल-सम मल्टी-एजेंट सुदृढीकरण लर्निंग को स्थिर करती है, जिससे चक्रीय गतिकी को कम किया जा सके और ल्यपुनोव पोटेंशियल (Lyapunov potential) के माध्यम से अभिसरण में सुधार किया जा सके।

Zuyuan Zhang, Sizhe Tang, Mahdi Imani, Tian Lan2026-05-20
🤖 machine learning

D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting

यह शोध पत्र D-PACE को प्रस्तुत करता है, जो एक डायनेमिक पोजीशन-अवेयर क्रॉस-एन्ट्रॉपी लॉस है जो मॉडल आर्किटेक्चर या इन्फरेंस प्रक्रियाओं को बदले बिना, समानांतर स्पेक्युलेटिव डिकोडिंग की दक्षता और स्पीडअप में सुधार करने के लिए अपेक्षित स्वीकृत ड्राफ्ट लंबाई के आधार पर प्रशिक्षण भार (ट्रेनिंग वेट्स) को अनुकूल रूप से समायोजित करता है।

Tianyu Wu, Yu Yao, Zhenting Qi, Han Zheng, Zhuohan Wang, Haoran Ma, Lawrence Liao, Himabindu Lakkaraju, Ju Li, Yilun Du2026-05-20
🤖 machine learning

PASC: Pipeline-Aware Conformal Prediction with Joint Coverage Guarantees for Multi-Stage NLP and LLM Pipelines

यह शोध पत्र PASC को प्रस्तुत करता है, जो एक पाइपलाइन-जागरूक कॉन्फॉर्मल प्रेडिक्शन विधि है जो समस्या को एकल स्केलर क्वांटाइल गणना में कम करके मल्टी-स्टेज NLP और LLM सिस्टम के लिए परिमित-नमूना संयुक्त कवरेज गारंटी सुनिश्चित करती है, जिससे यह सटीकता और दक्षता दोनों में स्वतंत्र अंशांकन (कैलिब्रेशन) और रूढ़िवादी बोनफेरोनी बाउंड्स से काफी बेहतर प्रदर्शन करती है।

Varun Kotte2026-05-20
🤖 machine learning

Composition of Memory Experts for Diffusion World Models

यह शोध पत्र एक डिफ्यूजन-आधारित वर्ल्ड मॉडल प्रस्तुत करता है जो एक कंट्रास्टिव प्रोडक्ट-ऑफ-एक्सपर्ट्स फॉर्मूलेशन के माध्यम से विशिष्ट शॉर्ट-टर्म, एपिसोडिक और स्पेशियल मेमोरी एक्सपर्ट्स को संयोजित करके मौजूदा आर्किटेक्चर के मेमोरी-फिडेलिटी ट्रेड-ऑफ पर विजय प्राप्त करता है, जिससे द्विघातीय (क्वाड्रेटिक) कम्प्यूटेशनल लागत के बिना स्केलेबल, हाई-फिडेलिटी भविष्य के पूर्वानुमान को प्राप्त किया जा सकता है।

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro2026-05-20
🤖 machine learning

How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

यह शोध पत्र प्रक्षेपवक्र-आधारित डेटा एट्रिब्यूशन (trajectory-based data attribution) में त्रुटि स्रोतों का पहला व्यवस्थित विश्लेषण प्रदान करता है, जो ऑप्टिमाइज़र मिसमैच (optimizer mismatch) को एक प्रमुख समस्या के रूप में पहचानता है और एट्रिब्यूशन सटीकता में महत्वपूर्ण सुधार करने तथा विश्वसनीय डेटा चयन के लिए व्यावहारिक दिशा-निर्देश प्रदान करने हेतु AdamW-इन्फ्लुएंस (AdamW-influence), एक क्लोज्ड-फॉर्म एरर प्रॉक्सी (closed-form error proxy), और एक K-स्टेप लुक-अहेड फ्रेमवर्क (K-step look-ahead framework) प्रस्तावित करता है।

Junwei Deng, Pingbang Hu, Suliang Jin, Hao Lu, Jiachen T. Wang, Shichang Zhang, Jiaqi W. Ma2026-05-20