🤖 machine learning

LLM Features Can Hurt GNNs: Concatenation Interference on Homophilous Graph Benchmarks

यह शोध पत्र यह प्रकट करता है कि केवल LLM-जनित नोड विशेषताओं (node features) को GNN इनपुट के साथ जोड़ने से होमोफिलस (homophilous) बेंचमार्क पर प्रदर्शन व्यवस्थित रूप से घट सकता है, एक ऐसी घटना जो ग्राफ होमोफिली के बजाय LLM की स्टैंडअलोन डिस्क्रिमिनेबिलिटी (discriminability) द्वारा संचालित होती है, और यह भविष्यवाणी करने के लिए एक डिस्क्रिमिनेबिलिटी थ्रेशोल्ड (discriminability threshold) प्रस्तावित करता है कि कब ऐसा संयोजन हानिकारक होगा।

Zhongyuan Wang, Pratyusha Vemuri2026-06-17
🤖 machine learning

A Risk Decomposition Framework for Pre-Hoc Fine-Tuning Prediction

यह शोधपत्र जोखिम को आंतरिक और अनुकूलन विचलन घटकों में विभाजित करके, अनिश्चितता क्षय (uncertainty decay) की मौलिक सीमाओं को सिद्ध करके, और तीन विशिष्ट कार्य व्यवस्थाओं (task regimes) में मान्य एक बजट-इष्टतम प्रोबिंग रणनीति व्युत्पन्न करके, प्री-हॉक फाइन-ट्यूनिंग भविष्यवाणी के लिए एक सैद्धांतिक ढांचा स्थापित करता है।

Yuxiang Luo, Chen Wang, Nan Tang2026-06-17
🤖 machine learning

TuneAhead: Predicting Fine-tuning Performance Before Full Training Begins

TuneAhead एक हल्का फ्रेमवर्क है जो पूर्ण प्रशिक्षण शुरू होने से पहले ही स्टैटिक डेटासेट डिस्क्रिप्टर्स और डायनेमिक प्रोब फीचर्स को जोड़कर बड़े भाषा मॉडलों के फाइन-ट्यूनिंग प्रदर्शन का सटीक अनुमान लगाता है, जिससे कंप्यूटेशनल बर्बादी को कम करने के लिए कुशल go/no-go स्क्रीनिंग सक्षम होती है।

Yuxiang Luo, Haonan Long, Chen Wang, Qiqi Duan, Xiaotian Lin, Yanwei Xu, Yuyu Luo, Weikai Yang, Nan Tang2026-06-17
🤖 machine learning

Handling Feature Heterogeneity with Learnable Graph Patches

यह शोध पत्र ग्राफ फाउंडेशन मॉडल्स के लिए एक नवीन ढांचे (framework) को प्रस्तुत करता है जो ग्राफ्स को डोमेन-अज्ञेय (domain-agnostic) "लर्नेबल ग्राफ पैचेस" में विभाजित करके फीचर विषमता (feature heterogeneity) को संबोधित करता है ताकि प्रभावी मल्टी-डोमेन प्री-ट्रेनिंग और विविध डाउनस्ट्रीम कार्यों में बेहतर हस्तांतरणीयता (transferability) सक्षम की जा सके।

Yifei Sun, Yang Yang, Xiao Feng, Zijun Wang, Haoyang Zhong, Chunping Wang, Lei Chen2026-06-17
💬 NLP

Vision-language models for chest radiography do not always need the image

यह शोध पत्र प्रदर्शित करता है कि चेस्ट रेडियोग्राफी के लिए कई विजन-लैंग्वेज मॉडल वास्तव में छवियों का विश्लेषण करने के बजाय टेक्स्ट-आधारित प्रायोरिटीज़ (priors) पर निर्भर रहकर उच्च सटीकता प्राप्त करते हैं, और यह तर्क देता है कि सुरक्षित नैदानिक तैनाती सुनिश्चित करने के लिए केवल सटीकता स्कोर ही नहीं, बल्कि ग्राउंडिंग ऑडिट भी आवश्यक हैं।

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh2026-06-17
🤖 machine learning

Continual Self-Improvement with Lightweight Experiential Latent Memories

यह शोध पत्र एक कुशल ऑनलाइन विधि प्रस्तावित करता है जो हल्के स्व-पर्यवेक्षित प्रशिक्षण के माध्यम से क्षणिक तर्क तtraces (reasoning traces) को संक्षिप्त, मॉड्यूलर लेटेंट मेमोरीज़ में परिवर्तित करता है, जिससे बड़े भाषा मॉडलों (LLMs) को कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) के बिना निरंतर आत्म-सुधार और बेहतर तर्क प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके।

Vaggelis Dorovatas, Nancy Kalaj, Rahaf Aljundi2026-06-17
🤖 machine learning

Conservation Laws for Modern Neural Architectures

यह शोध पत्र आधुनिक न्यूरल आर्किटेक्चर—जिसमें GELU, SiLU, SwiGLU एक्टिवेशन, विभिन्न अटेंशन मैकेनिज्म और मिक्स्चर-ऑफ-एक्सपर्ट्स डिज़ाइन शामिल हैं—के लिए ग्रेडिएंट फ्लो में संरक्षण नियमों (conservation laws) को अभिलक्षणित करने हेतु एक एकीकृत सैद्धांतिक ढांचा स्थापित करता है, जो ओवर-पैरामीटराइज्ड मॉडल्स के इम्प्लिसिट बायस (implicit bias) को बेहतर ढंग से समझाने के लिए प्रयोगों के माध्यम से इन निष्कर्षों को मान्य करता है।

Viet-Hoang Tran, Vinh Khanh Bui, Tan Lai Ngoc, Nam Nguyen, Tuan Dam, Tan M. Nguyen2026-06-17
🤖 machine learning

From Drift to Coherence: Stabilizing Beliefs in LLMs

यह शोध पत्र प्रदर्शित करता है कि जबकि बड़े भाषा मॉडल ऑटोरेग्रेसिव उत्तर पुन: नमूनाकरण (autoregressive answer resampling) के दौरान मार्टिंगेल गुण का उल्लंघन करते हुए प्रारंभ में विश्वास विचलन (belief drift) प्रदर्शित करते हैं, वे अंततः सुसंगत भविष्य कहनेवाला वितरणों (predictive distributions) में स्व-स्थिर हो जाते हैं, एक ऐसी घटना जिसका लाभ उठाकर विचलन को कम करने और सटीकता से समझौता किए बिना सुसंगतता में सुधार करने के लिए प्रॉम्प्टिंग और फाइन-ट्यूनिंग रणनीतियों का प्रस्ताव दिया गया है।

SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee2026-06-17
🤖 machine learning

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip एक सामान्यीकरण योग्य विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है जो प्रतिनिधित्व, गति और व्यवहार संबंधी आयामों में एक एकीकृत संरेखण ढांचे का लाभ उठाता है ताकि लगभग 38,100 घंटों के ओपन-सोर्स कॉर्पस पर बड़े पैमाने पर प्रशिक्षण सक्षम किया जा सके, जिससे विविध रोबोटिक प्लेटफॉर्म और आउट-ऑफ-डिस्ट्रीब्यूशन बेंचमार्क में अत्याधुनिक प्रदर्शन और उभरती हुई सामान्यीकरण क्षमताएं प्राप्त होती हैं।

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang (…)2026-06-17