🤖 machine learning

RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

यह शोध पत्र RLCSD का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो सही और गलत संकेतों के बीच अंतर करके 'प्रिविलेज-इंड्यूस्ड स्टाइल ड्रिफ्ट' (privilege-induced style drift) को कम करती है ताकि सीखने के संकेतों को कार्य-भारित टोकन (task-bearing tokens) पर केंद्रित किया जा सके, जिससे मौजूदा दृष्टिकोणों की तुलना में गणितीय और तार्किक तर्क कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen2026-06-11
🤖 machine learning

ICA Lens: Interpreting Language Models Without Training Another Dictionary

यह शोध पत्र ICALens को प्रस्तुत करता है, जो एक व्यावहारिक और कुशल वर्कफ़्लो है जो स्पार्स ऑटोएनकोडर्स (sparse autoencoders) को प्रशिक्षित करने की आवश्यकता के बिना, सीधे भाषा मॉडल सक्रियणों (language model activations) से मानव-व्याख्या योग्य दिशाओं को निकालने के लिए अनुकूलित इंडिपेंडेंट कंपोनेंट एनालिसिस (ICA) का लाभ उठाता है, यह प्रदर्शित करते हुए कि ICA मॉडल व्याख्यात्मकता (model interpretability) के लिए एक प्रतिस्पर्धी और पूरक प्रथम लेंस के रूप में कार्य करता है।

Sida Liu, Feijiang Han2026-06-11✓ Author reviewed
💬 NLP

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA

यह शोधपत्र UniReason-Med को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो एक साझा ग्राउंडेड रीजनिंग इंटरफेस और एक बड़े पैमाने के 2D-3D इंस्ट्रक्शन-ट्यूनिंग डेटासेट (UniMed-CoT) का लाभ उठाता है ताकि प्रचुर मात्रा में उपलब्ध 2D मेडिकल इमेज से रीजनिंग क्षमताओं को स्थानांतरित करके 3D मेडिकल विजुअल क्वेश्चन अनस्विंग (VQA) में सुधार किया जा सके।

Mengzhuo Chen, Yan Shu, Chi Liu, Hongming Piao, Xidong Wang, Derek Li, Bryan Dai2026-06-11
💬 NLP

Hey Chat, Can You Teach Me? Structuring Socratic Dialogue for Human Learning in the Wild

यह शोध पत्र यह प्रदर्शित करता है कि ट्यूटरिंग को बड़े मॉडलों के साथ असंरचित संवाद पर निर्भर रहने के बजाय, एक हल्के सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) नीति द्वारा हल की जाने वाली पाठ्यक्रम अनुक्रमण समस्या के रूप में स्पष्ट रूप से संरचित करना, विविध विषयों में छात्र महारत की दर और दक्षता में महत्वपूर्ण सुधार करता है।

Sidney Tio, Arunesh Sinha, Pradeep Varakantham2026-06-11
💬 NLP

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

यह शोध पत्र एक स्केलेबल, डोमेन-अज्ञेय (domain-agnostic) ढांचे को प्रस्तुत करता है जो विचलित नवीनता (divergent novelty) को मापने के लिए सिमेंटिक एंट्रॉपी को कन्वर्जेंट कार्य पूर्ति (convergent task fulfilment) का आकलन करने वाले रिट्रीवल-आधारित मल्टी-एजेंट जज के साथ जोड़कर, ओपन-एंडेड कार्यों में लार्ज लैंग्वेज मॉडल की रचनात्मकता को परिमाणित करता है।

Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saiki (…)2026-06-11
⚡ electrical engineering

Fast Speech Foundation Model Distillation Using Interleaved Stacking

यह शोध पत्र "इंटरलीव्ड स्टैकिंग" (interleaved stacking) का प्रस्ताव करता है, जो बड़े स्पीच फाउंडेशन मॉडल्स को डिस्टिल करने के लिए एक नवीन प्रशिक्षण त्वरण विधि है, जो मौजूदा स्टैकिंग तकनीकों में देखी जाने वाली प्रदर्शन गिरावट से बचने के लिए लेयर पोजीशन को सुरक्षित रखते हुए मॉडल की गहराई को प्रगतिशील रूप से बढ़ाती है।

Eungbeom Kim, Kyogu Lee2026-06-11
💬 NLP

WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning

यह शोध पत्र WorldReasoner को प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है जो भाषा मॉडल एजेंटों की घटना पूर्वानुमान क्षमताओं का आकलन करने के लिए केवल पूर्वानुमान तिथि से पूर्व उपलब्ध जानकारी का उपयोग करके सटीक, साक्ष्य-आधारित और कारण-युक्त भविष्यवाणियां उत्पन्न करने की उनकी क्षमता का कठोरता से परीक्षण करता है, जिससे यह पता चलता है कि हालांकि टेम्पोरल रिट्रीवल (temporal retrieval) और कॉज़ल ग्राफ निर्माण प्रदर्शन को बढ़ाते हैं, फिर भी एजेंट जमीनी साक्ष्यों को सुव्यवस्थित संभाव्यताओं में अनुवाद करने में संघर्ष करते हैं।

Yizhou Chi, Eric Chamoun, Zifeng Ding, Andreas Vlachos2026-06-11
🤖 machine learning

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

यह शोध पत्र ART (आर्ट-बेस्ड रीइन्फोर्समेंट ट्रेनिंग) का प्रस्ताव देता है, जो एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो फ्रोजन मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सूचना इंजेक्ट करने के लिए रॉ विजुअल इनपुट्स को ऑप्टिमाइज़ करती है, जिससे उनके कंप्यूटेशनल ग्राफ को संशोधित किए बिना vLLM जैसे हाई-थ्रूपुट इंजनों के साथ अनुकूलता सक्षम होती है और साथ ही LoRA के समान सटीकता प्राप्त होती है।

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski2026-06-11
💬 NLP

I Understand How You Feel: Enhancing Deeper Emotional Support Through Multilingual Emotional Validation in Dialogue System

यह शोध पत्र M-EDESConv बहुभाषी कॉर्पस, M-TESC टेस्ट सेट और बेहतर टाइमिंग डिटेक्शन के लिए MEGUMI मॉडल को पेश करते हुए कम्प्यूटेशनल इमोशनल वैलिडेशन के अल्प-अन्वेषित क्षेत्र को संबोधित करता है, साथ ही वर्तमान LLMs को उनकी भावनात्मक समझ क्षमताओं में महत्वपूर्ण अंतराल को उजागर करने के लिए बेंचमार्क भी करता है।

Zi Haur Pang, Yahui Fu, Koji Inoue, Tatsuya Kawahara2026-06-11
💬 NLP

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

यह शोध पत्र प्रकट करता है कि विजन-लैंग्वेज-एक्शन मॉडल गैर-समान, चरण-दर-चरण भाषा संवेदनशीलता के कारण गैर-अंग्रेजी निर्देशों के तहत महत्वपूर्ण प्रदर्शन गिरावट का सामना करते हैं, और एक लक्षित इन्फरेंस-टाइम हस्तक्षेप प्रस्तावित करता है जो इन विशिष्ट संवेदनशीलताओं के आधार पर निरूपणों (representations) को संरेखित करता है ताकि बहुभाषी सुदृढ़ता में पर्याप्त सुधार किया जा सके।

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che2026-06-11