💬 NLP

Activation-Based Active Learning for In-Context Learning: Challenges and Insights

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में इन-कॉन्टेक्स्ट उदाहरणों के चयन के लिए MLP एक्टिवेशन-आधारित संकेतों के उपयोग की क्षमता की जांच करता है, लेकिन यह निष्कर्ष निकालता है कि कार्य प्रदर्शन के साथ सहसंबंध की कमी के कारण ऐसी विधियाँ अप्रभावी हैं, और यह सुझाव देता है कि भविष्य के शोध को सुपरपोजिशन की अंतर्निहित समस्या को संबोधित करने के लिए स्पार्स ऑटोएनकोडर जैसी तकनीकों का अन्वेषण करना चाहिए।

Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton2026-06-04
💬 NLP

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

यह शोधपत्र एक प्रशिक्षण-मुक्त विधि प्रस्तावित करता है जो रिकवरेबल (recoverable) और स्ट्रक्चरल (structural) विफलताओं के बीच अंतर करने के लिए विफल तर्क ट्रेसेस (reasoning traces) के वितरण संबंधी हस्ताक्षरों का विश्लेषण करती है, जिससे एक ऐसा रूटिंग नियम सक्षम होता है जो मॉडल वेट्स (model weights) तक पहुंच की आवश्यकता के बिना कठिन समस्याओं के लिए रेस्क्यू दरों में महत्वपूर्ण सुधार करता है।

Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller2026-06-04
💬 NLP

Reinforcement Learning from Rich Feedback with Distributional DAgger

यह शोध पत्र DistIL को प्रस्तुत करता है, जो एक वितरण संबंधी (distributional) DAgger-आधारित दृष्टिकोण है जो निरंतर सुधार (monotonic policy improvement) प्राप्त करने के लिए एक फॉरवर्ड क्रॉस-एन्ट्रॉपी ऑब्जेक्टिव के माध्यम से समृद्ध फीडबैक का लाभ उठाता है और मानक RLVR एवं सेल्फ-डिस्टिलेशन विधियों की तुलना में रीजनिंग, कोडिंग और गणितीय कार्यों में बेहतर प्रदर्शन करता है।

Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad2026-06-04
💬 NLP

Typhoon: Towards an Effective Task-Specific Masking Strategy for Pre-trained Language Models

यह शोध पत्र 'टाइफून' (Typhoon) को प्रस्तुत करता है, जो प्री-ट्रेंड लैंग्वेज मॉडल्स के लिए एक टास्क-एडेप्टिव मास्किंग रणनीति है जो ग्रेडिएंट-आधारित टोकन सैलिएंसी का उपयोग करती है, लेकिन कई सीड्स और बैकबोन्स के माध्यम से कठोर मूल्यांकन यह प्रकट करता है कि मानक रैंडम मास्किंग पर इसके स्पष्ट लाभ सांख्यिकीय रूप से महत्वपूर्ण नहीं हैं, जो ऐसी विधियों की पुनरुत्पादकता (reproducibility) पर एक चेतावनी के रूप में कार्य करता है।

Muhammed Shahir Abdurrahman, Hashem Elezabi, Bruce Changlong Xu2026-06-03
💬 NLP

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

यह शोधपत्र METEORA को प्रस्तुत करता है, जो संवेदनशील डोमेन के लिए एक नवीन RAG फ्रेमवर्क है, जो अपारदर्शी री-रैंकिंग को एक तर्क-आधारित चयन प्रक्रिया से बदल देता है जिसमें एक DPO-ट्यून्ड LLM, सांख्यिकीय एल्बो डिटेक्शन और एक सत्यापनकर्ता (verifier) का उपयोग किया गया है, ताकि सटीक रूप से उच्च सटीकता, डेटा पॉइज़निंग के विरुद्ध सुदृढ़ता और व्याख्यात्मकता प्राप्त करते हुए साक्ष्य की मात्रा को महत्वपूर्ण रूप से कम किया जा सके।

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur2026-06-03
💬 NLP

Learning without training: The implicit dynamics of in-context learning

यह शोध पत्र प्रस्तावित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) में इन-कॉन्टेक्स्ट लर्निंग (in-context learning) एक ऐसी प्रक्रिया से उत्पन्न होती है जहाँ सेल्फ-अटेंशन लेयर्स (self-attention layers) फॉरवर्ड पास के दौरान एमएलपी वेट्स (MLP weights) में निहित रूप से लो-रैंक अपडेट्स (low-rank updates) प्रेरित करती हैं, जो वास्तविक वेट परिवर्तनों के बिना प्रदान किए गए कॉन्टेक्स्ट उदाहरणों पर प्रशिक्षण के गणितीय रूप से समकक्ष है।

Benoit Dherin, Michael Munn, Hanna Mazzawi, Michael Wunder, Javier Gonzalvo2026-06-03
💬 NLP

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

यह शोध पत्र CoMPAS3D प्रस्तुत करता है, जो एक व्यापक डेटासेट और बेंचमार्क है जिसमें विभिन्न कौशल स्तरों के 18 नर्तकों के 3 घंटे के एनोटेटेड पार्टनर साल्सा मोशन (partner salsa motion) शामिल हैं, जिसे मूव लेजिबिलिटी (move legibility) और प्रोफिशिएंसी अप्रोप्रिएटनेस (proficiency appropriateness) के लिए नवीन मेट्रिक्स का उपयोग करके इंटरैक्टिव ह्यूमनॉइड रोबोट्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो मौजूदा किनेमैटिक-आधारित ढांचों की सीमाओं को संबोधित करते हैं।

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica (…)2026-06-03
💬 NLP

Privacy-Aware Decoding: Mitigating Privacy Leakage of Large Language Models in Retrieval-Augmented Generation

यह शोधपत्र प्राइवेसी-अवेयर डिकोडिंग (PAD) को प्रस्तुत करता है, जो एक हल्का, मॉडल-एग्नोस्टिक इन्फरेंस-टाइम डिफेंस है जो रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में प्राइवेसी लीकेज को कम करने के लिए टोकन लॉजिट्स में कैलिब्रेटेड गॉसियन नॉइज़ को एडेप्टिवली इंजेक्ट करता है और साथ ही कठोर डिफरेंशियल प्राइवेसी गारंटी प्रदान करता है और रिस्पॉन्स यूटिलिटी को बनाए रखता है।

Haoran Wang, Xiongxiao Xu, Baixiang Huang, Kai Shu2026-06-03
💬 NLP

Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL

यह शोध पत्र स्व-पुरस्कृत सुदृढीकरण शिक्षण (self-rewarding reinforcement learning) में एक व्यवस्थित स्व-पुष्टि पूर्वाग्रह (self-confirming bias) की पहचान करता है जहाँ मॉडल उच्च-विश्वास वाली गलतियों को अत्यधिक पुरस्कृत करते हैं, और विविध मॉडल एकत्रीकरण के माध्यम से इस अस्थिरता को कम करने के लिए 'एन्सेम्बल्ड रिवार्ड्स के साथ सुदृढीकरण शिक्षण' (RLER) का प्रस्ताव करता है, जो अनलेबल डेटा पर प्रभावी ढंग से स्केल करते हुए पर्यवेक्षित विधियों (supervised methods) के करीब प्रदर्शन प्राप्त करता है।

Chuyi Tan, Peiwen Yuan, Xinglin Wang, Yiwei Li, Shaoxiong Feng, Yueqi Zhang, Jiayi Shi, Ji Zhang, Boyuan Pan, Yao Hu, Ka (…)2026-06-03
💬 NLP

ReaLM: Residual Quantization Bridging Knowledge Graph Embeddings and Large Language Models

ReaLM एक नवीन ढांचा है जो नॉलेज ग्राफ एम्बेडिंग्स और लार्ज लैंग्वेज मॉडल्स के बीच के अंतर को रेसिडुअल वेक्टर क्वांटाइजेशन के माध्यम से निरंतर (continuous) KG एम्बेडिंग्स को सीखने योग्य टोकन में विविक्त (discretize) करके और ऑन्टोलॉजी-निर्देशित बाधाओं को शामिल करके पाटता है, जिससे नॉलेज ग्राफ कंप्लीशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Wenbin Guo, Xin Wang, Jiaoyan Chen, Lingbing Guo, Zhao Li, Zirui Chen2026-06-03