💻 computer science

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

यह शोध पत्र फ्रेशनेस-अवेयर प्रायोरिटाइज्ड एक्सपीरियंस रिप्ले (Freshness-Aware Prioritized Experience Replay) को प्रस्तुत करता है, जो एक नवीन विधि है जो एक एक्सपोनेंशियल एज डिके फैक्टर (exponential age decay factor) को शामिल करके बड़े भाषा और विजन-लैंग्वेज मॉडलों में प्रायोरिटी स्टेलेनेस (priority staleness) को कम करती है, जिससे पारंपरिक ऑन-पॉलिसी दृष्टिकोणों की तुलना में जटिल एजेंटिक और रीजनिंग कार्यों पर सैंपल दक्षता और प्रदर्शन में उल्लेखनीय सुधार होता है।

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny2026-04-21
💬 NLP

SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

यह शोध पत्र स्टीयरिंग प्रोबेबिलिटी स्क्वीज़िंग (SPS) का प्रस्ताव देता है, जो एक नवीन प्रशिक्षण प्रतिमान (training paradigm) है जो संभाव्यता द्रव्यमान संकेंद्रण (probability mass concentration) का मुकाबला करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) को प्रतिलोम सुदृढीकरण शिक्षण (inverse reinforcement learning) के साथ अंतर्निहित करता है, जिससे विविध प्रक्षेपवक्र अन्वेषण (trajectory exploration) को बढ़ावा मिलता है और तर्क-उन्मुख बड़े भाषा मॉडलों में Pass@k प्रदर्शन में सुधार होता है।

Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Xiaojia Chang, J (…)2026-04-21
💬 NLP

Beyond Black-Box Labels: Interpretable Criteria for Diagnosing SubjectiveNLP Tasks

यह शोधपत्र एक स्कीमा-स्तरीय नैदानिक पद्धति प्रस्तावित करता है जो गोल्ड लेबल्स को अंतिम रूप दिए जाने से पहले व्यक्तिपरक एनएलपी कार्यों में अस्थिर मानदंडों और व्यवस्थित श्रेणी ओवरलैप के बीच अंतर करने और उन्हें पहचानने के लिए मल्टी-एनोटेटर मानदंड निर्णयों का उपयोग करता है, जिससे एनोटेशन दिशानिर्देशों और संरचनाओं में साक्ष्य-आधारित सुधार सक्षम होते हैं।

Nisrine Rair, Alban Goupil, Valeriu Vrabie, Emmanuel Chochoy2026-04-21
💬 NLP

Where is the Mind? Persona Vectors and LLM Individuation

यह शोध पत्र मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) और पर्सोना वेक्टर अनुसंधान का लाभ उठाते हुए, बड़े भाषा मॉडलों (LLMs) के भीतर मन (minds) की पहचान करने के लिए तीन प्रमुख उम्मीदवारों—वर्चुअल इंस्टेंस व्यू (virtual instance view), इंस्टेंस-पर्सोना व्यू (instance-persona view), और मॉडल-पर्सोना व्यू (model-persona view)—का प्रस्ताव और मूल्यांकन करके LLM इंडिविडुएशन (individuation) की समस्या को संबोधित करता है।

Pierre Beckmann, Patrick Butlin2026-04-21
💬 NLP

Efficient Task Adaptation in Large Language Models via Selective Parameter Optimization

यह शोध पत्र एक चयनात्मक पैरामीटर अनुकूलन पद्धति प्रस्तावित करता है जो सामान्य भाषाई क्षमताओं के लिए आवश्यक "कोर पैरामीटर्स" (core parameters) को अलग करने और उन्हें फ्रीज करने के साथ-साथ केवल विशिष्ट डोमेन के लिए "नॉन-कोर पैरामीटर्स" (non-core parameters) को फाइन-ट्यून करता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम किया जा सके और वैज्ञानिक, चिकित्सा और भौतिक कार्यों में मॉडल की अनुकूलन क्षमता को बढ़ाया जा सके।

Weijie Wan, Jiangjiang Zhao2026-04-21
💬 NLP

Stability-Weighted Decoding for Diffusion Language Models

यह शोध पत्र स्टेबिलिटी-वेटेड डिकोडिंग (SWD) प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-फ्री रणनीति है जो टोकन टेम्पोरल इनस्टेबिलिटी का लाभ उठाकर समयपूर्व अनमास्किंग को रोकती है, जिससे कोड और गणित संबंधी कार्यों में जनरेशन सटीकता और मजबूती में महत्वपूर्ण सुधार होता है।

Yue Wu, Jian Huang2026-04-21
💬 NLP

Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

यह शोध पत्र LLMs के ऑडिट के लिए एक ग्राउंडेड मल्टी-टर्न सोशल सिमुलेशन फ्रेमवर्क पेश करता है, जो यह प्रकट करता है कि सहायता रणनीतियाँ अनुमानित उपयोगकर्ता संकट और सामुदायिक संदर्भ के जवाब में गतिशील रूप से बदलती हैं, ऐसे निष्कर्ष जो पारंपरिक सिंगल-टर्न मूल्यांकनों के लिए अदृश्य हैं।

Michelle Star, Andrew Aquilina, Yu-Ru Lin2026-04-21
💬 NLP

Comparing Human and Large Language Model Interpretation of Implicit Information

यह शोध पत्र एक इम्प्लिसिट इंफॉर्मेशन एक्सट्रैक्शन (IIE) पाइपलाइन प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल (LLMs) निहित अर्थों की व्याख्या करने में मनुष्यों की तुलना में कैसे प्रदर्शन करते हैं, जो यह प्रकट करता है कि हालांकि मॉडल निकाले गए ट्रिपलेट्स पर मानवीय निर्णयों के साथ संरेखित होते हैं, वे संदर्भ की सामाजिक या तथ्यात्मक प्रकृति के आधार पर सीमित कवरेज और विशिष्ट रूढ़िवादिता पैटर्न प्रदर्शित करते हैं।

Antonio De Santis, Tommaso Bonetti, Andrea Tocchetti, Marco Brambilla2026-04-21
💬 NLP

GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0)

GenericAgent एक स्व-विकसित (self-evolving) LLM एजेंट है जो एक न्यूनतम टूल सेट, पदानुक्रमित स्मृति (hierarchical memory), और सत्यापित प्रक्षेप पथों (trajectories) को पुन: प्रयोज्य SOPs और कोड में बदलने वाली एक प्रणाली के माध्यम से एक सीमित संदर्भ बजट के भीतर निर्णय-प्रासंगिक सूचना घनत्व को अधिकतम करता है, जिससे यह कम टोकन के साथ लंबी अवधि के कार्यों में अग्रणी प्रणालियों से बेहतर प्रदर्शन करने में सक्षम होता है।

Jiaqing Liang, Jinyi Han, Weijia Li, Xinyi Wang, Zhoujia Zhang, Zishang Jiang, Ying Liao, Tingyun Li, Ying Huang, Hao Sh (…)2026-04-21
💬 NLP

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them

यह शोध पत्र प्रदर्शित करता है कि मानक सबवर्ड टोकनाइज़ेशन (subword tokenization) भाषा मॉडलों के ध्वन्यात्मक ज्ञान प्रतिनिधित्व (phonological knowledge representation) को व्यवस्थित रूप से बाधित करता है, और एक हल्का IPA-आधारित फाइन-ट्यूनिंग तरीका प्रस्तावित करता है जो सामान्य तर्क क्षमताओं को काफी हद तक सुरक्षित रखते हुए ध्वन्यात्मक प्रदर्शन में महत्वपूर्ण सुधार करता है।

Disen Liao, Freda Shi2026-04-21