💬 NLP

Word Embeddings Track Social Group Changes Across 70 Years in China

यह अध्ययन 1950 से 2019 तक के चीनी राज्य-नियंत्रित मीडिया के पहले बड़े पैमाने के कम्प्यूटेशनल विश्लेषण को प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ कुछ सामाजिक रूढ़ियाँ स्थिर बनी हुई हैं, वहीं लिंग और आर्थिक वर्गों के आधिकारिक भाषाई निरूपण नाटकीय बदलावों से गुजरते हैं जो चीन के क्रांतिकारी सामाजिक परिवर्तनों का अनुसरण करते हैं, जिससे इस बात पर एक महत्वपूर्ण गैर-पश्चिमी परिप्रेक्ष्य मिलता है कि भाषा किस प्रकार सामाजिक परिवर्तन को कूटबद्ध करती है।

Yuxi Ma, Yongqian Peng, Yixin Zhu2026-01-30
💬 NLP

Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों (Large Language Models) को स्पष्ट उद्धरणों के साथ संरचित, साक्ष्य-आधारित आउटपुट उत्पन्न करने के लिए निर्देशित करके रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) की पारदर्शिता और सटीकता को बढ़ाता है, जिससे उन्नत वाणिज्यिक मॉडलों के तुलनीय प्रदर्शन प्राप्त होता है।

Jingyi Ren, Yekun Xu, Xiaolong Wang, Weitao Li, Ante Wang, Weizhi Ma, Yang Liu2026-01-30
💬 NLP

Probing Neural Topology of Large Language Models

यह शोध पत्र "ग्राफ प्रोबिंग" (graph probing) को प्रस्तुत करता है, जो एक नवीन विधि है जो LLM न्यूरॉन्स की कार्यात्मक कनेक्टिविटी (functional connectivity) को प्रकट करती है, यह प्रदर्शित करते हुए कि न्यूरल टोपोलॉजी में सक्रियता पैटर्न (activation patterns) की तुलना में मॉडल प्रदर्शन के बारे में काफी समृद्ध जानकारी होती है और इसे मॉडल प्रूनिंग (model pruning) और मतिभ्रम का पता लगाने (hallucination detection) जैसे अनुप्रयोगों के माध्यम से दक्षता और विश्वसनीयता में सुधार करने के लिए उपयोग किया जा सकता है।

Yu Zheng, Yuan Yuan, Yue Zhuo, Yong Li, Gabriel Kreiman, Tomaso Poggio, Paolo Santi2026-01-30
💬 NLP

Guided Perturbation Sensitivity (GPS): Detecting Adversarial Text via Embedding Stability and Word Importance

यह शोध पत्र गाइडेड परटर्बेशन सेंसिटिविटी (GPS) को पेश करता है, जो एक अटैक-अग्नोस्टिक डिटेक्शन फ्रेमवर्क है जो शीर्ष-रैंक वाले महत्वपूर्ण शब्दों को मास्क करके एम्बेडिंग अस्थिरता को मापकर एडवर्सरियल टेक्स्ट की पहचान करता है, और बिना किसी रिट्रेनिंग के विविध डेटासेट्स और मॉडल्स पर 85% से अधिक सटीकता प्राप्त करता है।

Bryan E. Tuck, Rakesh M. Verma2026-01-30
💬 NLP

Context Parametrization with Compositional Adapters

यह शोध पत्र CompAs को प्रस्तुत करता है, जो एक मेटा-लर्निंग फ्रेमवर्क है जो कई संदर्भ चंक्स (context chunks) को बीजगणितीय रूप से संयोजनीय (algebraically composable) एडैप्टर मापदंडों में अनुवादित करता है, जो बड़े भाषा मॉडलों को स्केल करने के लिए इन-कॉन्टेक्स्ट लर्निंग और सुपरवाइज्ड फाइन-ट्यूनिंग के एक अधिक कुशल, स्थिर और प्रतिवर्ती विकल्प के रूप में कार्य करता है।

Josip Jukić, Martin Tutek, Jan Šnajder2026-01-30
💬 NLP

Neural network embeddings recover value dimensions from psychometric survey items on par with human data

यह शोध पत्र प्रदर्शित करता है कि एक नवीन विधि जिसे SQuID कहा जाता है, जो लार्ज लैंग्वेज मॉडल एम्बेडिंग्स को प्रोसेस करती है, PVQ-RR से मानवीय मूल्यों की संरचना को 55% वेरिएंस स्पष्टीकरण और पारंपरिक मानव सर्वेक्षण डेटा के तुलनीय क्रॉस-सांस्कृतिक संरेखण के साथ प्रभावी ढंग से पुन: प्राप्त कर सकती है, जो साइकोमेट्रिक अनुसंधान के लिए एक स्केलेबल और लागत प्रभावी विकल्प प्रदान करती है।

Max Pellert, Clemens M. Lechner, Indira Sen, Markus Strohmaier2026-01-30
💬 NLP

LLM×\timesMapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System

यह शोध पत्र LLM×MapReduce-V3 को प्रस्तुत करता है, जो एक पदानुक्रमित रूप से मॉड्यूलर एजेंट सिस्टम है, जो व्यापक, गहन शोध सर्वेक्षणों के संवादात्मक, मानव-नियंत्रित सृजन को सक्षम करने के लिए मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) सर्वरों और एक गतिशील योजनाकार (डायनामिक प्लानर) का लाभ उठाता है, जो सामग्री की गहराई और लंबाई में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Yu Chao, Siyu Lin, xiaorong wang, Zhu Zhang, Zihan Zhou, Haoyu Wang, Shuo Wang, Jie Zhou, Zhiyuan Liu, Maosong Sun2026-01-30
💬 NLP

NOSA: Native and Offloadable Sparse Attention

यह शोध पत्र NOSA को प्रस्तुत करता है, जो विशेष रूप से KV कैश ऑफलोडिंग के लिए डिज़ाइन किया गया एक प्रशिक्षित स्पार्स अटेंशन मैकेनिज्म है जो मेमोरी दक्षता और जनरेशन गुणवत्ता के बीच के ट्रेड-ऑफ को हल करने के लिए CPU-GPU डेटा ट्रांसफर को सीमित करता है, जिससे मौजूदा बेसलाइन की तुलना में डिकोडिंग थ्रूपुट में महत्वपूर्ण सुधार प्राप्त होता है।

Yuxiang Huang, Pengjie Wang, Jicheng Han, Weilin Zhao, Zhou Su, Ao Sun, Hongya Lyu, Hengyu Zhao, Yudong Wang, Chaojun Xi (…)2026-01-30
💬 NLP

MOSAIC: Masked Objective with Selective Adaptation for In-domain Contrastive Learning

यह शोधपत्र MOSAIC को प्रस्तुत करता है, जो एक बहु-चरणीय ढांचा (multi-stage framework) है जो मास्क्ड लैंग्वेज मॉडलिंग और कंट्रास्टिव ऑब्जेक्टिव्स को संयुक्त रूप से अनुकूलित करके सामान्य-डोमेन टेक्स्ट एम्बेडिंग मॉडल्स को विशिष्ट डोमेन्स के लिए प्रभावी ढंग से अनुकूलित करता है, जिससे उच्च-और-निम्न-संसाधन दोनों सेटिंग्स में NDCG@10 में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Vera Pavlova, Mohammed Makhlouf2026-01-30
💬 NLP

Language Generation: Complexity Barriers and Implications for Learning

यह शोध पत्र यह प्रदर्शित करता है कि यद्यपि विभिन्न औपचारिक भाषा वर्गों के लिए सीमा (limit) में भाषा निर्माण सैद्धांतिक रूप से संभव है, फिर भी यह अत्यधिक नमूना जटिलता (sample complexity) संबंधी आवश्यकताओं के कारण गणनात्मक रूप से अव्यवहार्य है, यहाँ तक कि नियमित और संदर्भ-मुक्त (context-free) भाषाओं जैसे अपेक्षाकृत सरल वर्गों के लिए भी।

Marcelo Arenas, Pablo Barceló, Luis Cofré, Alexander Kozachinskiy2026-01-30