💬 NLP

LLM-Oriented Information Retrieval: A Denoising-First Perspective

यह परिप्रेक्ष्य पत्र तर्क देता है कि जैसे-जैसे लार्ज लैंग्वेज मॉडल्स (LLMs) द्वारा पुनर्प्राप्त सूचनाओं का उपभोग बढ़ता जा रहा है, सूचना पुनर्प्राप्ति (इन्फॉर्मेशन रिट्रीवल) में प्राथमिक बाधा 'डिनोइजिंग-फर्स्ट' (डेटा से शोर हटाने पर केंद्रित) दृष्टिकोण के माध्यम से साक्ष्य घनत्व (एविडेंस डेंसिटी) और सत्यापन क्षमता को अधिकतम करने की ओर स्थानांतरित हो जाती है, जिसे एक चार-चरणीय चुनौती ढांचे और रिट्रीवल पाइपलाइन में सिग्नल-टू-नॉइज़ अनुकूलन तकनीकों के एक व्यापक वर्गीकरण के माध्यम से संबोधित किया गया है।

Lu Dai, Liang Sun, Fanpu Cao, Ziyang Rao, Cehao Yang, Hao Liu, Hui Xiong2026-05-04
💬 NLP

Surprisal Minimisation over Goal-directed Alternatives Predicts Production Choice in Dialogue

यह शोध पत्र यह प्रदर्शित करता है कि उत्पत्ति (utterance) के उत्पादन को भाषा मॉडल द्वारा जनरेट किए गए, लक्ष्य-निर्देशित विकल्पों पर एक संभाव्य लागत-संवेदनशील विकल्प (probabilistic cost-sensitive choice) के रूप में मॉडल करना यह प्रकट करता है कि इन विकल्पों के सापेक्ष सर्प्राइज़ल न्यूनीकरण (surprisal minimisation), यूनिफॉर्म इंफॉर्मेशन डेंसिटी और लंबाई-आधारित लागतों से बेहतर प्रदर्शन करते हुए, संवाद में वक्ता के विकल्पों का सबसे मजबूत भविष्यवक्ता है।

Tom Utting, Mario Giulianelli, Arabella Sinclair2026-05-04
💬 NLP

ControBench: An Interaction-Aware Benchmark for Controversial Discourse Analysis on Social Networks

यह शोध पत्र ControBench को प्रस्तुत करता है, जो विवादास्पद विमर्श विश्लेषण के लिए एक नवीन बेंचमार्क है, जो ट्रम्प, गर्भपात और धर्म जैसे विषयों पर मॉडलों के यथार्थवादी मूल्यांकन को सक्षम करने के लिए रेडिट (Reddit) से समृद्ध पाठ्य अर्थशास्त्र (textual semantics) और स्व-घोषित उपयोगकर्ता विचारधाराओं के साथ विषम सामाजिक संपर्क ग्राफों को एकीकृत करता है।

Ta Thanh Thuy, Jiaqi Zhu, Xuan Liu, Lin Shang, Reihaneh Rabbany, Guillaume Rabusseau, Lihui Chen, Zheng Yilun, Sitao Lua (…)2026-05-04
💬 NLP

AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

यह शोध पत्र AGoQ को पेश करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक मेमोरी-कुशल वितरित प्रशिक्षण ढांचा (distributed training framework) है, जो मॉडल अभिसरण (convergence) और सटीकता बनाए रखते हुए मेमोरी उपयोग को 52% तक कम करने और प्रशिक्षण गति को 1.34× तक बढ़ाने के लिए लेयर-अवेयर एक्टिवेशन क्वांटाइजेशन (layer-aware activation quantization) और प्रिसिजन-प्रिजर्विंग 8-बिट ग्रेडिएंट क्वांटाइजेशन (precision-preserving 8-bit gradient quantization) का उपयोग करता है।

Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi2026-05-04
💬 NLP

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

यह शोध पत्र SCISENSE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो LLMs को प्रशिक्षित करने के लिए संरचित, उद्धरण-सशर्त विचार प्रक्षेपवक्रों (ideation trajectories) का लाभ उठाता है, और यह प्रदर्शित करता है कि कैसे नियंत्रित अर्थ-निर्माण (sensemaking) डाउनस्ट्रीम एजेंटों पर संज्ञानात्मक बोझ को कम करके अनुसंधान परिणामों की नवीनता और गुणवत्ता दोनों को आश्चर्यजनक रूप से बढ़ाता है।

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang2026-05-04
💬 NLP

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

यह शोध पत्र एक एनकोडिंग प्रोब (Encoding Probe) प्रस्तुत करता है जो व्याख्या योग्य विशेषताओं से भाषा मॉडल के निरूपणों (representations) का पुनर्निर्माण करता है, जो पारंपरिक डिकोडिंग प्रोब्स के पूरक दृष्टिकोण के रूप में कार्य करता है, जिससे प्रत्यक्ष विशेषता तुलना सक्षम होती है और यह प्रकट होता है कि विभिन्न भाषाई और ध्वन्यात्मक गुण आंतरिक मॉडल अवस्थाओं में कैसे योगदान देते हैं।

Gaofei Shen, Martijn Bentum, Tom Lentz, Afra Alishahi, Grzegorz Chrupała2026-05-04
💬 NLP

SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models

यह शोध पत्र SC-Taxo का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो पदानुक्रमित अर्थ संबंधी निरंतरता (hierarchical semantic consistency) सुनिश्चित करके वैज्ञानिक वर्गीकरण (scientific taxonomy) निर्माण में संरचनात्मक विसंगतियों और अर्थ संबंधी बेमेल (semantic misalignment) को संबोधित करने के लिए एक द्विदिश शीर्षक निर्माण तंत्र (bidirectional heading generation mechanism) के साथ बड़े भाषा मॉडल (large language models) का लाभ उठाता है।

Shiqiang Cai, Nianhong Niu, Shizhu He, Kang Liu, Jun Zhao2026-05-04
💬 NLP

Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

यह शोध पत्र MathArena को प्रस्तुत करता है, जो एक निरंतर अनुरक्षित मूल्यांकन मंच है जो स्थिर बेंचमार्क से आगे बढ़कर विविध गणितीय कार्यों—ओलंपियाड समस्याओं, अनुसंधान-स्तरीय प्रश्नों और औपचारिक प्रमाणों सहित—में LLMs का व्यापक रूप से आकलन करता है, यह प्रदर्शित करते हुए कि GPT-5.5 जैसे अत्याधुनिक मॉडल अब अत्यंत चुनौतीपूर्ण गणितीय समस्याओं को हल कर सकते हैं और साथ ही तीव्र प्रगति को ट्रैक करने के लिए गतिशील मूल्यांकन प्रणालियों की आवश्यकता पर प्रकाश डालता है।

Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger, Kári Rögnvalddson, Ivo Petrov, Chenhao Sun, Martin Vechev2026-05-04
💬 NLP

Characterizing the Expressivity of Local Attention in Transformers

यह शोध पत्र एक दूसरे टेम्पोरल ऑपरेटर के जुड़ाव के माध्यम से नियमित भाषाओं (regular languages) पर मॉडल की अभिव्यंजक क्षमता (expressivity) के सख्त विस्तार को सिद्ध करके, ट्रांसफॉर्मर में लोकल अटेंशन की बेहतर गुणवत्ता के लिए एक औपचारिक सैद्धांतिक स्पष्टीकरण प्रदान करता है, जिसे उन प्रयोगों द्वारा पुष्ट किया गया है जो दर्शाते हैं कि हाइब्रिड ग्लोबल-लोकल आर्किटेक्चर, केवल ग्लोबल मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं।

Jiaoda Li, Ryan Cotterell2026-05-04
💬 NLP

Directed Social Regard: Surfacing Targeted Advocacy, Opposition, Aid, Harms, and Victimization in Online Media

यह शोध पत्र 'डायरेक्टेड सोशल रिगार्ड' (DSR) को प्रस्तुत करता है, जो एक नवीन बहु-आयामी सेंटीमेंट विश्लेषण ढांचा है, जो ऑनलाइन मीडिया में प्रो- और एंटी-सोशल भावनाओं के सह-अस्तित्व को पकड़ने के लिए ट्रांसफार्मर-आधारित मॉडलों का उपयोग करता है जिसे पारंपरिक उपकरण नहीं पकड़ पाते, और यह साथ ही साथ सेंटीमेंट लक्ष्यों की पहचान करने और उन्हें तीन सामाजिक-दृष्टि (सोशल-रिगार्ड) अक्षों पर स्कोर करने का कार्य करता है।

Scott Friedman, Ruta Wheelock, Sonja Schmer-Galunder, Drisana Iverson, Jake Vasilakes, Joan Zheng, Jeffrey Rye, Vasanth (…)2026-05-04