💬 NLP

GHTM: A Graph-based Hybrid Topic Modeling Approach with a Benchmark Dataset for the Low-Resource Bengali Language

यह शोध पत्र GHTM को पेश करके बंगाली टॉपिक मॉडलिंग के लिए संसाधनों की कमी को संबोधित करता है, जो एक नवीन ग्राफ-आधारित हाइब्रिड आर्किटेक्चर है जो बेहतर टॉपिक सुसंगतता (coherence) और विविधता प्राप्त करने के लिए TF-IDF-वेटेड ग्लोव (GloVe) एम्बेडिंग, ग्राफ कनवल्शनल नेटवर्क और नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन को संयोजित करता है, साथ ही 8,650 पाठ्यपुस्तक दस्तावेजों के एक विविध बेंचमार्क डेटासेट, NCTBText को भी जारी करता है।

Farhana Haque, Md. Abdur Rahman, Sumon Ahmed2026-03-31
💬 NLP

L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search

यह शोध पत्र L-MARS को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो क्वेरीज़ को विघटित करने और एजेंटिक वेब सर्च करने के साथ-साथ LegalSearchQA बेंचमार्क के निर्माण के माध्यम से, अद्यतित जानकारी की आवश्यकता वाले कार्यों पर कानूनी प्रश्न उत्तर देने में महत्वपूर्ण सुधार करता है।

Ziqi Wang, Boqin Yuan2026-03-31
💬 NLP

Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking

यह शोध पत्र जस्ट-इनफ थिंकिंग (JET) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ट्राजेक्टरी ट्रंकेशन (trajectory truncation) और गुणवत्ता-नियंत्रित लंबाई पुरस्कारों (quality-controlled length rewards) का लाभ उठाकर बड़े रीजनिंग मॉडलों को अनावश्यक रीजनिंग चरणों को सक्रिय रूप से समाप्त करने के लिए प्रशिक्षित करता है, जिससे सटीकता से समझौता किए बिना कम्प्यूटेशनल दक्षता में उल्लेखनीय सुधार होता है।

Jinyi Han, Ying Huang, Ying Liao, Zishang Jiang, Xikun Lu, Haiquan Zhao, Xinyi Wang, Guanghao Zhou, Sihang Jiang, Jiaqin (…)2026-03-31
💬 NLP

The Rise of AfricaNLP: Contributions, Contributors, Community Impact, and Bibliometric Analysis

यह शोध पत्र 2005 से 2025 तक के अफ्रीकी नेचुरल लैंग्वेज प्रोसेसिंग (AfricaNLP) अनुसंधान का एक व्यापक बिब्लियोमेट्रिक विश्लेषण प्रस्तुत करता है, जिसमें योगदान को मापने, रुझानों को ट्रैक करने और एक नव विकसित रिसर्च एक्सप्लोरर टूल के माध्यम से प्रमुख शोधकर्ताओं और संस्थानों की पहचान करने के लिए 2,200 शोध पत्रों के एक मैन्युअल रूप से एनोटेटेड डेटासेट का उपयोग किया गया है।

Tadesse Destaw Belay, Kedir Yassin Hussen, Sukairaj Hafiz Imam, Ibrahim Said Ahmad, Isa Inuwa-Dutse, Abrham Belete Haile (…)2026-03-31
💬 NLP

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

यह शोध पत्र एजेंटिक कॉन्टेक्स्ट इंजीनियरिंग (ACE) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संदर्भों (contexts) को विकसित होते हुए 'प्लेबुक्स' के रूप में मानता है ताकि संक्षिप्तता पूर्वाग्रह (brevity bias) और संदर्भ पतन (context collapse) को दूर किया जा सके, जिससे स्व-सुधार करने वाले भाषा मॉडल बिना किसी लेबल वाली निगरानी के संरचित, वृद्धिशील अपडेट के माध्यम से एजेंट और डोमेन-विशिष्ट बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम हो सकें।

Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmen (…)2026-03-31
💬 NLP

CLMN: Concept based Language Models via Neural Symbolic Reasoning

यह शोध पत्र CLMN को प्रस्तुत करता है, जो एक न्यूरल-सिम्बोलिक फ्रेमवर्क है जो अवधारणाओं को निरंतर एम्बेडिंग्स के रूप में प्रदर्शित करके और गतिशील अंतःक्रियाओं को मॉडल करने तथा पारदर्शी तर्क नियमों को प्रेरित करने के लिए फजी-लॉजिक रीजनिंग को लागू करके एनएलपी (NLP) की व्याख्यात्मकता और प्रदर्शन को बढ़ाता है।

Yibo Yang2026-03-31
💬 NLP

Schema for In-Context Learning

संज्ञानात्मक स्कीमा सिद्धांत (cognitive schema theory) से प्रेरित होकर, यह शोध पत्र स्कीमा-एक्टिवेटेड इन-कॉन्टेक्स्ट लर्निंग (SA-ICL) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो जटिल वैज्ञानिक कार्यों पर बड़े भाषा मॉडलों के प्रदर्शन और व्याख्यात्मकता को महत्वपूर्ण रूप से बढ़ाने के लिए पूर्व उदाहरणों से अमूर्त तर्क टेम्पलेट (abstracted reasoning templates) को स्पष्ट रूप से निर्मित करता है और साथ ही कई प्रदर्शन उदाहरणों पर निर्भरता को कम करता है।

Pan Chen, Shaohong Chen, Mark Wang, Shi Xuan Leong, Priscilla Fung, Varinia Bernales, Alan Aspuru-Guzik2026-03-31
💬 NLP

Evaluating Latent Knowledge of Public Tabular Datasets in Large Language Models

यह शोध पत्र टैबुलर डेटासेट पर लार्ज लैंग्वेज मॉडल्स में डेटा संदूषण (data contamination) का पता लगाने के लिए नियंत्रित क्वेरी रूपांतरणों और सांख्यिकीय परीक्षणों का उपयोग करने वाले एक नवीन ढांचे का प्रस्ताव करता है, जो यह प्रकट करता है कि आठ में से चार व्यापक रूप से उपयोग किए जाने वाले डेटासेट्स पर प्रदर्शन, वास्तविक सामान्यीकरण के बजाय पूर्व प्रदर्शन (prior exposure) के कारण बढ़ा हुआ होने की संभावना है।

Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei2026-03-31
💬 NLP

LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data

यह शोधपत्र LuxIT को प्रस्तुत करता है, जो मूल ग्रंथों से संश्लेषित और LLM-as-a-judge के माध्यम से सत्यापित लक्ज़मबर्गिश का एक उच्च-गुणवत्ता वाला एकभाषी निर्देश-ट्यूनिंग डेटासेट है, जो यह प्रदर्शित करता है कि इस डेटा पर छोटे मॉडलों को फाइन-ट्यून करने से भाषा प्रवीणता परीक्षाओं और विभिन्न डाउनस्ट्रीम एनएलपी कार्यों पर उनके प्रदर्शन में महत्वपूर्ण सुधार होता है।

Julian Valline, Cedric Lothritz, Siwen Guo, Jordi Cabot2026-03-31
💬 NLP

Complete asymptotic type-token relationship for growing complex systems with inverse power-law count rankings

यह शोध पत्र एक नियतात्मक, आदर्श मॉडल प्रस्तुत करता है जो बढ़ते जटिल तंत्रों में प्रकार-प्रतीक (type-token) संबंध के लिए एक एकीकृत स्पर्शोन्मुख अभिव्यक्ति व्युत्पन्न करता है, यह प्रदर्शित करते हुए कि हीप्स का नियम (Heaps' law) स्टोकेस्टिक तंत्रों पर निर्भर किए बिना सभी पावर-लॉ घातांकों में जिप का नियम (Zipf's law) के केवल एक गणितीय परिणाम के रूप में उभरता है।

Pablo Rosillo-Rodes, Laurent Hébert-Dufresne, Peter Sheridan Dodds2026-03-31