💬 NLP

A Method for Learning Large-Scale Computational Construction Grammars from Semantically Annotated Corpora

यह शोधपत्र अर्थपूर्ण रूप से एनोटेट किए गए कॉर्पोरा (corpus) से स्वतः ही बड़े पैमाने पर, मानव-व्याख्या योग्य कम्प्यूटेशनल कंस्ट्रक्शन ग्रामर (construction grammars) सीखने की एक विधि प्रस्तुत करता है, जिससे उपयोग-आधारित कंस्ट्रक्शन ग्रामर दृष्टिकोणों की स्केलेबिलिटी का प्रदर्शन होता है और ओपन-डोमेन टेक्स्ट में सिंटैक्टिको-सिमेंटिक पैटर्न का विश्लेषण करने के लिए एक व्यावहारिक उपकरण प्राप्त होता है।

Paul Van Eecke, Katrien Beuls2026-03-16
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

यह शोध पत्र CLARIN-PT-LDB को प्रस्तुत करता है, जो यूरोपीय पुर्तगाली पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए समर्पित पहला ओपन लीडरबोर्ड है, जिसमें भाषा प्रवीणता, सांस्कृतिक संरेखण और सभ्यता संबंधी सुरक्षा उपायों का आकलन करने वाले नवीन बेंचमार्क शामिल हैं।

João Silva, Luís Gomes, António Branco2026-03-16
💬 NLP

DS2^2-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning

यह शोधपत्र DS2^2-Instruct को प्रस्तुत करता है, जो एक ज़ीरो-शॉट फ्रेमवर्क है जो कार्य-सूचित कीवर्ड्स (task-informed keywords) को ब्लूम्स टैक्सोनॉमी (Bloom's Taxonomy) और सेल्फ-कंसिस्टेंसी वैलिडेशन के साथ जोड़कर उच्च-गुणवत्ता वाले, डोमेन-विशिष्ट इंस्ट्रक्शन ट्यूनिंग डेटासेट को संश्लेषित करता है, जिससे बिना मानव एनोटेशन के विशिष्ट क्षेत्रों में लार्ज लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ruiyao Xu, Noelle I. Samia, Han Liu2026-03-16
🤖 AI

Structured Distillation for Personalized Agent Memory: 11x Token Reduction with Retrieval Preservation

यह शोध पत्र एक संरचित डिस्टिलेशन पद्धति प्रस्तुत करता है जो व्यक्तिगत एजेंट बातचीत के इतिहास को सघन, चार-क्षेत्रीय सारांशों में संकुचित करती है जो प्रति विनिमय औसतन 38 टोकन होते हैं, जिससे हजारों सॉफ्टवेयर इंजीनियरिंग बातचीत में वर्बेटिम (शब्दशः) बेसलाइन के समान या उससे बेहतर रिट्रीवल गुणवत्ता बनाए रखते हुए टोकन उपयोग में 11 गुना की कमी आती है।

Sydney Lewis2026-03-16
💬 NLP

Interpretable Semantic Gradients in SSD: A PCA Sweep Approach and a Case Study on AI Discourse

यह शोध पत्र सुपरवाइज्ड सिमेंटिक डिफरेंशियल (SSD) विश्लेषण में घटकों की इष्टतम संख्या को व्यवस्थित रूप से निर्धारित करने के लिए एक PCA स्वीप प्रक्रिया प्रस्तुत करता है, जिससे शोधकर्ता के स्वतंत्रता स्तर (researcher degrees of freedom) को कम किया जा सके और सिमेंटिक ग्रेडिएंट्स की व्याख्यात्मकता को बढ़ाया जा सके, जैसा कि एआई (AI) विमर्श के विशिष्ट फ्रेमिंग को नैर्सिसिज्म (नार्सिसिज्म) लक्षणों से जोड़ने वाले एक केस स्टडी में प्रदर्शित किया गया है।

Hubert Plisiecki, Maria Leniarska, Jan Piotrowski, Marcin Zajenkowski2026-03-16
💬 NLP

ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation

यह शोध पत्र ESG-Bench प्रस्तुत करता है, जो एक मानव-एनोटेटेड बेंचमार्क डेटासेट है जिसे जटिल ESG रिपोर्टों का विश्लेषण करते समय लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) का मूल्यांकन करने और उन्हें कम करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि चेन-ऑफ-थॉट प्रॉम्प्टिंग और इस डेटासेट पर फाइन-ट्यूनिंग तथ्यात्मक सटीकता और सामान्यीकरण क्षमता में महत्वपूर्ण सुधार करती है।

Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song2026-03-16
🤖 AI

Semantic Invariance in Agentic AI

यह शोध पत्र विभिन्न रूपांतरणों और मॉडलों के माध्यम से LLM एजेंटों की सिमेंटिक इनवेरिएंस (semantic invariance) का मूल्यांकन करने के लिए एक मेटामॉर्फिक टेस्टिंग फ्रेमवर्क पेश करता है, जो यह प्रकट करता है कि रीजनिंग स्टेबिलिटी (reasoning stability) का मॉडल स्केल के साथ कोई सहसंबंध नहीं है और Qwen3-30B-A3B जैसे छोटे मॉडल मजबूती के मामले में बड़े समकक्षों से बेहतर प्रदर्शन कर सकते हैं।

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate2026-03-16
💬 NLP

Neuron-Aware Data Selection In Instruction Tuning For Large Language Models

यह शोध पत्र NAIT का प्रस्ताव करता है, जो एक नवीन ढांचा है जो उम्मीदवार नमूनों और लक्षित डोमेन क्षमताओं के बीच न्यूरॉन सक्रियता पैटर्न की समानता के आधार पर इष्टतम डेटा उपसमुच्चयों का चयन करके लार्ज लैंग्वेज मॉडल इंस्ट्रक्शन ट्यूनिंग में सुधार करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण मौजूदा विधियों से बेहतर प्रदर्शन करता है और विविध कार्यों के बीच तार्किक और प्रोग्रामेटिक विशेषताओं की मजबूत हस्तांतरणीयता को प्रकट करता है।

Xin Chen, Junchao Wu, Shu Yang, Runzhe Zhan, Zeyu Wu, Min Yang, Shujian Huang, Lidia S. Chao, Derek F. Wong2026-03-16
💬 NLP

Llettuce: An Open Source Natural Language Processing Tool for the Translation of Medical Terms into Uniform Clinical Encoding

यह शोध पत्र Llettuce को प्रस्तुत करता है, जो एक ओपन-सोर्स, GDPR-अनुपालन वाला नेचुरल लैंग्वेज प्रोसेसिंग टूल है जो बड़े भाषा मॉडलों (large language models) और फजी मैचिंग (fuzzy matching) का उपयोग करके अनौपचारिक चिकित्सा शब्दों को OMOP मानक अवधारणाओं (standard concepts) में मैप करने की प्रक्रिया को स्वचालित और बेहतर बनाता है, जिससे मौजूदा मैनुअल-प्रधान समाधानों की सीमाओं का समाधान होता है।

James Mitchell-White, Reza Omdivar, Benjamin Partridge, Esmond Urwin, Karthikeyan Sivakumar, Ruizhe Li, Andy Rae, Xiaoya (…)2026-03-13
💬 NLP

Structured Agent Distillation for Large Language Model

यह शोध पत्र स्ट्रक्चर्ड एजेंट डिस्टिलेशन (Structured Agent Distillation) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो तर्क (reasoning) और क्रिया (action) खंडों को संरेखित करने के लिए स्पैन-विशिष्ट नुकसान (span-specific losses) लागू करके बड़े भाषा मॉडल एजेंटों को छोटे, कुशल मॉडलों में संकुचित करता है, जिससे मानक टोकन-स्तरीय डिस्टिलेशन से बेहतर प्रदर्शन करते हुए निर्णय लेने की निष्ठा (decision-making fidelity) को संरक्षित किया जाता है।

Jun Liu, Zhenglun Kong, Peiyan Dong, Changdi Yang, Tianqi Li, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue L (…)2026-03-13