💬 NLP

MUTANT: A Recipe for Multilingual Tokenizer Design

यह शोधपत्र MUTANT को प्रस्तुत करता है, जो बहुभाषी टोकनाइज़र डिजाइन करने के लिए एक व्यापक रेसिपी है जो अनुकूलित शब्दावली, भाषा-जागरूक प्री-टोकनाइजेशन और सबवर्ड-जागरूक प्रशिक्षण रणनीतियों के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है और LLaMA4 की तुलना में इन्फरेंस थ्रूपुट (inference throughput) में 44% तक महत्वपूर्ण सुधार करता है।

Souvik Rana, Arul Menezes, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal2026-03-24
💬 NLP

AgentExpt: Automating AI Experiment Design with LLM-based Resource Retrieval Agent

यह शोध पत्र AgentExpt प्रस्तुत करता है, जो एक सामूहिक धारणा-संवर्धित रिट्रीवर (collective perception-enhanced retriever) और एक तर्क-संवर्धित रीरैंकर (reasoning-augmented reranker) को प्रशिक्षित करने के लिए 100,000 शोध पत्रों के एक बड़े पैमाने के डेटासेट का लाभ उठाकर एआई प्रयोग डिजाइन को स्वचालित करने वाला एक ढांचा है, जो उपयुक्त बेसलाइन और डेटासेट की सिफारिश करने में पूर्व बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Yu Li, Lehui Li, Qingmin Liao, Fengli Xu, Yong Li2026-03-24
💬 NLP

From Synthetic Scenes to Real Performance: Enhancing Spatial Reasoning in VLMs

यह शोध पत्र विजन-लैंग्वेज मॉडल्स को फाइन-ट्यून करने के लिए एक नियंत्रित सिंथेटिक डेटा जनरेशन फ्रेमवर्क प्रस्तावित करता है जो एनोटेशन पूर्वाग्रहों और वितरण असंतुलन को समाप्त करता है, जिसके परिणामस्वरूप मानक वास्तविक दुनिया के डेटासेट पर प्रशिक्षित मॉडलों की तुलना में वास्तविक दुनिया के स्थानिक तर्क कार्यों पर 13% प्रदर्शन सुधार होता है।

Massimo Rizzoli, Simone Alghisi, Seyed Mahed Mousavi, Giuseppe Riccardi2026-03-24
💬 NLP

M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

यह शोध पत्र M4-RAG प्रस्तुत करता है, जो बहुभाषी मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन (retrieval-augmented generation) का मूल्यांकन करने के लिए 42 भाषाओं और 189 देशों में फैला एक विशाल-स्तर का बेंचमार्क है, जो यह प्रकट करता है कि जबकि RAG छोटे विजन-लैंग्वेज मॉडल्स को लाभान्वित करता है, यह अक्सर बड़े मॉडल्स तक स्केल करने में विफल रहता है और गैर-अंग्रेजी संदर्भों में महत्वपूर्ण प्रदर्शन गिरावट से ग्रस्त होता है।

David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata2026-03-24
💬 NLP

Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors

यह शोध पत्र "कॉन्फ्लिक्ट-अवेयर फ्यूजन" (Conflict-Aware Fusion) का परिचय देता है, जो एक द्वैत-प्रक्रिया आर्किटेक्चर और संरचित संज्ञानात्मक पूर्वग्रहों (cognitive priors) का उपयोग करके लार्ज लैंग्वेज मॉडल्स में "लॉजिक इनर्शिया" (Logic Inertia) को दूर करता है, जिससे विरोधाभासी साक्ष्यों और संरचनात्मक व्यवधानों के तहत भी तर्क संबंधी कार्यों में पूर्ण सटीकता प्राप्त की जा सकती है जहाँ मानक मॉडल पूरी तरह विफल हो जाते हैं।

Qiming Bao, Xiaoxuan Fu, Michael Witbrock2026-03-24
💬 NLP

SciLaD: A Large-Scale, Transparent, Reproducible Dataset for Natural Scientific Language Processing

SciLaD एक नवीन, बड़े पैमाने का और पूर्णतः पारदर्शी डेटासेट है जिसमें 1 करोड़ से अधिक क्यूरेटेड अंग्रेजी और 3.5 करोड़ बहुभाषी वैज्ञानिक प्रकाशन शामिल हैं, जिसे पुनरुत्पादक अनुसंधान को सक्षम करने के लिए ओपन-सोर्स फ्रेमवर्क का उपयोग करके बनाया गया है और एक प्री-ट्रेंड RoBERTa मॉडल द्वारा सत्यापित किया गया है जो मौजूदा वैज्ञानिक भाषा मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है।

Luca Foppiano, Sotaro Takeshita, Pedro Ortiz Suarez, Ekaterina Borisova, Raia Abu Ahmad, Malte Ostendorff, Fabio Barth (…)2026-03-24
💬 NLP

Mining Legal Arguments to Study Judicial Formalism

यह अध्ययन MADON डेटासेट और एक तीन-चरणीय एनएलपी (NLP) पाइपलाइन प्रस्तुत करता है जो चेक सुप्रीम कोर्ट के निर्णयों में न्यायिक तर्क और औपचारिकता को स्वचालित रूप से वर्गीकृत करता है, जो मध्य और पूर्वी यूरोप में औपचारिकता के बारे में प्रचलित आख्यानों को चुनौती देता है और कम्प्यूटेशनल लीगल स्टडीज के लिए लीगल आर्गुमेंट माइनिंग की क्षमता को प्रदर्शित करता है।

Tomáš Koref, Lena Held, Mahammad Namazov, Harun Kumru, Yassine Thlija, Ivan Habernal2026-03-24
💬 NLP

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

यह शोध पत्र Agent-Dice प्रस्तुत करता है, जो एक पैरामीटर फ्यूजन फ्रेमवर्क है जो ज्यामितिक सर्वसम्मति फ़िल्टरिंग (geometric consensus filtering) और वक्रता-आधारित वेटिंग (curvature-based weighting) के माध्यम से ज्ञान अपडेट को अलग करके साझा अर्थों (shared semantics) और कार्य-विशिष्ट हस्तक्षेप (task-specific interference) के बीच प्रभावी ढंग से संतुलन बनाकर LLM-आधारित निरंतर शिक्षण (continual learning) में स्थिरता-प्लास्टिसिटी दुविधा को संबोधित करता है।

Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang2026-03-24
💬 NLP

Pantagruel: Unified Self-Supervised Encoders for French Text and Speech

यह शोध पत्र पंटाग्रुअल (Pantagruel) को प्रस्तुत करता है, जो फ्रांसीसी पाठ और वाक् के लिए एक एकीकृत स्व-पर्यवेक्षित एनकोडर मॉडलों का एक परिवार है, जो मौजूदा फ्रांसीसी बेसलाइन की तुलना में विविध डाउनस्ट्रीम कार्यों में प्रतिस्पर्धी या बेहतर प्रदर्शन प्राप्त करने के लिए संदर्भयुक्त फीचर-स्पेस रिप्रजेंटेशन सीखना है।

Phuong-Hang Le, Valentin Pelloin, Arnault Chatelain, Maryem Bouziane, Mohammed Ghennai, Qianwen Guan, Kirill Milintsevic (…)2026-03-24
💬 NLP

Measuring Iterative Temporal Reasoning with Time Puzzles

यह शोध पत्र "टाइम पज़ल्स" (Time Puzzles) पेश करता है, जो टूल के साथ पुनरावृत्ति संबंधी टेम्पोरल रीजनिंग (iterative temporal reasoning) के मूल्यांकन के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि स्पष्ट बाधाओं के बिना यहाँ तक कि शीर्ष LLMs भी दिनांक अनुमान (date inference) में संघर्ष करते हैं और वर्तमान टूल का उपयोग ऐसे कार्यों के लिए अविश्वसनीय बना हुआ है।

Zhengxiang Wang, Zeyu Dong2026-03-24