💬 NLP

Detecting RLVR Training Data via Structural Convergence of Reasoning

यह शोध पत्र Min-kkNN डिस्टेंस को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स डिटेक्शन विधि है जो देखे गए प्रॉम्प्ट्स पर मॉडल जनरेशन के संरचनात्मक अभिसरण (structural convergence) और कम हुई विविधता को मापकर RLVR प्रशिक्षण डेटा की पहचान करती है, जो प्रभावी रूप से मॉडल के आंतरिक विवरणों तक पहुँच की आवश्यकता के बिना मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Hongbo Zhang, Yue Yang, Jianhao Yan, Guangsheng Bao, Yue Zhang, Yue Zhang2026-02-13
💬 NLP

A Subword Embedding Approach for Variation Detection in Luxembourgish User Comments

यह शोध पत्र एक सबवर्ड एम्बेडिंग-आधारित पद्धति प्रस्तावित करता है जो लक्ज़मबर्गिश उपयोगकर्ता टिप्पणियों में शाब्दिक और वर्तनी संबंधी विविधताओं को स्वचालित रूप से पहचानने और क्लस्टर करने के लिए कच्चे टेक्स्ट पर प्रशिक्षण लेता है, यह प्रदर्शित करते हुए कि वितरण संबंधी मॉडलिंग पूर्व सामान्यीकरण या मैन्युअल एनोटेशन पर निर्भर किए बिना कम-संसाधन वाले, शोर वाले परिवेश में अर्थपूर्ण भाषाई पैटर्न को प्रभावी ढंग से प्रकट कर सकती है।

Anne-Marie Lutgen, Alistair Plum, Christoph Purschke2026-02-13
💬 NLP

LLM-based Triplet Extraction from Financial Reports

यह शोध पत्र LLMs और ऑन्टोलॉजी-संचालित प्रॉक्सी मेट्रिक्स का उपयोग करके वित्तीय ट्रिपलेट्स (triplets) निकालने के लिए एक अर्ध-स्वचालित पाइपलाइन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि स्वचालित रूप से प्रेरित ऑन्टोलॉजी स्कीमा ड्रिफ्ट (schema drift) को समाप्त करती है जबकि एक हाइब्रिड सत्यापन रणनीति मतिभ्रम (hallucination) की दरों को महत्वपूर्ण रूप से कम करती है और विषय-विषय (subject-object) पीढ़ी में व्यवस्थित विषमताओं को प्रकट करती है।

Dante Wesslund, Ville Stenström, Pontus Linde, Alexander Holmberg2026-02-13
💬 NLP

Benchmark Illusion: Disagreement among LLMs and Its Scientific Consequences

यह शोध पत्र एक "बेंचमार्क भ्रम" (benchmark illusion) को प्रकट करता है जहाँ समान सटीकता वाले बड़े भाषा मॉडल (large language models) तर्क संबंधी कार्यों पर महत्वपूर्ण असहमति प्रदर्शित करते हैं, जिससे मॉडल चयन एक छिपा हुआ लेकिन महत्वपूर्ण चर बन जाता है जो शिक्षा और राजनीति विज्ञान जैसे क्षेत्रों में वैज्ञानिक निष्कर्षों को नाटकीय रूप से बदल सकता है या यहाँ तक कि उलट भी सकता है।

Eddie Yang, Dashun Wang2026-02-13
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

यह शोध पत्र चुनौतीपूर्ण PDF-टू-मार्डाउन रूपांतरण कार्यों पर विजन-लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक फ्रांसीसी-केंद्रित बेंचमार्क प्रस्तुत करता है, जो मॉडल-असहमति सैंपलिंग और विशिष्ट सामान्यीकरण मेट्रिक्स का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि जबकि प्रोप्रायटरी मॉडल्स जटिल हस्तलिखित और फॉर्म-आधारित दस्तावेजों पर उत्कृष्ट हैं, कई ओपन-वेट्स सिस्टम मानक मुद्रित लेआउट के लिए प्रतिस्पर्धी बने हुए हैं।

Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery2026-02-13
💬 NLP

DHPLT: large-scale multilingual diachronic corpora and word representations for semantic change modelling

यह शोध पत्र DHPLT को प्रस्तुत करता है, जो 41 भाषाओं में बड़े पैमाने के, बहुभाषी कालक्रमिक संग्रहों (diachronic corpora) से युक्त एक खुला संसाधन है जिसमें पूर्व-गणनाकृत एम्बेडिंग्स और लेक्सिकल प्रतिस्थापन शामिल हैं, जिसे उच्च-संसाधन वाली भाषाओं से परे अर्थ परिवर्तन मॉडलिंग के लिए डेटा की कमी को दूर करने के लिए डिज़ाइन किया गया है।

Mariia Fedorova, Andrey Kutuzov, Khonzoda Umarova2026-02-13
💬 NLP

Automatic Simplification of Common Vulnerabilities and Exposures Descriptions

यह अध्ययन कॉमन वल्नरेबिलिटीज एंड एक्सपोज़र्स (CVE) विवरणों को स्वचालित रूप से सरल बनाने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि वे पठनीयता बढ़ा सकते हैं, लेकिन वे वर्तमान में मूल तकनीकी अर्थ को संरक्षित करने में संघर्ष करते हैं।

Varpu Vehomäki, Kimmo K. Kaski2026-02-13
💬 NLP

DeepSight: An All-in-One LM Safety Toolkit

DeepSight एक नवीन, ओपन-सोर्स टूलकिट है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए सुरक्षा मूल्यांकन और निदान को एकीकृत करता है, जो वर्तमान खंडित सुरक्षा वर्कफ़्लो की सीमाओं को दूर करने के लिए ब्लैक-बॉक्स व्यवहार संबंधी मूल्यांकन से व्हाइट-बॉक्स आंतरिक मूल कारण विश्लेषण की ओर संक्रमण करता है।

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yi (…)2026-02-13
💬 NLP

Meta-Sel: Efficient Demonstration Selection for In-Context Learning via Supervised Meta-Learning

यह शोध पत्र Meta-Sel को प्रस्तुत करता है, जो एक हल्का, सुपर्वाइज्ड मेटा-लर्निंग दृष्टिकोण है जो सरल विशेषताओं पर प्रशिक्षित एक व्याख्या योग्य लॉजिस्टिक रिग्रेसर का उपयोग करके इन-कॉन्टेक्स्ट लर्निंग प्रदर्शनों को कुशलतापूर्वक चुनता है, और बिना किसी फाइन-ट्यूनिंग या अतिरिक्त LLM कॉल्स की आवश्यकता के विविध मॉडलों और डेटासेट्स में शीर्ष-स्तरीय प्रदर्शन प्राप्त करता है।

Xubin Wang, Weijia Jia2026-02-13
💬 NLP

Seq2Seq2Seq: Lossless Data Compression via Discrete Latent Transformers and Reinforcement Learning

यह शोध पत्र एक नवीन लॉसलेस डेटा संपीड़न विधि का प्रस्ताव करता है जो डेटा को डिस्क्रीट टोकन अनुक्रमों में एनकोड करने के लिए T5 आर्किटेक्चर पर ऑफ-पॉलिसी सुदृढीकरण शिक्षण (Reinforcement Learning) का उपयोग करता है, जिससे संरचनात्मक अखंडता सुरक्षित रहती है और पारंपरिक वेक्टर-आधारित डीप लर्निंग दृष्टिकोणों की तुलना में बेहतर संपीड़न अनुपात प्राप्त होता है।

Mahdi Khodabandeh, Ghazal Shabani, Arash Yousefi Jordehi, Seyed Abolghasem Mirroshandel2026-02-13