💬 NLP

Bundesrecht: An Open Library and Corpus for German Statutory Reference Processing

यह शोधपत्र **bundesrecht** प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी और संरचित कॉर्पस है जो कच्चे उद्धरण स्ट्रिंग्स (citation strings) से विशिष्ट कानूनी प्रावधानों तक जर्मन वैधानिक संदर्भों को पार्स करने, सामान्य करने और हल करने के लिए पहला एंड-टू-एंड पाइपलाइन प्रदान करता है।

Harshil Darji, Martin Heckelmann, Christina Kratsch, Gerard de Melo2026-06-01
💬 NLP

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

यह शोध पत्र FBHM प्रस्तुत करता है, जो एक नया बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक विजन-लैंग्वेज मॉडल डेटासेट ह्यूरिस्टिक्स (dataset heuristics) पर निर्भरता के कारण घृणास्पद मीम डिटेक्शन (hateful meme detection) में सामान्यीकरण करने में विफल रहते हैं, और LSV प्रस्तावित करता है, जो एक लो-डेटा स्टीयरिंग वेक्टर विधि है जो कॉज़ल इंटरवेंशन (causal interventions) लागू करके प्रदर्शन में महत्वपूर्ण सुधार करती है।

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee2026-06-01
💬 NLP

The Latin Substrate: How Language Models Represent and Mediate Script Choice

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) साझा लेटेंट रिप्रजेंटेशन्स और भाषा-अज्ञेय तंत्रों के माध्यम से लिपि चयन में मध्यस्थता करते हैं, जो एक संरचनात्मक विषमता प्रदर्शित करते हैं जहाँ गैर-लैटिन लिपियों को विशिष्ट विलंब-परत (लेट-लेयर) घटकों द्वारा नियंत्रित किया जाता है जबकि लैटिन लिपि एक विशेषाधिकार प्राप्त, विसरित डिफ़ॉल्ट आधार के रूप में उभरती है।

Daniil Gurgurov, Alan Saji, Katharina Trinley, Josef van Genabith, Simon Ostermann2026-06-01
💬 NLP

Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning

यह शोध पत्र RIEQE का प्रस्ताव करता है, जो एक दो-चरणीय प्रशिक्षण ढांचा है जो फाइन-ग्रेन्ड ट्रांसलेशन क्वालिटी एस्टीमेशन को महत्वपूर्ण रूप से सुधारने के लिए लार्ज रीजनिंग मॉडल्स में इम्प्लिसिट और एक्सप्लिसिट रीजनिंग क्षमताओं को सहक्रियात्मक रूप से विकसित करता है।

Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang2026-06-01
💬 NLP

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

यह शोध पत्र प्रकट करता है कि स्वचालित न्यायाधीश के रूप में उपयोग किए जाने वाले लार्ज लैंग्वेज मॉडल्स (LLMs) महत्वपूर्ण विसंगति और अविश्वसनीयता प्रदर्शित करते हैं, विशेष रूप से वित्त जैसे विनियमित डोमेन में या भाषा और मानदंडों के आधार पर भिन्नता दिखाते हुए, जो सुरक्षा आकलन में सावधानीपूर्वक कार्यान्वयन की आवश्यकता को रेखांकित करता है।

Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi2026-06-01
💬 NLP

Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models

यह शोध पत्र साइन लैंग्वेज ट्रांसलेशन मॉडल के प्रशिक्षण के लिए संदर्भ वाक्यों के नियंत्रित वेरिएंट उत्पन्न करने हेतु GPT-4o का उपयोग करके एक टार्गेट-साइड पैराफ्रेस ऑग्मेंटेशन विधि प्रस्तावित करता है, जो PHOENIX14T डेटासेट पर बेहतर BLEU स्कोर और सिमेंटिक फिडेलिटी प्रदर्शित करता है और साथ ही अत्यधिक पुनरावृत्ति वाले या अत्यंत विरल डेटा पर इस दृष्टिकोण की सीमाओं को भी रेखांकित करता है।

Pedro Dal Bianco, Jean Paul Nunes Reinhold, Oscar Stanchi, Facundo Quiroga, Franco Ronchetti, Ulisses Brisolara Corrêa2026-06-01
💬 NLP

"Intelegi Româneste?'' A Recipe for Romanian Vision-Language Models

यह शोध पत्र अंग्रेजी कॉर्पोरा को अनुवादित करके, सांस्कृतिक रूप से आधारित HoraVQA बेंचमार्क को क्यूरेट करके, और यह प्रदर्शित करके रोमानिया-विशिष्ट विजन-लैंग्वेज मॉडल्स के निर्माण पर एक व्यवस्थित अध्ययन प्रस्तुत करता है कि रोमानियाई भाषा बैकबोन के साथ अनुकूलित मॉडल सभी मूल्यांकित कार्यों में बड़े बहुभाषी समकक्षों से बेहतर प्रदर्शन करते हैं।

Mihai Masala, Marius Leordeanu, Mihai Dascalu, Traian Rebedea2026-06-01
💬 NLP

Neuro-symbolic Syntactic Parsing: Shaping a Neural Network with the CYK Algorithm

यह शोध पत्र CYKNN प्रस्तुत करता है, जो एक नवीन आवर्ती तंत्रिका नेटवर्क (recurrent neural network) आर्किटेक्चर है जो सीधे अपने प्रशिक्षित मैट्रिक्स-वेक्टर ऑपरेशन्स में कॉक-यंगर-कासमी (CYK) पार्सिंग एल्गोरिदम को समाहित करता है, और सिंटैक्टिक पार्सिंग कार्यों पर बड़े इन-कॉन्टेक्स्ट लर्निंग मॉडल्स और फाइन-ट्यून्ड छोटे LLMs दोनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Fabio Massimo Zanzotto, Federico Ranaldi, Giorgio Satta2026-06-01
💬 NLP

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

यह शोध पत्र DOA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त नीति (training-free policy) है जो बिना मॉडल पुनप्रशिक्षण की आवश्यकता के प्रभावी, कम-विलंबता वाले दीर्घ-रूप समवर्ती अनुवाद (long-form simultaneous translation) को सक्षम करने के लिए ऑफ-द-शेल्फ डिकोडर-ओनली स्पीचLLMs से सेल्फ-अटेंशन संकेतों का लाभ उठाता है।

Sara Papi, Luisa Bentivogli2026-06-01
💬 NLP

SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks

SCOPE एक डेटा-मुक्त सेल्फ-प्ले फ्रेमवर्क है जो दस्तावेज़-आधारित कार्यों को उत्पन्न करने और ग्रेड करने के लिए एक फ्रोजन सेल्फ-जज के साथ एक चैलेंजर और एक सॉल्वर को सह-विकसित करता है, जो बाहरी पर्यवेक्षण या क्यूरेटेड प्रॉम्प्ट्स पर निर्भर किए बिना कई मॉडलों में ओपन-एंडेड और शॉर्ट-फॉर्म QA प्रदर्शन में महत्वपूर्ण सुधार करता है।

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini2026-06-01