💬 NLP

HalleluBERT: Let Every Token That Has Meaning Bear Its Weight

यह शोध पत्र HalleluBERT को प्रस्तुत करता है, जो एक RoBERTa-आधारित एनकोडर परिवार है जिसे एक बड़े हिब्रू कॉर्पस पर स्क्रैच से प्रशिक्षित किया गया है और जो प्रमुख हिब्रू एनएलपी बेंचमार्क पर मौजूदा मोनोलिंगुअल और मल्टीलिंगुअल बेसलाइन से बेहतर प्रदर्शन करता है, जिसके इसके वेट्स (weights) और टोकेनाइज़र को पुनरुत्पादक अनुसंधान को आगे बढ़ाने के लिए MIT लाइसेंस के तहत जारी किया गया है।

Raphael Schmitt2026-06-02
💬 NLP

Optimizing Diversity and Quality through Base-Aligned Model Collaboration

यह शोध पत्र बेस-अलाइन्ड मॉडल कोलैबोरेशन (BACo) का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम फ्रेमवर्क है जो बिना किसी महंगे रिट्रेनिंग के आउटपुट विविधता और गुणवत्ता को एक साथ अनुकूलित करने के लिए एक बेस और एक अलाइन्ड लार्ज लैंग्वेज मॉडल के बीच टोकन-लेवल डिकोडिंग को गतिशील रूप से रूट करता है।

Yichen Wang, Chenghao Yang, Tenghao Huang, Muhao Chen, Jonathan May, Mina Lee2026-06-02
💬 NLP

Latent Reasoning in TRMs is Secretly a Policy Improvement Operator

यह शोध पत्र प्रदर्शित करता है कि छोटे मॉडलों में लेटेंट रिकर्सिव रीजनिंग (latent recursive reasoning) एक पॉलिसी इम्प्रूवमेंट ऑपरेटर के रूप में कार्य करती है, जो अप्रभावी कंप्यूटेशन स्टेप्स को समाप्त करने और प्रदर्शन को बनाए रखते हुए फॉरवर्ड पासेस को महत्वपूर्ण रूप से कम करने के लिए रिइन्फोर्समेंट लर्निंग और डिफ्यूजन ट्रेनिंग स्कीम्स के अनुप्रयोग को सक्षम बनाती है।

Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac2026-06-02
💬 NLP

NormEval: A Unified Multi-Metric Framework for Evaluating Semantic Fidelity in Text Normalization

यह शोधपत्र NormEval को प्रस्तुत करता है, जो एक एकीकृत बहु-मापन ढांचा (unified multi-metric framework) है जो दक्षता, डाउनस्ट्रीम उपयोगिता और रूपात्मक निष्ठा (morphological fidelity) के across टेक्स्ट नॉर्मलाइजेशन की गुणवत्ता का समग्र रूप से मूल्यांकन करने के लिए पांच पूरक मेट्रिक्स को संयोजित करता है, जिससे अलग-थलग मूल्यांकन विधियों की सीमाओं के कारण होने वाली भ्रामक रैंकिंग को रोका जा सके।

Md Abdullah Al Kafi, Raka Moni, Walayat Hussain2026-06-02
💬 NLP

Latent Collaboration in Multi-Agent Systems

यह शोध पत्र LatentMAS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो मल्टी-एजेंट सिस्टम को साझा हिडन एम्बेडिंग के माध्यम से सीधे निरंतर लेटेंट स्पेस (continuous latent space) के भीतर सहयोग करने में सक्षम बनाता है, जिससे पारंपरिक टेक्स्ट-आधारित दृष्टिकोणों की तुलना में बेहतर तर्क प्रदर्शन, महत्वपूर्ण टोकन कमी और तेज़ इन्फरेंस प्राप्त होता है।

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He (…)2026-06-02
💬 NLP

ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education

यह शोध पत्र ClinTutor-R1 को प्रस्तुत करता है, जो ClinTeach डेटासेट पर प्रशिक्षित और व्यापक सिमुलेशन एवं उपयोगकर्ता अध्ययनों के माध्यम से मान्य एक नवीन विजन-लैंग्वेज एजेंट है, जो व्यक्तिगत छात्र आवश्यकताओं और समूह सर्वसम्मति को एक साथ मॉडल करके क्लिनिकल सोक्रेटिक शिक्षा में 'वन-टू-मेनी' संरेखण (one-to-many alignment) की चुनौतियों का प्रभावी ढंग से समाधान करता है।

Zhitao He, Haolin Yang, Zeyu Qin, Yi R Fung2026-06-02
💬 NLP

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning

यह शोधपत्र ReasonBench का परिचय देता है, जो एक ऐसा बेंचमार्क सुइट है जो यह प्रदर्शित करता है कि LLM तर्क प्रदर्शन बार-बार निष्पादन के दौरान महत्वपूर्ण, संरचित अस्थिरता प्रदर्शित करता है, जिससे यह तर्क दिया जाता है कि एकल-बिंदु मूल्यांकन अपर्याप्त हैं और गुणवत्ता, लागत एवं विश्वसनीयता के बीच के व्यापारों को सटीक रूप से पकड़ने के लिए वितरण-जागरूक मूल्यांकन की वकालत की जाती है।

Nearchos Potamitis, Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Lars Klein, Akhil Arora2026-06-02
💬 NLP

Uncovering Competency Gaps in Large Language Models and Their Benchmarks

यह शोध पत्र स्पार्स ऑटोएन्कोडर कॉन्सेप्ट एक्टिवेशन्स का उपयोग करने वाली एक अनसुपरवाइज्ड विधि प्रस्तुत करता है जो "मॉडल गैप्स" (लार्ज लैंग्वेज मॉडल्स की विशिष्ट कमजोरियां) और "बेंचमार्क गैप्स" (कवरेज असंतुलन) दोनों को स्वचालित रूप से पहचानने और विघटित करने के लिए, मौजूदा मानकीकृत बेंचमार्क के पूरक के रूप में एक सूक्ष्म, कॉन्सेप्ट-स्तरीय मूल्यांकन प्रदान करता है।

Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan2026-06-02
⚡ electrical engineering

SARA: Stress Test Reasoning in Audio Deepfake Detection

यह शोधपत्र SARA प्रस्तुत करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो प्रतिकूल हमलों (adversarial attacks) के विरुद्ध ऑडियो लैंग्वेज मॉडल्स के रीजनिंग ट्रेसेस की मजबूती का मूल्यांकन करता है, यह प्रकट करते हुए कि हालांकि ऐसे हमले भविष्यवाणियों की सुसंगतता को कम कर देते हैं, रीजनिंग की भाषाई सुसंगतता स्वयं हेरफेर किए गए ऑडियो का पता लगाने के लिए एक विश्वसनीय, सिग्नल-मुक्त संकेतक के रूप में कार्य कर सकती है।

Binh Nguyen, Charles Fleming, Thai Le2026-06-02
💬 NLP

Assessment of Generative Named Entity Recognition in the Era of Large Language Models

यह शोध पत्र जनरेटिव नेम्ड एंटिटी रिकग्निशन के लिए ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रदर्शित करता है कि पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग और स्ट्रक्चर्ड आउटपुट फॉर्मेट के साथ, वे सामान्य मॉडल क्षमताओं से समझौता किए बिना, रटने के बजाय इंस्ट्रक्शन-फॉलोइंग क्षमताओं पर निर्भर करते हुए पारंपरिक मॉडल्स के प्रतिस्पर्धी प्रदर्शन को प्राप्त करते हैं।

Qi Zhan, Yile Wang, Hui Huang2026-06-02