💬 NLP

Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks

यह शोध पत्र तर्क की कठिनाई के दो आयामों (गहराई और जटिलता) और चार तर्क परिवारों (reasoning families) में 'वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) का अध्ययन करने के लिए एक नियंत्रित सिंथेटिक वातावरण प्रस्तुत करता है, जो यह प्रकट करता है कि इन कारकों का संयुक्त कवरेज और समान डेटा मिश्रण, एकल-अक्ष या चरणबद्ध दृष्टिकोणों की तुलना में बेहतर प्रदर्शन करते हैं, जबकि वर्तमान मॉडलों में एक निरंतर डीडक्टिव-ओवर-एबडक्टिव (deductive-over-abductive) विषमता को भी उजागर करते हैं।

Yihua Zhu, Qianying Liu, Fei Cheng, Jiaxin Wang, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira2026-05-27
💬 NLP

DunbaaBERT: From Sacrifice to Semantics

यह शोधपत्र DunbaaBERT को प्रस्तुत करता है, जो एक विशाल कॉर्पस पर स्क्रैच से प्रशिक्षित उर्दू-विशिष्ट RoBERTa-base मॉडलों का एक परिवार है, जो यह प्रदर्शित करता है कि सावधानीपूर्वक क्यूरेट किए गए, छोटे वोकैबुलरी वाले कॉम्पैक्ट मॉडल विभिन्न उर्दू एनएलपी कार्यों में बड़े बहुभाषी बेसलाइन की तुलना में प्रतिस्पर्धी प्रदर्शन और अनुकूल दक्षता ट्रेड-ऑफ प्राप्त कर सकते हैं।

Iffat Maab, Waleed Jamil, Raphael Schmitt2026-05-27
💬 NLP

Beyond Questions: Evaluating What Large Language Models (Actually) Know

यह शोध पत्र "बियॉन्ड क्वेश्चन्स" (BeQu) को प्रस्तुत करता है, जो एक नया ओपन नॉलेज इवैल्यूएशन प्रतिमान है जो बड़े भाषा मॉडलों का मूल्यांकन पूर्व-निर्धारित प्रश्नों के बजाय ओपन-एंडेड एलिसिटेशन के माध्यम से स्वाभाविक रूप से व्यक्त किए गए उनके ज्ञान पर करता है, जो स्केल और रीजनिंग एफर्ट जैसे विभिन्न कारकों पर मॉडल की क्षमताओं के बारे में महत्वपूर्ण अंतर्दृष्टि प्रकट करता है।

Luca Giordano, Simon Razniewski2026-05-27
💬 NLP

JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

यह शोध पत्र JuICE को प्रस्तुत करता है, जो एक बहुभाषी बेंचमार्क डेटासेट है जिसे सूक्ष्म, संदर्भ-निर्भर सांस्कृतिक त्रुटियों का पता लगाने में LLM-जजों की सीमाओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल उन "घने" (thick) सांस्कृतिक बारीकियों को पहचानने में संघर्ष करते हैं जिन्हें मूल वक्ता आसानी से पहचान लेते हैं।

Jiho Jin, Junho Myung, Juhyun Oh, Junyeong Park, Rifki Afina Putri, Sunipa Dev, Vinodkumar Prabhakaran, Alice Oh2026-05-27
💬 NLP

Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling

यह शोध पत्र Recon प्रस्तुत करता है, जो एक ऐसी विधि है जो तर्क संबंधी निशानों (reasoning traces) को उनकी उपयोगकर्ता क्रियाओं को भविष्योन्मुखी रूप से पुनर्निर्मित करने की क्षमता के आधार पर स्कोर और संश्लेषित करके उपयोगकर्ता मॉडलिंग में सुधार करती है, जिससे अप्रभावी उत्तरवर्ती औचित्य (post-hoc rationalization) से आगे बढ़कर वास्तविक कारण संबंधी निर्णय पथों को कैप्चर किया जा सके।

Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez2026-05-27
💬 NLP

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

यह शोध पत्र कम-संसाधन वाले गैर-लैटिन लिपि टेक्स्ट-टू-स्पीच मूल्यांकन के लिए एक स्वचालित स्क्रीनिंग फ्रेमवर्क, INSV-A को प्रस्तुत करता है, और इसे PashtoTTS-Bench के रूप में स्थापित करता है ताकि ASR वर्ड एरर रेट, स्क्रिप्ट फिडेलिटी और लैंग्वेज आइडेंटिफिकेशन जैसे मेट्रिक्स का उपयोग करके पश्तो पर कई TTS सिस्टम का व्यवस्थित रूप से आकलन किया जा सके।

Hanif Rahman2026-05-27
💬 NLP

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

यह शोध पत्र एक परिनियोजन-जागरूक (deployment-aware) मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि प्रॉम्प्ट इंजेक्शन डिटेक्शन का प्रदर्शन अत्यधिक रिजीम-निर्भर और थ्रेशोल्ड चयन के प्रति संवेदनशील है, जो यह प्रकट करता है कि जहाँ ट्रांसफॉर्मर-आधारित मॉडल समग्र रूप से सबसे मजबूत परिणाम प्रदान करते हैं, वहीं व्याख्या योग्य संरचनात्मक संकेत विशिष्ट परिचालन परिदृश्यों में निरंतर लाभ प्रदान करते हैं और रैंकिंग मेट्रिक्स एवं वास्तविक दुनिया की प्रभावशीलता के बीच महत्वपूर्ण अंतर को उजागर करते हैं।

Akindoyin Akinrele, Shreyank N Gowda2026-05-27
💬 NLP

Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling

यह शोध पत्र कोलैबोरेटिव पैरेलल थिंकिंग (CPT) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो समानांतर रीजनिंग शाखाओं को वास्तविक समय में मध्यवर्ती खोजों को साझा करने और पुन: उपयोग करने में सक्षम बनाकर टेस्ट-टाइम स्केलिंग दक्षता को बढ़ाता है, जिससे अनावश्यक अन्वेषण कम होता है और गणितीय बेंचमार्क पर बेहतर सटीकता-विलंबता ट्रेड-ऑफ प्राप्त होता है।

Xinglin Wang, Hao Lin, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Y (…)2026-05-27
💬 NLP

Tracing Computation Density in LLMs

यह शोध पत्र s-Trace पद्धति को प्रस्तुत करता है जो यह प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स एक मॉड्यूलर, दो-चरणीय तरीके से कार्य करते हैं जहाँ शुरुआती परतों का एक स्पार्स सबग्राफ उथले सांख्यिकी (shallow statistics) के आधार पर एक मोटा अनुमान प्रदान करता है, जिसे बाद की परतों में सघन गणनाओं द्वारा क्रमिक रूप से परिष्कृत किया जाता है, जिसमें आवश्यक गणना की मात्रा मॉडल अनिश्चितता के साथ सह-संबंधित होती है।

Corentin Kervadec, Iuliia Lysova, Iuri Macocco, Marco Baroni, Gemma Boleda2026-05-27
💬 NLP

ExTax: Explainable Disinformation Detection via Persuasion, Emotion, and Narrative Role Taxonomies

ExTax एक नवीन, व्याख्यात्मक दुष्प्रचार पहचान ढांचा है जो सटीकता और मजबूती में अत्याधुनिक बेसलाइन से बेहतर प्रदर्शन करने के लिए प्रेरक वक्तृत्व, भावनात्मक हेरफेर और कथा भूमिकाओं के 17 आयामों को एक वर्गीकरण स्थान में एकीकृत करता है और मानव-ऑडिट योग्य हेरफेर प्रोफाइल प्रदान करता है।

Shang Luo, Yingguang Yang, Zhenchen Sun, Yang Liu, Bin Chong, Jingru Chen, Yancheng Chen, Jiayu Liang, Kefu Xu, Hao Peng (…)2026-05-27