💬 NLP

CommonMorph: Participatory Morphological Documentation Platform

यह शोधपत्र CommonMorph को प्रस्तुत करता है, जो एक ओपन-सोर्स, सहभागी मंच है जो विशेषज्ञ परिभाषाओं, सामुदायिक उद्दलन (community elicitation) और सक्रिय शिक्षण (active learning) को मिलाकर इंटरऑपरेबल, UniMorph-संगत डेटासेट बनाने के माध्यम से कम-संसाधन वाली भाषाओं के रूपात्मक दस्तावेजीकरण (morphological documentation) को गति प्रदान करता है।

Aso Mahmudi, Sina Ahmadi, Kemal Kurniawan, Rico Sennrich, Eduard Hovy, Ekaterina Vylomova2026-04-07
💬 NLP

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

यह शोध पत्र प्रदर्शित करता है कि डेवलपर-एजेंट फ्रेमवर्क की प्रदर्शन रैंकिंग मूल्यांकन भाषा और जज बैकबोन के प्रति अत्यधिक संवेदनशील है, जो यह प्रकट करता है कि कोई भी एकल मॉडल सभी भाषाओं में प्रभुत्व नहीं रखता है और सटीक बहुभाषी मूल्यांकन के लिए जज निर्देशों का स्थानीयकरण करना महत्वपूर्ण है।

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban2026-04-07
💬 NLP

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

सात मॉडलों पर 10,000-परीक्षणों के एक व्यवस्थित अध्ययन के माध्यम से, यह शोध पत्र प्रकट करता है कि जबकि अधिकांश सामान्य प्रतिकूल प्रॉम्प्ट तकनीकें एलएलएम (LLM) एजेंटों को कमजोरियों का फायदा उठाने के लिए उकसाने में विफल रहती हैं, विशिष्ट "लक्ष्य पुनर्गठन" (goal reframing) निर्देश जो कार्यों को पहेलियों के रूप में पुनर्व्याख्या करते हैं, विश्वसनीय रूप से सुरक्षा नियमों को दरकिनार कर देते हैं, जो यह सुझाव देता है कि रक्षकों को व्यापक प्रतिकूल श्रेणियों के बजाय इस सूक्ष्म भाषाई पैटर्न के लिए ऑडिटिंग को प्राथमिकता देनी चाहिए।

Charafeddine Mouzouni2026-04-07
💬 NLP

Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation

यह शोध पत्र पश्तो पर बहुभाषी स्वचालित वाक् पहचान (ऑटोमैटिक स्पीच रिकग्निशन) के लिए पहले पुनरुत्पादक बेंचमार्क को प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ ज़ीरो-शॉट मॉडल अत्यधिक त्रुटि दरों और पश्तो लिपि उत्पन्न करने में गंभीर विफलता से ग्रस्त हैं, वहीं फाइन-ट्यून्ड मॉडल अभी भी महत्वपूर्ण क्रॉस-डोमेन गिरावट का सामना करते हैं, जिसमें विशिष्ट ध्वनियाँ (फोनीम) असमान रूप से त्रुटियों को प्रेरित करती हैं।

Hanif Rahman2026-04-07
💬 NLP

On Ambiguity: The case of fraction, its meanings and roles

यह शोध पत्र "fracterm", "fracvalue" और "fracsign" जैसे सटीक भेदों को पेश करके प्रारंभिक अंकगणित में "fraction" (भिन्न) शब्द की अस्पष्टता को संबोधित करता है ताकि इसे एक एकल गणितीय अवधारणा के बजाय अवधारणाओं की एक सामूहिक श्रेणी के रूप में पुनर्वर्गीकृत किया जा सके, साथ ही संख्या प्रणालियों की परिभाषा और संरचनावाद (structuralism) के लिए इसके निहितार्थों का भी अन्वेषण किया जा सके।

Jan A Bergstra, John V Tucker2026-04-07
💬 NLP

Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity

यह शोध पत्र इस धारणा को चुनौती देता है कि दृश्य साक्ष्य हमेशा मल्टीमॉडल तथ्य-जांच (fact-checking) में सुधार करते हैं, और इसके बजाय AMuFC का प्रस्ताव देता है, जो एक अनुकूलन योग्य ढांचा है जो दृश्य आवश्यकता निर्धारित करने के लिए एक सहयोगात्मक विश्लेषक (Analyzer) और दावे की सत्यता का आकलन करने के लिए एक सत्यापित्र (Verifier) का उपयोग करता है, जिससे मानक और हाल ही में जारी किए गए एक यथार्थवादी डेटासेट पर बेहतर प्रदर्शन प्राप्त होता है।

Jaeyoon Jung, Yejun Yoon, Kunwoo Park2026-04-07
💬 NLP

IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation

यह शोध पत्र IDIOLEX को प्रस्तुत करता है, जो वाक्य के स्रोत (sentence provenance) को भाषाई विशेषताओं के साथ जोड़कर व्यक्तिगत और सामुदायिक स्तर की शैलीगत एवं बोली संबंधी भिन्नता के निरंतर, विषय-विच्छेदित (content-decoupled) निरूपणों को सीखने वाला एक ढांचा है, जो बोली विश्लेषण और भाषा मॉडलों के लिए शैलीगत संरेखण में उनकी प्रभावशीलता को प्रदर्शित करता है।

Anjali Kantharuban, Aarohi Srivastava, Fahim Faisal, Orevaoghene Ahia, Antonios Anastasopoulos, David Chiang, Yulia Tsve (…)2026-04-07
💬 NLP

What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features

यह शोध पत्र इस धारणा को चुनौती देता है कि अंग्रेजी-केंद्रित तर्क पैटर्न बहुभाषी लार्ज रीजनिंग मॉडल्स के लिए सार्वभौमिक रूप से इष्टतम हैं, और मापने योग्य तर्क विशेषताओं को परिभाषित करते हुए तथा यह प्रदर्शित करते हुए कि सटीकता के साथ उनका संबंध विभिन्न भाषाओं में महत्वपूर्ण रूप से भिन्न होता है, भाषा-विशिष्ट तर्क पैटर्न को समायोजित करने वाले अनुकूलन योग्य उद्देश्यों की वकालत करता है।

Dayeon Ki, Kevin Duh, Marine Carpuat2026-04-07
🤖 machine learning

Darkness Visible: Reading the Exception Handler of a Language Model

यह शोध पत्र प्रकट करता है कि GPT-2 Small की अंतिम MLP परत में एक पूर्णतः पठनीय, तीन-स्तरीय अपवाद हैंडलर (exception handler) मौजूद है, जो 27 नामित न्यूरॉन्स से बना है और जो तथ्यात्मक ज्ञान को संग्रहीत करने के बजाय टोकन-स्तर की पूर्वानुमेयता को प्रबंधित करने के लिए रूटिंग इंफ्रास्ट्रक्चर के रूप में कार्य करता है।

Peter Balogh2026-04-07
💬 NLP

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

यह शोध पत्र व्यापक रूप से तैनात OpenClaw एजेंट का पहला वास्तविक दुनिया का सुरक्षा मूल्यांकन प्रस्तुत करता है, जिसमें एक CIK (क्षमता, पहचान, ज्ञान) वर्गीकरण पेश किया गया है ताकि यह प्रदर्शित किया जा सके कि किसी भी एकल आयाम को विषाक्त करने से हमले की सफलता दर नाटकीय रूप से बढ़ जाती है और यह उजागर किया गया है कि वर्तमान रक्षा रणनीतियां अंतर्निहित वास्तुशिल्प कमजोरियों के विरुद्ध अपर्याप्त बनी हुई हैं।

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Sh (…)2026-04-07