🤖 AI

Measuring AI Reasoning: A Guide for Researchers

यह शोध पत्र तर्क देता है कि एआई (AI) तर्क के मूल्यांकन को केवल अंतिम-उत्तर की सटीकता पर निर्भर रहने के बजाय एक प्रक्रिया-आधारित दृष्टिकोण की ओर स्थानांतरित होना चाहिए जो मध्यवर्ती तर्क प्रक्षेप पथों (reasoning traces) की निष्ठा और वैधता का आकलन करता है, क्योंकि अनुकूलनशील, बहु-चरणीय खोज (multi-step search), एकल फॉरवर्ड पास से संरचनात्मक रूप से भिन्न है और मॉडल के व्यवहार के निदान के लिए आवश्यक है।

Munachiso Samuel Nwadike, Zangir Iklassov, Kareem Ali, Rifo Genadi, Kentaro Inui2026-05-06
💬 NLP

Leveraging Argument Structure to Predict Content Hatefulness

यह शोध पत्र प्रदर्शित करता है कि WSF-ARG+ डेटासेट से तर्क संरचना एनोटेशन (आधार और निष्कर्ष) का लाभ उठाना श्वेत वर्चस्व वाले फ़ोरम संदेशों की समग्र घृणा को प्रभावी ढंग से अनुमानित कर सकता है, जो 96% तक F1 स्कोर प्राप्त करता है और सूचना संबंधी विकार (information disorder) से निपटने के लिए एक आशाजनक दृष्टिकोण प्रदान करता है।

Nicolás Benjamín Ocampo, Davide Ceolin2026-05-06
💬 NLP

Accurate Legal Reasoning at Scale: Neuro-Symbolic Offloading and Structural Auditability for Robust Legal Adjudication

यह शोध पत्र "अमोर्टाइज्ड इंटेलिजेंस" (Amortized Intelligence) प्रस्तुत करता है, जो एक न्यूरो-सिम्बोलिक ढांचा है जो कानूनी ग्रंथों को एक नियतात्मक ग्राफ प्रतिनिधित्व (DACL) में अनुवादित करता है ताकि लगभग पूर्ण तर्क निरंतरता, 90% से अधिक लागत में कमी और पूर्ण संरचनात्मक ऑडिटेबिलिटी प्राप्त की जा सके, जो कानूनी न्यायनिर्णयन में संभाव्य लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) की विश्वसनीयता और दक्षता की सीमाओं को प्रभावी ढंग से दूर करता है।

Stanisław Sójka, Witold Kowalczyk2026-05-06
💬 NLP

A multilingual hallucination benchmark: MultiWikiQHalluA

यह शोध पत्र MultiWikiQHalluA पेश करता है, जो 306 भाषाओं को कवर करने वाला एक बहुभाषी मतिभ्रम (hallucination) बेंचमार्क है, और इसका उपयोग यह प्रदर्शित करने के लिए करता है कि कम-संसाधन वाली भाषाओं और छोटे मॉडलों में मतिभ्रम की दर काफी अधिक है, जबकि सबसे बड़े मॉडल मूल्यांकित यूरोपीय भाषाओं में सर्वश्रेष्ठ प्रदर्शन करते हैं।

Freja Thoresen, Dan Saattrup Smart2026-05-06
💬 NLP

Revisiting Semantic Role Labeling: Efficient Structured Inference with Dependency-Informed Analysis

यह शोधपत्र सिमेंटिक रोल लेबलिंग के लिए एक आधुनिक, डिपेंडेंसी-इन्फॉर्म्ड एनकोडर-आधारित फ्रेमवर्क प्रस्तुत करता है जो लीगेसी सिस्टम्स की तुलना में 10 गुना तेज़ इन्फरेंस और तुलनीय या बेहतर प्रदर्शन प्राप्त करता है, साथ ही स्पष्ट संरचनात्मक बाधाएं प्रदान करता है और बहुभाषी प्रोजेक्शन को सक्षम बनाता है।

Sangpil Youm, Leah Jones, Bonnie J. Dorr2026-05-06
💬 NLP

Benchmarking Retrieval Strategies for Biomedical Retrieval-Augmented Generation: A Controlled Empirical Study

यह शोध पत्र एक बायोमेडिकल RAG पाइपलाइन में पांच रिट्रीवल रणनीतियों की तुलना करने वाला एक नियंत्रित अनुभवजन्य अध्ययन प्रस्तुत करता है, जिसमें पाया गया कि क्रॉस-एनकोडर रीरैंकिंग उच्चतम प्रदर्शन प्राप्त करती है जबकि सभी रिट्रीवल विधियां बिना संदर्भ के जनरेशन की तुलना में काफी बेहतर प्रदर्शन करती हैं।

Devi Prasad Bal, Subhashree Puhan2026-05-06
💬 NLP

Dependency Parsing Across the Resource Spectrum: Evaluating Architectures on High and Low-Resource Languages

यह अध्ययन दस विभिन्न प्रकार की भाषाओं में डिपेंडेंसी पार्सिंग आर्किटेक्चर का मूल्यांकन करता है और पाता है कि जहाँ ट्रांसफॉर्मर मॉडल प्रचुर डेटा के साथ उत्कृष्ट प्रदर्शन करते हैं, वहीं सरल बाइएफिन (Biaffine) एलएसटीएम (LSTM) कम-संसाधन वाले क्षेत्रों में, विशेष रूप से रूपात्मक रूप से जटिल अफ्रीकी भाषाओं के लिए, तब तक लगातार उनसे बेहतर प्रदर्शन करता है जब तक कि पर्याप्त एनोटेटेड डेटा उपलब्ध न हो जाए।

Kevin Guan, Happy Buzaaba, Christiane Fellbaum2026-05-06
💬 NLP

Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race

एक एजेंटिक रिसर्च हार्नेस का उपयोग करके ACL 2026 के एक अध्ययन को पुनरुत्पादित और विस्तारित करते हुए, यह शोध पत्र प्रदर्शित करता है कि GPT-5.5 और Claude Opus 4.7 जैसे फ्रंटियर LLMs न केवल व्यक्तिगत लेखन शैलियों की नकल करने में मानव पोस्ट-एडिटिंग से आगे निकल सकते हैं, बल्कि पुनरावृत्ति प्रतिरोधी फीडबैक (iterative adversarial feedback) के माध्यम से AI-टेक्स्ट डिटेक्टरों से प्रभावी ढंग से बचने में भी सक्षम हैं, जो AI-डिटेक्शन आर्म्स रेस के भविष्य के संबंध में महत्वपूर्ण चिंताएं पैदा करता है।

Andreas Maier, Moritz Zaiss, Siming Bayer2026-05-06
💬 NLP

Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations

यह शोध पत्र "realsim" प्रस्तुत करता है, जो 1,000 मल्टी-टर्न संवादों के एक क्यूरेटेड डेटासेट का उपयोग करके आठ आयामों के माध्यम से उपयोगकर्ता सिमुलेशन यथार्थवाद का आकलन करने के लिए एक वितरण मूल्यांकन ढांचा (distributional evaluation framework) है, जो यह प्रकट करता है कि वर्तमान सिम्युलेटेड उपयोगकर्ता अक्सर वास्तविक दुनिया के संचार घर्षणों (communication frictions) को पकड़ने में विफल रहते हैं और विभिन्न अनुप्रयोग डोमेन में महत्वपूर्ण प्रदर्शन परिवर्तनशीलता प्रदर्शित करते हैं।

Yu Lu Liu, Hyokun Yun, Tanya Roosta, Ziang Xiao2026-05-06
💬 NLP

ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

यह शोधपत्र ContextualJailbreak को पेश करता है, जो एक विकासवादी रेड-टीमिंग फ्रेमवर्क है जो मल्टी-टर्न कन्वर्सेशनल प्राइमिंग को अनुकूलित करने के लिए नवीन म्यूटेशन ऑपरेटर्स और श्रेणीबद्ध हानि स्कोरिंग (graded harm scoring) का उपयोग करता है, जो विभिन्न ओपन मॉडल्स पर लगभग पूर्ण जेलब्रेक सफलता दर प्राप्त करता है और विभिन्न प्रदाताओं के बीच अलाइनमेंट रोबस्टनेस में स्पष्ट विषमताओं को प्रकट करते हुए क्लोज्ड फ्रंटियर मॉडल्स में महत्वपूर्ण ट्रांसफ़रैबिलिटी प्रदर्शित करता है।

Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin, Jose L. Hernández-Ramos2026-05-06