💬 NLP

From Intuition to Calibrated Judgment: A Rubric-Based Expert-Panel Study of Human Detection of LLM-Generated Korean Text

यह शोध पत्र LREAD को प्रस्तुत करता है, जो एक रूब्रिक-आधारित विशेषज्ञ-कैलिब्रेशन ढांचा है जो सहज निर्णयों से मानदंड-आधारित स्कोरिंग की ओर स्थानांतरित होकर मानव एनोटेटरों की कोरियाई LLM-जनित पाठ को मानव लेखन से अलग करने की क्षमता में महत्वपूर्ण सुधार करता है, जिससे सटीकता 60% से बढ़कर 90% हो जाती है और अंतर-रेटर्स सहमति में वृद्धि होती है।

Shinwoo Park, Yo-Sub Han2026-03-17
💬 NLP

Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study

यह शोध पत्र दुर्भावनापूर्ण तृतीय-पक्ष एजेंट कौशल का पहला बड़े पैमाने पर अनुभवजन्य अध्ययन प्रस्तुत करता है, जो 157 पुष्ट खतरों के एक लेबल वाले डेटासेट को पेश करता है जो आपूर्ति श्रृंखला की कमजोरियों और प्लेटफॉर्म हुक का फायदा उठाने वाले डेटा चोरों और एजेंट अपहरणकर्ताओं के एक विभाजित पारिस्थितिकी तंत्र को प्रकट करते हैं, जबकि इन जोखिमों में से 93.6% को हटाने में जिम्मेदार प्रकटीकरण की प्रभावशीलता को प्रदर्शित करता है।

Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Ying Zhang, Leo Yu Zhang2026-03-17
💬 NLP

Targum - A Multilingual New Testament Translation Corpus

यह शोधपत्र "तर्गुम" (Targum) प्रस्तुत करता है, जो पाँच यूरोपीय भाषाओं में नए नियम (New Testament) के 651 अनुवादों का एक बहुभाषी संग्रह है, जो अनुवाद के इतिहास के लचीले, बहु-स्तरीय मात्रात्मक विश्लेषण को सक्षम करने के लिए अभूतपूर्व गहराई और मानकीकृत मेटाडेटा प्रदान करता है।

Maciej Rapacz, Aleksander Smywiński-Pohl2026-03-17
⚡ electrical engineering

Covo-Audio Technical Report

यह शोध पत्र Covo-Audio को प्रस्तुत करता है, जो एक 7B-पैरामीटर वाला एंड-टू-एंड लार्ज ऑडियो-लैंग्वेज मॉडल है जो विविध स्पीच और ऑडियो कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए निरंतर ऑडियो प्रोसेसिंग और जनरेशन को एकीकृत करता है, साथ ही स्पोकन डायलॉग और फुल-डुप्लेक्स इंटरेक्शन के लिए विशिष्ट वेरिएंट और डायलॉग इंटेलिजेंस को वॉयस रेंडरिंग से अलग करने के लिए एक लागत प्रभावी रणनीति भी प्रदान करता है।

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zik (…)2026-03-17
💬 NLP

When Tables Go Crazy: Evaluating Multimodal Models on French Financial Documents

यह शोध पत्र "मल्टीमॉडल फाइनेंस इवैल" (Multimodal Finance Eval) को प्रस्तुत करता है, जो फ्रांसीसी वित्तीय दस्तावेज़ समझ के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि जहाँ वर्तमान विज़न-लैंग्वेज मॉडल टेक्स्ट और टेबल निष्कर्षण में उत्कृष्ट हैं, वहीं वे चार्ट की व्याख्या करने में काफी संघर्ष करते हैं और मल्टी-टर्न कन्वर्सेशनल रीजनिंग में एरर प्रोपेगेशन (त्रुटि प्रसार) से ग्रस्त होते हैं।

Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah2026-03-17
💬 NLP

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

PolyFrame सिस्टम MWE-2026 AdMIRe2 साझा कार्य में मल्टीमॉडल मुहावरा विसंकेतन (multimodal idiom disambiguation) की चुनौती को संबोधित करने के लिए फ्रोजन CLIP और BGE M3 एनकोडर द्वारा संवर्धित एक एकीकृत पाइपलाइन का उपयोग करता है, जिसमें इडियम-अवेयर पैराफ्रेसिंग और सेंटेंस-टाइप प्रेडिक्शन जैसे हल्के मॉड्यूल शामिल हैं, जो बड़े मॉडलों को फाइन-ट्यून किए बिना महत्वपूर्ण प्रदर्शन लाभ और मजबूत ज़ीरो-शॉट बहुभाषी स्थानांतरण प्राप्त करते हैं।

Nina Hosseini-Kivanani2026-03-17
💬 NLP

Under the Influence: Quantifying Persuasion and Vigilance in Large Language Models

यह शोध पत्र एक सोकोबन-आधारित मल्टी-टर्न गेम का उपयोग करके लार्ज लैंग्वेज मॉडल्स में अनुनय (persuasion), सतर्कता (vigilance) और कार्य प्रदर्शन के बीच के संबंध की जांच करता है, जो यह प्रकट करता है कि ये क्षमताएं विच्छेदनीय (dissociable) हैं और जबकि मॉडल धोखे का पता लगाने में विफल हो सकते हैं, वे सलाह के कथित इरादे के आधार पर अपने तर्क के प्रयास को निरंतर नियंत्रित करते हैं।

Sasha Robinson, Katherine M. Collins, Ilia Sucholutsky, Kelsey R. Allen2026-03-17
💬 NLP

TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models

यह शोध पत्र TARAZ प्रस्तुत करता है, जो एक नवीन फारसी लघु-उत्तर बेंचमार्क और हाइब्रिड मूल्यांकन ढांचा है जो रूपात्मक सामान्यीकरण (morphological normalization) और अर्थ संबंधी समानता स्कोरिंग के माध्यम से बड़े भाषा मॉडलों की सांस्कृतिक सक्षमता का अधिक सटीक रूप से आकलन करने के लिए मौजूदा बहुविकल्पीय और सटीक-मिलान मेट्रिक्स की सीमाओं को दूर करता है।

Reihaneh Iranmanesh, Saeedeh Davoudi, Pasha Abrishamchian, Ophir Frieder, Nazli Goharian2026-03-17
💬 NLP

LLM Novice Uplift on Dual-Use, In Silico Biology Tasks

यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स तक पहुँच नए उपयोगकर्ताओं को जैव-सुरक्षा से संबंधित कार्यों में केवल इंटरनेट का उपयोग करने वाले नवागंतुकों और, कुछ मामलों में, जैविक विशेषज्ञों से भी बेहतर प्रदर्शन करने के लिए महत्वपूर्ण रूप से सशक्त बनाती है, जबकि यह यह भी प्रकट करती है कि वर्तमान सुरक्षा उपाय दोहरे उपयोग वाली जानकारी प्राप्त करने से रोकने के लिए अपर्याप्त हैं।

Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yur (…)2026-03-17
💬 NLP

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में मशीन अनलर्निंग अक्सर वास्तविक बहु-चरण संवादात्मक परिवेशों में मजबूत ज्ञान विलोपन प्राप्त करने में विफल रहती है, क्योंकि विस्मृत जानकारी को आत्म-सुधार और संवाद-आधारित पूछताछ के माध्यम से पुनः प्राप्त किया जा सकता है, जो यह सुझाव देता है कि वर्तमान स्थिर मूल्यांकन वास्तविक दुनिया की प्रभावशीलता का अत्यधिक आकलन करते हैं।

Ruihao Pan, Suhang Wang2026-03-17