💬 NLP

KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding

यह शोध पत्र KyrgyzLLM-Bench को प्रस्तुत करता है, जो कि पहली बड़े पैमाने की बेंचमार्क सुइट है जिसमें मूल रूप से रचित और सावधानीपूर्वक अनुवादित डेटासेट शामिल हैं, ताकि किलीज़ (Kyrgyz) भाषा की समझ पर 26 बड़े भाषा मॉडलों का व्यवस्थित रूप से मूल्यांकन किया जा सके, जो क्रॉस-लिंगुअल प्रदर्शन हस्तांतरण और अनुवाद संबंधी आर्टिफैक्ट्स के प्रभाव में महत्वपूर्ण अंतर्दृष्टि को प्रकट करता है।

Timur Turatali, Aida Turdubaeva, Rustem Izmailov, Anton M. Alekseev, Sergey I. Nikolenko2026-07-21
💬 NLP

Literary Non-Style in LLM-Generated Text

यह शोध पत्र यह तर्क देता है कि LLM-जनित पाठ की विशिष्ट "गैर-शैली" (non-style) विशिष्ट सांख्यिकीय n-ग्राम पैटर्न से उत्पन्न होती है जो अर्थ संबंधी सीमाओं को प्रकट करते हैं, यह प्रदर्शित करते हुए कि AI लेखन में शैलीगत और अर्थ संबंधी गुण मौलिक रूप से आपस में जुड़े हुए हैं न कि अलग करने योग्य।

Cory Massaro2026-07-21
💬 NLP

Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?

इस धारणा को चुनौती देते हुए कि मल्टीमॉडल सेंटीमेंट एनालिसिस में सभी लुप्त मोडैलिटीज़ (missing modalities) की मरम्मत की जानी चाहिए, यह पेपर SIEVE का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो भविष्यवाणी प्रदर्शन को अनुकूलित करने के लिए पर्याप्तता संकेतों (sufficiency signals) और एपिस्टेमिक अनसर्टेन्टी (epistemic uncertainty) का लाभ उठाकर यह सीखने के लिए कि क्या लुप्त इनपुट की मरम्मत करनी है, नमूना-स्तरीय निर्णय (sample-level decisions) लेता है।

Yubo Gao, Haotian Wu, Xiaoyu Xu, Yibo Yan, Hong Chen, Ruoshui Peng, Fei Pan, Puay Siew Tan, Zhuoran Gao, Yonghua Hei, Ji (…)2026-07-21
💬 NLP

Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models

यह अध्ययन प्रकट करता है कि जहाँ फ्रंटियर लार्ज लैंग्वेज मॉडल्स अंग्रेजी और हौसा दोनों में नैदानिक सुरक्षा बनाए रखते हैं, वहीं स्थानीय स्तर पर तैनात होने वाले स्मॉल मॉडल्स हौसा में गंभीर सुरक्षा विचलन (सेफ्टी ड्रिफ्ट) प्रदर्शित करते हैं, जो अंग्रेजी में पर्याप्त प्रदर्शन करने के बावजूद नैदानिक रूप से सही प्रतिक्रियाओं से सक्रिय रूप से हानिकारक प्रतिक्रियाओं तक गिर जाता है, जो यह संकेत देता है कि सुरक्षा की यह कमी भाषा या नैदानिक सामग्री के बजाय मॉडल क्लास से उत्पन्न होती है।

Anthonio Oladimeji Gabriel, Dimeji Olawuyi, Toba Ajayi, Temilola Aderemi2026-07-21
💬 NLP

DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

यह शोध पत्र DRNOISE को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि डीप रिसर्च एजेंट ओपन-वेब वातावरण में विश्वसनीय दिखने वाले भ्रामक दस्तावेज़ों का सामना करने पर सटीकता में महत्वपूर्ण गिरावट का शिकार होते हैं, जिसका मुख्य कारण "वेरिफिकेशन इनर्शिया" (सत्यापन जड़ता) नामक एक विफलता मोड है जहाँ एजेंट पुष्टिकारक साक्ष्यों के साथ सक्रिय रूप से सामंजस्य बिठाने के बजाय सीधे गलत दावों के प्रति समयपूर्व समर्पण कर देते हैं।

Jun Nie, Zhiqin Yang, Zhenheng Tang, Yonggang Zhang, Xiaowen Chu, Xinmei Tian, Bo Han2026-07-21
💬 NLP

Team DACTYL at PAN 2026: Bayesian Data Mixing and Empirical X-risk Minimization for AI-text Detection

टीम DACTYL डेटासेट क्यूरेशन के लिए बेयसियन डेटा मिक्सिंग और एम्पिरिकल X-रिस्क मिनिमाइजेशन को नियोजित करके AI-टेक्स्ट डिटेक्शन में आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन अंतराल को संबोधित करती है, जिससे एक MCGrad-कैलिब्रेटेड ModernBERT-large मॉडल के साथ शीर्ष लीडरबोर्ड रैंक प्राप्त की गई जिसने PAN 2026 टेस्ट सेट पर 0.974 का माध्य स्कोर प्राप्त किया।

Shantanu Thorat2026-07-21
💰 quantitative finance

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

यह अध्ययन प्रदर्शित करता है कि "एब्लीटरेशन" (abliteration), जो एआई मॉडलों से इनकार तंत्र (refusal mechanisms) को हटाने की प्रक्रिया है, निर्णय लेने के रुझानों—जैसे कि बढ़ी हुई आशावादिता, वाचालता और विभिन्न मॉडल परिवारों में विचलित आत्मविश्वास परिवर्तन—पर महत्वपूर्ण और असंगत ऑफ-टारगेट प्रभाव उत्पन्न करता है, जो यह सिद्ध करता है कि अनसेंसर्ड (uncensored) मॉडल केवल अपने मूल समकक्षों के केवल परिशोधित संस्करण नहीं बल्कि मौलिक रूप से परिवर्तित एजेंट हैं।

Aleksander Fafuła2026-07-21
📊 statistics

Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

यह शोधपत्र एक "सिमेंटिक मैप" (semantic map) ढांचे को प्रस्तुत करता है जो एक लैंग्वेज मॉडल की शब्द-स्तर की संभावनाओं और अर्थपूर्ण अवस्था-स्तर की अनिश्चितताओं के बीच के अंतर को पाटता है, जिससे अर्ध-पैरामीट्रिक अंशांकन (semiparametric calibration) के माध्यम से पेशेवर निर्णय लेने के लिए ऑडिट करने योग्य और पैराफ्रेस-स्थिर (paraphrase-stable) पोस्टीरियर अनुमानों का निष्कर्षण सक्षम होता है।

Matthew F. Dixon2026-07-21
💬 NLP

How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks

यह अध्ययन रिमोट डायडिक कार्यों में संवादात्मक अवस्थाओं के लिए मल्टीमॉडल संकेतों की भविष्य कहनेवाला सटीकता, क्रॉस-टास्क सामान्यीकरण क्षमता और टेस्ट-रीटेस्ट विश्वसनीयता का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ भाषाई विशेषताएं उच्च सटीकता प्रदान करती हैं, वहीं उनमें सामान्यीकरण क्षमता का अभाव होता है, ध्वनिक विशेषताएं अक्सर अवस्था के बजाय वक्ता की पहचान को दर्शाती हैं, और इंटरेक्शन संबंधी विशेषताएं वक्ता के सामान्यीकरण के बाद ही एकमात्र वास्तविक विश्वसनीय संकेत प्रदान करती हैं।

Tahiya Chowdhury2026-07-21
💬 NLP

After the Euclidean Highway: Hyperbolic Expert AI as the Next Innovation

यह शोध पत्र HySAT को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण ढांचा है जो हाइपरबोलिक कर्वेचर (hyperbolic curvature) को ट्रेन करने योग्य एडेप्टर के भीतर के बजाय विशेष रूप से लॉस लेयर (loss layer) पर लागू करके हाइपरबोलिक एक्सपर्ट एआई को स्थिर करता है, जिससे विशेषज्ञ डोमेन में पैरेंट-चाइल्ड ट्री संरचनाओं को संरक्षित किया जाता है और कई छोटे लैंग्वेज मॉडल्स में ट्रेनिंग कोलैप्स को रोका जाता है।

Kwan Soo Shin, In Seok Kang, Munho Lee2026-07-21