💬 NLP

DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

यह शोध पत्र DRNOISE को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि डीप रिसर्च एजेंट ओपन-वेब वातावरण में विश्वसनीय दिखने वाले भ्रामक दस्तावेज़ों का सामना करने पर सटीकता में महत्वपूर्ण गिरावट का शिकार होते हैं, जिसका मुख्य कारण "वेरिफिकेशन इनर्शिया" (सत्यापन जड़ता) नामक एक विफलता मोड है जहाँ एजेंट पुष्टिकारक साक्ष्यों के साथ सक्रिय रूप से सामंजस्य बिठाने के बजाय सीधे गलत दावों के प्रति समयपूर्व समर्पण कर देते हैं।

Jun Nie, Zhiqin Yang, Zhenheng Tang, Yonggang Zhang, Xiaowen Chu, Xinmei Tian, Bo Han2026-07-21
💬 NLP

Team DACTYL at PAN 2026: Bayesian Data Mixing and Empirical X-risk Minimization for AI-text Detection

टीम DACTYL डेटासेट क्यूरेशन के लिए बेयसियन डेटा मिक्सिंग और एम्पिरिकल X-रिस्क मिनिमाइजेशन को नियोजित करके AI-टेक्स्ट डिटेक्शन में आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन अंतराल को संबोधित करती है, जिससे एक MCGrad-कैलिब्रेटेड ModernBERT-large मॉडल के साथ शीर्ष लीडरबोर्ड रैंक प्राप्त की गई जिसने PAN 2026 टेस्ट सेट पर 0.974 का माध्य स्कोर प्राप्त किया।

Shantanu Thorat2026-07-21
💰 quantitative finance

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

यह अध्ययन प्रदर्शित करता है कि "एब्लीटरेशन" (abliteration), जो एआई मॉडलों से इनकार तंत्र (refusal mechanisms) को हटाने की प्रक्रिया है, निर्णय लेने के रुझानों—जैसे कि बढ़ी हुई आशावादिता, वाचालता और विभिन्न मॉडल परिवारों में विचलित आत्मविश्वास परिवर्तन—पर महत्वपूर्ण और असंगत ऑफ-टारगेट प्रभाव उत्पन्न करता है, जो यह सिद्ध करता है कि अनसेंसर्ड (uncensored) मॉडल केवल अपने मूल समकक्षों के केवल परिशोधित संस्करण नहीं बल्कि मौलिक रूप से परिवर्तित एजेंट हैं।

Aleksander Fafuła2026-07-21
📊 statistics

Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

यह शोधपत्र एक "सिमेंटिक मैप" (semantic map) ढांचे को प्रस्तुत करता है जो एक लैंग्वेज मॉडल की शब्द-स्तर की संभावनाओं और अर्थपूर्ण अवस्था-स्तर की अनिश्चितताओं के बीच के अंतर को पाटता है, जिससे अर्ध-पैरामीट्रिक अंशांकन (semiparametric calibration) के माध्यम से पेशेवर निर्णय लेने के लिए ऑडिट करने योग्य और पैराफ्रेस-स्थिर (paraphrase-stable) पोस्टीरियर अनुमानों का निष्कर्षण सक्षम होता है।

Matthew F. Dixon2026-07-21
💬 NLP

How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks

यह अध्ययन रिमोट डायडिक कार्यों में संवादात्मक अवस्थाओं के लिए मल्टीमॉडल संकेतों की भविष्य कहनेवाला सटीकता, क्रॉस-टास्क सामान्यीकरण क्षमता और टेस्ट-रीटेस्ट विश्वसनीयता का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ भाषाई विशेषताएं उच्च सटीकता प्रदान करती हैं, वहीं उनमें सामान्यीकरण क्षमता का अभाव होता है, ध्वनिक विशेषताएं अक्सर अवस्था के बजाय वक्ता की पहचान को दर्शाती हैं, और इंटरेक्शन संबंधी विशेषताएं वक्ता के सामान्यीकरण के बाद ही एकमात्र वास्तविक विश्वसनीय संकेत प्रदान करती हैं।

Tahiya Chowdhury2026-07-21
💬 NLP

After the Euclidean Highway: Hyperbolic Expert AI as the Next Innovation

यह शोध पत्र HySAT को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण ढांचा है जो हाइपरबोलिक कर्वेचर (hyperbolic curvature) को ट्रेन करने योग्य एडेप्टर के भीतर के बजाय विशेष रूप से लॉस लेयर (loss layer) पर लागू करके हाइपरबोलिक एक्सपर्ट एआई को स्थिर करता है, जिससे विशेषज्ञ डोमेन में पैरेंट-चाइल्ड ट्री संरचनाओं को संरक्षित किया जाता है और कई छोटे लैंग्वेज मॉडल्स में ट्रेनिंग कोलैप्स को रोका जाता है।

Kwan Soo Shin, In Seok Kang, Munho Lee2026-07-21
💬 NLP

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

यह शोध पत्र टोकन-लेवल ऑफ-पॉलिसी लेबलिंग (TOPL) का प्रस्ताव करता है, जो एक प्रशिक्षण प्रतिमान (पैराडाइम) है जो पोस्ट-ट्रेनिंग को टोकन-स्तरीय शुद्धता भविष्यवाणी कार्य के रूप में पुनर्गठित करता है ताकि सारांशीकरण और मशीन अनुवाद जैसे निष्ठावान जनरेशन कार्यों में मजबूत आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण और व्याख्या योग्य मॉडल अपडेट प्राप्त किया जा सके।

Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia2026-07-21
💬 NLP

Is Progressive Disclosure All You Need for Long-Context Agents?

यह शोधपत्र लॉन्ग-कॉन्टेक्स्ट एजेंटों में प्रोग्रेसिव डिस्क्लोजर (क्रमिक प्रकटीकरण) का पहला नियंत्रित अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ एजेंटों के पास पहले से ही मजबूत रिट्रीवल क्षमताएं मौजूद होने पर इसके सीमित लाभ मिलते हैं, वहीं यह उन मल्टी-बुक कार्यों तक विस्तार करने के लिए निर्णायक हो जाता है जहाँ रॉ डॉक्यूमेंट नेविगेशन विफल हो जाता है, हालाँकि एक से अधिक डिस्क्लोजर स्तर जोड़ने से कोई अतिरिक्त लाभ नहीं मिलता है।

Yifeng He, Yinzhe Zhao, Jicheng Wang, Hao Chen2026-07-21
💬 NLP

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer

PoLoRA एक नवीन ऑप्टिमाइज़र है जो लो-रैंक एडेप्टेशन (LoRA) के लिए उत्पाद-जागरूक स्पेक्ट्रल अपडेट (product-aware spectral updates), कर्वेचर प्रीकंडीशनिंग (curvature preconditioning), और एक मैग्नीट्यूड कंट्रोल रूल (magnitude control rule) को जोड़ता है ताकि मानक Adam की तुलना में तेज़ अभिसरण (convergence), लर्निंग रेट स्थिरता, और रैंक चयन के प्रति कम संवेदनशीलता प्राप्त की जा सके, जिसमें न्यूनतम कम्प्यूटेशनल ओवरहेड शामिल है।

Nikhil Ghosh, Tetiana Parshakova, Robert M. Gower2026-07-21
💬 NLP

It Matters How You Say It: Exploring Rhetorical Patterns for AI-Assisted Information Evaluation

यह शोध पत्र इस बात की जांच करता है कि एआई-सहायता प्राप्त तथ्य सत्यापन में आठ विशिष्ट अलंकारिक पैटर्न (rhetorical patterns) उपयोगकर्ता के प्रदर्शन और चिंतन को कैसे प्रभावित करते हैं, जिसमें यह पाया गया है कि जहाँ 'स्कैफोल्ड स्पष्टीकरण' (Scaffold Explanations) उच्चतम सटीकता लाभ प्रदान करते हैं, वहीं उपयोगकर्ता अन्य चिंतनशील शैलियों से जुड़े समय के खर्च के बावजूद आम तौर पर 'वैकल्पिक रूपरेखा' (Alternative Framing) को प्राथमिकता देते हैं।

Sadra Sabouri, Zeinabsadat Saghi, Jordan Lee Boyd-Graber, Jonathan May, Jonathan K. Kummerfeld, Souti Chattopadhyay2026-07-21