💬 NLP

Structured Disagreement in Health-Literacy Annotation: Epistemic Stability, Conceptual Difficulty, and Agreement-Stratified Inference

यह शोध पत्र तर्क देता है कि श्रेणीबद्ध स्वास्थ्य-साक्षरता एनोटेशन (annotation) में, असहमति एनोटेटर की त्रुटि के बजाय कार्य की जटिलता से संरचनात्मक रूप से प्रेरित होती है, और इस परिप्रेक्ष्यवादी भिन्नता (perspectivist variance) को बनाए रखना प्रमुख सामाजिक-वैज्ञानिक निष्कर्षों को अस्पष्ट करने या उलटने से बचने के लिए सांख्यिकीय रूप से आवश्यक है।

Olga Kellert, Sriya Kondury, Candice Koo, Nemika Tyagi, Steffen Eikenberry2026-04-23
🤖 machine learning

Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल अनिश्चितता और शुद्धता को तीन कार्यात्मक रूप से भिन्न फीचर आबादी—शुद्ध अनिश्चितता, शुद्ध अशुद्धता, और मिश्रित फीचर्स—की पहचान करने के लिए स्पार्स ऑटोएनकोडर्स का उपयोग करके दो अलग आंतरिक घटनाओं के रूप में कूटबद्ध करते हैं, जहाँ बाद वाले को दबाने से सटीकता में महत्वपूर्ण सुधार होता है और प्रभावी चयनात्मक अपवर्जन (selective abstention) सक्षम होता है।

Het Patel, Tiejin Chen, Hua Wei, Evangelos E. Papalexakis, Jia Chen2026-04-23
💬 NLP

Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring

यह शोध पत्र प्रकट करता है कि जहाँ LLM-जनित रेज़्यूमे सारांश तथ्यात्मक स्थिरता बनाए रखते हैं, वहीं वे मूल्यांकनात्मक भाषा में सूक्ष्म, नाम-आधारित पूर्वाग्रह प्रदर्शित करते हैं—विशेष रूप से ओपन-सोर्स मॉडलों और वितरण संबंधी चरम सीमाओं में—जो दिशात्मक भेदभाव को ऐसी सममित अस्थिरता में बदल सकता है जो स्वचालित भर्ती प्रणालियों में पारंपरिक निष्पक्षता ऑडिट से बच निकलती है।

Huy Nghiem, Phuong-Anh Nguyen-Le, Sy-Tuyen Ho, Hal Daume III2026-04-23
💬 NLP

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

यह शोध पत्र मेमोरा (Memora) को प्रस्तुत करता है, जो हफ्तों से लेकर महीनों तक फैला हुआ एक दीर्घकालिक मेमोरी बेंचमार्क है जो एक नवीन फॉरगेटिंग-अवेयर मेमोरी एक्यूरेसी (FAMA) मीट्रिक का उपयोग करके व्यक्तिगत एजेंटों का याद रखने, तर्क करने और अनुशंसा करने वाले कार्यों पर मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल अक्सर अप्रचलित जानकारी पर निर्भर रहते हैं और विकसित होती यादों के बीच सामंजस्य बिठाने में संघर्ष करते हैं, बावजूद इसके कि समर्पित मेमोरी एजेंटों से मामूली सुधार हुए हैं।

Md Nayem Uddin, Kumar Shubham, Eduardo Blanco, Chitta Baral, Gengyu Wang2026-04-23
💬 NLP

Frictionless Love: Associations Between AI Companion Roles and Behavioral Addiction

यह अध्ययन लगभग 250,000 रेडिट पोस्टों का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि एआई साथियों द्वारा अपनाई जाने वाली विशिष्ट रूपक भूमिकाएं (जैसे कि "सोलमेट" या "कोच") स्पष्ट रूप से उपयोगकर्ता की बातचीत और कथित लाभों या हानियों को आकार देती हैं, जिसमें "कोच" जैसी कुछ भूमिकाएं अन्य की तुलना में व्यवहार संबंधी लत के संकेतों के साथ आश्चर्यजनक रूप से अधिक मजबूती से सह-संबंधित हैं।

Vibhor Agarwal, Ke Zhou, Edyta Paulina Bogucka, Daniele Quercia2026-04-23
💬 NLP

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

यह शोध पत्र EmbodiedMidtrain का प्रस्ताव करता है, जो एक डेटा इंजन का उपयोग करके मिड-ट्रेनिंग के लिए VLA-संरेखित VLM डेटा को क्यूरेट करके विजन-लैंग्वेज मॉडल्स (VLMs) और विजन-लैंग्वेज-एक्शन मॉडल्स (VLAs) के बीच के अंतर को पाटता है, जिससे विभिन्न बैकबोन पर डाउनस्ट्रीम रोबोट मैनिपुलेशन प्रदर्शन में महत्वपूर्ण सुधार होता है।

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong2026-04-23
💬 NLP

TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs

यह शोध पत्र TriEx को प्रस्तुत करता है, जो एक गेम-आधारित त्रि-दृष्टिकोण (tri-view) ढांचा है जो प्रथम-व्यक्ति तर्क (first-person reasoning), द्वितीय-व्यक्ति विश्वास अवस्थाओं (second-person belief states), और तृतीय-व्यक्ति ओरेकल ऑडिट (third-person oracle audits) को संरेखित करके मल्टी-एजेंट LLMs की व्याख्यात्मकता को बढ़ाता है ताकि एजेंटों के घोषित तर्क, आंतरिक विश्वास और वास्तविक कार्यों के बीच व्यवस्थित विसंगतियों को प्रकट किया जा सके।

Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang2026-04-23
💬 NLP

Large language models perceive cities through a culturally uneven baseline

यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल शहरों को सांस्कृतिक रूप से तटस्थ दृष्टिकोण से नहीं देखते हैं, बल्कि एक सांस्कृतिक रूप से असमान आधार के माध्यम से देखते हैं जो व्यवस्थित रूप से पश्चिमी दृष्टिकोणों का पक्ष लेता है और गैर-पश्चिमी सांस्कृतिक दृष्टिकोणों के साथ संकेत दिए जाने पर भी भावनात्मक मूल्यांकनों को प्रभावित करता है।

Rong Zhao, Wanqi Liu, Zhizhou Sha, Nanxi Su, Yecheng Zhang2026-04-23
🤖 machine learning

On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks

यह शोध पत्र प्रदर्शित करता है कि डिफ्यूजन-आधारित भाषा मॉडल कम बिट-विड्थ पर अपने ऑटोरेग्रेसिव समकक्षों की तुलना में बेहतर क्वांटाइजेशन सुदृढ़ता (quantization robustness) प्रदर्शित करते हैं, जो यह सुझाव देता है कि वे कोडिंग कार्यों में कुशल परिनियोजन के लिए महत्वपूर्ण लाभ प्रदान करते हैं।

Aarav Gupta, Gururaj Deshpande, Chandreyi Chakraborty2026-04-23
💬 NLP

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

यह शोध पत्र SkillLearnBench प्रस्तुत करता है, जो LLM एजेंटों के लिए स्वचालित कौशल पीढ़ी (automatic skill generation) में निरंतर शिक्षण (continual learning) विधियों के मूल्यांकन के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि हालांकि ये विधियाँ संरचित कार्यों (structured tasks) पर प्रदर्शन में सुधार करती हैं, लेकिन कोई भी एक दृष्टिकोण सभी परिदृश्यों में लगातार हावी नहीं होता है या मजबूत मॉडलों के साथ विश्वसनीय रूप से स्केल नहीं होता है।

Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammira (…)2026-04-23