💬 NLP

Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?

यह अध्ययन एक स्ट्रेस-टेस्टिंग फ्रेमवर्क का उपयोग करके स्तन कैंसर विकिरण के दुष्प्रभावों की पहचान करने में सात लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो दस्तावेज़ीकरण परिवर्तनों के प्रति उनकी संवेदनशीलता और दुर्लभ या दीर्घकालिक विषाक्तता को कम रिपोर्ट करने की प्रवृत्ति को प्रकट करता है, जबकि यह भी प्रदर्शित करता है कि आउटपुट को नैदानिक-क्यूरेटेड सूचियों में ग्राउंड करना सर्वाइवरशिप केयर अनुप्रयोगों के लिए विश्वसनीयता में महत्वपूर्ण सुधार करता है।

Natalie Seah, Danielle S. Bitterman, Daphna Spiegel, Thomas Hartvigsen2026-05-12
🤖 AI

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

यह शोध पत्र संकट-संबंधी ट्वीट्स को वर्गीकृत करने के लिए LLM-निर्देशित अर्ध-पर्यवेक्षित शिक्षण (semi-supervised learning) का पहला अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि LG-CoTrain जैसी विधियाँ कम-संसाधन वाले परिवेश में शास्त्रीय दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करती हैं और LLM ज्ञान को कॉम्पैक्ट, तैनात करने योग्य मॉडलों में स्थानांतरित कर सकती हैं जो ज़ीरो-शॉट बड़े भाषा मॉडलों (large language models) के बराबर हैं।

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea2026-05-12
🤖 AI

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

यह अध्ययन यह दर्शाता है कि LLM-जनित तर्क के मानव न्यायनिर्णयन के माध्यम से मतिभ्रम (hallucination) पहचान बेंचमार्क का पुनर्मूल्यांकन करने पर यह स्पष्ट होता है कि मूल एनोटेशन अक्सर मॉडल के प्रदर्शन को कम करके आंकते हैं, जो यह सुझाव देता है कि मॉडल-सहायता प्राप्त पुनर्मूल्यांकन अस्पष्टता-प्रवण कार्यों के लिए अधिक विश्वसनीय बेंचमार्क प्रदान करता है।

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan2026-05-12
💬 NLP

A Computational Operationalisation of Competing Maturational Theories of Syntactic Development via Statistical Grammar Induction

यह शोध पत्र सांख्यिकीय व्याकरण प्रेरण (statistical grammar induction) का उपयोग करके वाक्यात्मक विकास के प्रतिस्पर्धी परिपक्वता सिद्धांतों को गणनात्मक रूप से कार्यात्मक बनाता है ताकि यह प्रदर्शित किया जा सके कि श्रेणी अधिग्रहण का एक बॉटम-अप "GROWING" विवरण, समान शिक्षण स्थितियों के तहत एक "INWARD" विवरण की तुलना में काफी बेहतर प्रदर्शन करता है।

Mila Marcheva, Suchir Salhan, Weiwei Sun2026-05-12
💬 NLP

NARRA-Gym for Evaluating Interactive Narrative Agents

यह शोध पत्र NARRA-Gym को प्रस्तुत करता है, जो एक निष्पादन योग्य मूल्यांकन वातावरण है जिसे कहानी निर्माण, स्मृति, गति और वैयक्तिकरण को संयुक्त रूप से प्रबंधित करके बड़े भाषा मॉडलों की सुसंगत, विकसित होती संवादात्मक आख्यानों को बनाए रखने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो सरल प्रवाह से परे मॉडलों के बीच महत्वपूर्ण प्रदर्शन भिन्नताओं को प्रकट करता है।

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong H (…)2026-05-12
🤖 AI

Human-Inspired Memory Architecture for LLM Agents

यह शोध पत्र छह संज्ञानात्मक तंत्रों और एक सिंथेटिक अंशांकन पद्धति (synthetic calibration methodology) से युक्त एक जैविक रूप से आधारित मेमोरी आर्किटेक्चर प्रस्तुत करता है, जो बड़े पैमाने के इश्यू-ट्रैकिंग और पर्सनल-चैट बेंचमार्क में प्रतिधारण परिशुद्धता (retention precision) और भंडारण दक्षता में महत्वपूर्ण सुधार प्रदर्शित करता है।

Doga Kerestecioglu, Alexei Robsky, Clemens Vasters, Anshul Sharma, Yitzhak Kesselman2026-05-12
🤖 machine learning

PAAC: Privacy-Aware Agentic Device-Cloud Collaboration

PAAC एक गोपनीयता-जागरूक एजेंटिक फ्रेमवर्क है जो टाइप किए गए प्लेसहोल्डर टोकन और एक नियत रजिस्ट्री का उपयोग करके प्लानर-एक्जीक्यूटर अपघटन को डिवाइस-क्लाउड सीमा के साथ संरेखित करता है, जिससे मौजूदा अत्याधुनिक बेसलाइन की तुलना में सटीकता में उल्लेखनीय सुधार होता है और डेटा रिसाव को नाटकीय रूप से कम किया जाता है।

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, Christopher G. Brinton2026-05-12
🤖 AI

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

यह शोध पत्र AgentCollabBench प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो यह प्रकट करता है कि मल्टी-एजेंट सिस्टम की विफलताएं अक्सर संरचनात्मक संचार बाधाओं और निर्देश क्षय (instruction decay) एवं मिथ्या-विश्वास संचरण (false-belief contagion) जैसे विशिष्ट व्यवहार संबंधी जोखिमों से उत्पन्न होती हैं, जो यह दर्शाता है कि विश्वसनीय सहयोग मॉडल की बुद्धिमत्ता को बढ़ाने के बजाय वास्तुशिल्प डिजाइन (architectural design) पर अधिक निर्भर करता है।

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu De (…)2026-05-12
🤖 AI

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

यह शोध पत्र MIND-Skill को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो जटिल कार्यों पर मजबूती और सामान्यीकरण सुनिश्चित करने के लिए टेक्स्टुअल लॉस (पुनर्निर्माण, परिणाम और रूब्रिक) के माध्यम से अनुकूलित इंडक्शन-डिडक्शन चक्र के माध्यम से स्वचालित रूप से उच्च-गुणवत्ता वाले, पुन: प्रयोज्य LLM कौशल उत्पन्न करता है।

Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An2026-05-12
🤖 AI

Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups

यह शोधपत्र एक्सप्लेनेशन फेयरनेस टैक्सोनॉमी (EFT) प्रस्तुत करता है और अनुभवजन्य साक्ष्य प्रस्तुत करता है कि लार्ज लैंग्वेज मॉडल्स विभिन्न जनसांख्यिकीय समूहों के बीच गुणवत्ता, स्वर और परिष्कार के विविध स्तरों वाली व्याख्याएं व्यवस्थित रूप से उत्पन्न करते हैं, जो यह प्रकट करता है कि हालांकि प्रॉम्पटिंग निर्णय-जुड़े विसंगतियों को कम कर सकती है, फिर भी प्री-ट्रेनिंग वितरणों के कारण शैलीगत असमानताएं बनी रहती हैं।

Gautam Veldanda2026-05-12