💬 NLP

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

यह शोध पत्र प्रदर्शित करता है कि RAG आर्किटेक्चर नॉलेज बेस पॉइजनिंग के विरुद्ध मजबूती को महत्वपूर्ण रूप से प्रभावित करता है, यह प्रकट करते हुए कि जबकि रिकर्सिव लैंग्वेज मॉडल्स जैसे उन्नत डिज़ाइन वैनिला पाइपलाइनों की तुलना में हमले की सफलता दर को नाटकीय रूप से कम कर देते हैं, प्राथमिक भेद्यता कंटेंट-रीज़निंग चरण में निहित है जहाँ प्रतिकूल फ्रेमिंग विश्वसनीयता मूल्यांकन को कमजोर करती है न कि रिट्रीवल ऑप्टिमाइज़ेशन में।

Samuel Korn2026-05-08
💬 NLP

Negative Before Positive: Asymmetric Valence Processing in Large Language Models

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) भावनात्मक वैलेंस (emotional valence) को विशिष्ट, कारण संबंधी और नियंत्रित आंतरिक तंत्रों के माध्यम से संसाधित करते हैं, जिसमें नकारात्मक परिणाम शुरुआती परतों में स्थानीयकृत होते हैं और सकारात्मक परिणाम मध्य-से-अंतिम परतों में चरम पर होते हैं, बजाय इसके कि वे केवल सतही टोकन मिलान पर निर्भर हों।

Sohan Venkatesh2026-05-08
💬 NLP

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

यह शोध पत्र XL-SafetyBench प्रस्तुत करता है, जो 10 भाषा युग्मों में 5,500 देश-आधारित परीक्षण मामलों वाला एक क्रॉस-कल्चरल बेंचमार्क है, जो फ्रंटियर मॉडल्स में जेलब्रेक मजबूती और सांस्कृतिक संवेदनशीलता के बीच एक विच्छेद को प्रकट करता है, साथ ही यह भी उजागर करता है कि स्थानीय मॉडल्स की स्पष्ट सुरक्षा अक्सर वास्तविक संरेखण के बजाय जनरेशन विफलताओं से उत्पन्न होती है।

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichl (…)2026-05-08
💬 NLP

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

यह शोध पत्र प्रदर्शित करता है कि यद्यपि मेडिकल LLMs में एक विशिष्ट "ओवरथिंकिंग" विफलता मोड (failure mode) को हिडन स्टेट्स (hidden states) से रैखिक रूप से डिकोड (linearly decodable) किया जा सकता है, फिर भी इसे कार्य-महत्वपूर्ण गणनाओं के साथ प्रतिनिधित्व संबंधी उलझाव (representational entanglement) के कारण फिक्स्ड लीनियर स्टीयरिंग (fixed linear steering) के माध्यम से सुधारा नहीं जा सकता है, हालांकि यही प्रोब (probe) चयनात्मक परहेज (selective abstention) को सक्षम करने के लिए विफलताओं का पता लगाने में प्रभावी बना रहता है।

Ming Liu2026-05-08
💬 NLP

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

यह शोध पत्र प्रदर्शित करता है कि LLM एजेंटों में अधिक स्कैफोल्डिंग घटकों को जोड़ने से अक्सर विनाशकारी क्रॉस-कंपोनेंट हस्तक्षेप होता है, जो यह सिद्ध करता है कि पारंपरिक "ऑल-इन" दृष्टिकोण की तुलना में कार्य-विशिष्ट उपसमुच्चय चयन (task-specific subset selection) बेहतर प्रदर्शन करता है और ग्रीडी चयन विधियाँ बार-बार होने वाले सबमॉड्यूलरिटी उल्लंघन के कारण अविश्वसनीय हैं।

Ming Liu2026-05-08
💬 NLP

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

यह शोध पत्र BioTool को पेश करता है, जो 34 बायोमेडिकल टूल्स के लिए 7,040 मानव-सत्यापित क्वेरी-API युग्मों का एक व्यापक डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को फाइन-ट्यून करने के लिए उपयोग किए जाने पर, उनकी टूल-कॉलिंग क्षमताओं और डाउनस्ट्रीम उत्तर गुणवत्ता को महत्वपूर्ण रूप से बढ़ाता है, और GPT-5.1 जैसे अत्याधुनिक वाणिज्यिक मॉडलों से भी बेहतर प्रदर्शन करता है।

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie2026-05-08
💬 NLP

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

यह शोध पत्र डिस्ट्रीब्यूशन-अलाइन्ड एडवर्सरियल डिस्टिलेशन (DisAAD) का प्रस्ताव करता है, जो एक विधि है जो एक ब्लैक-बॉक्स LLM के आउटपुट डिस्ट्रीब्यूशन की नकल करने और एविडेंस लर्निंग के माध्यम से अनिश्चितता का अनुमान लगाने के लिए एक हल्के प्रॉक्सी मॉडल को प्रशिक्षित करती है, जो आंतरिक मॉडल एक्सेस या महंगी मल्टीपल सैंपलिंग की आवश्यकता के बिना प्रभावी रूप से मतिभ्रम (hallucination) को संबोधित करती है।

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang2026-05-08
💬 NLP

LeakDojo: Decoding the Leakage Threats of RAG Systems

यह शोध पत्र LeakDojo पेश करता है, जो RAG लीकेज जोखिमों के व्यवस्थित मूल्यांकन के लिए एक कॉन्फ़िगर करने योग्य ढांचा है, जो यह प्रकट करता है कि लीकेज क्वेरी जनरेशन और एडवर्सरियल इंस्ट्रक्शंस के गुणनफल से प्रेरित होता है, मजबूत इंस्ट्रक्शन-फॉलोइंग क्षमताओं के साथ सहसंबंध रखता है, और विरोधाभासी रूप से RAG फेथफुलनेस (faithfulness) में सुधार के साथ बढ़ सकता है।

Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Han Qiu2026-05-08
💬 NLP

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

यह अध्ययन प्रदर्शित करता है कि बड़े रीजनिंग मॉडलों में मौखिक रूप से व्यक्त मूल्यांकन जागरूकता का सुरक्षा, संरेखण और रीजनिंग बेंचमार्क के उनके वास्तविक व्यवहार पर नगण्य प्रभाव पड़ता है, जो यह सुझाव देता है कि ऐसी जागरूकता की उच्च दरों को रणनीतिक हेरफेर या संरेखण से छेड़छाड़ के साक्ष्य के रूप में स्वतः ही नहीं माना जाना चाहिए।

Amelie Knecht, Lucas Florin, Thilo Hagendorff2026-05-08✓ Author reviewed
💬 NLP

Bridging Passive and Active: Enhancing Conversation Starter Recommendation via Active Expression Modeling

यह शोध पत्र पैसिव-एक्टिव ब्रिज (PA-Bridge) फ्रेमवर्क का प्रस्ताव करता है, जो पैसिव रिकमेंडेशन फीडबैक और एक्टिव यूजर एक्सप्रेशंस के बीच के अंतर को पाटने के लिए एक एडवर्सरियल डिस्ट्रीब्यूशन अलाइनर और एक सिमेंटिक डिस्क्रीटाइज़र का लाभ उठाता है, जिससे डेटा स्पर्सिटी और फीडबैक लूप्स पर काबू पाने के साथ LLM-संचालित सर्च में कन्वर्सेशन स्टार्टर रिकमेंडेशन में महत्वपूर्ण सुधार किया जा सके।

Yiqing Wu, Haoming Li, Guanyu Jiang, Jiahao Liang, Yongchun Zhu, Jingwu Chen, Feng Zhang2026-05-08