💬 NLP

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

यह शोध पत्र XL-SafetyBench प्रस्तुत करता है, जो 10 भाषा युग्मों में 5,500 देश-आधारित परीक्षण मामलों वाला एक क्रॉस-कल्चरल बेंचमार्क है, जो फ्रंटियर मॉडल्स में जेलब्रेक मजबूती और सांस्कृतिक संवेदनशीलता के बीच एक विच्छेद को प्रकट करता है, साथ ही यह भी उजागर करता है कि स्थानीय मॉडल्स की स्पष्ट सुरक्षा अक्सर वास्तविक संरेखण के बजाय जनरेशन विफलताओं से उत्पन्न होती है।

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichl (…)2026-05-08
💬 NLP

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

यह शोध पत्र प्रदर्शित करता है कि यद्यपि मेडिकल LLMs में एक विशिष्ट "ओवरथिंकिंग" विफलता मोड (failure mode) को हिडन स्टेट्स (hidden states) से रैखिक रूप से डिकोड (linearly decodable) किया जा सकता है, फिर भी इसे कार्य-महत्वपूर्ण गणनाओं के साथ प्रतिनिधित्व संबंधी उलझाव (representational entanglement) के कारण फिक्स्ड लीनियर स्टीयरिंग (fixed linear steering) के माध्यम से सुधारा नहीं जा सकता है, हालांकि यही प्रोब (probe) चयनात्मक परहेज (selective abstention) को सक्षम करने के लिए विफलताओं का पता लगाने में प्रभावी बना रहता है।

Ming Liu2026-05-08
💬 NLP

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

यह शोध पत्र प्रदर्शित करता है कि LLM एजेंटों में अधिक स्कैफोल्डिंग घटकों को जोड़ने से अक्सर विनाशकारी क्रॉस-कंपोनेंट हस्तक्षेप होता है, जो यह सिद्ध करता है कि पारंपरिक "ऑल-इन" दृष्टिकोण की तुलना में कार्य-विशिष्ट उपसमुच्चय चयन (task-specific subset selection) बेहतर प्रदर्शन करता है और ग्रीडी चयन विधियाँ बार-बार होने वाले सबमॉड्यूलरिटी उल्लंघन के कारण अविश्वसनीय हैं।

Ming Liu2026-05-08
💬 NLP

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

यह शोध पत्र BioTool को पेश करता है, जो 34 बायोमेडिकल टूल्स के लिए 7,040 मानव-सत्यापित क्वेरी-API युग्मों का एक व्यापक डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को फाइन-ट्यून करने के लिए उपयोग किए जाने पर, उनकी टूल-कॉलिंग क्षमताओं और डाउनस्ट्रीम उत्तर गुणवत्ता को महत्वपूर्ण रूप से बढ़ाता है, और GPT-5.1 जैसे अत्याधुनिक वाणिज्यिक मॉडलों से भी बेहतर प्रदर्शन करता है।

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie2026-05-08
💬 NLP

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

यह शोध पत्र डिस्ट्रीब्यूशन-अलाइन्ड एडवर्सरियल डिस्टिलेशन (DisAAD) का प्रस्ताव करता है, जो एक विधि है जो एक ब्लैक-बॉक्स LLM के आउटपुट डिस्ट्रीब्यूशन की नकल करने और एविडेंस लर्निंग के माध्यम से अनिश्चितता का अनुमान लगाने के लिए एक हल्के प्रॉक्सी मॉडल को प्रशिक्षित करती है, जो आंतरिक मॉडल एक्सेस या महंगी मल्टीपल सैंपलिंग की आवश्यकता के बिना प्रभावी रूप से मतिभ्रम (hallucination) को संबोधित करती है।

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang2026-05-08
💬 NLP

LeakDojo: Decoding the Leakage Threats of RAG Systems

यह शोध पत्र LeakDojo पेश करता है, जो RAG लीकेज जोखिमों के व्यवस्थित मूल्यांकन के लिए एक कॉन्फ़िगर करने योग्य ढांचा है, जो यह प्रकट करता है कि लीकेज क्वेरी जनरेशन और एडवर्सरियल इंस्ट्रक्शंस के गुणनफल से प्रेरित होता है, मजबूत इंस्ट्रक्शन-फॉलोइंग क्षमताओं के साथ सहसंबंध रखता है, और विरोधाभासी रूप से RAG फेथफुलनेस (faithfulness) में सुधार के साथ बढ़ सकता है।

Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Han Qiu2026-05-08
💬 NLP

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

यह अध्ययन प्रदर्शित करता है कि बड़े रीजनिंग मॉडलों में मौखिक रूप से व्यक्त मूल्यांकन जागरूकता का सुरक्षा, संरेखण और रीजनिंग बेंचमार्क के उनके वास्तविक व्यवहार पर नगण्य प्रभाव पड़ता है, जो यह सुझाव देता है कि ऐसी जागरूकता की उच्च दरों को रणनीतिक हेरफेर या संरेखण से छेड़छाड़ के साक्ष्य के रूप में स्वतः ही नहीं माना जाना चाहिए।

Amelie Knecht, Lucas Florin, Thilo Hagendorff2026-05-08✓ Author reviewed
💬 NLP

Bridging Passive and Active: Enhancing Conversation Starter Recommendation via Active Expression Modeling

यह शोध पत्र पैसिव-एक्टिव ब्रिज (PA-Bridge) फ्रेमवर्क का प्रस्ताव करता है, जो पैसिव रिकमेंडेशन फीडबैक और एक्टिव यूजर एक्सप्रेशंस के बीच के अंतर को पाटने के लिए एक एडवर्सरियल डिस्ट्रीब्यूशन अलाइनर और एक सिमेंटिक डिस्क्रीटाइज़र का लाभ उठाता है, जिससे डेटा स्पर्सिटी और फीडबैक लूप्स पर काबू पाने के साथ LLM-संचालित सर्च में कन्वर्सेशन स्टार्टर रिकमेंडेशन में महत्वपूर्ण सुधार किया जा सके।

Yiqing Wu, Haoming Li, Guanyu Jiang, Jiahao Liang, Yongchun Zhu, Jingwu Chen, Feng Zhang2026-05-08
💬 NLP

Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention

यह शोध पत्र FLAS को प्रस्तुत करता है, जो एक फ्लो-आधारित एक्टिवेशन स्टीयरिंग विधि है जो मॉडल एक्टिवेशन को ट्रांसपोर्ट करने के लिए एक सामान्य, कॉन्सेप्ट-कंडीशन्ड वेलोसिटी फील्ड को सीखता है, जिससे यह पूर्ववर्ती दृष्टिकोणों की प्रतिबंधात्मक धारणाओं को दूर करते हुए AxBench पर मौजूदा स्टीयरिंग तकनीकों और इन-कॉन्टेक्स्ट प्रॉम्प्टिंग दोनों से बेहतर प्रदर्शन करता है।

Zehao Jin, Ruixuan Deng, Junran Wang, Xinjie Shen, Chao Zhang2026-05-08
💬 NLP

Logic-Regularized Verifier Elicits Reasoning from LLMs

यह शोध पत्र LOVER को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised) वेरीफायर है जो बिना किसी महंगी सुपरवाइज्ड डेटा के, ऑफ-द-शेल्फ (off-the-shelf) LLMs से मजबूत तर्क प्राप्त करने के लिए रीजनिंग पाथ्स पर तार्किक बाधाओं का लाभ उठाता है, और सुपरवाइज्ड बेसलाइन्स के समान प्रदर्शन प्राप्त करता है।

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li2026-05-08