💬 NLP

Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models

यह शोध पत्र ASAG का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) और प्लग-एंड-प्ले फ्रेमवर्क है जो बड़े रीजनिंग मॉडल्स में ओवरथिंकिंग (overthinking) का पता लगाने और जनरेशन को अनुकूल रूप से रोकने के लिए अटेंशन डिस्ट्रीब्यूशन का लाभ उठाता है, जिससे विभिन्न बेंचमार्क पर टोकन उपयोग को कम करते हुए सटीकता में उल्लेखनीय सुधार होता है।

Jiakai Li, Ke Qin, Rongzheng Wang, Yizhuo Ma, Qizhi Chen, Muquan Li, Shuang Liang2026-06-16
💬 NLP

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

यह शोध पत्र AdaMame को प्रस्तुत करता है, जो एक दो-चरणीय प्रशिक्षण विधि है जिसमें सुपरवाइज्ड फाइन-ट्यूनिंग को एक नवीन एडेप्टिव GRPO एल्गोरिदम (AdaMame-GRPO) के साथ संयोजित किया गया है ताकि लार्ज रीजनिंग मॉडल्स को सटीकता या टोकन दक्षता से समझौता किए बिना क्वेरी की भाषा में तर्क करने में सक्षम बनाया जा सके, जिससे भाषा पतन (language collapse) की घटना पर विजय प्राप्त की जा सके।

Dayeon Ki, Kevin Duh, Marine Carpuat2026-06-16
💬 NLP

AmchiBias: Measuring Stereotypical Bias in Goan Identity Groups with a Minimal Pair Dataset in English and Konkani

यह शोध पत्र AmchiBias को प्रस्तुत करता है, जो अंग्रेजी और कोंकणी में मिनिमल पेयर्स (minimal pairs) का उपयोग करके गोअन पहचान समूहों में सामाजिक-सांस्कृतिक रूढ़िवादी पूर्वाग्रह को मापने वाला पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान बहुभाषी मॉडलों में वास्तविक गोअन सांस्कृतिक सक्षमता का अभाव है और वे अक्सर हाइपरलोकल वास्तविकताओं के बजाय पैन-इंडियन पूर्वाग्रहों को दर्शाते हैं।

Michelle Barbosa, Sebastian Padó, Franziska Weeber2026-06-16
💬 NLP

Spokes: Optimizing for Diverse Pretraining Data Selection

यह शोध पत्र SPOKES को पेश करता है, जो एक संभाव्य विविधीकरण ढांचा (probabilistic diversification framework) है जो G-Vendi स्कोर और एक्सपोनेंशियल ग्रेडिएंट डिसेंट का उपयोग करके सीधे डेटा विविधता के लिए अनुकूलन करता है, और यह प्रदर्शित करता है कि गुणवत्ता और विविधता दोनों के लिए प्रीट्रेनिंग डेटा का संयुक्त चयन डाउनस्ट्रीम प्रदर्शन में मौजूदा बेसलाइनों और रैंडम सैंपलिंग की तुलना में काफी बेहतर प्रदर्शन करता है।

Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu2026-06-16
💬 NLP

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

यह शोध पत्र अंग्रेजी और अरबी बेंचमार्क में घृणास्पद और प्रचार संबंधी मीम्स (memes) के सटीक पता लगाने और व्याख्यात्मक मॉडरेशन के लिए थिंकिंग-आधारित मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को बेहतर बनाने हेतु ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) और चेन-ऑफ-थॉट सुपरविजन का उपयोग करते हुए एक रिइन्फोर्समेंट लर्निंग-आधारित पोस्ट-ट्रेनिंग विधि प्रस्तावित करता है।

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam2026-06-16
💬 NLP

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

यह शोध पत्र ReRULE को पेश करता है, जो सुदृढीकरण शिक्षण (reinforcement learning) आधारित LLM अनलर्निंग के लिए एक ऑफ-पॉलिसी रिप्ले तंत्र है, जो बाउंड्री मामलों पर अभिसरण (convergence) में सुधार करने और अतिरिक्त प्रशिक्षण समय को कम करते हुए गुणवत्ता बनाए रखने के लिए कम-इनाम वाले कठिन मामलों के रोलआउट्स को संग्रहीत और पुन: उपयोग करता है।

Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong2026-06-16
💬 NLP

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

यह शोध पत्र DiSan को प्रस्तुत करता है, जो वितरित एजेंट सहयोग के लिए एक गोपनीयता-संरक्षण ढांचा है, जो कार्य अर्थों (task semantics) को संरक्षित करते हुए स्रोत-पहचान वाले शैलीगत हस्ताक्षरों को प्रभावी ढंग से हटाने के लिए विलगित निरूपणों (disentangled representations) का उपयोग करता है, जो स्टाइलोमेट्रिक एट्रिब्यूशन और PII एक्सपोज़र को कम करने में पारंपरिक टोकन-मास्किंग विधियों से काफी बेहतर प्रदर्शन करता है।

Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu2026-06-16
💬 NLP

Not All Skills Help: Measuring and Repairing Agent Knowledge

यह शोध पत्र ASSAY को प्रस्तुत करता है, जो एक ऐसा ढांचा (framework) है जो विशिष्ट कार्यों पर नकारात्मक कारण प्रभाव (negative causal effects) डालने वाले व्यक्तिगत कौशलों को अनुभवजन्य रूप से मापकर और उन्हें चुनिंदा रूप से दबाकर LLM एजेंट के प्रदर्शन में सुधार करता है, जिससे बिना वेट अपडेट के अत्याधुनिक परिणाम प्राप्त होते हैं।

Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao2026-06-16
💬 NLP

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

यह शोध पत्र CHILLGuard को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) चीनी LLM सुरक्षा गार्डरेल है जो एक स्केलेबल बहु-चरणीय निर्माण पाइपलाइन के माध्यम से उच्च-गुणवत्ता वाले एनोटेटेड डेटा की कमी को संबोधित करता है और एक बड़े पैमाने पर, कठोरता से क्यूरेट किए गए डेटासेट पर मॉडल-जागरूक प्राथमिकता संरेखण (model-aware preference alignment) के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।

Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu (…)2026-06-16
💬 NLP

Few-Shot Biomedical Relation Extraction with Large Language Models: A Viable Alternative to Supervised Learning?

यह शोध पत्र प्रदर्शित करता है कि प्रॉम्प्ट-आधारित लार्ज लैंग्वेज मॉडल्स बायोमेडिकल रिलेशन एक्सट्रैक्शन के लिए सुपरवाइज्ड लर्निंग के एक व्यवहार्य, लो-रिसोर्स विकल्प के रूप में कार्य कर सकते हैं, जो पेयरवाइज क्लासिफिकेशन की उच्च रिकॉल और जॉइंट जनरेशन की प्रिसिजन के बीच एक ट्रेड-ऑफ के माध्यम से दुर्लभ रिलेशन टाइप्स पर बेहतर मैक्रो-F1 प्रदर्शन प्राप्त करते हैं।

Jakob Mraz, Tomaž Curk, Blaž Zupan2026-06-16