💬 NLP

On the "Induction Bias" in Sequence Models

यह शोध पत्र यह प्रदर्शित करता है कि, रिकरेंट न्यूरल नेटवर्क के विपरीत जो अनुक्रम लंबाई (sequence lengths) के माध्यम से अवस्था-ट्रैकिंग तंत्र (state-tracking mechanisms) को प्रभावी ढंग से साझा करते हैं, ट्रांसफॉर्मर को अवस्था-स्थान (state-space) और लंबाई बढ़ने के साथ काफी अधिक प्रशिक्षण डेटा की आवश्यकता होती है और भार साझाकरण (weight sharing) की कमी के कारण वे लंबाई के पार सामान्यीकरण करने में विफल रहते हैं, जो उनकी अवस्था-ट्रैकिंग क्षमताओं में मौलिक इन-डिस्ट्रीब्यूशन सीमाओं को प्रकट करता है।

M. Reza Ebrahimi, Michaël Defferrard, Sunny Panchal, Roland Memisevic2026-06-01
💬 NLP

IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning

यह शोध पत्र IAPO का प्रस्ताव करता है, जो एक सूचना-सैद्धांतिक (information-theoretic) पोस्ट-ट्रेनिंग फ्रेमवर्क है, जो कंडीशनल म्यूचुअल इंफॉर्मेशन के आधार पर टोकन-वार एडवांटेज असाइन करके टोकन-कुशल तर्क (token-efficient reasoning) को अनुकूलित करता है, जिससे सटीकता में सुधार या उसे बनाए रखते हुए इन्फरेंस लागत में 36% तक की कमी आती है।

Yinhan He, Yaochen Zhu, Mingjia Shi, Wendy Zheng, Lin Su, Xiaoqing Wang, Qi Guo, Jundong Li2026-06-01
💻 computer science

Social Reasoning in Machines: Investigating Collective Truth-Seeking Dynamics in Large Language Model Debate

यह शोध पत्र यह प्रदर्शित करता है कि विविध लार्ज लैंग्वेज मॉडल्स के बीच मल्टी-एजेंट डिबेट्स के माध्यम से 'आर्ग्युमेंटेटिव थ्योरी ऑफ रीजनिंग' का अनुकरण करना सामूहिक सत्य-खोज प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और मतिभ्रम (hallucination) जैसे आंतरिक मॉडल गुणों के मूल्यांकन के लिए एक नवीन गतिशील बेंचमार्किंग पद्धति प्रदान करता है।

Tom Pecher2026-06-01
💬 NLP

Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology

यह नियंत्रित प्रयोग प्रदर्शित करता है कि भाषा मॉडलों में डोमेन अनुकूलन (domain adaptation) मुख्य रूप से पीढ़ी के लिए उपयोग किए जाने वाले भाषाई व्याख्यात्मक ढांचों को नया आकार देता है, जिसमें ब्रह्मांड संबंधी दृष्टिकोण (cosmological stance) में परिवर्तन मॉडल के अंतर्निहित विश्वासों के प्रत्यक्ष संशोधन के बजाय इन संरचनात्मक परिवर्तनों से द्वितीयक रूप से उभरते हैं।

Francesco De Bernardis2026-06-01
💬 NLP

Cross-Lingual Steering for Figurative Language Generation

यह शोध पत्र प्रदर्शित करता है कि एक भाषा में सीखी गई लाक्षणिक भाषा (figurative language) के लिए सक्रियण स्टीयरिंग दिशाएं (activation steering directions) न केवल उस भाषा के भीतर प्रभावी हैं, बल्कि भाषाओं के बीच भी स्थानांतरित होती हैं, जो बहुभाषी लार्ज लैंग्वेज मॉडल्स में लाक्षणिक सृजन के लिए एक पुन: प्रयोज्य किंतु लक्ष्य-निर्भर क्रॉस-लिंगुअल सिग्नल को प्रकट करती हैं।

Linfeng Liu, Tiffany Zhan, Louie Hong Yao, Saptarshi Ghosh, Tianyu Jiang2026-06-01
🤖 machine learning

Bounded Behavioral Indistinguishability for Black-Box LLM Distillation

यह शोध पत्र 'बाउंडेड बिहेवियरल इंडिस्टिंग्विशेबिलिटी' (सीमित व्यवहारिक अविभेद्यता) की अवधारणा प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि LoRA डिस्टिलेशन ब्लैक-बॉक्स LLM शिक्षकों और छात्रों के बीच सिमेंटिक समानता में सुधार करता है, यह शैली, मजबूती और तकनीकी डोमेन में पता लगाने योग्य व्यवहारिक अंतरों को पूरी तरह से समाप्त करने में विफल रहता है, जिसके लिए आउटपुट-मैचिंग से एडवरसेरियल, कैटेगरी-अवेयर इवैल्यूएशन की ओर बदलाव आवश्यक है।

Munawar Hasan2026-06-01
💬 NLP

Configurable Reward Model for Balanced Safety Alignment

यह शोध पत्र कॉन्फ़िगरेबल सेफ्टी रिवॉर्ड मॉडल (CSRM) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो विषम और विकसित होती सुरक्षा आवश्यकताओं के अनुकूल होने में सक्षम रिवॉर्ड मॉडल बनाने के लिए कॉन्फ़िगरेशन-लक्षित डेटा ऑग्मेंटेशन का लाभ उठाता है, जिससे कॉन्फ़िगरेबल सेफ्टी बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और संरेखित लार्ज लैंग्वेज मॉडल्स में हेल्पफुलनेस-सेफ्टी ट्रेडऑफ़ में महत्वपूर्ण सुधार होता है।

Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj, Manik Bhandari, Mayur Srungarapu, Anqi Liu, Benjamin Van Durme, Li (…)2026-06-01
💬 NLP

Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs

यह शोध पत्र प्रदर्शित करता है कि केवल तीन से पांच विषम (heterogeneous) मॉडलों के आउटपुट वितरणों को औसत निकालकर, जिसे WASH तकनीक कहा जाता है, LLM वॉटरमार्क्स द्वारा उत्पन्न सांख्यिकीय विक्षोभों को प्रभावी ढंग से निष्प्रभावी किया जा सकता है, जो न केवल वर्तमान वॉटरमार्किंग योजनाओं को अदृश्य बना देता है बल्कि टेक्स्ट की गुणवत्ता और जनरेशन गति में भी सुधार करता है।

Zhihao Wu, Gracia Gong, Qinglin Zhu, Yudong Chen, Runcong Zhao2026-06-01
🤖 machine learning

MAAT: Multi-phase Adapter-Aware Targeted Unlearning

यह शोध पत्र 5WBENCH प्रस्तुत करता है, जो एक संतुलित बेंचमार्क है जो यह प्रकट करता है कि मौजूदा मशीन अनलर्निंग विधियाँ मल्टी-हॉप रीजनिंग और ग्रेडिएंट डाइल्यूशन के कारण कारण संबंधी "क्यों" वाले प्रश्नों पर विफल रहती हैं, और MAAT का प्रस्ताव करता है, जो एक अभिनव तीन-चरणीय एडेप्टर-अवेयर फ्रेमवर्क है जो पहली बार ऐसे कारण संबंधी ज्ञान के लिए उच्च विस्मृति (forgetting) और प्रतिधारण (retention) प्राप्त करता है।

Suryash Yagnik, Shubham Gaur, Saksham Thakur, Vinija Jain, Aman Chadha, Amitava Das2026-06-01
🤖 machine learning

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

यह शोध पत्र प्रदर्शित करता है कि पोस्ट-ट्रेनिंग (post-training) भाषा मॉडलों में मापने योग्य, स्थानीयकृत "AI-जैसे" शैलीगत हस्ताक्षरों को पेश करती है और PASTA प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो टेक्स्ट की सुसंगतता को बनाए रखते हुए AI डिटेक्शन दरों को कम करने के लिए इन विशिष्ट सक्रियण दिशाओं (activation directions) को सफलतापूर्वक हटा देती है।

Aniket Anand, Janvijay Singh, Zhewei Sun, Dilek Hakkani-Tür, Nick Feamster2026-06-01