💬 NLP

Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

यह शोध पत्र इस धारणा को चुनौती देता है कि खोजे गए सर्किटों में संरचनात्मक अंतर अलग-अलग तंत्रों का संकेत देते हैं, जो "फैंटम स्पेशलाइजेशन" (phantom specialization) के माध्यम से यह प्रदर्शित करता है कि विविध इनपुट सांख्यिकी विविध लेकिन कार्यात्मक रूप से समान सबग्राफ उत्पन्न करती है, जिससे यह स्पष्ट होता है कि मानक मूल्यांकन पद्धतियां अक्सर सर्किट संरचना और मॉडल कार्य के बीच एक-से-अनेक (many-to-one) मैपिंग को छिपा देती हैं।

Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych2026-06-05
💬 NLP

LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs

यह शोध पत्र PropMe और SimpleTrace को पेश करता है ताकि यह प्रदर्शित किया जा सके कि जबकि लार्ज लैंग्वेज मॉडल्स (LLMs) प्रतिकूल हमलों (adversarial attacks) के तहत प्रशिक्षण डेटा को पुनरुत्पादित करने की क्षमता रखते हैं, वे सामान्य, गैर-प्रतिकूल सेटिंग्स में ऐसा करने की काफी कम प्रवृत्ति प्रदर्शित करते हैं, जो यह सुझाव देता है कि मेमोराइजेशन ऑडिट को सबसे खराब स्थिति वाली निष्कर्षण क्षमता (worst-case extractability) और विशिष्ट रिसाव प्रवृत्ति (typical leakage propensity) दोनों की रिपोर्ट करनी चाहिए।

Gianluca Barmina, Peter Schneider-Kamp, Lukas Galke Poech2026-06-05
💬 NLP

Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

यह शोध पत्र तथ्यात्मक चापलूसी (factual sycophancy) को "सत्य मार्जिन" (truth margin) और "हेरफेर संवेदनशीलता" (manipulation sensitivity) में विभाजित करता है ताकि यह प्रकट किया जा सके कि जबकि मॉडल का आकार मजबूती का प्राथमिक चालक है, निर्देश ट्यूनिंग (instruction tuning) इस संबंध को बदल देती है—बड़े मॉडलों में सत्य मार्जिन बढ़ाकर और संवेदनशीलता को कम करके, जबकि यह छोटे मॉडलों में विरोधाभासी रूप से मजबूती को कम कर सकती है।

Victor De Marez, Luna De Bruyne, Walter Daelemans2026-06-05
💬 NLP

Learning What to Forget: Improving LLM Unlearning via Learned Token-Level Importance

यह शोध पत्र अल्टरनेटिंग टोकन-वेटेड अनलर्निंग (ATWU) प्रस्तुत करता है, जो एक हल्का ढांचा है जो भूलने (forget) और बनाए रखने (retain) के उद्देश्यों के बीच संघर्ष के माध्यम से टोकन-स्तरीय महत्व को संयुक्त रूप से सीखकर बड़े भाषा मॉडलों में मशीन अनलर्निंग में सुधार करता है, जिससे बिना किसी बाहरी पर्यवेक्षण या सहायक मॉडलों की आवश्यकता के अत्याधुनिक प्रदर्शन प्राप्त होता है।

Gizem Yüce, Giorgos Nikolaou, Nicolas Flammarion2026-06-05
💬 NLP

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

यह शोध पत्र एविडेंस-डायग्नोस्ड इंटरवेंशन ट्रेनिंग (EDIT) का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो आंतरिक मॉडल संकेतों का उपयोग करके समस्यात्मक तर्क चरणों की पहचान करने और उन्हें संशोधित करने के बाद विश्वास-निर्देशित रिवॉर्ड शेपिंग (belief-guided reward shaping) के माध्यम से रूब्रिक-अनुपालक (rubric-faithful) LLM ग्रेडिंग को बढ़ाता है, जिससे यह वास्तविक दुनिया के ग्रेडिंग बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He2026-06-05
💬 NLP

Emergent Language as an Approach to Conscious AI

यह शोध पत्र कृत्रिम चेतना का अध्ययन करने के लिए मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) में उद्गामी भाषा (इमर्जेंट लैंग्वेज) का उपयोग करते हुए एक जनरेटिव कार्यप्रणाली प्रस्तावित करता है, यह प्रदर्शित करते हुए कि कैसे एजेंट, बिना किसी मानवीय भाषाई पूर्वधारणाओं के, केवल कार्य संबंधी मांगों और पर्यावरणीय सामर्थ्य (एनवायरनमेंटल अफोर्डेंस) द्वारा संचालित होकर, आत्म-संदर्भित संचार और नवीन संज्ञानात्मक संरचनाओं को विकसित कर सकते हैं।

Zengqing Wu, Chuan Xiao2026-06-05✓ Author reviewed
🤖 AI

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

यह शोध पत्र ALMANAC प्रस्तुत करता है, जो मैप टास्क (Map Task) पर मानव द्वैत सहयोग (human dyadic collaboration) से प्राप्त 2,987 एक्शन-लेवल मेंटल मॉडल एनोटेशन का एक डेटासेट है, जिसे एलएलएम (LLM) एजेंटों की संरेखित मेंटल मॉडल बनाए रखने और मानव सहयोगात्मक व्यवहारों को सिम्युलेट करने की क्षमता को प्रशिक्षित करने और मूल्यांकन करने के अंतराल को पाटने के लिए डिज़ाइन किया गया है।

Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu (…)2026-06-05
💬 NLP

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

यह शोधपत्र CollabSim को प्रस्तुत करता है, जो कंप्यूटर-सपोर्टेड कोऑपरेटिव वर्क (CSCW) सिद्धांत पर आधारित एक कॉन्फ़िगर करने योग्य सिमुलेशन फ्रेमवर्क है, जिसे केवल कार्य परिणामों को मापने के बजाय इंटरेक्शन स्थितियों को अलग करने और आंतरिक अवस्थाओं की जांच करने द्वारा लार्ज लैंग्वेज मॉडल एजेंटों की सहयोगात्मक क्षमता का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Jiaju Chen, Bo Sun, Yuxuan Lu, Yun Wang, Dakuo Wang, Bingsheng Yao2026-06-05
💬 NLP

Human Adults and LLMs as Scientists: Who Benefits from Active Exploration?

यह शोध पत्र प्रदर्शित करता है कि सक्रिय अन्वेषण के माध्यम से मानव वयस्कों को एजेंसी प्रदान करने से निष्क्रिय अवलोकन की तुलना में उनके संयोजक (conjunctive) कारण नियमों की पहचान करने की क्षमता में महत्वपूर्ण सुधार होता है, जबकि यह भी प्रकट करता है कि यद्यपि लार्ज लैंग्वेज मॉडल्स मानव अनुमान सटीकता के बराबर हो सकते हैं, वे अक्सर कम कुशल अन्वेषण रणनीतियों का उपयोग करते हैं और संयोजक एवं विच्छेदक (disjunctive) तर्क के बीच समान प्रदर्शन अंतराल प्रदर्शित करते हैं।

Mandana Samiei, Eunice Yiu, Anthony GX-Chen, Dongyan Lin, Jocelyn Shen, Blake A. Richards, Alison Gopnik, Doina Precup2026-06-05
💬 NLP

Self-Augmenting Retrieval for Diffusion Language Models

यह शोध पत्र SARDI को प्रस्तुत करता है, जो डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-फ्री रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है, जो डायनेमिक रिट्रीवल को निर्देशित करने के लिए त्याग दिए गए लो-कॉन्फिडेंस टोकन्स को लुकअहेड सिग्नल्स के रूप में उपयोग करता है, और मौजूदा बेसलाइन्स की तुलना में मल्टी-हॉप QA बेंचमार्क्स पर बेहतर प्रदर्शन और 8 गुना तक अधिक थ्रूपुट प्राप्त करता है।

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger2026-06-05