💬 NLP

LLMs and their Limited Theory of Mind: Evaluating Mental State Annotations in Situated Dialogue

यह शोध पत्र टीम के संवादों में साझा मानसिक मॉडलों (shared mental models) को एनोटेट करने और विसंगतियों का पता लगाने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करने वाले एक दो-चरणीय ढांचे (two-step framework) को प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि LLMs सरल कार्यों पर अच्छा प्रदर्शन करते हैं, वे स्थानिक तर्क (spatial reasoning) या स्वर-लहरी संबंधी अस्पष्टता (prosodic disambiguation) की आवश्यकता वाले परिदृश्यों में व्यवस्थित रूप से विफल हो जाते हैं।

Katharine Kowalyshyn, Matthias Scheutz2026-06-30
💬 NLP

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

यह शोध पत्र एक पैटर्न-अवेयर टूल-इंटीग्रेटेड रीजनिंग फ्रेमवर्क प्रस्तावित करता है जो शिक्षक की प्राथमिकताओं के साथ पैटर्न चयन को संरेखित करने से पहले कोड निष्पादन और एल्गोरिद्मिक एनकोडिंग पैटर्न दोनों को स्पष्ट रूप से सीखकर बड़े रीजनिंग मॉडल्स में सुधार करता है, जिससे MATH500 और AIME24 जैसे चुनौतीपूर्ण गणितीय बेंचमार्क पर महत्वपूर्ण सटीकता लाभ प्राप्त होता है।

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang2026-06-30
💬 NLP

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

यह शोध पत्र एक बेयसियन इनवर्स रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तुत करता है जो एलएलएम (LLM) ऑब्जेक्टिव ऑडिटिंग को एकल-बिंदु अनुमान से एक कठोर सत्यापन प्रक्रिया में परिवर्तित करता है, जिससे गैर-पहचान क्षमता (non-identifiability) का परिमाणीकरण, सुरक्षा जोखिमों के लिए अनिश्चितता-जागरूक डायग्नोस्टिक्स का सृजन, और प्रभावी आरएलएचएफ (RLHF) अलाइनमेंट के लिए परिष्कृत रिवार्ड्स का सत्यापन सक्षम होता है।

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo2026-06-30
💬 NLP

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM एक यूनिफाइड मल्टीमॉडल मॉडल्स के लिए एक सेल्फ-रिवॉर्डिंग पोस्ट-ट्रेनिंग फ्रेमवर्क पेश करता है जो बाहरी रिवॉर्ड मॉडल्स या मानव-लेबल वाले डेटा की आवश्यकता के बिना विजुअल जनरेशन फिडेलिटी को महत्वपूर्ण रूप से बढ़ाने के लिए एक ग्लोबल-लोकल डुअल रिवॉर्ड सिस्टम के साथ मॉडल के अपने अंडरस्टैंडिंग मॉड्यूल का आंतरिक इवैल्यूएटर के रूप में लाभ उठाता है।

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu2026-06-30
💬 NLP

Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers

यह शोध पत्र यह प्रदर्शित करता है कि एक प्रतीकात्मक इनडायरेक्ट ऑब्जेक्ट आइडेंटिफिकेशन (Indirect Object Identification) कार्य पर स्क्रैच से छोटे, अटेंशन-ओनली ट्रांसफॉर्मर्स को प्रशिक्षित करने से न्यूनतम, अत्यधिक व्याख्या योग्य सर्किट—विशेष रूप से एक दो-हेड सिंगल-लेयर मॉडल—प्राप्त होते हैं जो विशिष्ट योगात्मक (additive) और विरोधाभासी (contrastive) उप-सर्किट्स के माध्यम से पूर्ण सटीकता प्राप्त करते हैं, जिससे ट्रांसफॉर्मर रीजनिंग के कम्प्यूटेशनल आधारों को समझने के लिए एक नियंत्रित ढांचा प्रदान होता है।

Rabin Adhikari2026-06-30
💬 NLP

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

यह शोध पत्र प्रदर्शित करता है कि आगामी फाइन-ट्यूनिंग आम तौर पर ज्ञान संवर्द्धन (knowledge edits) में पर्याप्त क्षय का कारण बनती है, जो यह प्रकट करता है कि केवल संपादित परतों (edited layers) को फाइन-ट्यून करना डाउनस्ट्रीम प्रदर्शन को बनाए रखते हुए ऐसे संवर्द्धनों को हटाने का एक प्रभावी तरीका है, जिससे मॉडल अनुकूलन पाइपलाइनों के व्यापक संदर्भ के भीतर ज्ञान संवर्द्धन के मूल्यांकन की महत्वपूर्ण आवश्यकता रेखांकित होती है।

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao2026-06-30
💬 NLP

See, Think, Learn: A Self-Taught Multimodal Reasoner

यह शोध पत्र "सी-थिंक-लर्न" (STL) का प्रस्ताव करता है, जो एक लागत प्रभावी स्व-प्रशिक्षण ढांचा है जो एक संरचित "सोचने से पहले देखना" की प्रक्रिया को लागू करके और नकारात्मक तर्कों (negative rationales) को शामिल करके विजन-लैंग्वेज मॉडल्स को बढ़ाता है, ताकि महंगे मानवीय एनोटेशन पर निर्भर हुए बिना दृश्य धारणा और सुदृढ़ मल्टीमॉडल तर्क को संयुक्त रूप से सुधारा जा सके।

Sourabh Sharma, Sonam Gupta, Sadbhawna2026-06-30
💬 NLP

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

यह शोध पत्र ORCA को प्रस्तुत करता है, जो ऑडियो प्रश्नोत्तर में मुक्त-अंत वाली प्रतिक्रियाओं के मूल्यांकन के लिए एक हल्का मॉडल-आधारित ढांचा है, जो मानव निर्णयों के साथ उच्च सहसंबंध प्राप्त करने और समस्याग्रस्त बेंचमार्क मदों को प्रभावी ढंग से पहचानने के लिए एक तीन-चरणीय मानव-AI एनोटेशन पाइपलाइन का लाभ उठाता है।

Šimon Sedláček, Sara Barahona, Bolaji Yusuf, Laura Herrera-Alarcón, Santosh Kesiraju, Cecilia Bolaños, Alicia Lozano-Die (…)2026-06-30
⚡ electrical engineering

MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery

MauBERT, HuBERT का एक बहुभाषी विस्तार है जो भाषा-स्वतंत्र ध्वन्यात्मक निरूपण (phonetic representations) सीखने के लिए प्री-ट्रेनिंग के दौरान उच्चारण संबंधी विशेषताओं (articulatory features) को सम्मिलित करता है, जो उत्कृष्ट क्रॉस-लिंगुअल विभेदन क्षमता और अनदेखी भाषाओं एवं अनौपचारिक भाषण के प्रति फ्यू-शॉट अनुकूलन क्षमता प्रदर्शित करता है।

Angelo Ortiz Tandazo, Manel Khentout, Youssef Benchekroun, Thomas Hueber, Emmanuel Dupoux2026-06-30
💬 NLP

Categorize Early, Integrate Late: Divergent Processing Strategies in Automatic Speech Recognition

यह शोध पत्र एक "आर्किटेक्चरल फिंगरप्रिंटिंग" (Architectural Fingerprinting) ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि जबकि ट्रांसफॉर्मर्स (Transformers) और कॉन्फॉर्मर्स (Conformers) स्पीच रिकग्निशन में तुलनीय प्रदर्शन प्राप्त करते हैं, वे विविध प्रसंस्करण रणनीतियों का उपयोग करते हैं जहाँ कॉन्फॉर्मर्स उथले परतों (shallow layers) में ध्वन्यात्मक विवरणों (phonemic details) को हल करके "जल्दी वर्गीकृत" (categorize early) करते हैं, जबकि ट्रांसफॉर्मर्स ऐसे एनकोडिंग को गहरी परतों तक स्थगित करके "देर से एकीकृत" (integrate late) करते हैं।

Nathan Roll, Pranav Bhalerao, Martijn Bartelds, Arjun Pawar, Yuka Tatsumi, Tolulope Ogunremi, Chen Shani, Calbert Graham (…)2026-06-30