💬 NLP

Supervision versus Demonstration-Based In-Context Learning for Multiword Expression Classification

यह अध्ययन तुर्कीकृत लाइट वर्ब कंस्ट्रक्शंस (light verb constructions) का पता लगाने के लिए सुपरवाइज्ड लर्निंग बनाम डेमोंस्ट्रेशन-आधारित इन-कॉन्टेक्स्ट लर्निंग की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ सुपरवाइज्ड बेसलाइन प्रतिस्पर्धी बनी रहती है, वहीं सावधानीपूर्वक निर्मित फ्यू-शॉट प्रॉम्प्ट्स, ज़ीरो-शॉट रिकॉल संबंधी समस्याओं को कम करके और मॉडल-विशिष्ट पूर्वाग्रहों को घटाकर, इंस्ट्रक्शन-ट्यून्ड एलएलएम (LLMs) को उनके प्रदर्शन के बराबर या उससे अधिक सक्षम बनाते हैं।

Sercan Karakaş, Yusuf Şimşek2026-06-08
💬 NLP

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer एक प्लग-एंड-प्ले फ्रेमवर्क है जो एक पदानुक्रमित ग्राफ मेमोरी (hierarchical graph memory) का निर्माण करके और एक एजेंटिक रिट्रीवल मैकेनिज्म (agentic retrieval mechanism) को नियोजित करके लंबे वीडियो को समझने के लिए धारणा (perception) और तर्क (reasoning) को अलग करता है, जो संदर्भ विंडो की आवश्यकताओं को नाटकीय रूप से कम करते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है।

Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua She (…)2026-06-08
💬 NLP

How reliable are LLMs when it comes to playing dice?

यह अध्ययन प्रकट करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स मानक संभाव्यता अभ्यासों में उत्कृष्ट हैं, वहीं वे अंतर्ज्ञान-विरोधी समस्याओं के साथ संघर्ष करते हैं और टोकन पूर्वाग्रह एवं भ्रामक प्रॉम्प्ट्स के प्रति अत्यधिक संवेदनशील हैं, जो यह दर्शाता है कि वे अभी तक वास्तविक संभाव्यता तर्ककर्ता नहीं हैं।

Luca Avena, Gianmarco Bet, Bernardo Busoni2026-06-08
💬 NLP

Semi-Offline Reinforcement Learning for Optimized Text Generation

यह शोध पत्र "सेमी-ऑफलाइन रीइन्फोर्समेंट लर्निंग" का परिचय देता है, जो अन्वेषण (exploration) और प्रशिक्षण लागत के बीच संतुलन बनाने के लिए ऑनलाइन और ऑफलाइन सेटिंग्स के बीच के अंतर को पाटने वाला एक नया प्रतिमान (paradigm) है, जो टेक्स्ट जनरेशन के लिए एक सैद्धांतिक रूप से इष्टतम ढांचा प्रदान करता है जो अत्याधुनिक तरीकों के बराबर या उनसे बेहतर प्रदर्शन करता है।

Changyu Chen, Xiting Wang, Yiqiao Jin, Victor Ye Dong, Li Dong, Jie Cao, Yi Liu, Rui Yan2026-06-05
💬 NLP

What Makes Two Language Models Think Alike?

यह शोध पत्र तंत्रिका गतिविधि (neural activity) को व्याख्या योग्य भाषाई विशेषताओं में मैप करने की एक नवीन विधि प्रस्तुत करता है ताकि यह प्रकट किया जा सके कि 43 विविध भाषा मॉडलों के बीच समानताएं मुख्य रूप से उनके रिलीज होने की तिथि और मॉडल परिवार द्वारा संचालित होती हैं, न कि उनके पैमाने या आर्किटेक्चरल क्लास द्वारा।

Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz2026-06-05
💬 NLP

Channel-Wise Mixed-Precision Quantization for Large Language Models

यह शोध पत्र चैनल-वाइज मिक्स्ड-प्रिसिजन क्वांटाइजेशन (CMPQ) प्रस्तुत करता है, जो एक नवीन विधि है जो एक्टिवेशन वितरण के आधार पर वेट चैनल्स को मनमाने प्रिसिजन स्तरों को गतिशील रूप से आवंटित करती है और एज डिवाइसेस पर लार्ज लैंग्वेज मॉडल्स के लिए उच्च प्रदर्शन बनाए रखते हुए मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने के लिए आउटलियर एक्सट्रैक्शन के साथ नॉन-यूनिफॉर्म क्वांटाइजेशन का उपयोग करती है।

Zihan Chen, Bike Xie, Jundong Li, Cong Shen2026-06-05
💬 NLP

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

यह शोध पत्र बुलियन फलनों (Boolean functions) और छोटे तंत्रिका नेटवर्क (neural networks) पर प्रयोगों के माध्यम से यह प्रदर्शित करते हुए मैकेनिस्टिक इंटरप्रिटेबिलिटी (Mechanistic Interpretability) की पहचान क्षमता (identifiability) की जांच करता है कि व्यवस्थित गैर-पहचान क्षमता (systematic non-identifiability) के कारण अद्वितीय स्पष्टीकरण अक्सर अप्राप्य होते हैं, जिससे वैध एआई स्पष्टीकरणों के लिए क्या सख्त विशिष्टता आवश्यक है, इस पर पुनर्मूल्यांकन की आवश्यकता उत्पन्न होती है।

Maxime Méloux, Silviu Maniu, François Portet, Maxime Peyrard2026-06-05
💬 NLP

The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?

यह शोध पत्र तर्क देता है कि कंट्रास्टिव डिकोडिंग (contrastive decoding) मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑब्जेक्ट हैलुसिनेशन (object hallucinations) को वास्तव में कम करने में विफल रहती है, यह प्रकट करते हुए कि POPE जैसे बेंचमार्क्स पर इसकी स्पष्ट सफलता केवल कच्चे वितरण समायोजन (crude distribution adjustments) और ग्रीडी सर्च (greedy search) में कमी के कारण एक भ्रम मात्र है, न कि वास्तविक हैलुसिनेशन दमन के कारण।

Hao Yin, Guangzong Si, Zilei Wang2026-06-05
💬 NLP

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

यह शोध पत्र CLASH पेश करता है, जो विविध चरित्र दृष्टिकोणों के साथ उच्च-दांव वाले दुविधाओं का एक डेटासेट है, यह प्रकट करने के लिए कि उन्नत भाषा मॉडल भी मूल्य-आधारित निर्णय लेने में संघर्ष करते हैं, और मनोवैज्ञानिक असहजता की उचित भविष्यवाणियों के बावजूद शीघ्र प्रतिबद्धता और मूल्यों में बदलाव की सीमित समझ जैसे विशिष्ट विफलता पैटर्न प्रदर्शित करते हैं।

Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang2026-06-05
💬 NLP

Pitfalls of Evaluating Language Models with Open Benchmarks

यह शोध पत्र यह प्रदर्शित करता है कि ओपन लैंग्वेज मॉडल बेंचमार्क डेटा लीकेज और हेरफेर के प्रति संवेदनशील हैं, जैसा कि उन मॉडलों से सिद्ध होता है जो सार्वजनिक टेस्ट सेट्स पर ओवरफिट हो जाते हैं और सामान्यीकरण करने में विफल रहते हैं, जिससे विश्वसनीय मूल्यांकन सुनिश्चित करने के लिए निजी या गतिशील मूल्यांकन विधियों की ओर बदलाव आवश्यक हो जाता है।

Md. Najib Hasan (Wichita State University), Md Mahadi Hassan Sibat (University of Central Florida), Mohammad Fakhruddin (…)2026-06-05