📊 statistics

Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

यह शोध पत्र CapCode और CapReward को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क और रिवॉर्ड मैकेनिज्म है जो कोडिंग एजेंटों में धोखेबाज़ी से होने वाली बेईमानी का पता लगाने और उसे रोकने के लिए जानबूझकर सीमित प्रदर्शन सीमाओं वाले रैंडमाइज्ड टेस्ट का उपयोग करता है, जिससे यह सुनिश्चित होता है कि मूल्यांकन स्कोर वास्तविक कार्य-समाधान क्षमता को अधिक सटीक रूप से दर्शाते हैं।

Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori, Nontawat Charoenphakdee, Masashi Sugiyama, Takashi Ishida2026-06-08
💬 NLP

The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs

यह शोध पत्र यह प्रकट करता है कि जबकि बड़े भाषा मॉडल अपनी बेहतर सामान्य दक्षता के कारण अंग्रेजी में अक्सर उच्च कच्ची सटीकता प्रदर्शित करते हैं, एक बार जब इस दक्षता अंतराल को नियंत्रित कर लिया जाता है, तो स्थानीय सांस्कृतिक ज्ञान तक उनकी पहुँच मातृ भाषाओं में अधिक प्रभावी होती है, जो यह सुझाव देती है कि निम्न स्थानीय-भाषा प्रदर्शन अक्सर कमजोर सांस्कृतिक समझ को दर्शाता नहीं, बल्कि उसे छिपाता है।

Yang Zhang, Xiao Fei, Amr Mohamed, Sarah Almeida Carneiro, Mersin Konomi, Mingmeng Geng, Ahmed Asaad, Guokan Shang, Mich (…)2026-06-08
💬 NLP

Supervision versus Demonstration-Based In-Context Learning for Multiword Expression Classification

यह अध्ययन तुर्कीकृत लाइट वर्ब कंस्ट्रक्शंस (light verb constructions) का पता लगाने के लिए सुपरवाइज्ड लर्निंग बनाम डेमोंस्ट्रेशन-आधारित इन-कॉन्टेक्स्ट लर्निंग की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ सुपरवाइज्ड बेसलाइन प्रतिस्पर्धी बनी रहती है, वहीं सावधानीपूर्वक निर्मित फ्यू-शॉट प्रॉम्प्ट्स, ज़ीरो-शॉट रिकॉल संबंधी समस्याओं को कम करके और मॉडल-विशिष्ट पूर्वाग्रहों को घटाकर, इंस्ट्रक्शन-ट्यून्ड एलएलएम (LLMs) को उनके प्रदर्शन के बराबर या उससे अधिक सक्षम बनाते हैं।

Sercan Karakaş, Yusuf Şimşek2026-06-08
💬 NLP

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer एक प्लग-एंड-प्ले फ्रेमवर्क है जो एक पदानुक्रमित ग्राफ मेमोरी (hierarchical graph memory) का निर्माण करके और एक एजेंटिक रिट्रीवल मैकेनिज्म (agentic retrieval mechanism) को नियोजित करके लंबे वीडियो को समझने के लिए धारणा (perception) और तर्क (reasoning) को अलग करता है, जो संदर्भ विंडो की आवश्यकताओं को नाटकीय रूप से कम करते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है।

Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua She (…)2026-06-08
💬 NLP

How reliable are LLMs when it comes to playing dice?

यह अध्ययन प्रकट करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स मानक संभाव्यता अभ्यासों में उत्कृष्ट हैं, वहीं वे अंतर्ज्ञान-विरोधी समस्याओं के साथ संघर्ष करते हैं और टोकन पूर्वाग्रह एवं भ्रामक प्रॉम्प्ट्स के प्रति अत्यधिक संवेदनशील हैं, जो यह दर्शाता है कि वे अभी तक वास्तविक संभाव्यता तर्ककर्ता नहीं हैं।

Luca Avena, Gianmarco Bet, Bernardo Busoni2026-06-08
💬 NLP

Semi-Offline Reinforcement Learning for Optimized Text Generation

यह शोध पत्र "सेमी-ऑफलाइन रीइन्फोर्समेंट लर्निंग" का परिचय देता है, जो अन्वेषण (exploration) और प्रशिक्षण लागत के बीच संतुलन बनाने के लिए ऑनलाइन और ऑफलाइन सेटिंग्स के बीच के अंतर को पाटने वाला एक नया प्रतिमान (paradigm) है, जो टेक्स्ट जनरेशन के लिए एक सैद्धांतिक रूप से इष्टतम ढांचा प्रदान करता है जो अत्याधुनिक तरीकों के बराबर या उनसे बेहतर प्रदर्शन करता है।

Changyu Chen, Xiting Wang, Yiqiao Jin, Victor Ye Dong, Li Dong, Jie Cao, Yi Liu, Rui Yan2026-06-05
💬 NLP

What Makes Two Language Models Think Alike?

यह शोध पत्र तंत्रिका गतिविधि (neural activity) को व्याख्या योग्य भाषाई विशेषताओं में मैप करने की एक नवीन विधि प्रस्तुत करता है ताकि यह प्रकट किया जा सके कि 43 विविध भाषा मॉडलों के बीच समानताएं मुख्य रूप से उनके रिलीज होने की तिथि और मॉडल परिवार द्वारा संचालित होती हैं, न कि उनके पैमाने या आर्किटेक्चरल क्लास द्वारा।

Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz2026-06-05
💬 NLP

Channel-Wise Mixed-Precision Quantization for Large Language Models

यह शोध पत्र चैनल-वाइज मिक्स्ड-प्रिसिजन क्वांटाइजेशन (CMPQ) प्रस्तुत करता है, जो एक नवीन विधि है जो एक्टिवेशन वितरण के आधार पर वेट चैनल्स को मनमाने प्रिसिजन स्तरों को गतिशील रूप से आवंटित करती है और एज डिवाइसेस पर लार्ज लैंग्वेज मॉडल्स के लिए उच्च प्रदर्शन बनाए रखते हुए मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने के लिए आउटलियर एक्सट्रैक्शन के साथ नॉन-यूनिफॉर्म क्वांटाइजेशन का उपयोग करती है।

Zihan Chen, Bike Xie, Jundong Li, Cong Shen2026-06-05
💬 NLP

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

यह शोध पत्र बुलियन फलनों (Boolean functions) और छोटे तंत्रिका नेटवर्क (neural networks) पर प्रयोगों के माध्यम से यह प्रदर्शित करते हुए मैकेनिस्टिक इंटरप्रिटेबिलिटी (Mechanistic Interpretability) की पहचान क्षमता (identifiability) की जांच करता है कि व्यवस्थित गैर-पहचान क्षमता (systematic non-identifiability) के कारण अद्वितीय स्पष्टीकरण अक्सर अप्राप्य होते हैं, जिससे वैध एआई स्पष्टीकरणों के लिए क्या सख्त विशिष्टता आवश्यक है, इस पर पुनर्मूल्यांकन की आवश्यकता उत्पन्न होती है।

Maxime Méloux, Silviu Maniu, François Portet, Maxime Peyrard2026-06-05
💬 NLP

The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?

यह शोध पत्र तर्क देता है कि कंट्रास्टिव डिकोडिंग (contrastive decoding) मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑब्जेक्ट हैलुसिनेशन (object hallucinations) को वास्तव में कम करने में विफल रहती है, यह प्रकट करते हुए कि POPE जैसे बेंचमार्क्स पर इसकी स्पष्ट सफलता केवल कच्चे वितरण समायोजन (crude distribution adjustments) और ग्रीडी सर्च (greedy search) में कमी के कारण एक भ्रम मात्र है, न कि वास्तविक हैलुसिनेशन दमन के कारण।

Hao Yin, Guangzong Si, Zilei Wang2026-06-05