💬 NLP

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

यह अध्ययन प्रदर्शित करता है कि ऑन-डिवाइस 4B रिसर्च एजेंटों के लिए, उद्धरण निष्ठा (citation faithfulness) मुख्य रूप से मॉडल को दिए गए स्रोत टेक्स्ट की मात्रा द्वारा निर्धारित होती है न कि स्रोत की गुणवत्ता द्वारा, जबकि सही स्रोतों का कवरेज पूरी तरह से रिट्रीवल रिकॉल (retrieval recall) द्वारा सीमित रहता है।

Vinay Kumar Chaganti2026-07-15
🤖 machine learning

Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents

यह शोध पत्र SLEUTH को प्रस्तुत करता है, जो एक ऐसा भाषा एजेंट फ्रेमवर्क है जो निहित संदर्भ (implicit context) को एक स्पष्ट, संरचित एपिस्टेमिक वर्किंग मेमोरी (पुष्ट तथ्यों, रैंक किए गए परिकल्पनाओं और खुले प्रश्नों को ट्रैक करने वाली) से बदलकर मल्टी-हॉप रीजनिंग को स्केल करता है, जो जटिल बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है और यह प्रकट करता है कि संदर्भ विरलीकरण (context dilution) और साक्ष्य पर्याप्तता (evidence sufficiency) की समस्याओं को दूर करने के लिए तर्क की स्थिति को व्यवस्थित करना कच्चे मॉडल सामर्थ्य की तुलना में अधिक महत्वपूर्ण है।

Ning Liu2026-07-15
💬 NLP

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

यह शोध पत्र LakeQuest को प्रस्तुत करता है, जो तीन विविध डोमेन में लगभग 10,000 QA (प्रश्न-उत्तर) युग्मों से बना एक मानव-सत्यापित बेंचमार्क है, जिसे यथार्थवादी, विषम डेटा लेक्स (data lakes) पर एंड-टू-एंड प्रश्न उत्तर करने में वर्तमान रिट्रीवल-ऑगमेंटेड और एजेंटिक प्रणालियों की सीमाओं का मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong2026-07-15
💬 NLP

Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)

यह शोध पत्र एक सांस्कृतिक रूप से संवेदनशील 'रिस्पॉन्सिबल एनएलपी' (Responsible NLP) ढांचे का प्रस्ताव देकर कम-संसाधन वाली भाषाओं में स्वास्थ्य संबंधी गलत सूचनाओं की चुनौती को संबोधित करता है और यह प्रदर्शित करता है कि 'Phi-4 स्मॉल लैंग्वेज मॉडल' बांग्ला में दावे निष्कर्षण (claim extraction) के लिए परिशुद्धता (precision) और रिकॉल (recall) का एक इष्टतम संतुलन प्रदान करता है, जो संसाधन-गहन लार्ज लैंग्वेज मॉडल्स से बेहतर प्रदर्शन करता है।

Farnaz Farid, Raihan Alam, Al Al-Areqi, Farhad Ahamed, Muhammad Hassan Khan, Sadia Hossain, Irena Veljanova, Anika Tabas (…)2026-07-15
💻 computer science

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

यह शोध पत्र एक नवीन BCI-सचेत ढांचे का प्रस्ताव करता है जो धारणात्मक निष्ठा (perceptual fidelity) को अर्थपूर्ण पुनर्प्राप्ति (semantic recoverability) से अलग करके EEG-से-छवि पुनर्निर्माणों का मूल्यांकन करने के लिए विजन लैंग्वेज मॉडल्स का उपयोग करता है, और पारंपरिक पिक्सेल-आधारित एवं प्रतिनिधित्व मेट्रिक्स की सीमाओं को दूर करने के लिए BCI-Coherence Score (BCS) को प्रस्तुत करता है।

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik2026-07-15
💻 computer science

PM-Bench: Evaluating Prospective Memory in LLM Agents

यह शोध पत्र PM-Bench प्रस्तुत करता है, जो LLM एजेंटों में प्रोस्पेक्टिव मेमोरी (prospective memory) का मूल्यांकन करने के लिए 'वर्चुअल वीक' प्रतिमान से प्रेरित एक टेक्स्ट-आधारित बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी चल रही गतिविधियों के बीच विलंबित इरादों को विश्वसनीय रूप से निष्पादित करने में संघर्ष करते हैं, जिसका अधिकतम F1 स्कोर केवल 65.1% है।

Genglin Liu, Saadia Gabriel2026-07-15
💻 computer science

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

यह शोधपत्र 'क्रिटिक एक्सपीरियंस बैंक' (Critic Experience Bank) का परिचय देता है, जो एक प्रशिक्षण-मुक्त (training-free), स्व-विकसित (self-evolving) ढांचा है जो पिछले अनुभवों के मेमोरी बैंक को भरने के लिए पश्चदृष्टि फीडबैक (hindsight feedback) का लाभ उठाकर LLM एजेंटों के लिए स्टेप-लेवल कॉन्फिडेंस एस्टीमेशन को बढ़ाता है, जिससे बिना किसी ग्राउंड ट्रुथ लेबल की आवश्यकता के कैलिब्रेशन और रैंकिंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin2026-07-15
💻 computer science

Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

यह शोध पत्र यह प्रदर्शित करता है कि LoRA जैसे पैरामीटर-कुशल फाइन-ट्यूनिंग (PEFT) तरीके स्पेक्युलेटिव डिकोडिंग के लिए व्यावहारिक गति वृद्धि प्रदान करने में विफल रहते हैं क्योंकि, लंबे स्वीकृत प्रीफिक्स उत्पन्न करने के बावजूद, एडेप्टर-सक्षम ड्राफ्टर को निष्पादित करने की कम्प्यूटेशनल लागत पूर्ण वेरीफायर के तुलनीय बनी रहती है, जिससे यह मौलिक आवश्यकता का उल्लंघन होता है कि ड्राफ्टर को चलाने के लिए काफी सस्ता होना चाहिए।

Abdurrahman Javat, Allan Kazakov2026-07-15
💻 computer science

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning

यह शोध पत्र ARDepth को प्रस्तुत करता है, जो एक नवीन ऑटो-रिग्रेसिव फ्रेमवर्क है, जो पारंपरिक ग्लोबल डिफ्यूजन-आधारित विधियों की तुलना में पदानुक्रमित ज्यामितीय संरचनाओं (hierarchical geometric structures) को बेहतर ढंग से कैप्चर करने के लिए स्केल-प्रोग्रेसिव कंडीशनिंग और सिमेंटिक-अवेयर गाइडेंस का उपयोग करते हुए, बढ़ते स्थानिक पैमानों (spatial scales) के माध्यम से गहराई के निरूपण को प्रगतिशील रूप से निर्मित करता है।

Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li2026-07-15
🤖 machine learning

The Computational Basis of Confidence in Large Language Models

यह शोध पत्र सांख्यिकीय निर्णय विश्वास (SDC) के मानकीय ढांचे को लागू करते हुए यह प्रदर्शित करता है कि मल्टीमॉडल लैंग्वेज मॉडल्स में उत्तर लॉजिट्स (answer logits), ह्यूरिस्टिक प्रेफरेंस स्कोर्स के बजाय एक लेटेंट डिसीजन वेरिएबल के मोनोटोनिक रीडआउट के रूप में कार्य करते हैं, जिससे विश्वास का एक ऐसा कम्प्यूटेशनल विवरण प्राप्त होता है जो जैविक और कृत्रिम बुद्धिमत्ता को एकीकृत करता है।

Dharshan Kumaran, Viorica Patraucean, Maks Ovsanikov, Petar Veličković, Nathaniel Daw2026-07-15