💬 NLP

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

यह शोध पत्र BenchMarker प्रस्तुत करता है, जो एक शिक्षा-प्रेरित टूलकिट है जो बहुविकल्पीय बेंचमार्क में संदूषण (contamination), शॉर्टकट और लेखन त्रुटियों का पता लगाने के लिए LLM जजों का उपयोग करता है, जिससे यह पता चलता है कि इस तरह के दोष 12 प्रमुख डेटासेट में बने हुए हैं, मूल्यांकन मेट्रिक्स को महत्वपूर्ण रूप से विकृत करते हैं, और अक्सर पहले से सुधारे गए बेंचमार्क्स में भी उभर आते हैं।

Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Ra (…)2026-04-21
💬 NLP

Althea: Human-AI Collaboration for Fact-Checking and Critical Reasoning

यह शोध पत्र अल्थिया (Althea) का परिचय देता है, जो एक रिट्रीवल-ऑगमेंटेड मानव-AI सहयोग प्रणाली है जो निर्देशित संवाद के माध्यम से संज्ञानात्मक कार्य को संरचित करके तथ्य-जांच की सटीकता और आलोचनात्मक तर्क क्षमता को बढ़ाती है, और अंततः यह प्रदर्शित करती है कि शैक्षणिक स्कैफोल्डिंग (pedagogical scaffolding), स्वचालित निर्णयों या स्व-निर्देशित खोज की तुलना में उपयोगकर्ता की ज्ञान संबंधी स्वायत्तता (epistemic autonomy) में अधिक स्थायी सुधार लाती है।

Svetlana Churina, Kokil Jaidka, Anab Maulana Barik, Harshit Aneja, Cai Yang, Wynne Hsu, Mong Li Lee2026-04-21
💬 NLP

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

यह शोध पत्र MARA का प्रस्ताव करता है, जो एक मल्टीमॉडल एडेप्टिव रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जो सटीक रिट्रीवल के लिए क्वेरी-अलाइन्ड रीजन एनकोडिंग और एडेप्टिव जनरेशन के लिए एक सेल्फ-रिफ्लेक्टिव एविडेंस कंट्रोलर पेश करके डॉक्यूमेंट क्वेश्चन अनस्विंग को बेहतर बनाता है, और छह बेंचमार्क में मौजूदा स्टेट-ऑफ-द-आर्ट विधियों से बेहतर प्रदर्शन करता है।

Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang (…)2026-04-21
💬 NLP

Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations

यह शोध पत्र एक व्यवस्थित नैदानिक अध्ययन प्रस्तुत करता है जो यह प्रकट करता है कि कोल्ड-स्टार्ट मूवी रिकमेंडेशन के दौरान LLM-आधारित क्रॉस-एनकोडर रीरैंकर्स, रिट्रीवल कवरेज में महत्वपूर्ण विफलताओं, गंभीर एक्सपोज़र बायस और खराब स्कोर डिस्क्रिमिनेशन के कारण सरल लोकप्रियता बेसलाइन्स से भी कम प्रदर्शन करते हैं, जो हाइब्रिड रिट्रीवल और कैंडिडेट ऑप्टिमाइज़ेशन के लिए कार्रवाई योग्य रणनीतियों की ओर ले जाते हैं।

Ekaterina Lemdiasova, Nikita Zmanovskii2026-04-21
🤖 machine learning

Annotation Entropy Predicts Per-Example Learning Dynamics in LoRA Fine-Tuning

यह शोध पत्र प्रदर्शित करता है कि LoRA फाइन-ट्यूनिंग विशिष्ट रूप से उन उदाहरणों पर मॉडल के प्रदर्शन को कम करती है जिनमें एनोटेटर असहमति (उच्च एनोटेशन एंट्रॉपी) अधिक होती है, एक ऐसी घटना जिसे प्रशिक्षण के दौरान बढ़ते लॉस द्वारा पहचाना जाता है जो एनोटेशन अनिश्चितता के साथ दृढ़ता से सहसंबंधित है और फुल फाइन-ट्यूनिंग से भिन्न है।

Brady Steele2026-04-21
💬 NLP

Benchmarking Real-Time Question Answering via Executable Code Workflows

यह शोध पत्र RT-QA प्रस्तुत करता है, जो वास्तविक समय में प्रश्न उत्तर (real-time question answering) का आकलन करने के लिए निष्पादन योग्य कोड वर्कफ़्लो (executable code workflows) का उपयोग करने वाला एक गतिशील मूल्यांकन ढांचा है, जो यह प्रकट करता है कि स्टेट-ऑफ-द-आर्ट मॉडल भी आलसी पुनर्प्राप्ति (lazy retrieval) और सामयिक भ्रम (temporal confusion) के कारण अस्थायी अनुकूलन क्षमता (temporal adaptability) के साथ संघर्ष करते हैं, और केवल 46% सटीकता प्राप्त करते हैं।

Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao2026-04-21
💬 NLP

Training for Compositional Sensitivity Reduces Dense Retrieval Generalization

यह शोध पत्र प्रदर्शित करता है कि संरचना-लक्षित नेगेटिव्स (structure-targeted negatives) का उपयोग करके संरचनात्मक संवेदनशीलता (compositional sensitivity) के लिए डेंस रिट्रीवल मॉडल्स को प्रशिक्षित करने से ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्रदर्शन में महत्वपूर्ण गिरावट आती है, जबकि यह भी दर्शाता है कि मैक्ससिम (MaxSim) जैसे टोकन-स्तरीय सत्यापनकर्ता या समानता मानचित्रों (similarity maps) पर छोटे ट्रांसफॉर्मर्स, रीरैंकिंग परिदृश्यों में संरचनात्मक निकट-त्रुटियों (structural near-misses) के बीच अंतर करने के लिए अधिक उपयुक्त हैं।

Radoslav Ralev, Aditeya Baral, Iliya Zhechev, Jen Agarwal, Srijith Rajamohan2026-04-21
💬 NLP

Clinical Note Bloat Reduction for Efficient LLM Use

यह शोधपत्र TRACE को प्रस्तुत करता है, जो एक स्केलेबल प्रीप्रोसेसिंग पाइपलाइन है जो क्लिनिकल डॉक्यूमेंटेशन में लगभग आधे रेडंडेंट "नोट ब्लोट" (note bloat) को हटाने के लिए EHR मेटाडेटा और फ्रीक्वेंसी-आधारित डीडुप्लिकेशन का लाभ उठाता है, जिससे डाउनस्ट्रीम क्लिनिकल कार्यों में प्रदर्शन को बनाए रखते हुए LLM इन्फरेंस लागतों में उल्लेखनीय कमी आती है।

Jordan L. Cahoon, Chloe Stanwyck, Asad Aali, Rachel Madding, Emma Sun, Yixing Jiang, Renumathy Dhanasekaran, Emily Alsen (…)2026-04-21
💬 NLP

Cross-Family Speculative Decoding for Polish Language Models on Apple~Silicon: An Empirical Evaluation of Bielik~11B with UAG-Extended MLX-LM

यह शोध पत्र एप्पल सिलिकॉन पर पोलिश भाषा मॉडलों के लिए क्रॉस-फैमिली स्पेक्युलेटिव डिकोडिंग का एक अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि संदर्भ-जागरूक टोकन अनुवाद स्वीकृति दरों में सुधार करता है, यूनिफाइड मेमोरी बैंडविड्थ बाधाएं और असंगत टोकनाइज़र थ्रूपुट लाभों को सीमित करते हैं, विशेष रूप से तब जब विशिष्ट ड्राफ्ट मॉडल सामान्य-उद्देश्य वाले विकल्पों के मुकाबले कम प्रदर्शन करते हैं।

Krzysztof Fonal2026-04-21
💬 NLP

Brain-CLIPLM: Decoding Compressed Semantic Representations in EEG for Language Reconstruction

Brain-CLIPLM EEG डिकोडिंग के लिए एक सिमेंटिक कम्प्रेशन परिकल्पना प्रस्तावित करता है, जो यह प्रदर्शित करता है कि कंट्रास्टिव लर्निंग के माध्यम से सिमेंटिक एंकर्स निकालने और रिट्रीवल-ग्राउंडेड LLM के साथ वाक्यों को पुनर्गठित करने वाला एक दो-चरणीय ढांचा, गैर-आक्रामक मस्तिष्क संकेतों की अंतर्निहित सूचना क्षमता के साथ पुनर्निर्माण जटिलता को संरेखित करके प्रत्यक्ष डिकोडिंग की तुलना में काफी बेहतर प्रदर्शन करता है।

Xiaoli Yang, Huiyuan Tian, Yurui Li, Jianyu Zhang, Shijian Li, Gang Pan2026-04-21