💬 NLP

Benchmarking and Adapting On-Device LLMs for Clinical Decision Support

यह शोध पत्र नैदानिक निर्णय सहायता के लिए विभिन्न ओपन-सोर्स ऑन-डिवाइस लार्ज लैंग्वेज मॉडल्स का बेंचमार्किंग और अनुकूलन करता है, यह प्रदर्शित करते हुए कि वे बेहतर गोपनीयता और संसाधन दक्षता प्रदान करते हुए, विशेष रूप से फाइन-ट्यूनिंग के माध्यम से संवर्धित होने पर, अत्याधुनिक प्रोप्रायटरी मॉडल्स के तुलनीय या उनसे अधिक नैदानिक सटीकता प्राप्त कर सकते हैं।

Alif Munim, Jun Ma, Omar Ibrahim, Alhusain Abdalla, Shuolin Yin, Leo Chen, Bo Wang2026-04-29
💬 NLP

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

यह शोध पत्र MGSM-Pro प्रस्तुत करता है, जो GSM-Symbolic बेंचमार्क का एक बहुभाषी विस्तार है जो कई अंक-परिवर्तित इंस्टेंशिएशन (digit-varying instantiations) उत्पन्न करके नौ भाषाओं में गणितीय तर्क संबंधी सुदृढ़ता का मूल्यांकन करता है, जिससे कम-संसाधन वाली भाषाओं में प्रदर्शन में महत्वपूर्ण गिरावट और ऐसे व्यवधानों के प्रति मॉडलों की भिन्न लचीलापन का पता चलता है।

Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiya (…)2026-04-29
💬 NLP

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

यह शोध पत्र TimeMachine-bench प्रस्तुत करता है, जो वास्तविक दुनिया के रिपॉजिटरी-स्तरीय सॉफ्टवेयर माइग्रेशन कार्यों पर LLMs का मूल्यांकन करने के लिए एक स्वचालित और लाइव-अपडेट होने वाला बेंचमार्क है, जो यह प्रकट करता है कि हालांकि मॉडल आशाजनक दिखते हैं, वे वर्तमान में स्प्यूरियस (spurious) समाधानों और उप-इष्टतम टूल उपयोग जैसी विश्वसनीयता संबंधी समस्याओं के साथ संघर्ष करते हैं।

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki2026-04-29
💬 NLP

CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding

यह शोध पत्र पहला व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि सोर्स कोड को छवियों के रूप में निरूपित करने से विजन लैंग्वेज मॉडल्स (Vision Language Models) विभिन्न कोड समझ संबंधी कार्यों पर प्रदर्शन को बनाए रखते हुए या यहाँ तक कि सुधारते हुए उच्च संपीड़न अनुपातों (compression ratios) के माध्यम से महत्वपूर्ण कम्प्यूटेशनल दक्षता प्राप्त करने में सक्षम होते हैं।

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, X (…)2026-04-29
💬 NLP

Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR

यह शोध पत्र एक डेटा ऑग्मेंटेशन पाइपलाइन का प्रस्ताव करता है जो वृद्ध संदर्भ वाले सिंथेटिक डेटा को उत्पन्न करने के लिए वृद्ध संदर्भ वक्ताओं के उपयोग के साथ LLM-आधारित ट्रांसक्रिप्ट पैराफ्रेसिंग को TTS सिंथेसिस के साथ जोड़ता है, जो कम-संसाधन वाले वृद्ध भाषण डेटासेट पर Whisper ASR मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Minsik Lee, Seoi Hong, Chongmin Lee, Sieun Choi, Jian Kim, Jua Han, Jihie Kim2026-04-29
💬 NLP

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

यह शोध पत्र GAIA-v2-LILT को प्रस्तुत करता है, जो GAIA बेंचमार्क का एक कठोरता से पुन: ऑडिट किया गया बहुभाषी विस्तार है, जो कार्यात्मक संरेखण, सांस्कृतिक अनुकूलन और कठिनाई अंशांकन को संयोजित करने वाले एक परिष्कृत वर्कफ़्लो का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि न्यूनतम मशीन अनुवाद एजेंट प्रदर्शन मेट्रिक्स को महत्वपूर्ण रूप से विकृत करता है और उचित स्थानीयकरण बहुभाषी प्रदर्शन अंतराल को पर्याप्त रूप से कम करता है।

Yunsu Kim, Kaden Uhlig, Joern Wuebker2026-04-29
🤖 machine learning

Rethinking Layer Redundancy in Large Language Models: Calibration Objectives and Search for Depth Pruning

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स में लेयर रिडंडेंसी (परत अतिरेक) एक अंतर्निहित संरचनात्मक गुण नहीं है बल्कि यह कैलिब्रेशन उद्देश्य पर कार्यात्मक रूप से निर्भर है, जो यह प्रदर्शित करता है कि विशिष्ट सर्च एल्गोरिदम के उपयोग की तुलना में उद्देश्य का चयन डेप्थ प्रूनिंग परिणामों पर अधिक प्रभाव डालता है।

Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim, Youngjin Heo, Suin Cho, Seong-hun Kim, Woosang Lim, Gaeul Kwon2026-04-29
💬 NLP

Independent-Component-Based Encoding Models of Brain Activity During Story Comprehension

यह शोध पत्र एक स्वतंत्र घटक-आधारित एन्कोडिंग फ्रेमवर्क प्रस्तावित करता है जो fMRI डेटा को कार्यात्मक नेटवर्क में विघटित करके पारंपरिक वोक्सेल-वार (voxelwise) दृष्टिकोणों की सीमाओं को दूर करता है, जिससे प्राकृतिक कहानी सुनने के प्रति तंत्रिका संबंधी प्रतिक्रियाओं का सुदृढ़, व्याख्या योग्य और अंतर-विषय तुलना संभव हो पाती है।

Kamya Hari, Taha Binhuraib, Jin Li, Cory Shain, Anna A. Ivanova2026-04-29
💬 NLP

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

यह शोधपत्र बेंचगार्ड (BenchGuard) को प्रस्तुत करता है, जो एक स्वचालित ऑडिटिंग फ्रेमवर्क है जो टास्क-ओरिएंटेड एजेंट बेंचमार्क में दोषों को व्यवस्थित रूप से पहचानने और उन्हें मान्य करने के लिए फ्रंटियर एलएलएम (LLM) का लाभ उठाता है, जो कम लागत पर मानवीय समीक्षा द्वारा छूट जाने वाली महत्वपूर्ण त्रुटियों का पता लगाने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi2026-04-29
🤖 machine learning

PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference

PolyKV एक नवीन प्रणाली है जो कई समवर्ती (concurrent) LLM इन्फरेंस एजेंटों को एक एकल, एसिमेट्रिकल रूप से कंप्रेस्ड KV कैश पूल साझा करने में सक्षम बनाती है—जिसमें कीज़ (Keys) के लिए int8 क्वांटाइजेशन और वैल्यूज़ (Values) के लिए 3-बिट FWHT-आधारित क्वांटाइजेशन का उपयोग किया गया है—जो विभिन्न मॉडल स्केल्स और कॉन्टेक्स्ट लेंथ्स में उच्च आउटपुट गुणवत्ता बनाए रखते हुए, नगण्य परप्लेक्सिटी गिरावट के साथ 97.7% तक मेमोरी रिडक्शन प्राप्त करती है।

Ishan Patel, Ishan Joshi2026-04-29