💬 NLP

A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering

यह शोध पत्र MedQA USMLE बेंचमार्क पर रिट्रीवल-ऑगमेंटेड मेडिकल क्वेश्चन आंसरिंग का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि क्वेरी रीफॉर्मुलेशन और रीरैंकिंग के साथ एक डेंस रिट्रीवल पाइपलाइन 60.49% सटीकता प्राप्त करती है और साथ ही डोमेन-विशिष्ट मॉडलों के बेहतर प्रदर्शन और उपभोक्ता-ग्रेड हार्डवेयर पर ऐसे मूल्यांकनों की व्यवहार्यता को रेखांकित करती है।

Nusrat Sultana, Abdullah Muhammad Moosa, Kazi Afzalur Rahman, Sajal Chandra Banik2026-04-09
💬 NLP

Evaluating In-Context Translation with Synchronous Context-Free Grammar Transduction

यह शोध पत्र प्राकृतिक भाषाओं के एक औपचारिक प्रॉक्सी के रूप में सिंक्रोनस कॉन्टेक्स्ट-फ्री ग्रामर का उपयोग करते हुए इन-कॉन्टेक्स्ट अनुवाद करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिसमें यह पाया गया है कि व्याकरण के आकार और वाक्य की लंबाई बढ़ने के साथ प्रदर्शन में काफी गिरावट आती है, यह रूपात्मक (morphological) और लिपि संबंधी अंतरों से बाधित होता है, और शब्दावली संबंधी मतिभ्रम (hallucinations) तथा अननुवादित स्रोत शब्दों जैसी त्रुटियों द्वारा अभिलक्षित होता है।

Jackson Petty, Jaulie Goe, Tal Linzen2026-04-09
💬 NLP

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

यह शोध पत्र 'पर्सनलाइज्ड रिवॉर्डबेंच' (Personalized RewardBench) का परिचय देता है, जो एक नया बेंचमार्क है जो सख्त रूब्रिक्स का उपयोग करके व्यक्तिगत उपयोगकर्ता प्राथमिकताओं के साथ संरेखित होने की क्षमता पर रिवॉर्ड मॉडल्स का मूल्यांकन करता है, यह प्रदर्शित करते हुए कि वर्तमान अत्याधुनिक मॉडल वैयक्तिकरण (personalization) में संघर्ष करते हैं और यह बेंचमार्क डाउनस्ट्रीम प्रदर्शन की भविष्यवाणी करने में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao2026-04-09
💬 NLP

CodeMind: Evaluating Large Language Models for Code Reasoning

यह शोधपत्र CodeMind प्रस्तुत करता है, जो एक ऐसा ढांचा है जो तीन विशिष्ट कार्यों—स्वतंत्र निष्पादन (Independent Execution), विनिर्देश (Specification), और गतिशील अर्थ विज्ञान तर्क (Dynamic Semantics Reasoning)—के माध्यम से बड़े भाषा मॉडलों की कोड तर्क क्षमताओं का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि मॉडल बुनियादी गतिशील पहलुओं को संभाल सकते हैं, लेकिन जटिलता बढ़ने के साथ उनका प्रदर्शन घट जाता है और बग सुधार क्षमताओं के साथ उनका कोई सहसंबंध नहीं दिखता है।

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand2026-04-08
💬 NLP

Exploring Continual Fine-Tuning for Enhancing Language Ability in Large Language Model

यह शोधपत्र इस बात की जांच करता है कि क्रमिक फाइन-ट्यूनिंग चरणों के बीच की समानता, मौजूदा कार्य कौशल को भूले बिना नई भाषाओं को सीखने की लार्ज लैंग्वेज मॉडल्स की क्षमता को कैसे प्रभावित करती है, और यह प्रदर्शित करता है कि अनुकूलित लेयर फ्रीजिंग और जेनेरेटिव रिप्ले विधियाँ असमान बहुभाषी डेटासेटों के अनुकूल होने पर प्रदर्शन में गिरावट को प्रभावी ढंग से कम कर सकती हैं।

Divyanshu Aggarwal, Sankarshan Damle, Navin Goyal, Satya Lokam, Sunayana Sitaram2026-04-08
💬 NLP

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification

LongSpec एक नवीन फ्रेमवर्क है जो निरंतर-आकार के KV कैश वाले मेमोरी-कुशल ड्राफ्ट मॉडल, प्रशिक्षण-अनुमान अंतराल को पाटने के लिए नवीन स्थिति सूचकांकों और एक अनुकूलित अटेंशन एकत्रीकरण रणनीति को पेश करके, लॉन्ग-कॉन्टेक्स्ट लार्ज लैंग्वेज मॉडल्स के लिए लॉसलेस, कुशल स्पेक्युलेटिव डिकोडिंग को सक्षम बनाता है, जिससे मौजूदा बेसलाइन्स की तुलना में महत्वपूर्ण गति प्राप्त होती है।

Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An2026-04-08
💬 NLP

Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs

यह शोध पत्र CMP-RT को प्रस्तुत करता है, जो एक नैदानिक प्रोब (diagnostic probe) है जो यह प्रदर्शित करता है कि टोकनाइज़ेशन तंत्र का लाभ उठाने वाले ध्वन्यात्मक व्यवधान (phonetic perturbations), सुरक्षा-महत्वपूर्ण टोकन को सौम्य उप-शब्दों (benign sub-words) में विभाजित कर देते हैं, जिससे अत्याधुनिक LLMs में सुरक्षा संरेखण (safety alignments) को दरकिनार किया जा सकता है और प्री-ट्रेनिंग एवं सुरक्षा ट्यूनिंग के बीच एक मौलिक संरचनात्मक अंतराल का खुलासा होता है।

Darpan Aswal, Siddharth D Jaiswal2026-04-08
💬 NLP

ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models Reranking

ProRank एक नवीन दो-चरणीय प्रशिक्षण ढांचे को पेश करता है जो प्रॉम्प्ट वॉर्मअप के लिए सुदृढीकरण शिक्षण (reinforcement learning) और सूक्ष्म-स्तरीय स्कोर लर्निंग (fine-grained score learning) को जोड़ता है ताकि छोटे भाषा मॉडलों की अभिव्यक्ति और प्रॉम्प्ट-समझ संबंधी सीमाओं को दूर किया जा सके, जिससे एक 0.5B पैरामीटर वाला मॉडल BEIR जैसे बेंचमार्क पर कम्प्यूटेशनल दक्षता बनाए रखते हुए बड़े रीरैंकिंग मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।

Xianming Li, Aamir Shakir, Rui Huang, Julius Lipp, Benjamin Clavié, Jing Li2026-04-08
💬 NLP

MedGemma Technical Report

यह शोध पत्र MedGemma को प्रस्तुत करता है, जो Gemma 3 पर आधारित मेडिकल विजन-लैंग्वेज फाउंडेशन मॉडल्स का एक संग्रह है, जो MedSigLIP नामक एक विशिष्ट विजन एनकोडर के साथ मिलकर, सामान्य क्षमताओं को सुरक्षित रखते हुए विविध मेडिकल इमेजिंग और टेक्स्ट कार्यों में बेस मॉडल्स से काफी बेहतर प्रदर्शन करता है और कार्य-विशिष्ट प्रदर्शन के करीब पहुँचता है।

Andrew Sellergren, Sahar Kazemzadeh, Tiam Jaroensri, Atilla Kiraly, Madeleine Traverse, Timo Kohlberger, Shawn Xu, Fayaz (…)2026-04-08
💬 NLP

Enhancing Hallucination Detection via Future Context

यह शोधपत्र ब्लैक-बॉक्स लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए एक मतिभ्रम (hallucination) पहचान फ्रेमवर्क प्रस्तावित करता है जो निरंतर त्रुटियों की पहचान करने के लिए नमूनाकृत भविष्य के संदर्भों (sampled future contexts) का लाभ उठाता है, जो विभिन्न सैंपलिंग-आधारित विधियों में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

Joosung Lee, Cheonbok Park, Hwiyeol Jo, Jeonghoon Kim, Joonsuk Park, Kang Min Yoo2026-04-08