💬 NLP

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

यह शोधपत्र TAB-PO प्रस्तुत करता है, जो एक नवीन प्राथमिकता अनुकूलन (preference optimization) विधि है जो टोकन-क्रिटिकल संरचित पीढ़ी कार्यों में मानक DPO की सीमाओं को दूर करने के लिए टोकन-स्तरीय अनुकूली बाधाओं (adaptive barriers) और भारित लाभों (weighted advantages) का उपयोग करती है, जिससे मार्जिन कोलैप्स और ग्रेडिएंट डाइल्यूशन जैसी समस्याओं को संबोधित करते हुए मेडिकल एनोटेशन में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Ashley Hagaman, Sarah R. Lowe, Aimee Kendall (…)2026-03-03
💬 NLP

ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents

यह शोध पत्र ActMem को प्रस्तुत करता है, जो एक नवीन ढांचा है जो संवाद इतिहास को एक संरचित कारण ग्राफ (causal graph) में बदलकर स्मृति पुनर्प्राप्ति और तर्क के बीच के अंतर को पाटता है ताकि LLM एजेंट अंतर्निहित बाधाओं का अनुमान लगा सकें और संघर्षों को हल कर सकें, साथ ही इन उन्नत क्षमताओं का मूल्यांकन करने के लिए एक नया बेंचमार्क, ActMemEval भी प्रस्तुत करता है।

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yaqin Jin, Yazhong Zhang, Wei Hu2026-03-03
💬 NLP

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

यह शोध पत्र EPPCMinerBen को प्रस्तुत करता है, जो इलेक्ट्रॉनिक रोगी-प्रदाता संचार का विश्लेषण करने में विभिन्न बड़े भाषा मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए येल न्यू हेवन अस्पताल के पेशेंट पोर्टल से तीन उप-कार्यों और 1,933 विशेषज्ञ-एनोटेटेड वाक्यों से युक्त एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि बड़े, इंस्ट्रक्शन-ट्यून्ड मॉडल आम तौर पर छोटे मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं, विशेष रूप से साक्ष्य निष्कर्षण और सूक्ष्म-स्तरीय तर्क (fine-grained reasoning) में।

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn2026-03-03
💬 NLP

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models

यह शोध पत्र पारंपरिक पूर्ण-आयामी स्टीयरिंग (whole-dimension steering) की तुलना में लार्ज लैंग्वेज मॉडल्स में बेहतर डोमेन अनुकूलन (domain adaptation) और जेलब्रेकिंग प्रदर्शन प्राप्त करने के लिए "डोमेन-क्रिटिकल डाइमेंशन्स" (Domain-Critical Dimensions)—जो विशाल सक्रियणों (massive activations) द्वारा अभिलक्षित व्याख्या योग्य फीचर इकाइयों (interpretable feature units) द्वारा पहचाने जाते हैं—की पहचान करने और उन्हें निर्देशित करने का प्रस्ताव करता है।

Youngji Roh, Hyunjin Cho, Jaehyung Kim2026-03-03
💬 NLP

GRIP: Geometric Refinement and Adaptive Information Potential for Data Efficiency

यह शोध पत्र GRIP को प्रस्तुत करता है, जो एक डेटा दक्षता ढांचा (data efficiency framework) है जो ज्यामितीय मॉडलिंग और अनुकूली सूचना क्षमता (adaptive information potential) के माध्यम से वैश्विक वितरण संतुलन और स्थानीय इंस्टेंस चयन को एकीकृत करता है, जिससे मॉडल उन मॉडलों से बेहतर प्रदर्शन करने में सक्षम होते हैं जिन्हें काफी बड़े अक्यूरेटेड (uncurated) डेटासेट पर प्रशिक्षित किया गया है।

Changhao Wang, Jiaolong Yang, Xinhao Yao, Yunfei Yu, Peng Jiao, Lu Yu, Junpeng Fang, Riccardo Cantoro, Qing Cui, Jun Zho (…)2026-03-03
💬 NLP

How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?

यह शोध पत्र MMGrader को प्रस्तुत करता है, जो मल्टीमॉडल लघु उत्तरों से छात्रों के STEM मेंटल मॉडल्स (मानसिक मॉडलों) की गुणवत्ता का अनुमान लगाने के लिए कॉन्सेप्ट ग्राफ्स का उपयोग करने वाला एक फ्रेमवर्क है, लेकिन यह पाता है कि वर्तमान विजन-लैंग्वेज मॉडल केवल ~40% सटीकता प्राप्त करते हैं और इस प्रकार मानव-स्तर के प्रदर्शन से पीछे रह जाते हैं, बावजूद इसके कि उनमें शिक्षकों को लक्षित शैक्षणिक हस्तक्षेपों को डिजाइन करने में सहायता करने की क्षमता है।

Pritam Sil, Durgaprasad Karnam, Vinay Reddy Venumuddala, Pushpak Bhattacharyya2026-03-03
💬 NLP

Linguistic Uncertainty and Engagement in Arabic-Language X (formerly Twitter) Discourse

यह अध्ययन लेबनान के बारे में 16,695 अरबी-भाषा के ट्वीट्स के एक डेटासेट का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि भाषाई अनिश्चितता उपयोगकर्ता जुड़ाव को महत्वपूर्ण रूप से बढ़ाती है, विशेष रूप से उत्तरों (रिप्लाइज) के रूप में, जो यह सुझाव देता है कि अनिश्चितता गैर-अंग्रेजी सोशल मीडिया विमर्श में एक संवादात्मक संकेत के रूप में कार्य करती है।

Mohamed Soufan2026-03-03
💬 NLP

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

यह शोध पत्र स्टेप-वाइज एडेप्टिव पेनलाइजेशन (SWAP) का प्रस्ताव करता है, जो एक सूक्ष्म-स्तरीय सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो सही उत्तर में उनके योगदान के आधार पर कम-महत्वपूर्ण तर्क चरणों को गतिशील रूप से लंबाई दंड (लेंथ पेनल्टी) आवंटित करता है, जिससे प्रदर्शन से समझौता किए बिना तर्क की लंबाई में 64.3% की कमी और सटीकता में 5.7% का सुधार प्राप्त होता है।

Xintong Li, Sha Li, Rongmei Lin, Hongye Jin, Linwei Li, Hejie Cui, Sarah Zhang, Chia-Yuan Chang, Kewei Cheng, Besnik Fet (…)2026-03-03
💬 NLP

From Prerequisites to Predictions: Validating a Geometric Hallucination Taxonomy Through Controlled Induction

यह अध्ययन यह प्रदर्शित करके कि कवरेज-गैप (प्रकार 3) विफलताएं सबसे विशिष्ट और स्थिर विफलता मोड हैं, जो स्टैटिक एम्बेडिंग्स में सुदृढ़ नॉर्म सेपरेशन द्वारा अभिलक्षित हैं, GPT-2 में एक ज्यामितीय मतिभ्रम वर्गीकरण को मान्य करता है, जबकि यह भी पुष्टि करता है कि सेंटर-ड्रिफ्ट और रोंग-वेल कन्वर्जेंस प्रकार ज्यामितीय रूप से अलग नहीं होते हैं और टोकन-स्तरीय विश्लेषण गंभीर स्यूडोरेप्लिकेशन से ग्रस्त होते हैं।

Matic Korun2026-03-03
💬 NLP

A Typologically Grounded Evaluation Framework for Word Order and Morphology Sensitivity in Multilingual Masked LMs

यह शोध पत्र यूनिवर्सल डिपेंडेंसीज़ और इन्फरेंस-टाइम परटर्बेशन्स का उपयोग करते हुए एक टाइपोलॉजी-अवेयर डायग्नोस्टिक फ्रेमवर्क प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि मल्टीलिंगुअल मास्कड लैंग्वेज मॉडल्स (mBERT और XLM-R) पांच भाषाओं में शब्द क्रम बनाम विभक्तित्मक रूपविज्ञान (inflectional morphology) पर किस प्रकार निर्भर करते हैं, जिससे यह पता चलता है कि जहाँ पूर्ण स्कैम्बलिंग प्रदर्शन को गंभीर रूप से कम कर देती है, वहीं लेम्मा प्रतिस्थापन (lemma substitution) विभक्तित्मक भाषाओं में सटीकता को महत्वपूर्ण रूप से प्रभावित करता है लेकिन संरचनात्मक व्यवधान के प्रभावों को कम करने में विफल रहता है।

Anna Feldman, Libby Barak, Jing Peng2026-03-03