💬 NLP

Counting trees: A treebank-driven exploration of syntactic variation in speech and writing across languages

यह शोध पत्र एक नवीन, आगमनात्मक (inductive) ट्रीबैंक-संचालित ढांचे का परिचय देता है जो यूनिवर्सल डिपेंडेंसीज़ (Universal Dependencies) का उपयोग करके यह प्रदर्शित करता है कि अंग्रेजी और स्लोवेनियाई में मौखिक भाषा, लेखन की तुलना में एक छोटे, कम विविध और काफी हद तक गैर-अतिव्यापी (non-overlapping) वाक्य-विन्यास संरचनाओं के सेट पर निर्भर करती है, जो अंतरक्रियात्मकता और मितव्ययिता की माध्यम-विशिष्ट मांगों को दर्शाती है।

Kaja Dobrovoljc2026-02-24
💬 NLP

Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models

यह शोध पत्र "क्रॉस-लिंगुअल कोलैप्स" (Cross-lingual Collapse) की पहचान और विश्लेषण करता है, जो एक ऐसी घटना है जहाँ सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (RLVR) बहुभाषी बड़े भाषा मॉडलों को उनके तर्क प्रदर्शन में सुधार होने के साथ ही अपनी तर्क श्रृंखलाओं को एक प्रमुख प्री-ट्रेनिंग भाषा (आमतौर पर अंग्रेजी) की ओर वापस ले जाता है, जो तर्क की गहराई और लक्षित-भाषा की निष्ठा के बीच एक निरंतर समझौता प्रकट करता है।

Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo2026-02-24
💬 NLP

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

यह शोध पत्र Shop-R1 प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कार्य को तर्क निर्माण (rationale generation) और क्रिया भविष्यवाणी (action prediction) चरणों में विभाजित करके LLMs की मानव ऑनलाइन शॉपिंग व्यवहार को सिम्युलेट करने की क्षमता को बढ़ाता है, जिसमें प्रत्येक चरण को विशिष्ट स्व-पर्यवेक्षित (self-supervised) और पदानुक्रमित (hierarchical) पुरस्कार संकेतों द्वारा निर्देशित किया गया है ताकि बेसलाइन की तुलना में 65% से अधिक सुधार प्राप्त किया जा सके।

Yimeng Zhang, Tian Wang, Jiri Gesi, Ziyi Wang, Yuxuan Lu, Jiacheng Lin, Sinong Zhan, Vianne Gao, Ruochen Jiao, Junze Liu (…)2026-02-24
💬 NLP

Role-Aware Language Models for Secure and Contextualized Access Control in Organizations

यह शोध पत्र नए निर्मित डेटासेट पर तीन मॉडलिंग रणनीतियों का मूल्यांकन करके और प्रॉम्प्ट इंजेक्शन एवं जेलब्रेक जैसे सुरक्षा खतरों के विरुद्ध उनकी मजबूती का आकलन करके, एंटरप्राइज सेटिंग्स में भूमिका-आधारित एक्सेस कंट्रोल (role-based access control) को लागू करने के लिए लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने की जांच करता है।

Saeed Almheiri, Yerulan Kongrat, Adrian Santosh, Ruslan Tasmukhanov, Josemaria Loza Vera, Muhammad Dehan Al Kautsar, Faj (…)2026-02-24
💬 NLP

MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs

MolReasoner एक नवीन दो-चरणीय ढांचा है जो ज्ञान-संवर्धित चेन-ऑफ-थॉट फाइन-ट्यूनिंग को कार्य-अनुकूलित सुदृढीकरण शिक्षण चरण के साथ जोड़कर लार्ज लैंग्वेज मॉडल्स में आणविक तर्क की व्याख्यात्मकता और सटीकता को बढ़ाता है ताकि प्रभावी रूप से मतिभ्रम (hallucinations) को कम किया जा सके और मौजूदा बेसलाइनों से बेहतर प्रदर्शन किया जा सके।

Guojiang Zhao, Zixiang Lu, Yutang Ge, Sihang Li, Zheng Cheng, Haitao Lin, Lirong Wu, Hanchen Xia, Hengxing Cai, Wentao G (…)2026-02-24
💬 NLP

HebID: Detecting Social Identities in Hebrew-language Political Text

यह शोध पत्र HebID प्रस्तुत करता है, जो राजनीतिक विमर्श में सूक्ष्म सामाजिक पहचानों का पता लगाने के लिए पहला मल्टीलेबल हिब्रू कॉर्पस है, जिसका उपयोग भाषा मॉडलों को बेंचमार्क करने और इज़राइल में अभिजात वर्ग की पहचान अभिव्यक्ति और सार्वजनिक प्राथमिकताओं के बीच संरेखण का विश्लेषण करने के लिए किया जाता है।

Guy Mor-Lan, Naama Rivlin-Angert, Yael R. Kaplan, Tamir Sheafer, Shaul R. Shenhav2026-02-24
💬 NLP

HEART: Emotionally-Driven Test-Time Scaling of Language Models

यह शोध पत्र HEART को प्रस्तुत करता है, जो एक टेस्ट-टाइम स्केलिंग फ्रेमवर्क है जो भाषा मॉडलों को दोहराव वाले तर्क के डेड-एंड्स से बाहर निकालने के लिए वैकल्पिक रूप से आलोचनात्मक और उत्साहजनक भावनात्मक संकेतों का लाभ उठाता है, जिससे विविध उच्च-कठिनाई वाले बेंचमार्क में सटीकता में महत्वपूर्ण सुधार होता है।

Gabriela Pinto, Palash Goyal, Mihir Parmar, Yiwen Song, Souradip Chakraborty, Zifeng Wang, Jinsung Yoon, Tomas Pfister (…)2026-02-24
💬 NLP

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

मेमोटाइम (MemoTime) एक मेमोरी-ऑगमेंटेड फ्रेमवर्क है जो जटिल प्रश्नों को एक पदानुक्रमित 'ट्री ऑफ टाइम' (Tree of Time) में विभाजित करके, एडेप्टिव ऑपरेटर-अवेयर रिट्रीवल का उपयोग करके और स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए एक सेल्फ-इवॉल्विंग एक्सपीरियंस मेमोरी का लाभ उठाकर लार्ज लैंग्वेज मॉडल के टेम्पोरल रीजनिंग को बढ़ाता है।

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang2026-02-24
⚡ electrical engineering

Closing the Gap Between Text and Speech Understanding in LLMs

यह शोध पत्र SALAD को प्रस्तुत करता है, जो एक डेटा-कुशल विधि है जो स्पीच-एडेप्टेड लार्ज लैंग्वेज मॉडल्स में टेक्स्ट-स्पीच समझ के अंतर को दूर करने के लिए लक्षित सिंथेटिक डेटा के साथ क्रॉस-मोडल डिस्टिलेशन को जोड़ती है, जिससे क्षमता विस्मृति (capability forgetting) को कम किया जा सके और क्रॉस-मोडल संरेखण में सुधार किया जा सके, तथा काफी कम प्रशिक्षण डेटा के साथ सार्वजनिक कॉर्पोरा पर प्रतिस्पर्धी प्रदर्शन प्राप्त किया जा सके।

Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakari (…)2026-02-24
💬 NLP

Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language

यह शोध पत्र यह प्रदर्शित करके बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के सांस्कृतिक प्रसंस्करण में व्यावहारिक अंतराल का मूल्यांकन करता है कि यद्यपि वे लाक्षणिक भाषा की व्याख्या कर सकते हैं, फिर भी वे अंग्रेजी की तुलना में मिस्र की अरबी मुहावरों और लोकोक्तियों जैसे सांस्कृतिक रूप से आधारित अभिव्यक्तियों के साथ काफी अधिक संघर्ष करते हैं, जो भविष्य के अनुसंधान को समर्थन देने के लिए 'किनायात' (Kinayat) डेटासेट के विमोचन को प्रेरित करता है।

Mena Attia, Aashiq Muhamed, Mai Alkhamissi, Thamar Solorio, Mona Diab2026-02-24