💬 NLP

Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance

यह शोध पत्र सफल समाधानों में तर्क रणनीतियों (reasoning strategies) के उपयोग और मार्गदर्शन के रूप में लागू किए जाने पर उनकी निष्पादन क्षमता (executability) के बीच एक महत्वपूर्ण अंतर की पहचान करता है, जिससे सेलेक्टिव स्ट्रैटेजी रिट्रीवल (SSR) का प्रस्ताव मिलता है, जो मानव-मॉडल अंतरों का लाभ उठाकर रणनीतियों को चुनिंदा रूप से संयोजित करने और विविध बेंचमार्क में गणितीय तर्क की सटीकता में उल्लेखनीय सुधार करने वाला एक ढांचा है।

Weida Liang, Yiyou Sun, Shuyuan Nan, Chuang Li, Dawn Song, Kenji Kawaguchi2026-02-27
💬 NLP

pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training

यह शोध पत्र pQuant का प्रस्ताव करता है, जो एक नवीन क्वांटाइजेशन-अवेयर ट्रेनिंग विधि है जो पैरामीटर होमोजेनाइजेशन (parameter homogenization) को संबोधित करने और अत्यंत लो-बिट लैंग्वेज मॉडल्स में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए लीनियर लेयर्स को एक डोमिनेंट 1-बिट ब्रांच और एक स्पार्सली-एक्टिवेटेड हाई-प्रिसिजन एक्सपर्ट ब्रांच में डिकपल करता है।

Wenzheng Zhang, Bingzheng Liu, Yang Hu, Xiaoying Bai, Wentao Zhang, Bin Cui2026-02-27
💬 NLP

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

यह शोधपत्र ContextRL का प्रस्ताव करता है, जो एक नवीन ढांचा है जो सूक्ष्म सत्यापन के लिए संदर्भ-संवर्धित पुरस्कारों (context-augmented rewards) और रिवॉर्ड हैकिंग को कम करने के लिए मल्टी-टर्न मिस्टेक-गाइडेड सैंपलिंग का उपयोग करके MLLM ज्ञान खोज दक्षता को बढ़ाता है, जिससे Qwen3-VL-8B जैसे छोटे मॉडल धारणा और तर्क कार्यों पर बड़े बेसलाइन को पीछे छोड़ने में सक्षम होते हैं।

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang (…)2026-02-27
💬 NLP

Vectorizing the Trie: Efficient Constrained Decoding for LLM-based Generative Retrieval on Accelerators

यह शोध पत्र STATIC को प्रस्तुत करता है, जो एक नवीन कंस्ट्रेंड डिकोडिंग तकनीक है जो हार्डवेयर एक्सेलेरेटर्स पर कुशल, उच्च-थ्रूपुट, कड़ाई से प्रतिबंधित जनरेटिव रिट्रीवल को सक्षम करने के लिए ट्राइ-आधारित प्रीफिक्स ट्रीज़ को स्पार्स मैट्रिक्स ऑपरेशन्स में वेक्टरइज़ करता है, जिससे भारी गति वृद्धि प्राप्त होती है और एक प्रोडक्शन वीडियो रिकमेंडेशन सिस्टम में सफलतापूर्वक बड़े पैमाने पर तैनात किया जाता है।

Zhengyang Su, Isay Katsman, Yueqi Wang, Ruining He, Lukasz Heldt, Raghunandan Keshavan, Shao-Chuan Wang, Xinyang Yi, Min (…)2026-02-27
💬 NLP

Enhancing Persuasive Dialogue Agents by Synthesizing Cross-Disciplinary Communication Strategies

यह शोध पत्र एक नवीन ढाँचे का प्रस्ताव और सत्यापन करता है जो सामाजिक मनोविज्ञान, व्यवहारिक अर्थशास्त्र और संचार सिद्धांत से अंतर-विषयक रणनीतियों को संश्लेषित करता है, जो विविध डेटासेट्स के माध्यम से, विशेष रूप से कम प्रारंभिक इरादा रखने वाले व्यक्तियों के लिए, बेहतर अनुनय सफलता दर और सामान्यीकरण प्रदर्शित करता है।

Shinnosuke Nozue, Yuto Nakano, Yotaro Watanabe, Meguru Takasaki, Shoji Moriya, Reina Akama, Jun Suzuki2026-02-27
💬 NLP

Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue

यह शोध पत्र InteractCS-RL का प्रस्ताव करता है, जो एक बहु-स्तर (multi-granularity) सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो एक उच्च-सटीक उपयोगकर्ता-केंद्रित प्रशिक्षण वातावरण और एक लागत-जागरूक नीति अनुकूलन रणनीति का उपयोग करके कार्य-उन्मुख संवाद में सहानुभूतिपूर्ण उपयोगकर्ता संपर्क के साथ बजट-जागरूक निर्णय लेने के बीच संतुलन बनाता है ताकि उपयोगकर्ता पुरस्कार और वैश्विक लागत बाधाओं के बीच इष्टतम समझौता प्राप्त किया जा सके।

Ning Gao, Wei Zhang, Yuqin Dai, Ling Shi, Ziyin Wang, Yujie Wang, Wei He, Jinpeng Wang, Chaozheng Wang2026-02-27
💬 NLP

Imagination Helps Visual Reasoning, But Not Yet in Latent Space

यह शोध पत्र इनपुट और आउटपुट से लेटेंट विजुअल रीजनिंग (latent visual reasoning) के कारणत्मक विच्छेदन (causal disconnections) को प्रकट करते हुए इसकी प्रभावकारिता को चुनौती देता है, और CapImagine प्रस्तावित करता है, जो एक टेक्स्ट-आधारित स्पष्ट इमेजिनेशन (explicit imagination) विधि है जो जटिल लेटेंट-स्पेस बेसलाइन्स से काफी बेहतर प्रदर्शन करती है।

You Li, Chi Chen, Yanghao Li, Fanhu Zeng, Kaiyu Huang, Jinan Xu, Maosong Sun2026-02-27
💬 NLP

TherapyProbe: Generating Design Knowledge for Relational Safety in Mental Health Chatbots Through Adversarial Simulation

यह शोधपत्र 'थेरेपीप्रोब' (TherapyProbe) का परिचय देता है, जो एक लागत प्रभावी, एडवर्सरियल मल्टी-एजेंट सिमुलेशन पद्धति है, जो मानसिक स्वास्थ्य चैटबॉट्स में समय के साथ होने वाली रिलेशनल सेफ्टी विफलताओं की पहचान करती है और उन्हें 23 विफलता आर्केटाइप्स (failure archetypes) के एक नैदानिक रूप से आधारित पुस्तकालय में अनुवादित करती है, जिसमें व्यावहारिक डिजाइन अनुशंसाएँ शामिल हैं।

Joydeep Chandra, Satyam Kumar Navneet, Yong Zhang2026-02-27
💬 NLP

Probing for Knowledge Attribution in Large Language Models

यह शोध पत्र AttriWiki प्रस्तुत करता है, जो लेबल किए गए डेटा को उत्पन्न करने के लिए एक स्व-पर्यवेक्षित (self-supervised) पाइपलाइन है जो सरल लीनियर प्रोब्स (linear probes) को सटीक रूप से यह पहचानने में सक्षम बनाता है कि क्या किसी LLM का आउटपुट प्रॉम्प्ट संदर्भ या आंतरिक ज्ञान पर निर्भर करता है, जिससे एट्रिब्यूशन त्रुटियों और मतिभ्रम (hallucinations) के बीच एक मजबूत संबंध प्रकट होता है और उच्च क्रॉस-डोमेन हस्तांतरणीयता (cross-domain transferability) का प्रदर्शन होता है।

Ivo Brink, Alexander Boer, Dennis Ulmer2026-02-27
💬 NLP

Moral Preferences of LLMs Under Directed Contextual Influence

यह शोध पत्र एक पायलट मूल्यांकन हारनेस (evaluation harness) प्रस्तुत करता है यह प्रदर्शित करने के लिए कि निर्देशित प्रासंगिक प्रभाव ट्रॉली-समस्या परिदृश्यों में एलएलएम (LLM) के नैतिक निर्णयों को महत्वपूर्ण रूप से नया आकार देते हैं, जिससे यह प्रकट होता है कि आधारभूत तटस्थता स्टीयरेबिलिटी (steerability) का एक खराब भविष्यवक्ता है और तर्क औसत संवेदनशीलता को कम करने के बावजूद विरोधाभासी रूप से पूर्वाग्रह को बढ़ा सकता है।

Phil Blandfort, Tushar Karayil, Urja Pawar, Robert Graham, Alex McKenzie, Dmitrii Krasheninnikov2026-02-27