💬 NLP

Are you going to finish that? A Practical Study of the Partial Token Problem

यह शोध पत्र "पार्शियल टोकन समस्या" (partial token problem) की जांच करता है, जो यह प्रदर्शित करता है कि वास्तविक प्रॉम्प्ट्स का टोकन के बीच में समाप्त होना—विशेष रूप से बिना व्हाइटस्पेस वाली भाषाओं, कंपाउंडिंग भाषाओं और कोड में—लार्ज लैंग्वेज मॉडल्स में गंभीर संभाव्यता विरूपण (probability distortions) का कारण बनता है जो स्केल के साथ भी सुधरते नहीं हैं, जबकि सटीक इन्फरेंस-टाइम समाधानों की प्रभावशीलता को भी मान्य करता है।

Hao Xu, Alisa Liu, Jonathan Hayase, Yejin Choi, Noah A. Smith2026-02-04
💬 NLP

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

यह शोध पत्र LegalOne को प्रस्तुत करता है, जो चीनी कानूनी फाउंडेशन मॉडलों का एक परिवार है, जो विश्वसनीय और व्याख्या योग्य न्यायिक तर्क को सक्षम करने के लिए प्लास्टिसिटी-एडजस्टेड सैंपलिंग (Plasticity-Adjusted Sampling), लीगल एजेंटिक CoT डिस्टिलेशन (Legal Agentic CoT Distillation), और करिकुलम रीइन्फोर्समेंट लर्निंग (Curriculum Reinforcement Learning) से युक्त एक तीन-चरणीय प्रशिक्षण पाइपलाइन के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingya (…)2026-02-04
💬 NLP

Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles

यह शोध पत्र विकी लाइव चैलेंज (Wiki Live Challenge) को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो विशेषज्ञ-सत्यापित विकिपीडिया 'गुड आर्टिकल्स' (Good Articles) का उपयोग करते हुए एक कठोर 39-मानदंड ढांचे के विरुद्ध डीप रिसर्च एजेंट्स (Deep Research Agents) का मूल्यांकन करता है, जो वर्तमान एजेंट्स और मानव-स्तरीय अनुसंधान गुणवत्ता के बीच एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

Shaohan Wang, Benfeng Xu, Licheng Zhang, Mingxuan Du, Chiwei Zhu, Xiaorui Wang, Zhendong Mao, Yongdong Zhang2026-02-04
💬 NLP

WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora

यह शोधपत्र WildGraphBench प्रस्तुत करता है, जो यथार्थवादी, दीर्घ-संदर्भ (long-context) कार्यों पर GraphRAG प्रणालियों का मूल्यांकन करने के लिए विकिपीडिया की विषम संदर्भ संरचना (heterogeneous reference structure) का उपयोग करने वाला एक नया बेंचमार्क है, जो यह प्रकट करता है कि जबकि वर्तमान पाइपलाइनें बहु-तथ्य एकत्रीकरण (multi-fact aggregation) में उत्कृष्ट हैं, वे उच्च-स्तरीय कथनों पर अत्यधिक जोर देने के कारण अक्सर सूक्ष्म सारांशीकरण (fine-grained summarization) में संघर्ष करती हैं।

Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao2026-02-04
💬 NLP

Closing the Loop: Universal Repository Representation with RPG-Encoder

यह शोध पत्र RPG-Encoder को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रॉ कोड को एक गतिशील रिपॉजिटरी प्लानिंग ग्राफ (Repository Planning Graph) में एनकोड करके रिपॉजिटरी बोध (repository comprehension) और जनरेशन को एक उच्च-सटीक, स्केलेबल प्रतिनिधित्व में एकीकृत करता है, जिससे कोड लोकलाइजेशन में अत्याधुनिक प्रदर्शन और लगभग पूर्ण पुनर्निर्माण कवरेज प्राप्त होता है।

Jane Luo, Chengyu Yin, Xin Zhang, Qingtao Li, Steven Liu, Yiming Huang, Jie Wu, Hao Liu, Yangyu Huang, Yu Kang, Fangkai (…)2026-02-04
💬 NLP

AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?

यह शोध पत्र AR-MAP का प्रस्ताव करता है, जो एक नवीन ट्रांसफर लर्निंग फ्रेमवर्क है जो सरल वेट स्केलिंग (weight scaling) के माध्यम से डिफ्यूजन LLMs को प्रभावी ढंग से अलाइन करने के लिए प्रेफरेंस-अलाइन्ड ऑटो-रिग्रेसिव LLMs को इम्पलिसिट टीचर्स के रूप में उपयोग करता है, जिससे डायरेक्ट अलाइनमेंट की उच्च वेरिएंस और कम्प्यूटेशनल ओवरहेड से बचा जा सकता है और बेहतर प्रदर्शन प्राप्त किया जा सकता है।

Liang Lin, Feng Xiong, Zengbin Wang, Kun Wang, Junhao Dong, Xuecai Hu, Yong Wang, Xiangxiang Chu2026-02-04
💬 NLP

Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient

यह शोध पत्र इंटीग्रेटेड पॉलिसी ग्रेडिएंट (IPG) प्रस्तुत करता है, जो एक नवीन ढांचा है जो परिणाम-आधारित संकेतों के बैकवर्ड प्रोपेगेशन के माध्यम से आंतरिक घटकों को क्रमिक योगदानों का श्रेय देकर लार्ज लैंग्वेज मॉडल रीजनिंग की व्याख्यात्मकता और नियंत्रणीयता को बढ़ाता है, जिससे रीजनिंग व्यवहारों के अधिक सटीक स्थानीयकरण और विश्वसनीय मॉड्यूलेशन को सक्षम बनाया जा सके।

Changming Li, Kaixing Zhang, Haoyun Xu, Yingdong Shi, Zheng Zhang, Kaitao Song, Kan Ren2026-02-04
💬 NLP

The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders

यह शोध पत्र "हाइपोक्रिसी गैप" (Hypocrisy Gap) प्रस्तुत करता है, जो एक स्पार्स ऑटोएनकोडर (Sparse Autoencoder) का उपयोग करने वाला एक यांत्रिक मीट्रिक है, जो एक LLM के आंतरिक तर्क और उसके अंतिम आउटपुट के बीच के विचलन को मापने और पहचानने के लिए है, जो कई मॉडलों में चापलूसी (sycophancy) और पाखंड (hypocrisy) जैसे अविश्वसनीय व्यवहारों की पहचान करने में लॉग-प्रोबेबिलिटी बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Shikhar Shiromani, Archie Chaudhury, Sri Pranav Kunda2026-02-04
💬 NLP

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

यह शोध पत्र एक हाइब्रिड ट्रांसक्रिएशन फ्रेमवर्क और एक बड़े पैमाने के चीनी-अमेरिकी मीम डेटासेट को प्रस्तुत करता है ताकि क्रॉस-कल्चरल मीम अनुकूलन पर विजन-लैंग्वेज मॉडल्स का मूल्यांकन किया जा सके, जो यह प्रकट करता है कि जहाँ वर्तमान मॉडल सीमित क्षमता प्रदर्शित करते हैं, वहीं वे अमेरिकी-से-चीनी ट्रांसक्रिएशन की तुलना में इसके विपरीत दिशा में बेहतर प्रदर्शन के साथ महत्वपूर्ण दिशात्मक विषमताएं प्रदर्शित करते हैं।

Yuming Zhao, Peiyi Zhang, Oana Ignat2026-02-04
💬 NLP

Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems

यह शोध पत्र एलएलएम-आधारित अनुशंसा प्रणालियों (LLM-based recommendation systems) के लिए एक व्यापक बेंचमार्क और मूल्यांकन पद्धति प्रस्तुत करता है जो भविष्यवाणात्मक अनिश्चितता को परिमाणित करता है और व्यवस्थित जनसांख्यिकीय एवं व्यक्तित्व-जुड़े पूर्वाग्रहों को प्रकट करता है, जिससे सुरक्षित, अधिक न्यायसंगत और व्याख्या योग्य अनुशंसा मॉडल विकसित करने के लिए एक आधार स्थापित होता है।

Chandan Kumar Sah, Xiaoli Lian, Li Zhang, Tony Xu, Syed Shazaib Shah2026-02-04