💬 NLP

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

यह शोध पत्र एक्सप्लोरेशन-एन्हांस्ड पॉलिसी ऑप्टिमाइज़ेशन (EEPO) को प्रस्तुत करता है, जो बड़े भाषा मॉडलों (LLMs) के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो स्व-सुदृढ़ व्यवहार संबंधी लूपों को बाधित करने और अन्वेषण (exploration) को बढ़ाने के लिए एक "सैंपल-देन-फॉरगेट" तंत्र का उपयोग करके एंट्रॉपी पतन (entropy collapse) को कम करता है और तर्क प्रदर्शन में सुधार करता है।

Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong2026-04-14
💬 NLP

Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented Generation

यह शोध पत्र ProbeRAG को प्रस्तुत करता है, जो एक नया ढांचा है जो ज्ञान के संघर्षों का पता लगाने और शोर (noise) को व्यवस्थित रूप से हटाने के लिए मॉडल के आंतरिक लेटेंट स्पेस (latent space) का विश्लेषण करके रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) की विश्वसनीयता को बढ़ाता है, जिससे अधिक सटीक और संदर्भ-अनुरूप प्रतिक्रियाएं प्राप्त करने के लिए भंगुर ब्लैक-बॉक्स हस्तक्षेपों से आगे बढ़ा जा सका है।

Linfeng Gao, Qinggang Zhang, Baolong Bi, Bo Zeng, Zheng Yuan, Zerui Chen, Zhimin Wei, Shenghua Liu, Linlong Xu, Longyue (…)2026-04-14
💬 NLP

Think Parallax: Solving Multi-Hop Problems via Multi-View Knowledge-Graph-Based Retrieval-Augmented Generation

यह शोध पत्र ParallaxRAG को प्रस्तुत करता है, जो एक मल्टी-व्यू रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो मौजूदा KG-आधारित प्रणालियों की सीमाओं को संबोधित करने के लिए क्वेरीज़ और नॉलेज ग्राफ्स को हेड-विशिष्ट सिमेंटिक स्पेस में डिकपल करता है ताकि ट्रांसफॉर्मर के नेचुरल हॉप-अलाइन्ड रिले पैटर्न के साथ संरेखित किया जा सके, जिससे मल्टी-हॉप रीजनिंग की सटीकता में काफी सुधार होता है और मतिभ्रम (hallucinations) कम होता है।

Jinliang Liu, Jiale Bai, Shaoning Zeng2026-04-14
💬 NLP

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

AtlasKV एक पैरामीट्रिक नॉलेज इंटीग्रेशन विधि है जो KG2KV और HiKVP को पेश करके, पारंपरिक रिट्रीवल-ऑगमेंटेड जनरेशन दृष्टिकोणों से जुड़े विलंबता (latency) और मेमोरी लागतों को समाप्त करते हुए, 20GB से कम VRAM का उपयोग करके बड़े भाषा मॉडलों को अरबों-पैमाने के नॉलेज ग्राफ के साथ उनकी क्षमताओं को कुशलतापूर्वक बढ़ाने में सक्षम बनाती है।

Haoyu Huang, Hong Ting Tsang, Jiaxin Bai, Xi Peng, Gong Zhang, Yangqiu Song2026-04-14
💬 NLP

Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?

यह शोध पत्र पहचानता है कि रीजनिंग लैंग्वेज मॉडल्स में बहुभाषी तर्क अंतराल (multilingual reasoning gaps) मुख्य रूप से इनपुट को मॉडल की प्रमुख तर्क भाषा में अनुवाद करने में विफल होने के कारण उत्पन्न होते हैं, और एक "चयनात्मक अनुवाद" (Selective Translation) रणनीति का प्रस्ताव करता है जो इन विफलताओं का पता लगाकर केवल इनपुट के एक छोटे अंश को अनुवादित करती है, जिससे दक्षता बनाए रखते हुए प्रदर्शन के अंतर को काफी हद तक कम किया जा सकता है।

Deokhyung Kang, Seonjeong Hwang, Daehui Kim, Hyounghun Kim, Gary Geunbae Lee2026-04-14
💬 NLP

Thought Branches: Interpreting LLM Reasoning Requires Resampling

यह शोध पत्र तर्क देता है कि LLM तर्क (reasoning) की व्याख्या करने के लिए एकल नमूनों (single samples) के बजाय चेन-ऑफ-थॉट्स (chain-of-thoughts) के वितरणों का विश्लेषण करना आवश्यक है, जो यह प्रदर्शित करता है कि आगामी पाठ के पुन: नमूनाकरण (resampling) से विश्वसनीय कारण विश्लेषण (causal analysis) सक्षम होता है, अविश्वसनीय आत्म-औचित्य (unfaithful self-justifications) के सीमित प्रभाव को प्रकट करता है, और अस्थिर ऑफ-पॉलिसी हस्तक्षेपों (off-policy interventions) के लिए एक सिद्धांतपूर्ण विकल्प प्रदान करता है।

Uzay Macar, Paul C. Bogdan, Senthooran Rajamanoharan, Neel Nanda2026-04-14
💬 NLP

LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs

यह शोध पत्र LiveCLKTBench प्रस्तुत करता है, जो एक स्वचालित बेंचमार्क है जो समय-संवेदनशील, वास्तविक दुनिया की संस्थाओं का लाभ उठाकर प्री-ट्रेनिंग आर्टिफ़ेक्ट्स से वास्तविक क्रॉस-लिंगुअल नॉलेज ट्रांसफर को अलग करता है, और यह प्रकट करता है कि ट्रांसफर प्रभावशीलता भाषाई दूरी, विषमता और मॉडल स्केल के साथ घटते प्रतिफल से दृढ़ता से प्रभावित होती है।

Pei-Fu Guo, Yun-Da Tsai, Chun-Chia Hsu, Kai-Xin Chen, Ya-An Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin2026-04-14
💬 NLP

Different types of syntactic agreement recruit the same units within large language models

यह अध्ययन प्रदर्शित करता है कि बड़े भाषा मॉडल प्रत्येक घटना के लिए अलग-अलग घटकों पर निर्भर रहने के बजाय, विविध भाषाओं में ओवरलैपिंग (अतिव्यापी) कारण इकाइयों के सेट को भर्ती करके, विभिन्न प्रकार के सिंटैक्टिक एग्रीमेंट (वाक्य संरचनात्मक सहमति) को एक एकीकृत कार्यात्मक श्रेणी के रूप में प्रस्तुत करते हैं।

Daria Kryvosheieva, Andrea de Varda, Evelina Fedorenko, Greta Tuckute2026-04-14
💬 NLP

Look Twice before You Leap: A Rational Framework for Localized Adversarial Anonymization

यह शोध पत्र रेशनल लोकलाइज्ड एडवर्सरियल एनोनिमाइजेशन (RLAA) को प्रस्तुत करता है, जो एक पूर्णतः स्थानीयकृत और प्रशिक्षण-मुक्त ढांचा है जो रिमोट एपीआई के गोपनीयता विरोधाभास और स्थानीय मॉडलों के उपयोगिता पतन को दूर करने के लिए एक अटैकर-आर्बिट्रेटर-एनोनिमाइज़र आर्किटेक्चर का उपयोग करता है, जो लालची प्रतिकूल रणनीतियों को एक तर्कसंगतता-गेटेड तंत्र से बदल देता है जो गोपनीयता लाभ और उपयोगिता लागत के बीच के संतुलन को अनुकूलित करता है।

Donghang Duan, Xu Zheng, Yuefeng He, Chong Mu, Leyi Cai, Lizong Zhang2026-04-14
💬 NLP

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

यह शोध पत्र फंक्शन-वर्ड डी-अटेंशन (FDA) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मूल अटेंशन से फंक्शन-वर्ड अटेंशन को विभेदक रूप से घटाकर विजन-लैंग्वेज मॉडल्स में क्रॉस-मोडल एडवर्सरियल कमजोरियों को कम करती है, जिससे डाउनस्ट्रीम टास्क पर नगण्य या सकारात्मक प्रभावों के साथ महत्वपूर्ण मजबूती में सुधार प्राप्त होता है।

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen2026-04-14