💬 NLP

FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering

FrugalRAG एक दो-चरणीय फाइनट्यूनिंग फ्रेमवर्क है जो प्रश्न की कठिनाई के आधार पर रिट्रीवल स्टेप्स को अनुकूल रूप से छाँटने (प्रून) के लिए सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) का लाभ उठाता है, जिससे काफी कम प्रशिक्षण उदाहरणों और कम कम्प्यूटेशनल लागत के साथ मल्टी-हॉप QA में अत्याधुनिक दक्षता और सटीकता प्राप्त होती है।

Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma2026-03-03
💬 NLP

Diversity-Enhanced Reasoning for Subjective Questions

यह शोध पत्र MultiRole-R1 को प्रस्तुत करता है, जो एक विविधता-वर्धित प्रशिक्षण ढांचा है जो सुदृढीकरण शिक्षण (reinforcement learning) सेटअप के भीतर अनसुपरवाइज्ड पर्सपेक्टिव सिंथेसिस और टोकन-स्तरीय विविधता का लाभ उठाकर बड़े रीजनिंग मॉडलों के व्यक्तिपरक कार्यों पर प्रदर्शन में उल्लेखनीय सुधार करता है और साथ ही उनकी वस्तुनिष्ठ तर्क क्षमताओं को भी बढ़ाता है।

Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung2026-03-03
💬 NLP

Rote Learning Considered Useful: Generalizing over Memorized Data in LLMs

यह शोध पत्र इस धारणा को चुनौती देता है कि रटने से सामान्यीकरण (generalization) बाधित होता है, यह प्रदर्शित करते हुए कि लार्ज लैंग्वेज मॉडल्स अर्थहीन डेटा के ऊपर भी प्रभावी ढंग से पुनर्व्याख्या और सामान्यीकरण कर सकते हैं, जब उन्हें सार्थक प्रॉम्प्ट्स के एक छोटे सेट पर फाइन-ट्यून किया जाता है।

Qinyuan Wu, Soumi Das, Mahsa Amani, Bishwamittra Ghosh, Mohammad Aflah Khan, Krishna P. Gummadi, Muhammad Bilal Zafar2026-03-03
💬 NLP

DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router

यह शोध पत्र DeepSieve को प्रस्तुत करता है, जो एक एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) फ्रेमवर्क है जो जटिल प्रश्नों को उप-प्रश्नों में विभाजित करके और एक बहु-चरणीय आसवन (distillation) प्रक्रिया के माध्यम से सूचना को गतिशील रूप से छानने और रूट करने के लिए 'LLM-as-a-knowledge-router' का उपयोग करके तर्क की गहराई और रिट्रीवल की सटीकता को बढ़ाता है।

Minghao Guo, Qingcheng Zeng, Xujiang Zhao, Yanchi Liu, Wenchao Yu, Mengnan Du, Haifeng Chen, Wei Cheng2026-03-03
💬 NLP

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

यह शोध पत्र TDBench प्रस्तुत करता है, जो एक स्केलेबल बेंचमार्क है जो बड़े भाषा मॉडलों (Large Language Models) के समय-संवेदनशील तथ्यात्मक तर्क का व्यवस्थित रूप से मूल्यांकन करने के लिए टेम्पोरल डेटाबेस और तकनीकों का लाभ उठाता है, जो एक नवीन "टाइम एक्यूरेसी" मीट्रिक और एप्लिकेशन-विशिष्ट डेटा के साथ मौजूदा दृष्टिकोणों का पूरक बनता है।

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang2026-03-03
💬 NLP

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

Uni-CoT एक एकीकृत चेन-ऑफ-थॉट (Chain-of-Thought) फ्रेमवर्क पेश करता है जो टेक्स्ट और विज़न के बीच कुशल, सुसंगत मल्टीमॉडल तर्क को सक्षम करने के लिए एक दो-स्तरीय तर्क प्रतिमान (two-level reasoning paradigm) और संरचित प्रशिक्षण का लाभ उठाता है, जिससे सीमित कम्प्यूटेशनल संसाधनों के साथ इमेज जनरेशन और एडिटिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li2026-03-03
💬 NLP

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

यह शोध पत्र प्रदर्शित करता है कि मिक्सचर-ऑफ-एक्सपर्ट्स लैंग्वेज मॉडल्स के लिए, तर्क प्रदर्शन (reasoning performance) न केवल प्री-ट्रेनिंग लॉस को कम करके, बल्कि सक्रिय FLOPs और प्रति पैरामीटर कुल टोकन को संयुक्त रूप से संतुलित करके अनुकूलित किया जाता है, जो यह प्रकट करता है कि तर्क कार्य डेटा-प्यासे (data-hungry) होते हैं और विशिष्ट स्पर्सिटी कॉन्फ़िगरेशन से लाभान्वित होते हैं जो कि याद रखने वाले (memorization) कार्यों से भिन्न होते हैं।

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota2026-03-03
💬 NLP

Post-training Large Language Models for Diverse High-Quality Responses

यह शोध पत्र DQO को प्रस्तुत करता है, जो एक नवीन पोस्ट-ट्रेनिंग विधि है जो उच्च-गुणवत्तापूर्ण और अर्थपूर्ण रूप से विविध प्रतिक्रियाओं के लिए लार्ज लैंग्वेज मॉडल्स को संयुक्त रूप से अनुकूलित करने के लिए डिटरमिनेंटल पॉइंट प्रोसेसेज का लाभ उठाता है, जो प्रभावी रूप से संकीर्ण, कैनोनिकल आउटपुट उत्पन्न करने की सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) की प्रवृत्ति पर विजय प्राप्त करता है।

Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano2026-03-03
💬 NLP

BinaryShield: Cross-Service Threat Intelligence in LLM Services using Privacy-Preserving Fingerprints

बाइनरीशील्ड (BinaryShield) एक नवीन गोपनीयता-संरक्षण वाला थ्रेट इंटेलिजेंस सिस्टम है जो PII रेडैक्शन, सिमेंटिक एम्बेडिंग, बाइनरी क्वांटाइजेशन और रैंडमाइज्ड रिस्पॉन्स के एक पाइपलाइन के माध्यम से प्रॉम्प्ट इंजेक्शन अटैक फिंगरप्रिंट्स के सुरक्षित क्रॉस-सर्विस साझाकरण को सक्षम बनाता है, जिससे उच्च पहचान सटीकता (0.94 F1-स्कोर) और नियामक सीमाओं का अनुपालन करते हुए मौजूदा बेसलाइनों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Waris Gill, Natalie Isak, Matthew Dressman2026-03-03
💬 NLP

Distribution-Aligned Decoding for Efficient LLM Task Adaptation

यह शोध पत्र स्टीयरिंग वेक्टर डिकोडिंग (SVDecode) को प्रस्तुत करता है, जो एक हल्का और सैद्धांतिक रूप से सुदृढ़ तरीका है जो एक वॉर्म-स्टार्टेड मॉडल के KL-डाइवर्जेंस ग्रेडिएंट से एक स्टीयरिंग वेक्टर निकालकर बड़े भाषा मॉडल (LLM) के कार्य अनुकूलन को बढ़ाता है ताकि डिकोडिंग के दौरान आउटपुट वितरण को सीधे संरेखित किया जा सके, जिससे बिना किसी अतिरिक्त प्रशिक्षण योग्य पैरामीटर के कई बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Senkang Hu, Xudong Han, Jinqi Jiang, Yihang Tao, Zihan Fang, Yong Dai, Sam Tak Wu Kwong, Yuguang Fang2026-03-03