💬 NLP

Supervising the search process produces reliable and generalizable information-seeking agents

यह शोध पत्र RAG-Gym और Re2^2Search++ एजेंट को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि पर्यवेक्षण (supervision) को अंतिम उत्तरों से हटाकर स्वयं खोज प्रक्रिया पर केंद्रित करने से अधिक विश्वसनीय और सामान्यीकरण योग्य सूचना-खोज एजेंट प्राप्त होते हैं, विशेष रूप से आउट-ऑफ-डोमेन सेटिंग्स में।

Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia (…)2026-05-19
💬 NLP

Automated Knowledge Component Generation for Interpretable Knowledge Tracing in Coding Problems

यह शोध पत्र KCGen-KT को प्रस्तुत करता है, जो एक स्वचालित LLM-आधारित पाइपलाइन है जो ओपन-एंडेड कोडिंग समस्याओं के लिए नॉलेज कंपोनेंट्स (ज्ञान घटकों) को उत्पन्न और टैग करती है, और व्यापक मूल्यांकन के माध्यम से यह प्रदर्शित करती है कि ये AI-जनरेटेड घटक छात्र प्रदर्शन की भविष्यवाणी करने और लर्निंग कर्व्स को मॉडल करने में पारंपरिक मानव-लिखित घटकों से बेहतर प्रदर्शन करते हैं।

Zhangqi Duan, Nigel Fernandez, Arun Balajiee Lekshmi Narayanan, Mohammad Hassany, Rafaella Sampaio de Alencar, Peter Bru (…)2026-05-19
💬 NLP

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant ने एक नवीन लॉग-डिस्ट्रीब्यूटेड 2-बिट क्वांटाइजेशन तकनीक पेश की है जो KV कैश के लिए, न्यूनतम मेमोरी फुटप्रिंट बनाए रखते हुए, बड़े भाषा मॉडलों (LLMs) के लिए इन्फरेंस थ्रूपुट, बैच साइज और टास्क सटीकता में महत्वपूर्ण सुधार करती है।

Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen2026-05-19
💬 NLP

Sustainability via LLM Right-sizing

यह अध्ययन अनुभवजन्य रूप से यह प्रदर्शित करता है कि छोटे, स्थानीय रूप से तैनात किए जा सकने वाले एलएलएम (LLMs) अक्सर रोजमर्रा के संगठनात्मक कार्यों के लिए बड़े मॉडलों की तुलना में एक टिकाऊ और लागत प्रभावी विकल्प प्रदान करते हैं, जो प्रदर्शन-अधिकतम करने वाले बेंचमार्क से संदर्भ-जागरूक पर्याप्तता आकलन की ओर बदलाव का समर्थन करते हैं।

Jennifer Haase, Finn Klessascheck, Jan Mendling, Sebastian Pokutta2026-05-19
💬 NLP

Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs

यह शोध पत्र Sparse-to-Dense (StD) को प्रस्तुत करता है, जो एक ट्यूनिंग-मुक्त (tuning-free), प्लग-एंड-प्ले डिकोडिंग रणनीति है जो एक सहयोगी तंत्र का लाभ उठाकर लार्ज लैंग्वेज मॉडल्स में वीडियो समझ को बिना किसी प्रदर्शन हानि के 1.94×\times तक तेज करती है, जहाँ एक तेज़ स्पार्स मॉडल अनुमानित रूप से टोकन को डिकोड करता है और एक धीमा डेंस मॉडल समानांतर में उन्हें सत्यापित करता है।

Xuan Zhang, Cunxiao Du, Sicheng Yu, Jiawei Wu, Fengzhuo Zhang, Wei Gao, Qian Liu2026-05-19
💬 NLP

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

यह शोध पत्र यह प्रदर्शित करता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) भाषा मॉडल, एक इष्टतम सक्रियण दर (activation rate) की पहचान करके जो विभिन्न मॉडल आकारों में सुसंगत रहती है, समान संसाधन बाधाओं (कुल पैरामीटर, कंप्यूट, और डेटा) के तहत अपने डेंस समकक्षों से बेहतर प्रदर्शन कर सकते हैं, एक ऐसा निष्कर्ष जिसे लगभग 250 मॉडलों को प्रशिक्षित करने और 50 ट्रिलियन टोकन को प्रोसेस करने के व्यापक प्रयोगों के माध्यम से मान्य किया गया है।

Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Dax (…)2026-05-19
💬 NLP

LLM Agents Are the Antidote to Walled Gardens

यह शोध पत्र यह तर्क देता है कि एलएलएम-आधारित एजेंट (LLM-based agents), एआई-मध्यस्थ एडेप्टर (AI-mediated adapters) के माध्यम से "सार्वभौमिक अंतर-संचालनीयता" (universal interoperability) को सक्षम करके 'वॉल्ड गार्डन्स' (walled gardens) के प्रभुत्व को समाप्त कर सकते हैं, जो क्रॉस-प्लेटफ़ॉर्म डेटा विनिमय की लागत को नाटकीय रूप से कम करते हैं, जिससे उपयोगकर्ता की स्वतंत्रता और बाजार प्रतिस्पर्धा बहाल होती है, जबकि इससे जुड़े सुरक्षा और कानूनी जोखिमों को संबोधित करने के लिए नए ढांचे की आवश्यकता भी होती है।

Samuele Marro, Philip Torr2026-05-19
💬 NLP

Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap

यह शोध पत्र डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) के लिए एक नवीन कठिनाई-आधारित डेटा चयन रणनीति प्रस्तुत करता है जो छोटे निहित रिवॉर्ड गैप्स के माध्यम से चुनौतीपूर्ण प्राथमिकता उदाहरणों की पहचान करता है, जिससे मौजूदा बेसलाइन की तुलना में मूल डेटा के केवल 10% का उपयोग करके मॉडल अलाइनमेंट दक्षता और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Xuan Qi, Rongwu Xu, Zhijing Jin2026-05-19
💬 NLP

We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong

यह शोध पत्र एडेप्टिव मल्टी-ब्रांच स्टीयरिंग (AMBS) प्रस्तुत करता है, जो एक दो-चरणीय 1-to-N ट्रांसफॉर्मर फ्रेमवर्क है, जो एक साझा प्रतिनिधित्व के सापेक्ष उद्देश्य-विशिष्ट रूपांतरणों को पैरामीटराइज़ करके लार्ज लैंग्वेज मॉडल्स को हेल्पफुलनेस (helpfulness), हार्मलेसनेस (harmlessness) और ऑनेस्टी (honesty) उद्देश्यों के साथ एक साथ संरेखित करता है, जिससे पूर्ववर्ती विधियों की हस्तक्षेप और असंगतता संबंधी समस्याओं को दूर करते हुए इन्फरेंस दक्षता को बनाए रखा जा सकता है।

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem2026-05-19
💬 NLP

Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks

यह शोध पत्र रिफ्यूज़ल इंडेक्स (RI) को प्रस्तुत करता है, जो तथ्यात्मक कार्यों में लार्ज लैंग्वेज मॉडल्स की अक्सर अविश्वसनीय ज्ञान-जागरूक इनकार क्षमताओं को प्रभावी ढंग से मापने और प्रकट करने के लिए इनकार (refusal) और त्रुटि संभावनाओं के बीच सहसंबंध पर आधारित एक नवीन मीट्रिक है।

Wenbo Pan, Jie Xu, Qiguang Chen, Junhao Dong, Libo Qin, Xinfeng Li, Haining Yu, Xiaohua Jia2026-05-19