💬 NLP

Test-time Recursive Thinking: Self-Improvement without External Feedback

यह शोध पत्र टेस्ट-टाइम रिकर्सिव थिंकिंग (TRT) का प्रस्ताव करता है, जो एक पुनरावृत्ति स्व-सुधार ढांचा है जो विविध उम्मीदवार पीढ़ी और स्व-सत्यापन का लाभ उठाकर, बाहरी फीडबैक या अतिरिक्त प्रशिक्षण के बिना, चुनौतीपूर्ण बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स की तर्क और कोडिंग क्षमता को महत्वपूर्ण रूप से बढ़ाने में सक्षम बनाता है।

Yufan Zhuang, Chandan Singh, Liyuan Liu, Yelong Shen, Dinghuai Zhang, Jingbo Shang, Jianfeng Gao, Weizhu Chen2026-02-04
💬 NLP

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

ForesightKV एक प्रशिक्षण-आधारित ढांचा है जो गोल्डन इविक्शन एल्गोरिदम को सुपरवाइज्ड लर्निंग और रिइन्फोर्समेंट लर्निंग (GRPO) के साथ जोड़कर रीजनिंग मॉडल्स के लिए KV कैश इविक्शन को अनुकूलित करता है ताकि सबसे महत्वपूर्ण KV पेयर्स का पूर्वानुमान लगाया जा सके और उन्हें बनाए रखा जा सके, जिससे लंबे रीजनिंग कार्यों पर उच्च प्रदर्शन बनाए रखते हुए मेमोरी लागत को काफी कम किया जा सके।

Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao2026-02-04
💬 NLP

ATACompressor: Adaptive Task-Aware Compression for Efficient Long-Context Processing in LLMs

यह शोध पत्र ATACompressor को प्रस्तुत करता है, जो एक अनुकूली कार्य-जागरूक संपीड़न विधि है जो "लॉस्ट इन द मिडल" (बीच में खो जाने की) समस्या को कम करने के लिए केवल कार्य-प्रासंगिक अंशों को गतिशील रूप से चुनती और संपीड़ित करती है, जिससे यह QA बेंचमार्क पर संपीड़न दक्षता और कार्य प्रदर्शन दोनों में मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन करती है।

Xuancheng Li, Haitao Li, Yujia Zhou, Qingyao Ai, Yiqun Liu2026-02-04
💬 NLP

Accurate Failure Prediction in Agents Does Not Imply Effective Failure Prevention

यह शोध पत्र यह प्रदर्शित करता है कि LLM क्रिटिक मॉडल्स में उच्च ऑफलाइन सटीकता (offline accuracy), व्यवधान-पुनर्प्राप्ति व्यापार-बंद (disruption-recovery tradeoff) के कारण तैनाती के दौरान प्रभावी विफलता रोकथाम की गारंटी नहीं देती है, और एक हल्के प्री-डिप्लॉयमेंट पायलट टेस्ट का प्रस्ताव करता है जो यह पहचान सके कि कब हस्तक्षेपों से सुधार के बजाय प्रदर्शन में गंभीर गिरावट आने की संभावना है।

Rakshith Vasudev, Melisa Russak, Dan Bikel, Waseem Alshikh2026-02-04
💬 NLP

Robustness as an Emergent Property of Task Performance

यह शोध पत्र तर्क देता है कि मजबूती (robustness) एक स्वतंत्र क्षमता के बजाय कार्य प्रदर्शन का एक उभरता हुआ गुण है, यह प्रदर्शित करते हुए कि जैसे-जैसे मॉडल किसी कार्य पर उच्च दक्षता प्राप्त करते हैं, उनकी मजबूती स्वाभाविक रूप से पीछे आती है, जिससे यह सुझाव मिलता है कि मजबूती में सुधार के लिए स्पष्ट प्रयास करने के बजाय प्रदर्शन लाभों पर ध्यान केंद्रित करना अधिक महत्वपूर्ण हो सकता है।

Shir Ashury-Tahan, Ariel Gera, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen2026-02-04
💬 NLP

GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer

GFlowPO एक सैंपल-एफिशिएंट प्रॉम्प्ट ऑप्टिमाइज़ेशन फ्रेमवर्क है जो एक प्रॉम्प्ट लैंग्वेज मॉडल को फाइन-ट्यून करने के लिए ऑफ-पॉलिसी जेनेरेटिव फ्लो नेटवर्क को एक ट्रेनिंग-फ्री डायनेमिक मेमोरी अपडेट मैकेनिज्म के साथ जोड़ता है ताकि उच्च-रिवॉर्ड वाले प्रॉम्प्ट्स पर खोज को प्रगतिशील रूप से केंद्रित किया जा सके, जो विभिन्न कार्यों में मौजूदा डिस्क्रीट ऑप्टिमाइज़ेशन बेसलाइन्स से बेहतर प्रदर्शन करता है।

Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee2026-02-04
💬 NLP

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

यह शोध पत्र A-RAG को प्रस्तुत करता है, जो एक एजेंटिक RAG फ्रेमवर्क है जो पदानुक्रमित पुनर्प्राप्ति इंटरफेस (कीवर्ड खोज, सिमेंटिक खोज और चंक रीड) को सीधे भाषा मॉडलों के लिए उपलब्ध कराता है, जिससे अनुकूलन योग्य, बहु-स्तर की सूचना पुनर्प्राप्ति सक्षम होती है जो मॉडल के आकार और टेस्ट-टाइम कंप्यूट के साथ प्रभावी ढंग से स्केल करते हुए मौजूदा प्रतिमानों से लगातार बेहतर प्रदर्शन करती है।

Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao2026-02-04
💬 NLP

Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning

यह शोध पत्र पहचान करता है कि लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) अक्सर अनुत्पादक स्व-सत्यापन चरणों में संलग्न होते हैं और एक अनुभव-संचालित टेस्ट-टाइम फ्रेमवर्क का प्रस्ताव करता है जो इन अनावश्यक जाँचों को दबाने के लिए ऐतिहासिक परिणामों का लाभ उठाता है, जिससे सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए टोकन के उपयोग को काफी कम किया जा सकता है।

Quanyu Long, Kai Jie Jiang, Jianda Chen, Xu Guo, Leilei Gan, Wenya Wang2026-02-04
💬 NLP

Assessing the Impact of Typological Features on Multilingual Machine Translation in the Age of Large Language Models

यह शोध पत्र यह प्रदर्शित करता है कि डेटा की उपलब्धता और लिपि को नियंत्रित करने के बाद भी, लक्ष्य भाषा की टाइपोलॉजिकल (typological) विशेषताएं NLLB-200 और Tower+ जैसे अत्याधुनिक बहुभाषी लार्ज लैंग्वेज मॉडल्स की अनुवाद गुणवत्ता को महत्वपूर्ण रूप से प्रभावित करती हैं, और साथ ही यह भी सुझाव देता है कि विशिष्ट टाइपोलॉजिकल गुणों वाली भाषाओं को वैकल्पिक डिकोडिंग रणनीतियों से लाभ हो सकता है।

Vitalii Hirak, Jaap Jumelet, Arianna Bisazza2026-02-04
💬 NLP

Efficient Algorithms for Partial Constraint Satisfaction Problems over Control-flow Graphs

यह शोध पत्र फिक्स्ड डोमेन वाले सीरीज़-पैरेलल-लूप (Series-Parallel-Loop) डिकम्पोज्ड कंट्रोल-फ्लो ग्राफ्स पर आंशिक बाधा संतुष्टि समस्याओं (Partial Constraint Satisfaction Problems) को हल करने के लिए एक सामान्य लीनियर-टाइम एल्गोरिदम प्रस्तुत करता है, जो रजिस्टर एलोकेशन जैसे कार्यों के लिए पिछले दृष्टिकोणों को एकीकृत करता है और इष्टतम बैंक चयन (optimal bank selection) में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है।

Xuran Cai, Amir Goharshady2026-02-04