💬 NLP

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL एक दोहरा-पुरस्कार (dual-reward) सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को अनुकूल रूप से यह सिखाकर उन्हें कब गहन तर्क (deep reasoning) करना है बनाम कब सीधा उत्तर देना है, उन्हें बेहतर बनाता है, जिससे तर्क की सटीकता में सुधार होता है, मतिभ्रम (hallucinations) कम होता है, और शीर्ष-स्तरीय वाणिज्यिक मॉडलों के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng2026-02-04
💬 NLP

Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space

यह शोध पत्र नेचुरल लैंग्वेज एक्टर-क्रिटिक (NLAC) को प्रस्तुत करता है, जो एक स्केलेबल ऑफ-पॉलिसी लर्निंग एल्गोरिदम है जो स्केलर रिवॉर्ड्स के बजाय प्राकृतिक भाषा फीडबैक प्रदान करने के लिए एक जनरेटिव LLM क्रिटिक का उपयोग करता है, जिससे जटिल, लॉन्ग-होरिज़न कार्यों के लिए LLM एजेंटों के प्रशिक्षण की स्थिरता और सैंपल दक्षता में सुधार होता है।

Joey Hong, Kang Liu, Zhan Ling, Jiecao Chen, Sergey Levine2026-02-04
💬 NLP

Encoder-Free Knowledge-Graph Reasoning with LLMs via Hyperdimensional Path Retrieval

PathHD एक एनकोडर-मुक्त नॉलेज-ग्राफ रीजनिंग फ्रेमवर्क पेश करता है जो कुशल पाथ रिट्रीवल के लिए हाइपरडायमेंशनल कंप्यूटिंग और निर्णय लेने के लिए एक सिंगल LLM कॉल का लाभ उठाता है, जिससे पारंपरिक न्यूरल बेसलाइन्स की तुलना में काफी कम लेटेंसी, मेमोरी उपयोग और बेहतर व्याख्यात्मकता के साथ प्रतिस्पर्धी सटीकता प्राप्त होती है।

Yezi Liu, William Youngwoo Chung, Hanning Chen, Calvin Yeung, Mohsen Imani2026-02-04
💬 NLP

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

कॉन्फ्यूशियस कोड एजेंट (CCA), कॉन्फ्यूशियस SDK पर निर्मित एक स्केलेबल सॉफ्टवेयर इंजीनियरिंग एजेंट है, जो उन्नत संदर्भ प्रबंधन, निरंतर सीखने और स्वचालित परिशोधन के लिए एक मेटा-एजेंट को एकीकृत करता है ताकि SWE-Bench-Pro जैसे वास्तविक कोडिंग कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Yi (…)2026-02-04
💬 NLP

Self-attention vector output similarities reveal how machines pay attention

यह अध्ययन वेक्टर समानताओं का विश्लेषण करके सेल्फ-अटेंशन तंत्र को परिमाणित करने की एक नवीन विधि प्रस्तुत करता है, जो यह प्रकट करता है कि अटेंशन हेड्स विशिष्ट भाषाई विशेषताओं में विशेषज्ञता रखते हैं और शुरुआती परतों में लंबी दूरी की निर्भरताओं को पकड़ने से लेकर गहरी परतों में लघु-दूरी के, वाक्य-स्तरीय संबंधों पर ध्यान केंद्रित करने की ओर विकसित होते हैं।

Tal Halevi, Yarden Tzach, Ronit D. Gross, Shalom Rosner, Ido Kanter2026-02-04
💬 NLP

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

KVzap एक तेज़, इनपुट-अनुकूल KV कैश प्रूनिंग विधि है जो विभिन्न लार्ज लैंग्वेज मॉडल्स और कार्यों में नगण्य सटीकता हानि के साथ अत्याधुनिक संपीड़न (compression) प्राप्त करती है, जो बढ़ते संदर्भ लंबाई (context lengths) के कारण उत्पन्न होने वाली महत्वपूर्ण इन्फरेंस बाधा को संबोधित करती है।

Simon Jegou, Maximilian Jeblick2026-02-04
💬 NLP

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

यह शोधपत्र PluriHarms को प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जिसे बाइनरी सुरक्षा आकलन से आगे बढ़कर, विशेष रूप से मानव निर्णयों के पूर्ण स्पेक्ट्रम का व्यवस्थित रूप से विश्लेषण करने के लिए डिज़ाइन किया गया है, जो हानिकारक आयामों की गंभीरता और अंतर-एनोटेटर असहमति पर ध्यान केंद्रित करता है ताकि अधिक बहुलवादी और व्यक्तिगत AI सुरक्षा प्रणालियों के विकास को सक्षम बनाया जा सके।

Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine2026-02-04
💬 NLP

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

PrefixRL सफल ट्रेसेस (traces) के ऑफ-पॉलिसी प्रीफिक्स (off-policy prefixes) पर निर्भर होकर कठिन रीजनिंग समस्याओं पर सुदृढीकरण शिक्षण (reinforcement learning) की अक्षमता को संबोधित करता है ताकि प्रशिक्षण को स्थिर किया जा सके और सैंपल दक्षता को बढ़ाया जा सके, जिससे मानक बेसलाइनों की तुलना में तेज़ अभिसरण (convergence) और बेहतर प्रदर्शन प्राप्त होता है और रिजेक्शन सैंपलिंग (rejection sampling) के माध्यम से एक स्व-सुधार लूप सक्षम होता है।

Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie2026-02-04
💬 NLP

Linear representations in language models can change dramatically over a conversation

यह शोध पत्र प्रदर्शित करता है कि भाषा मॉडलों (language models) में उच्च-स्तरीय अवधारणाओं के रैखिक निरूपण (linear representations), मॉडल द्वारा अपनी संवादात्मक भूमिका के अनुकूल होने के साथ ही, एक बातचीत के दौरान नाटकीय रूप से और विषय-निर्भर तरीके से बदल सकते हैं, जो स्थिर व्याख्यात्मकता विधियों (static interpretability methods) और स्टीयरिंग तकनीकों की विश्वसनीयता को चुनौती देता है।

Andrew Kyle Lampinen, Yuxuan Li, Eghbal Hosseini, Sangnie Bhardwaj, Murray Shanahan2026-02-04
💬 NLP

The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus

यह शोध पत्र PoLR को प्रस्तुत करता है, जो एक कंप्यूट-कुशल इन्फरेंस-टाइम विधि है जो रीजनिंग प्रीफिक्स को क्लस्टर करती है ताकि केवल सबसे आशाजनक पथों की पहचान और विस्तार किया जा सके, जिससे बिना किसी मॉडल फाइन-ट्यूनिंग के सेल्फ-कंसिस्टेंसी की सटीकता से मेल खाते हुए टोकन उपयोग और लेटेंसी को काफी कम किया जा सके।

Ishan Jindal, Sai Prashanth Akuthota, Jayant Taneja, Sachin Dev Sharma2026-02-04