💬 NLP

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

यह शोध पत्र MENTOR का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग की सामान्यीकरण सीमाओं और सख्त प्रक्षेपवक्र मिलान (trajectory matching) की बाधाओं को दूर करने के लिए एक लचीले, प्रक्रिया-जागरूक पुरस्कार संरचना का उपयोग करके बड़े भाषा मॉडलों से टूल-उपयोग क्षमताओं को छोटे भाषा मॉडलों में संकुचित (distill) करता है।

ChangSu Choi, Hoyun Song, Dongyeon Kim, WooHyeon Jung, Minkyung Cho, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim2026-06-19
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

यह शोध पत्र RECAP को प्रस्तुत करता है, जो एक एंड-टू-एंड रिप्ले रणनीति है जिसमें डायनेमिक ऑब्जेक्टिव रीवेटिंग (dynamic objective reweighting) शामिल है, जो सुदृढीकरण शिक्षण (reinforcement learning) के साथ प्रशिक्षित बड़े रीजनिंग मॉडल्स में सामान्य-क्षमता विस्मृति (general-capability forgetting) को प्रभावी ढंग से कम करती है और साथ ही लचीले रिवॉर्ड ट्रेड-ऑफ के माध्यम से रीजनिंग प्रदर्शन को बढ़ाती है।

Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei2026-06-19
🤖 AI

Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning

यह अध्ययन आठ कस्टम-डिज़ाइन किए गए प्रश्नों का उपयोग करके नौ प्रमुख लार्ज लैंग्वेज मॉडल्स की तार्किक और अमूर्त तर्क क्षमताओं का मानव प्रदर्शन के विरुद्ध मूल्यांकन और तुलना करता है, जो मॉडल्स की निगमनात्मक क्षमताओं में महत्वपूर्ण अंतराल को प्रकट करता है।

Benjamin Grando Moreira2026-06-19
💻 computer science

An In-depth Study of LLM Contributions to the Bin Packing Problem

यह शोध पत्र इस दावे को चुनौती देता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) बिन पैकिंग समस्या में गणितीय खोज को महत्वपूर्ण रूप से आगे बढ़ाते हैं, यह प्रदर्शित करते हुए कि उनके द्वारा उत्पन्न ह्यूरिस्टिक्स (heuristics) अपारदर्शी हैं और समस्या के उदाहरण वास्तव में इतने सरल हैं कि उन्हें अधिक कुशल, व्याख्या योग्य और सामान्यीकरण योग्य एल्गोरिदम द्वारा हल किया जा सकता है, जिससे LLM-जनित वैज्ञानिक योगदानों के कठोर सत्यापन की आवश्यकता पर प्रकाश पड़ता है।

Julien Herrmann, Guillaume Pallez2026-06-19
💻 computer science

RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories

यह शोध पत्र रिपलबेंच (RippleBench) को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो भाषा मॉडल अनलर्निंग के "रिपल प्रभावों" (ripple effects) को मापने के लिए मौजूदा ज्ञान भंडारों का लाभ उठाता है, जिससे यह पता चलता है कि संबंधित अवधारणाओं पर प्रदर्शन में गिरावट अनलर्निंग पद्धति का एक सुसंगत गुण है न कि मूल मॉडल का।

Roy Rinberg, Usha Bhalla, Igor Shilov, Flavio P. Calmon, Rohit Gandikota2026-06-19
🤖 AI

Creativity Reconsidered: Generative AI and the Problem of Intentional Agency

यह शोध पत्र तर्क देता है कि रचनात्मकता के लिए एक आवश्यक आवश्यकता के रूप में 'इरादतन एजेंसी स्थिति' (Intentional Agency Condition) को त्याग दिया जाना चाहिए, और इसके बजाय 'रचनात्मक क्षमता' (creative ability) का प्रस्ताव देता है, जो एक ऐसा ढांचा है जो कथित इरादतनता के महत्व को सुरक्षित रखते हुए जनरेटिव एआई (generative AI) के रचनात्मक आउटपुट को समाहित करता है।

James S. Pearson, Matthew J. Dennis, Marc Cheong2026-06-19
🤖 AI

Bi-Anchor Interpolation Solver for Accelerating Generative Modeling

यह शोध पत्र बायो-एंकर इंटरपोलेशन सॉल्वर (BA-solver) का प्रस्ताव करता है, जो एक हल्का और प्रशिक्षण-कुशल तरीका है जो एक फ्रोजन बैकबोन को एक छोटे साइडनेट (SideNet) के साथ जोड़कर फ्लो मैचिंग जनरेशन को तेज करता है, ताकि बहुमुखीता से समझौता किए बिना या अत्यधिक प्रशिक्षण लागत उठाए बिना मात्र 5-10 न्यूरल फंक्शन इवैल्यूएशन में उच्च-निष्ठा वाला संश्लेषण प्राप्त किया जा सके।

Hongxu Chen, Hongxiang Li, Zhen Wang, Long Chen2026-06-19
🤖 AI

Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic Methods

यह शोध पत्र PAVE का प्रस्ताव करता है, जो एक क्रिटिक-केंद्रित (critic-centric) रेगुलेराइज़ेशन फ्रेमवर्क है जो पॉलिसी ऑसिलेशन्स (policy oscillations) को Q-फंक्शन की डिफरेंशियल ज्योमेट्री (differential geometry) से सैद्धांतिक रूप से जोड़कर और एक्टर में संशोधन किए बिना Q-ग्रेडिएंट वोलैटिलिटी (Q-gradient volatility) को अनुभवजन्य रूप से कम करके, एक्टर-क्रिटिक विधियों में पॉलिसी स्मूथनेस (policy smoothness) को स्थिर करता है।

Jeong Woon Lee, Kyoleen Kwak, Daeho Kim, Hyoseok Hwang2026-06-19
🤖 AI

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication

यह शोध पत्र LoRDO का प्रस्ताव करता है, जो एक वितरित प्रशिक्षण ढांचा (डिस्ट्रीब्यूटेड ट्रेनिंग फ्रेमवर्क) है जो सबस्पेस एक्सप्लोरेशन को बहाल करने के लिए एक फुल-रैंक क्वासी-हाइपरबोलिक अपडेट पेश करके लो-रैंक ऑप्टिमाइज़ेशन को विरल संचार (इन्फ्रीक्वेंट कम्युनिकेशन) के साथ एकीकृत करता है, जिससे मानक DDP प्रदर्शन के साथ लगभग समानता प्राप्त करते हुए संचार ओवरहेड को लगभग 10 गुना कम किया जा सकता है।

Andrej Jovanović, Alex Iacob, Mher Safaryan, Ionut-Vlad Modoranu, Lorenzo Sani, William F. Shen, Xinchi Qiu, Dan Alistar (…)2026-06-19
🤖 AI

Flickering Multi-Armed Bandits

यह शोध पत्र गतिशील क्रिया उपलब्धता बाधाओं के तहत अनुक्रमिक निर्णय लेने को मॉडल करने के लिए फ्लिकरिंग मल्टी-आर्म्ड बैंडिट्स (FMAB) ढांचे को प्रस्तुत करता है, जो एक दो-चरणीय लेज़ी रैंडम वॉक एल्गोरिदम का प्रस्ताव करता है जो स्टोकेस्टिक रूप से विकसित होने वाले ग्राफ वातावरण में सूचना प्राप्ति और नेविगेशन ओवरहेड के बीच संतुलन बनाकर निकट-इष्टतम उप-रैखिक रिग्रेट (sublinear regret) प्राप्त करता है।

Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni, Lijun Chen2026-06-19