💬 NLP

On Advantage Estimates for Max@K Policy Gradients

यह शोध पत्र MaxPO प्रस्तुत करता है, जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में max@K उद्देश्यों को अनुकूलित करने के लिए एक नई पॉलिसी-ग्रेडिएंट विधि है, जो केंद्रित लाभ (centered advantages) सुनिश्चित करने, ग्रेडिएंट वेरिएंस को कम करने और अधिक प्रभावी LLM पोस्ट-ट्रेनिंग के लिए मौजूदा एस्टिमेटर्स को एकीकृत करने के लिए एक नवीन 'लीव-टू-आउट' (Leave-Two-Out) बेसलाइन का उपयोग करता है।

Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takes (…)2026-06-05
🤖 AI

Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents

यह शोध पत्र MAGE को प्रस्तुत करता है, जो एक नवीन मेमोरी आर्किटेक्चर है जो निष्पादन अवस्थाओं (execution states) को प्रबंधित करने के लिए सिमेंटिक समानता-आधारित रिट्रीवल के स्थान पर एक पदानुक्रमित स्टेट ट्री (hierarchical state tree) का उपयोग करता है, जिससे त्रुटियों को अलग करने, संदर्भ वृद्धि को सीमित करने और टोकन खपत को कम करते हुए टास्क सफलता दर में उल्लेखनीय वृद्धि करके लॉन्ग-होरिज़न एजेंट प्रदर्शन में सुधार किया जाता है।

Yaoqi Chen, Haibin Lai, Yuru Feng, Chuyu Han, Qianxi Zhang, Baotong Lu, Menghao Li, Xinjiang Wang, Zhirui Wang, Shusen X (…)2026-06-05
💬 NLP

OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation

OrderGrad अनबायस्ड ग्रेडिएंट एस्टिमेटर्स (unbiased gradient estimators) का एक एकीकृत, प्लग-एंड-प्ले परिवार पेश करता है जो रैंक वेट्स (rank weights) के आधार पर रिवॉर्ड्स को रूपांतरित करके ऑर्डर-सांख्यिकी उद्देश्यों (जैसे VaR, CVaR, और best-of-K) को अनुकूलित करता है, जिससे पॉलिसी-ग्रेडिएंट विधियों को साधारण माध्य अनुकूलन (mean optimization) से परे टेल रिस्क (tail risk) और आउटलियर रोबस्टनेस (outlier robustness) जैसी वितरण संबंधी विशेषताओं को प्रभावी ढंग से संबोधित करने में सक्षम बनाया जा सके।

Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Shota Takashiro, Soichiro Nishimori, Takeshi Kojima, Yusuke Iwasawa, Yutaka (…)2026-06-05
🤖 AI

Step-adaptive multimodal fusion network with multi-scale cloud feature learning for ultra-short-term solar irradiance forecasting

यह शोध पत्र एक स्टेप-एडैप्टिव मल्टीमॉडल फ्यूजन नेटवर्क का प्रस्ताव करता है जो मौजूदा विधियों की तुलना में अल्ट्रा-शॉर्ट-टर्म सौर विकिरण पूर्वानुमान सटीकता में उल्लेखनीय सुधार करने के लिए InceptionNeXt के माध्यम से मल्टी-स्केल क्लाउड फीचर एक्सट्रैक्शन, डायनेमिक लो-फ्रीक्वेंसी कंपनसेशन और TempAttnLSTM टेम्पोरल मॉडलिंग को एकीकृत करता है।

Jingxin Zhang Xiaoqin Wang2026-06-05
💬 NLP

Harnessing Structural Context for Entity Alignment Foundation Models

यह शोध पत्र ContextEA को प्रस्तुत करता है, जो एक हल्का एन्कोडर-डिकोडर ढांचा है जो एनकोडिंग के दौरान क्रॉस-केजी (cross-KG) इंटरैक्शन को मजबूत करके और डिकोडिंग के दौरान मल्टी-लेवल स्ट्रक्चरल एविडेंस के साथ अलाइनमेंट स्कोर को कैलिब्रेट करके एंटिटी अलाइनमेंट फाउंडेशन मॉडल्स को उन्नत करता है, जिससे मौजूदा बेसलाइन्स की तुलना में अनदेखे नॉलेज ग्राफ्स पर बेहतर ट्रांसफर प्रदर्शन प्राप्त होता है।

Xingyu Chen, Yuanning Cui, Zequn Sun, Wei Hu2026-06-05
🤖 AI

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

यह शोध पत्र ANCHOR को प्रस्तुत करता है, जो एक LLM-आधारित फ्रेमवर्क है जो स्व-विकसित एजेंट प्रणालियों (self-evolving agent systems) में सुरक्षा क्षरण को कम करने और प्रदर्शन को स्थिर करने के लिए मानवीय पर्यवेक्षण का अनुकरण करता है, जो यह प्रदर्शित करता है कि आउटपुट सत्यापन चरण के दौरान लक्षित पर्यवेक्षण मानव संरेखण बनाए रखने के लिए सबसे प्रभावी है।

Dianxing Shi, Junqi He, Junhao Chen, Bowen Wang, Yuta Nakashima2026-06-05
🤖 AI

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover एक 20-बिलियन-पैरामीटर वाला मॉडल है जो सुपरवाइज्ड फाइन-ट्यूनिंग को रिपेयर-आधारित पॉलिसी ऑप्टिमाइज़ेशन और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन के साथ जोड़कर वेरीफिएबल TLA+ स्पेसिफिकेशन के संश्लेषण में महत्वपूर्ण सुधार करता है, जो TLC मॉडल चेकर को एक प्रत्यक्ष रिवॉर्ड सिग्नल के रूप में उपयोग करके एक होल्ड-आउट बेंचमार्क पर 30% पास रेट प्राप्त करता है।

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer (…)2026-06-05
🤖 AI

A Finite Certificate for the Positive n=9n=9 Vasc Inequality

यह शोध पत्र बहुपद न्यूनीकरण (polynomial reduction) और स्वचालित सत्यापन (automated verification) के संयोजन के माध्यम से सभी 40,320 क्रमबद्ध शंकुओं (sorted cones) में असमानता को सत्यापित करने वाले एक परिमित प्रमाणपत्र (finite certificate) का उपयोग करते हुए, वास्क चक्रीय असमानता (Vasc cyclic inequality) के धनात्मक-वास्तविक n=9n=9 मामले का एक मानव-निर्देशित एआई-सहायता प्राप्त प्रमाण प्रस्तुत करता है।

Dakai Guo, Ruichen Qiu, Yichuan Cao, Ruyong Feng2026-06-05
🤖 AI

Amortizing Federated Adaptation: Hypernetwork Driven LoRA for Personalized Foundation Models

यह शोध पत्र HyperLoRA का प्रस्ताव करता है, जो एक एकीकृत फेडरेटेड लर्निंग फ्रेमवर्क है जो संरचनात्मक पूर्वाग्रह (structural bias) और इनिशियलाइजेशन लैग (initialization lag) को दूर करने के लिए हाइपरनेटवर्क-संचालित LoRA जनरेशन और प्रोडक्ट स्पेस एग्रीगेशन का लाभ उठाता है, जिससे विषम वितरित सेटिंग्स (heterogeneous distributed settings) में फाउंडेशन मॉडल्स के लिए तेज़ अभिसरण (faster convergence), निष्पक्ष एकत्रीकरण (unbiased aggregation) और बेहतर वैयक्तिकरण (improved personalization) प्राप्त होता है।

Sunny Gupta, Shambhavi Shanker, Amit Sethi2026-06-05
🤖 AI

Learning to replenish: A hybrid deep reinforcement learning for dynamic inventory management in the pharmaceutical supply chains

यह शोध पत्र एक हाइब्रिड डीप रिइन्फोर्समेंट लर्निंग एल्गोरिदम, विशेष रूप से एक A3C DPPO मॉडल, प्रस्तावित करता है, जो अनिश्चित मांग और लीड समय के तहत उत्पाद की उपलब्धता और अपव्यय में कमी के बीच संतुलन बनाकर फार्मास्युटिकल आपूर्ति श्रृंखलाओं में गतिशील इन्वेंटरी पुनर्भरण को अनुकूलित करता है, जो अंततः मौजूदा बेंचमार्क की तुलना में बेहतर लाभप्रदता और कम लागत प्रदर्शित करता है।

Amandeep Kaur, Gyan Prakash2026-06-05