💬 NLP

Three Models of RLHF Annotation: Extension, Evidence, and Authority

यह शोध पत्र RLHF में मानव एनोटेटरों के तीन वैचारिक मॉडलों—एक्सटेंशन (extension), एविडेंस (evidence), और अथॉरिटी (authority)—के बीच अंतर करने का प्रस्ताव देता है, ताकि मॉडल अलाइनमेंट के प्रत्येक आयाम के लिए आवश्यक विशिष्ट मानदण्ड संबंधी भूमिका के अनुरूप डेटा संग्रह और एकत्रीकरण रणनीतियों को अनुकूलित करके अधिक प्रभावी एनोटेशन पाइपलाइनों के डिज़ाइन का मार्गदर्शन किया जा सके।

Steve Coyne2026-04-29
🤖 machine learning

TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning

यह शोध पत्र TSN-Affinity का प्रस्ताव करता है, जो एक नवीन निरंतर ऑफलाइन सुदृढीकरण शिक्षण (continual offline reinforcement learning) विधि है जो कार्य-विशिष्ट पैरामीट्रिकरण और समानता-संचालित ज्ञान साझाकरण को सक्षम करने के लिए TinySubNetworks और एक डिसीजन ट्रांसफॉर्मर का लाभ उठाती है, जो रीप्ले-आधारित रणनीतियों के लिए एक स्मृति-कुशल विकल्प प्रदान करती है जो डिस्क्रीट और कंटीन्यूअस कंट्रोल कार्यों में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को प्रभावी ढंग से कम करती है।

Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo2026-04-29
💬 NLP

Toward a Functional Geometric Algebra for Natural Language Semantics

यह शोध पत्र एक फंक्शनल ज्योमेट्रिक अलजेब्रा (FGA) ढांचे का प्रस्ताव करता है जो प्राकृतिक भाषा अर्थविज्ञान (natural language semantics) में पारंपरिक रैखिक बीजगणित की संरचनात्मक सीमाओं को दूर करने के लिए क्लिफोर्ड बीजगणित का लाभ उठाता है, जो एक एकीकृत मल्टीवेक्टर स्पेस के भीतर अर्थपूर्ण अवधारणाओं और उनकी अंतःक्रियाओं को निरूपित करने के लिए एक सिद्धांत-आधारित, प्रकारित (typed) और संयोजनकारी (compositional) प्रणाली प्रदान करता है।

James Pustejovsky2026-04-29
🤖 machine learning

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

यह शोध पत्र एक टैलिस लॉस निरंतरता (Tsallis loss continuum) प्रस्तुत करता है जो रीजनिंग मॉडल्स में कोल्ड-स्टार्ट स्टालिंग (cold-start stalling) को हल करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) और घनत्व अनुमान (density estimation) के बीच मध्यस्थता करता है, जिसमें दो व्यावहारिक अनुमानकों (GARL और PAFT) का प्रस्ताव दिया गया है जो कम सफलता की संभावनाओं से बाहर निकलने की गति और प्रशिक्षण स्थिरता के बीच संतुलन बनाकर जटिल रीजनिंग बेंचमार्क पर GRPO जैसे मानक तरीकों से काफी बेहतर प्रदर्शन करते हैं।

Chu-Cheng Lin, Eugene Ie2026-04-29
💬 NLP

Recursive Multi-Agent Systems

यह शोध पत्र RecursiveMAS प्रस्तुत करता है, जो एक पुनरावर्ती मल्टी-एजेंट फ्रेमवर्क है जो विषम एजेंटों को एक नवीन लर्निंग एल्गोरिदम के साथ लेटेंट-स्पेस सहयोग लूप में एकीकृत करता है, और मौजूदा सिंगल एवं मल्टी-एजेंट सिस्टम की तुलना में विविध बेंचमार्क पर सटीकता, इन्फरेंस स्पीड और टोकन दक्षता में महत्वपूर्ण सुधार प्राप्त करता है।

Xiyuan Yang, Jiaru Zou, Rui Pan, Ruizhong Qiu, Pan Lu, Shizhe Diao, Jindong Jiang, Hanghang Tong, Tong Zhang, Markus J. (…)2026-04-29
📊 statistics

"Noisier" Noise Contrastive Eestimation is (Almost) Maximum Likelihood

यह शोध पत्र "Noisier" NCE को प्रस्तुत करता है, जो एक सरल संशोधन है जो शोर की तीव्रता (noise magnitude) को कृत्रिम रूप से बढ़ाता है ताकि NCE उद्देश्य को अधिकतम संभावना (Maximum Likelihood) के साथ संरेखित किया जा सके, जिससे उच्च-आयामी, बहुविध (multimodal) परिवेशों में तेज़ अभिसरण (convergence) और अधिक सटीक घनत्व-अनुपात अनुमान (density-ratio estimation) सक्षम हो सके।

Peiyu Yu, Dinghuai Zhang, Hengzhi He, Xiaojian Ma, Sirui Xie, Ruiyao Miao, Yifan Lu, Yasi Zhang, Deqian Kong, Ruiqi Gao (…)2026-04-28
🤖 AI

Attention-Based Deep Reinforcement Learning for Qubit Allocation in Modular Quantum Architectures

यह शोध पत्र एक नवीन डीप रिइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तावित करता है जो ट्रांसफॉर्मर एनकोडर्स और ग्राफ न्यूरल नेटवर्क्स को एकीकृत करता है ताकि मॉड्यूलर क्वांटम आर्किटेक्चर में लॉजिकल क्वबिट्स को फिजिकल कोर्स में मैप करने के लिए ह्यूरिस्टिक्स को कुशलतापूर्वक सीखा जा सके, जिससे बेसलाइन विधियों की तुलना में इंटर-कोर संचार को कम किया जा सके और संकलन समय (कंपाइलेशन टाइम) को घटाया जा सके।

Enrico Russo, Maurizio Palesi, Davide Patti, Giuseppe Ascia, Vincenzo Catania2026-04-28
💻 computer science

MVIGER: Multi-View Variational Integration of Complementary Knowledge for Generative Recommender

यह शोध पत्र MVIGER का प्रस्ताव करता है, जो एक एकीकृत वेरिएशनल फ्रेमवर्क है जो एक सीखने योग्य कैटेगोरिकल लेटेंट वेरिएबल के माध्यम से विविध प्रॉम्प्ट टेम्पलेट्स और आइटम इंडेक्स प्रकारों से प्राप्त पूरक प्राथमिकता ज्ञान को अनुकूल रूप से एकीकृत करके जनरेटिव रिकमेंडर सिस्टम्स में विसंगतियों को हल करता है।

Tongyoung Kim, Soojin Yoon, SeongKu Kang, Jinyoung Yeo, Dongha Lee2026-04-28
💻 computer science

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

यह शोधपत्र CodeSim को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट फ्रेमवर्क है जो सात चुनौतीपूर्ण बेंचमार्क में योजना सत्यापन (plan verification) और आंतरिक डिबगिंग के लिए एक मानव-समान, सिमुलेशन-संचालित दृष्टिकोण का उपयोग करके अत्याधुनिक कोड जनरेशन प्रदर्शन प्राप्त करता है।

Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez2026-04-28
💻 computer science

Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization

यह शोध पत्र Speech-FT का प्रस्ताव करता है, जो एक नवीन दो-चरणीय फाइन-ट्यूनिंग फ्रेमवर्क है जो मौजूदा रेगुलराइजेशन विधियों की तुलना में क्रॉस-टास्क जनरलाइजेशन को संरक्षित करने और यहाँ तक कि सुधारने के साथ-साथ कार्य-विशिष्ट प्रदर्शन को बढ़ाने के लिए रिप्रेजेंटेशनल ड्रिफ्ट रिडक्शन को वेट-स्पेस इंटरपोलेशन के साथ जोड़ता है।

Tzu-Quan Lin, Wei-Ping Huang, Hao Tang, Hung-yi Lee2026-04-28