💬 NLP

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following

यह शोध पत्र MDP-GRPO को प्रस्तुत करता है, जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) का एक स्थिर संस्करण है, जो डिस्क्रीट (discrete), लो-डिस्पर्शन रिवॉर्ड सेटिंग्स में अस्थिरता को दूर करने के लिए मल्टी-टेम्परेचर सैंपलिंग, ड्यूल-एंकर एडवांटेज, प्रॉस्पेक्ट-थ्योरेटिक शेपिंग और एसिमेट्रिक KL रेगुलराइजेशन का उपयोग करता है, जिससे मल्टी-कन्स्ट्रेंट इंस्ट्रक्शन फॉलोइंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti2026-06-05
⚡ electrical engineering

Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

यह शोध पत्र प्रदर्शित करता है कि द्वैत-आउटपुट (dual-output) द्वितीय-भाषा भाषण पहचान के लिए मानक मल्टी-टास्क लर्निंग अक्सर एनकोडर-स्तर के प्रतिनिधित्व संबंधी उलझाव (representational entanglement) के कारण सतही प्रतिलेखन सटीकता को कम कर देता है, जो विशेष रूप से अंग्रेजी में एक ऐसी घटना है जहाँ उच्चारण और अर्थ काफी भिन्न होते हैं।

Seung Hwan Cho, Young-Min Kim2026-06-05
💬 NLP

On Advantage Estimates for Max@K Policy Gradients

यह शोध पत्र MaxPO प्रस्तुत करता है, जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में max@K उद्देश्यों को अनुकूलित करने के लिए एक नई पॉलिसी-ग्रेडिएंट विधि है, जो केंद्रित लाभ (centered advantages) सुनिश्चित करने, ग्रेडिएंट वेरिएंस को कम करने और अधिक प्रभावी LLM पोस्ट-ट्रेनिंग के लिए मौजूदा एस्टिमेटर्स को एकीकृत करने के लिए एक नवीन 'लीव-टू-आउट' (Leave-Two-Out) बेसलाइन का उपयोग करता है।

Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takes (…)2026-06-05
💬 NLP

OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation

OrderGrad अनबायस्ड ग्रेडिएंट एस्टिमेटर्स (unbiased gradient estimators) का एक एकीकृत, प्लग-एंड-प्ले परिवार पेश करता है जो रैंक वेट्स (rank weights) के आधार पर रिवॉर्ड्स को रूपांतरित करके ऑर्डर-सांख्यिकी उद्देश्यों (जैसे VaR, CVaR, और best-of-K) को अनुकूलित करता है, जिससे पॉलिसी-ग्रेडिएंट विधियों को साधारण माध्य अनुकूलन (mean optimization) से परे टेल रिस्क (tail risk) और आउटलियर रोबस्टनेस (outlier robustness) जैसी वितरण संबंधी विशेषताओं को प्रभावी ढंग से संबोधित करने में सक्षम बनाया जा सके।

Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Shota Takashiro, Soichiro Nishimori, Takeshi Kojima, Yusuke Iwasawa, Yutaka (…)2026-06-05
💬 NLP

IR3DE: A Linear Router for Large Language Models

यह शोध पत्र IR3DE को प्रस्तुत करता है, जो एक हल्का, रैखिक रिज़ रिग्रेशन-आधारित राउटर है जो किसी दिए गए प्रॉम्प्ट के लिए सबसे उपयुक्त डोमेन-विशेषज्ञ लार्ज लैंग्वेज मॉडल को कुशलतापूर्वक और गतिशील रूप से चुनता है, और नए मॉडल जोड़े जाने पर पुनर्रचना (retraining) की आवश्यकता के बिना मौजूदा बेसलाइन के तुलनीय या उससे बेहतर प्रदर्शन प्राप्त करता है।

Eros Fanì, Oğuzhan Ersoy2026-06-05
💬 NLP

Harnessing Structural Context for Entity Alignment Foundation Models

यह शोध पत्र ContextEA को प्रस्तुत करता है, जो एक हल्का एन्कोडर-डिकोडर ढांचा है जो एनकोडिंग के दौरान क्रॉस-केजी (cross-KG) इंटरैक्शन को मजबूत करके और डिकोडिंग के दौरान मल्टी-लेवल स्ट्रक्चरल एविडेंस के साथ अलाइनमेंट स्कोर को कैलिब्रेट करके एंटिटी अलाइनमेंट फाउंडेशन मॉडल्स को उन्नत करता है, जिससे मौजूदा बेसलाइन्स की तुलना में अनदेखे नॉलेज ग्राफ्स पर बेहतर ट्रांसफर प्रदर्शन प्राप्त होता है।

Xingyu Chen, Yuanning Cui, Zequn Sun, Wei Hu2026-06-05
💬 NLP

Ouvia: A User-centered Framework for Measuring Usability of Speech Translation in Real-World Communication Scenarios

यह शोधपत्र Ouvia को प्रस्तुत करता है, जो एक उपयोगकर्ता-केंद्रित ढांचा है जो वास्तविक दुनिया के एक-से-एक संचार परिदृश्यों में भाषण अनुवाद का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान प्रणालियाँ महत्वपूर्ण जनसांख्यिकीय असमानताओं के साथ सीमित उपयोगिता प्रदान करती हैं और मानक समग्र गुणवत्ता स्कोर की तुलना में QA-आधारित मेट्रिक्स व्यावहारिक प्रभावशीलता के बेहतर भविष्यवक्ता हैं।

Giuseppe Attanasio, Beatrice Savoldi, Daniel Chechelnitsky, Matteo Negri, Marine Carpuat, Maarten Sap, André F. T. Marti (…)2026-06-05
⚡ electrical engineering

Revisiting Lexicon Evaluation in Unsupervised Word Discovery

यह शोध पत्र अनसुपरवाइज्ड वर्ड डिस्कवरी के मूल्यांकन में मानक नॉर्मलाइज्ड एडिट डिस्टेंस मेट्रिक के पूर्वाग्रह की आलोचना करता है और दो नए मेट्रिक्स प्रस्तावित करता है जो लेक्सिकॉन की गुणवत्ता का अधिक सुदृढ़ और सटीक आकलन प्रदान करने के लिए क्लस्टर आकार और वास्तविक वर्गों के वितरण को बेहतर ढंग से ध्यान में रखते हैं।

Simon Malan, Danel Slabbert, Herman Kamper2026-06-05
💬 NLP

The Tell-Tale Norm: 2\ell_2 Magnitude as a Signal for Reasoning Dynamics in Large Language Models

यह शोध पत्र हिडन स्टेट्स (hidden states) के 2\ell_2 नॉर्म को लार्ज लैंग्वेज मॉडल्स में रीजनिंग इंटेंसिटी (reasoning intensity) के लिए एक सिद्धांतगत, मॉडल-अंतर्निहित सिग्नल के रूप में पहचानता है, जो स्पार्स ऑटोएनकोडर (Sparse Autoencoder) फीचर एक्टिवेशन्स के साथ इसके सैद्धांतिक संबंध को प्रदर्शित करता है और तीन ट्रेनिंग-मुक्त, टेस्ट-टाइम स्केलिंग तकनीकों को प्रस्तुत करता है जो विभिन्न बेंचमार्क्स पर रीजनिंग प्रदर्शन में महत्वपूर्ण सुधार करते हैं।

Jinyang Zhang, Hongxin Ding, Yue Fang, Weibin Liao, Muyang Ye, Junfeng Zhao, Yasha Wang2026-06-05
⚡ electrical engineering

FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition

यह शोध पत्र x-vectors के माध्यम से एक फ्रोजन (frozen) SpeechLLM को पैथोलॉजिकल वक्ताओं पर कंडिशन करने के लिए फीचर-वाइज लीनियर मॉड्यूलेशन (FiLM) का उपयोग करते हुए एक पैरामीटर-कुशल दृष्टिकोण प्रस्तावित करता है, जो यह प्रदर्शित करता है कि यह विधि मॉडल की सामान्य संवादात्मक क्षमताओं को संरक्षित करते हुए स्पेनिश और अंग्रेजी पैथोलॉजिकल डेटा पर प्रतिस्पर्धी ऑटोमैटिक स्पीच रिकग्निशन प्रदर्शन प्राप्त करती है।

Fernando López, Santosh Kesiraju, Jordi Luque2026-06-05