🤖 machine learning

Extreme Region Policy Distillation

एक्स्ट्रीम रीजन पॉलिसी डिस्टिलेशन (ERPD), एलएलएम (LLMs) के लिए आरएल (RL) में सैंपल एफिशिएंसी और एसिम्प्टोटिक परफॉरमेंस के बीच के ट्रेड-ऑफ को एग्रेसिव ऑफ-पॉलिसी ऑप्टिमाइजेशन को कंजर्वेटिव ट्रस्ट-रीजन कंस्ट्रेंट्स से अलग करके संबोधित करता है, जो पहले फिक्स्ड डेटा से मैक्सिमल ट्रेनिंग सिग्नल्स निकालता है और फिर उन्हें एक बेस पॉलिसी में डिस्टिल करता है ताकि काफी कम केएल (KL) डाइवर्जेंस के साथ बेहतर प्रदर्शन प्राप्त किया जा सके।

Changyu Chen, Xiting Wang, Rui Yan2026-05-26
🤖 machine learning

Generalized Evidential Deep Learning: From a Bayesian Perspective

यह शोध पत्र एविडेंशियल डीप लर्निंग (EDL) के लिए एक सिद्धांतिक बेयसियन सैद्धांतिक आधार स्थापित करता है और जनरलाइज्ड एविडेंशियल डीप लर्निंग (GEDL) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो मौजूदा EDL वेरिएंट्स को व्यवस्थित रूप से संबंधित करता है और वर्गीकरण (classification), अनिश्चितता अनुमान (uncertainty estimation), और आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन में तुलनीय प्रदर्शन प्रदर्शित करता है।

Yuanye Liu, Yibo Gao, Yuanyang Chen, Xiahai Zhuang2026-05-26
💬 NLP

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

यह शोध पत्र डायनेमिक वेरिएंस-एडेप्टिव एडवांटेज ऑप्टिमाइज़ेशन (DVAO) का प्रस्ताव करता है, जो एक नवीन विधि है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन में मानक स्केलर केशन की प्रशिक्षण अस्थिरता और स्थिर सीमाओं को दूर करने के लिए अनुभवजन्य वेरिएंस के आधार पर मल्टी-रिवॉर्ड कॉम्बिनेशन वेट्स को गतिशील रूप से समायोजित करती है, जिससे कई उद्देश्यों के साथ बड़े भाषा मॉडलों को संरेखित करने में बेहतर प्रदर्शन और स्थिरता प्राप्त होती है।

Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang2026-05-26
📊 statistics

Courtroom Analogy: New Perspective on Uncertainty-Aware Classification

यह शोध पत्र अनिश्चितता-जागरूक वर्गीकरण (uncertainty-aware classification) के लिए "कोर्टरूम एनालॉजी" (courtroom analogy) प्रस्तुत करता है, जो क्लास-विशिष्ट अधिवक्ताओं के बीच एक संरचित बहस के रूप में प्रेडिक्टिव अनसर्टेन्टी को मॉडल करने के लिए 'मिक्सचर ऑफ डिरिचलेट एक्सपर्ट्स' (Mixture of Dirichlet EXperts - MoDEX) आर्किटेक्चर का प्रस्ताव करता है, जिससे अत्यधिक व्याख्या योग्य अनसर्टेन्टी अनुमानों के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Taeseong Yoon, Heeyoung Kim2026-05-26
🤖 machine learning

Analogies between Transformer Layers and Power Method

यह शोध पत्र ट्रांसफॉर्मर परतों और पावर मेथड के बीच एक सादृश्य स्थापित करता है, जो यह प्रदर्शित करता है कि टोकन, वैल्यू (value) और आउटपुट वेट मैट्रिसेस (output weight matrices) के गुणनफल के मुख्य आइजनवेक्टर (principal eigenvector) के साथ संरेखित होते हैं, जो एक ऐसी घटना है जिसे साझा-भार वाले मॉडलों (shared-weight models) में विश्लेषणात्मक रूप से सिद्ध किया जा सकता है और जिसका उपयोग ट्रांसफॉर्मर के आउटपुट को मनचाहे दिशाओं की ओर मोड़ने के लिए किया जा सकता है।

Chenglong Li, Claudio Altafini2026-05-26
💬 NLP

When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

यह शोध पत्र प्रकट करता है कि 'वीक-टू-स्ट्रॉन्ग प्रेफरेंस लर्निंग' अक्सर वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के दौरान रिप्रेजेंटेशनल ड्रिफ्ट के कारण विफल हो जाता है, और प्रीट्रेन मॉडल के स्पेस से अत्यधिक विचलन को नियंत्रित करने के लिए एक "रिप्रेजेंटेशन एंकरिंग" रेगुलराइज़र का प्रस्ताव करता है, जिससे इन-डिस्ट्रीब्यूशन प्रदर्शन को बनाए रखते हुए आउट-ऑफ-डिस्ट्रीब्यूशन ट्रांसफर में सुधार होता है।

Khoi Le, Tri Cao, Phong Nguyen, Cong-Duy Nguyen, Anh Tuan Luu, Miao Chunyan, See-Kiong Ng, Thong Nguyen2026-05-26
🤖 machine learning

Opportunistic Target Selection: Early Directional Commitment for Query-Efficient Black-Box Adversarial Attacks

यह शोध पत्र ऑपर्चुनिस्टिक टारगेट सिलेक्शन (OTS) को प्रस्तुत करता है, जो एक क्वेरी-कुशल ब्लैक-बॉक्स एडवरसैरियल अटैक रैपर है जो हमले के प्रक्षेपवक्र (ट्रैजेक्टरी) के दौरान ही सबसे आशाजनक गैर-सत्य वर्ग (नॉन-ट्रू क्लास) पर गतिशील रूप से लॉक हो जाता है, जिससे रैंडम-सर्च हमलों पर सफलता दर में उल्लेखनीय सुधार होता है और क्वेरी काउंट कम होता है, जबकि यह ग्रेडिएंट-एस्टिमेशन परिदृश्यों और एडवरसरियली-ट्रेन्ड मॉडल्स पर अपनी रेडंडेंसी को भी प्रकट करता है।

Florent Tariolle, Florian Yger2026-05-26
🤖 AI

FLOATBench: A Dataset and Benchmark for Floating Offshore Wind Turbine Tower Fatigue

यह शोध पत्र FLOATBench प्रस्तुत करता है, जो 22 मेगावाट के फ्लोटिंग ऑफशोर विंड टर्बाइनों के उच्च-सटीकता वाले सिमुलेशन से प्राप्त 5,80,000 से अधिक थकान-क्षति (fatigue-damage) लेबल वाला एक सार्वजनिक डेटासेट और बेंचमार्क है, जिसे एक नवीन रिजीम-अवेयर (regime-aware) प्रोटोकॉल के माध्यम से सरोगेट मॉडल के मूल्यांकन को मानकीकृत करने के लिए डिज़ाइन किया गया है, जो गहरे पानी की पवन ऊर्जा अनुप्रयोगों में पारंपरिक रैंडम-स्प्लिट सत्यापन की सीमाओं को संबोधित करता है।

João Alves Ribeiro, Bruno Alves Ribeiro, Francisco Pimenta, Sérgio M. O. Tavares, Faez Ahmed2026-05-26
📊 statistics

The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible

यह शोध पत्र "व्यवहारात्मक विश्वसनीयता त्रिशंकु" (Behavioral Credibility Trilemma) को सिद्ध करता है, जो यह दर्शाता है कि कोई भी सुदृढीकरण शिक्षण नीति (reinforcement learning policy) तर्कसंगत निरीक्षण के तहत अधिकतम सहायकता, इष्टतम अंशांकन (optimal calibration) और पूर्ण स्वायत्तता को एक साथ प्राप्त नहीं कर सकती है क्योंकि स्वायत्त कार्रवाई के प्रोत्साहन स्वाभाविक रूप से आत्मविश्वास रिपोर्टिंग को विकृत करते हैं, जो एक सैद्धांतिक असंभवता है जिसकी पुष्टि बड़े पैमाने पर प्रयोगों द्वारा की गई है और जिसे केवल प्रतिबद्धता या डोमेन पृथक्करण के माध्यम से ही हल किया जा सकता है।

Lauri Lovén, Nam Do, Hassan Mehmood, Dinesh Kumar Sah, Sasu Tarkoma2026-05-26
🤖 machine learning

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

यह शोध पत्र लेटेंट-अलाइन्ड वैल्यू लर्निंग (LAVL) को प्रस्तुत करता है, जो एक ऑफलाइन गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग एल्गोरिदम है जो लंबी अवधि के कार्यों में त्रुटिपूर्ण सामान्यीकरण से उबरने के लिए पदानुक्रमित योजना (hierarchical planning) के साथ लेटेंट-रिप्रेजेंटेशन-आधारित वैल्यू जनरलाइजेशन को एकीकृत करता है, और OGBench पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh2026-05-26