💬 NLP

Reinforcement Learning from Rich Feedback with Distributional DAgger

यह शोध पत्र DistIL को प्रस्तुत करता है, जो एक वितरण संबंधी (distributional) DAgger-आधारित दृष्टिकोण है जो निरंतर सुधार (monotonic policy improvement) प्राप्त करने के लिए एक फॉरवर्ड क्रॉस-एन्ट्रॉपी ऑब्जेक्टिव के माध्यम से समृद्ध फीडबैक का लाभ उठाता है और मानक RLVR एवं सेल्फ-डिस्टिलेशन विधियों की तुलना में रीजनिंग, कोडिंग और गणितीय कार्यों में बेहतर प्रदर्शन करता है।

Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad2026-06-04
💬 NLP

Typhoon: Towards an Effective Task-Specific Masking Strategy for Pre-trained Language Models

यह शोध पत्र 'टाइफून' (Typhoon) को प्रस्तुत करता है, जो प्री-ट्रेंड लैंग्वेज मॉडल्स के लिए एक टास्क-एडेप्टिव मास्किंग रणनीति है जो ग्रेडिएंट-आधारित टोकन सैलिएंसी का उपयोग करती है, लेकिन कई सीड्स और बैकबोन्स के माध्यम से कठोर मूल्यांकन यह प्रकट करता है कि मानक रैंडम मास्किंग पर इसके स्पष्ट लाभ सांख्यिकीय रूप से महत्वपूर्ण नहीं हैं, जो ऐसी विधियों की पुनरुत्पादकता (reproducibility) पर एक चेतावनी के रूप में कार्य करता है।

Muhammed Shahir Abdurrahman, Hashem Elezabi, Bruce Changlong Xu2026-06-03
📊 statistics

Greed is Good: A Unifying Perspective on Guided Generation

यह शोध पत्र पूर्ववर्ती (posterior) को उत्तरवर्ती (end-to-end) निर्देशित जनरेशन के एक लालची सन्निकटन (greedy approximation) के रूप में फ्रेम करके दोनों को एकीकृत करता है, जिससे एक नई इंटरपोलेशन विधि सक्षम होती है जो फ्लो और डिफ्यूजन मॉडल्स में ट्रेनिंग-फ्री कंट्रोल के लिए कम्प्यूटेशनल लागत और ग्रेडिएंट सटीकता के बीच संतुलन बनाती है।

Zander W. Blasingame, Chen Liu2026-06-03
🤖 AI

Leave it to the Specialist: Repair Sparse LLMs with Sparse Fine-Tuning via Sparsity Evolution

यह शोध पत्र स्पर्सिटी इवोल्यूशन फाइन-ट्यूनिंग (SEFT) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो अपडेट्स को पुनर्वितरित करके और वेट्स को पुन: सक्रिय करके फाइन-ट्यूनिंग के दौरान लार्ज लैंग्वेज मॉडल्स की स्पर्स टोपोलॉजी को गतिशील रूप से विकसित करता है, जिससे स्पर्सिटी के मेमोरी और समय दक्षता के लाभों को बनाए रखते हुए बेहतर टास्क अडैप्टेशन प्रदर्शन प्राप्त किया जा सकता है।

Qiao Xiao, Alan Ansell, Boqian Wu, Lu Yin, Mykola Pechenizkiy, Shiwei Liu, Decebal Constantin Mocanu2026-06-03
🤖 AI

FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs

यह शोध पत्र FlashMLA-ETAP प्रस्तुत करता है, जो एक कुशल ट्रांसपोज़ अटेंशन पाइपलाइन (Efficient Transpose Attention Pipeline) का उपयोग करने वाला एक नवीन ढांचा है, जो WGMMA ऑपरेशन्स को अनुकूलित करके NVIDIA H20 GPU पर मल्टी-हेड लेटेंट अटेंशन (Multi-Head Latent Attention) इन्फरेंस को महत्वपूर्ण रूप से तेज करता है, जिससे उच्च संख्यात्मक स्थिरता बनाए रखते हुए मौजूदा विधियों की तुलना में पर्याप्त गति प्राप्त होती है।

Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong2026-06-03
🤖 machine learning

Curriculum-Adapted Robust Reinforcement Learning for UAV Deconfliction in Adversarial Environments

यह शोध पत्र सुदृढीकरण अधिगम (रिनफोर्समेंट लर्निंग) के लिए एक पाठ्यक्रम-निर्देशित अनुकूलन ढांचे का प्रस्ताव करता है जो अनदेखे GNSS स्पूफिंग हमलों के तहत सुदृढ़ UAV विसंघटन (डीकन्फ्लिक्शन) और सीमित प्रदर्शन ह्रास सुनिश्चित करने के लिए बढ़ती प्रतिकूल तीव्रताओं के बीच टेम्पोरल-डिफरेंस त्रुटि वितरणों को संरेखित करता है।

Deepak Kumar Panda, Adolfo Perrusquia, Weisi Guo2026-06-03
💬 NLP

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

यह शोध पत्र CoMPAS3D प्रस्तुत करता है, जो एक व्यापक डेटासेट और बेंचमार्क है जिसमें विभिन्न कौशल स्तरों के 18 नर्तकों के 3 घंटे के एनोटेटेड पार्टनर साल्सा मोशन (partner salsa motion) शामिल हैं, जिसे मूव लेजिबिलिटी (move legibility) और प्रोफिशिएंसी अप्रोप्रिएटनेस (proficiency appropriateness) के लिए नवीन मेट्रिक्स का उपयोग करके इंटरैक्टिव ह्यूमनॉइड रोबोट्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो मौजूदा किनेमैटिक-आधारित ढांचों की सीमाओं को संबोधित करते हैं।

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica (…)2026-06-03
🤖 AI

Assistax: A Multi-Agent Hardware-Accelerated Reinforcement Learning Benchmark for Assistive Robotics

Assistax एक ओपन-सोर्स, मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग बेंचमार्क है जो सहायक रोबोटिक्स (assistive robotics) के लिए है और यह CPU-आधारित विकल्पों की तुलना में 370 गुना तक तेज़ प्रशिक्षण गति प्राप्त करने के लिए JAX हार्डवेयर एक्सेलेरेशन का लाभ उठाता है, जबकि यह रोबोटिक एजेंटों और विविध मानव भागीदारों के बीच ज़ीरो-शॉट कोऑर्डिनेशन का मूल्यांकन करता है।

Leonard Hinckeldey, Elliot Fosong, Rimvydas Rubavicius, Elle Miller, Trevor McInroe, Fan Zhang, Patricia Wollstadt, Stef (…)2026-06-03
💰 quantitative finance

AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining

यह शोधपत्र AlphaEval को प्रस्तुत करता है, जो एक एकीकृत, समानांतर करने योग्य (parallelizable) और बैकटेस्ट-मुक्त मूल्यांकन ढांचा है, जो मौजूदा मेट्रिक्स की कम्प्यूटेशनल अक्षमताओं और सीमित दायरे को दूर करने के लिए पांच आयामों—पूर्वानुमानित शक्ति, स्थिरता, मजबूती, वित्तीय तर्क और विविधता—में स्वचालित अल्फा माइनिंग मॉडलों का आकलन करता है और ओपन-सोर्स टूल के माध्यम से पुनरुत्पादकता (reproducibility) को बढ़ावा देता है।

Hongjun Ding, Binqi Chen, Jinsheng Huang, Taian Guo, Zhengyang Mao, Guoyi Shao, Lutong Zou, Luchen Liu, Ming Zhang2026-06-03
🤖 machine learning

Learning the Neighborhood: Contrast-Free Multimodal Self-Supervised Molecular Graph Pretraining

यह शोध पत्र C-FREE को प्रस्तुत करता है, जो एक कंट्रास्ट-फ्री (contrast-free) सेल्फ-सुपरवाइज्ड प्रीट्रेनिंग फ्रेमवर्क है जो स्टेट-ऑफ-द-आर्ट मॉलिक्यूलर रिप्रेजेंटेशन लर्निंग प्राप्त करने के लिए ईगो-नेट सबग्राफ प्रेडिक्शन के माध्यम से 2D टोपोलॉजी और 3D कन्फॉर्मर एंसेम्बल्स को एकीकृत करता है, जिसमें बिना किसी नेगेटिव्स या जटिल ऑग्मेंटेशन्स के यह कार्य किया जाता है।

Boshra Ariguib, Mathias Niepert, Andrei Manolache2026-06-03