🤖 machine learning

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

यह शोध पत्र शैडो मास्क डिस्टिलेशन (Shadow Mask Distillation) प्रस्तुत करता है, जो एक नवीन विधि है जिसे सुदृढीकरण अधिगम (Reinforcement Learning) पोस्ट-ट्रेनिंग के दौरान रोलआउट चरण में KV कैश संपीड़न (KV cache compression) लागू करने से होने वाले गंभीर ऑफ-पॉलिसी बायस (off-policy bias) और ग्रेडिएंट वेरिएंस को कम करने के लिए डिज़ाइन किया गया है, जिससे लंबी-संदर्भ तर्क (long-context reasoning) कार्यों के लिए मेमोरी-कुशल संरेखण सक्षम होता है।

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu2026-05-11
🤖 machine learning

Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility

यह शोध पत्र यह तर्क देता है कि जनरेटिव एआई के मजबूत बेंचमार्क प्रदर्शन और इसकी सीमित वास्तविक दुनिया की उपयोगिता के बीच का अंतर त्रुटिपूर्ण मूल्यांकन प्रथाओं से उत्पन्न होता है, और विशिष्ट परिनियोजन संदर्भों के भीतर मानव परिणामों में निरंतर सुधार को मापने की ओर मूल्यांकन को स्थानांतरित करने के लिए SCU-GenEval ढांचे का प्रस्ताव करता है।

Ishani Mondal, Shweta Bhardwaj2026-05-11
🤖 AI

Knowledge Transfer Scaling Laws for 3D Medical Imaging

यह शोध पत्र 3D मेडिकल इमेजिंग के लिए क्रॉस-डोमेन नॉलेज ट्रांसफर में एसिमेट्रिक, पावर-लॉ स्केलिंग व्यवहारों की पहचान करता है और एक ट्रांसफर-अवेयर डेटा एलोकेशन रणनीति प्रस्तावित करता है जो मानक आनुपातिक सैंपलिंग की तुलना में काफी मजबूत रिप्रेजेंटेशन प्राप्त करने के लिए प्रीट्रेनिंग मिश्रण को अनुकूलित करती है।

Ho Hin Lee, Dongna Du, Chu Wang, Yuankai Huo, Shi Gu, James C. Gee, Yifan Wu2026-05-11
🤖 machine learning

Christoffel-DPS: Optimal sensor placement in diffusion posterior sampling for arbitrary distributions

यह शोध पत्र क्रिस्टोफेल-डीपीएस (Christoffel-DPS) प्रस्तुत करता है, जो क्रिस्टोफेल फलन (Christoffel function) पर आधारित एक वितरण-मुक्त इष्टतम सेंसर प्लेसमेंट ढांचा है जो डिफ्यूजन पोस्टीरियर सैंपलिंग का उपयोग करके मनमाने, गैर-गाऊसी (non-Gaussian) वितरणों के लिए प्रभावी अवस्था अनुमान (state estimation) को सक्षम बनाता है, और कम-सेंसर-बजट वाली स्थितियों में शास्त्रीय गाऊसी-आधारित विधियों और मौजूदा जनरेटिव-मॉडल दृष्टिकोणों दोनों से बेहतर प्रदर्शन करता है।

James Rowbottom, Nick Huang, Carola-Bibiane Schönlieb, Ben Adcock2026-05-11
🤖 machine learning

Dataset Watermarking for Closed LLMs with Provable Detection

यह शोध पत्र क्लोज्ड लार्ज लैंग्वेज मॉडल्स के लिए पहले प्रुवेबल (provable) डेटासेट वॉटरमार्किंग पद्धति को प्रस्तुत करता है, जो यादृच्छिक रूप से चयनित शब्द युग्मों की सह-उपस्थिति आवृत्ति बढ़ाकर पता लगाने योग्य संकेत सम्मिलित करता है और सफलतापूर्वक उन्हें मॉडल आउटपुट में पहचान लेता है, भले ही वॉटरमार्क किया गया डेटा फाइन-ट्यूनिंग टोकन का केवल 1% हो, और यह सब डेटासेट की उपयोगिता को बनाए रखते हुए किया जाता है।

Pengrun Huang, Kamalika Chaudhuri, Yu-Xiang Wang2026-05-11
🤖 machine learning

A Finite-Iteration Theory for Asynchronous Categorical Distributional Temporal-Difference Learning

यह शोध पत्र i.i.d. और मार्कोवियन सैंपलिंग व्यवस्थाओं के तहत एसिंक्रोनस, सिंगल-स्टेट कैटेगोरिकल टेम्पोरल-डिफरेंस लर्निंग के लिए नॉन-एसिम्प्टोटिक अभिसरण गारंटी स्थापित करके मौजूदा फाइनाइट-इटरेशन थ्योरी और व्यावहारिक कार्यान्वयन के बीच के अंतर को पाटता है।

Ege C. Kaya, Abolfazl Hashemi2026-05-11
🤖 machine learning

Temporal Attention for Adaptive Control of Euler-Lagrange Systems with Unobservable Memory

यह शोध पत्र अनऑब्ज़र्वेबल मेमोरी स्टेट्स वाले यूलर-लैग्रेंज सिस्टम के एडेप्टिव कंट्रोल के लिए एक टेम्पोरल अटेंशन-आधारित मेटा-कंट्रोल आर्किटेक्चर प्रस्तावित करता है, जो यह प्रदर्शित करता है कि जबकि एक स्टैटिक अटेंशन-हेड सिलेक्शन स्ट्रैटेजी शॉर्ट-टू-मैच्ड मेमोरी रिजीम्स में डीपर ट्रांसफॉर्मर बेसलाइन्स से बेहतर प्रदर्शन करती है, यह लॉन्ग-मेमोरी परिदृश्यों में विफल हो जाती है, जिससे रनटाइम हेड प्रूनिंग और ग्रोथ के लिए एक डायनेमिक, रिइन्फोर्समेंट-लर्निंग-इंटीग्रेटेड दृष्टिकोण को प्रेरित किया जा सके।

Giansalvo Cirrincione, Adriano Fagiolini2026-05-11
🧬 biology

Better Protein Function Prediction by Modeling Survivorship Bias

यह शोध पत्र Evo-PU को प्रस्तुत करता है, जो एक पॉजिटिव-अनलेबल लर्निंग फ्रेमवर्क है जो विभिन्न वायरल डेटासेट्स में प्रोटीन कार्यक्षमता की भविष्यवाणी करने के लिए विकासवादी उत्परिवर्तन प्रक्रियाओं (evolutionary mutation processes) के माध्यम से सर्वाइवरशिप बायस (survivorship bias) को स्पष्ट रूप से मॉडल करता है ताकि मौजूदा तरीकों से काफी बेहतर प्रदर्शन किया जा सके।

Zhongmou Chao, Poompol Buathong, Ekaterina Selivanovitch, Susan Daniel, Peter I. Frazier2026-05-11
🤖 machine learning

Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment

यह शोध पत्र REPR-ALIGN को प्रस्तुत करता है, जो एक ऐसी विधि है जो डिफ्यूजन लैंग्वेज मॉडल्स के प्रशिक्षण को उनके हिडन स्टेट्स (hidden states) को एक फ्रोजन ऑटोरेग्रेसिव मॉडल के हिडन स्टेट्स के साथ संरेखित करके त्वरित करती है, जिससे सीखे गए सिमेंटिक रिप्रेजेंटेशन्स (semantic representations) को संरक्षित किया जा सके और बिना किसी आर्किटेक्चरल बदलाव या अतिरिक्त पैरामीटर्स के कुशल अनुकूलन को सक्षम बनाया जा सके।

Fred Zhangzhi Peng, Alexis Fox, Anru R. Zhang, Alexander Tong2026-05-11
🤖 machine learning

Towards Fairness under Label Bias in Image Segmentation: Impact, Measurement and Mitigation

यह शोध पत्र एक डेटा-केंद्रित ढांचे को प्रस्तुत करता है जो इमेज सेगमेंटेशन में लेबल पूर्वाग्रह का पता लगाने और उसे कम करने के लिए कॉन्फिडेंट लर्निंग को अनुकूलित करता है, जो व्यवस्थित त्रुटियों और फीचर स्पेस आर्टिफैक्ट्स की पहचान करने के लिए मॉडल के कॉन्फिडेंट प्रेडिक्शन का लाभ उठाता है, जिससे बिना किसी स्वच्छ, निष्पक्ष ग्राउंड ट्रुथ लेबल की आवश्यकता के जनसांख्यिकीय उपसमूहों में समान प्रदर्शन प्राप्त किया जा सके।

Aditya Parikh, Stella Frank, Sneha Das, Aasa Feragen2026-05-11