📊 statistics

Targeted Synthetic Control Method

यह शोध पत्र टार्गेटेड सिंथेटिक कंट्रोल (TSC) पद्धति को प्रस्तुत करता है, जो एक लचीला दो-चरणीय अनुमानक (estimator) है जो स्थिर, उत्तल (convex) काउंटरफैक्टुअल अनुमान प्राप्त करने के लिए लक्षित डीबायसिंग अपडेट के माध्यम से प्रारंभिक सिंथेटिक कंट्रोल वेट्स को परिष्कृत करता है और जो सटीकता में मौजूदा अत्याधुनिक विधियों से लगातार बेहतर प्रदर्शन करता है।

Yuxin Wang, Dennis Frauen, Emil Javurek, Konstantin Hess, Yuchen Ma, Stefan Feuerriegel2026-05-12
🤖 AI

SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization

यह शोध पत्र SE-Bench प्रस्तुत करता है, जो एक नैदानिक वातावरण (diagnostic environment) है जो पूर्व ज्ञान और तर्क जटिलता से ज्ञान के आंतरिककरण (knowledge internalization) को अलग करके स्वयं-विकास (self-evolution) का कड़ाई से बेंचमार्किंग करने के लिए NumPy लाइब्रेरी को अस्पष्ट (obfuscate) करता है, जिससे यह पता चलता है कि नए ज्ञान को मॉडल के भार (weights) में समाहित करने के लिए ओपन-बुक ट्रेनिंग या मानक RL की तुलना में क्लोज्ड-बुक ट्रेनिंग और सेल्फ-प्ले अधिक प्रभावी हैं।

Jiarui Yuan, Tailin Jin, Weize Chen, Zeyuan Liu2026-05-12
🤖 machine learning

Disentangled Representation Learning via Flow Matching

यह शोध पत्र डिसेंटैंगलमेंट (disentanglement) को एक कॉम्पैक्ट लेटेंट स्पेस में फैक्टर-कंडीशन्ड फ्लो सीखने के रूप में प्रस्तुत करते हुए और एक नॉन-ओवरलैप रेगुलराइज़र के माध्यम से स्पष्ट सिमेंटिक अलाइनमेंट लागू करते हुए, डिसेंटैंगलड रिप्रेजेंटेशन लर्निंग के लिए एक फ्लो मैचिंग-आधारित फ्रेमवर्क प्रस्तावित करता है, जो मौजूदा डिफ्यूजन-आधारित विधियों की तुलना में डिसेंटैंगलमेंट स्कोर, कंट्रोलेबिलिटी और सैंपल फिडेलिटी में बेहतर प्रदर्शन प्राप्त करता है।

Jinjin Chi, Taoping Liu, Mengtao Yin, Ximing Li, Yongcheng Jing, Jialie Shen, Leszek Rutkowski, Dacheng Tao2026-05-12
🤖 machine learning

CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers

यह शोध पत्र CORP का प्रस्ताव करता है, जो एक क्लोज्ड-फॉर्म वन-शॉट स्ट्रक्चर्ड प्रूनिंग विधि है जो बिना रिट्रेनिंग या फाइन-ट्यूनिंग के उच्च सटीकता प्राप्त करने के लिए केवल अनलेबल डेटा और एफ़ाइन रिकंस्ट्रक्शन का उपयोग करके ट्रांसफॉर्मर्स में MLP और अटेंशन घटकों को हटा देता है।

Boxiang Zhang, Baijian Yang2026-05-12
📊 statistics

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

यह शोध पत्र ff-GRPO और ff-HAL को पेश करके डाइवर्जेंस-आधारित प्रेफरेंस अलाइनमेंट (preference alignment) को सामान्य LLM अलाइनमेंट तक विस्तारित करता है, जो रिवॉर्ड-आधारित रीजनिंग (reward-based reasoning) में सुधार करने और सेफ्टी अलाइनमेंट में रिवॉर्ड हैकिंग (reward hacking) को कम करने के लिए ff-डाइवर्जेंस एस्टीमेशन का लाभ उठाते हैं।

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song2026-05-12
🔢 mathematics

Achieving Better Local Regret Bound for Online Non-Convex Bilevel Optimization

यह शोध पत्र अनुकूलित (adaptive) और सिंगल-लूप एल्गोरिदम प्रस्तावित करके ऑनलाइन नॉन-कॉन्वेक्स बाइलेवल ऑप्टिमाइज़ेशन के लिए इष्टतम स्थानीय रिग्रेट बाउंड्स स्थापित करता है, जो कुशल ग्रेडिएंट मूल्यांकन जटिलताओं के साथ मानक और विंडो-एवरेज सेटिंग्स दोनों में बेहतर प्रदर्शन प्राप्त करते हैं।

Tingkai Jia, Haiguang Wang, Cheng Chen2026-05-12
🤖 machine learning

Breaking the Grid: Distance-Guided Reinforcement Learning in Large Discrete Action Spaces

यह शोध पत्र डिस्टेंस-गाइडेड रिइन्फोर्समेंट लर्निंग (DGRL) प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो बड़े डिस्क्रीट एक्शन स्पेस (1020^{20} तक एक्शन) में 'कर्स ऑफ डाइमेंशनैलिटी' पर विजय पाने के लिए सैंपल्ड डायनेमिक नेबरहुड्स और डिस्टेंस-आधारित अपडेट्स को संयोजित करके पॉलिसी ऑप्टिमाइज़ेशन को एक स्थिर रिग्रेशन टास्क में बदल देता है, जिससे अत्याधुनिक तरीकों की तुलना में महत्वपूर्ण प्रदर्शन और अभिसरण (कन्वर्जेंस) सुधार प्राप्त होता है।

Heiko Hoppe, Fabian Akkerman, Wouter van Heeswijk, Maximilian Schiffer2026-05-12
🤖 machine learning

ERIS: Enhancing Privacy and Scalability in Federated Learning via Federated Shard Aggregation

ERIS एक नवीन फेडरेटेड लर्निंग फ्रेमवर्क है जो 'फेडरेटेड शार्ड एग्रीगेशन' को पेश करके अरबों-पैरामीटर वाले मॉडल्स के लिए गोपनीयता और स्केलेबिलिटी को बढ़ाता है ताकि क्लाइंट-साइड अपडेट्स को कई एग्रीगेटर्स के बीच वितरित किया जा सके, जिससे केंद्रीय बाधाओं को समाप्त किया जा सके और सूचना रिसाव को सीमित किया जा सके, जबकि भारी क्रिप्टोग्राफी पर निर्भर किए बिना अभिसरण (convergence) और मॉडल उपयोगिता को बनाए रखा जा सके।

Dario Fenoglio, Pasquale Polverino, Jacopo Quizi, Martin Gjoreski, Akash Dhasade, Marc Langheinrich2026-05-12
⚡ electrical engineering

From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement Networks

यह शोध पत्र यह प्रदर्शित करता है कि वॉयस एक्टिविटी डिटेक्शन (VAD), शोर वर्गीकरण (noise classification) और फंडामेंटल फ्रीक्वेंसी एस्टीमेशन जैसे सहायक सिग्नल गुणों की सटीक भविष्यवाणी एक स्पीच एनहांसमेंट नेटवर्क के आंतरिक डायनेमिक प्रूनिंग मास्क से की जा सकती है, जिससे अलग मॉडलों की आवश्यकता समाप्त हो जाती है और कुशल, गोपनीयता-संरक्षित ऑन-डिवाइस प्रोसेसिंग सक्षम होती है।

Riccardo Miccini, Clément Laroche, Tobias Piechowiak, Xenofon Fafoutis, Luca Pezzarossa2026-05-12
🤖 machine learning

Fully First-Order Algorithms for Online Bilevel Optimization

यह शोध पत्र नॉनकॉन्वेक्स-स्ट्रॉन्गली कॉनवेक्स ऑनलाइन बाइलेवल ऑप्टिमाइज़ेशन के लिए एक पूर्णतः फर्स्ट-ऑर्डर एल्गोरिदम प्रस्तावित करता है जो समस्या को असमानता बाधाओं (इनीक्वलिटी कंस्ट्रेंट्स) के साथ पुनर्गठित करके हेसियन-वेक्टर उत्पादों की आवश्यकता को समाप्त करता है, जिससे बेहतर रिग्रेट बाउंड्स प्राप्त होते हैं और सैद्धांतिक विश्लेषण एवं संख्यात्मक प्रयोगों के माध्यम से व्यवहार्यता प्रदर्शित होती है।

Tingkai Jia, Cheng Chen2026-05-12