🤖 machine learning

Efficient Estimation of Kernel Surrogate Models for Task Attribution

यह शोध पत्र स्केलेबल टास्क एट्रिब्यूशन के लिए गैररेखीय टास्क इंटरैक्शन को सटीक रूप से पकड़ने हेतु एक कुशल ग्रेडिएंट-आधारित अनुमान प्रक्रिया के साथ कर्नेल सरोगेट मॉडल पेश करता है, जो ग्राउंड ट्रुथ के साथ सहसंबंध और डाउनस्ट्रीम डेटा चयन प्रदर्शन के मामले में लीनियर सरोगेट्स और इन्फ्लुएंस फंक्शन्स से काफी बेहतर प्रदर्शन करता है।

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang2026-05-12
🤖 machine learning

Federated Concept-Based Models: Interpretable models with distributed supervision

यह शोध पत्र फेडरेटेड कॉन्सेप्ट-आधारित मॉडल्स (F-CMs) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो डेटा गोपनीयता बनाए रखते हुए विकसित होते पर्यवेक्षण सेटों के अनुसार आर्किटेक्चर को गतिशील रूप से अनुकूलित करने और कॉन्सेप्ट-स्तरीय जानकारी को एकत्रित करके वितरित संस्थानों में व्याख्या योग्य डीप लर्निंग मॉडल्स को प्रशिक्षित करने में सक्षम बनाता है।

Dario Fenoglio, Arianna Casanova, Francesco De Santis, Gabriele Dominici, Johannes Schneider, Pietro Barbiero, Giovanni (…)2026-05-12
📊 statistics

Beyond Accuracy: Evaluating Posterior Fidelity of Diffusion Inverse Solvers

यह शोध पत्र पोस्टीरियर फिडेलिटी (posterior fidelity) के एक व्यवस्थित अध्ययन को पेश करके और एक ग्राउंड-ट्रुथ-मुक्त मीट्रिक, स्कोर-आधारित कर्नेल स्टीन डिस्क्रीपेंसी (score-based Kernel Stein Discrepancy), का प्रस्ताव देकर मौजूदा डिफ्यूजन इनवर्स सॉल्वर बेंचमार्क की उस सीमा को संबोधित करता है जो केवल पुनर्निर्माण सटीकता (reconstruction accuracy) पर ध्यान केंद्रित करते हैं, ताकि यह मूल्यांकन किया जा सके कि उत्पन्न नमूने नियंत्रित सिमुलेशन और वास्तविक दुनिया की इनवर्स समस्याओं में लक्षित पोस्टीरियर वितरण को कितनी अच्छी तरह कैप्चर करते हैं।

Xiaoyu Qiu, Taewon Yang, Zhanhao Liu, Guanyang Wang, Liyue Shen2026-05-12
🤖 AI

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

यह शोध पत्र Agent-Omit को पेश करता है, जो एक एकीकृत प्रशिक्षण ढांचा (unified training framework) है जो कोल्ड-स्टार्ट फाइन-ट्यूनिंग और ओमिट-अवेयर रीइन्फोर्समेंट लर्निंग के माध्यम से LLM एजेंटों को अनावश्यक विचारों और अवलोकनों को अनुकूल रूप से छोड़ने में सक्षम बनाकर उनकी दक्षता को बढ़ाता है, जिससे कई बेंचमार्क में बेहतर प्रभावशीलता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu2026-05-12
📊 statistics

Targeted Synthetic Control Method

यह शोध पत्र टार्गेटेड सिंथेटिक कंट्रोल (TSC) पद्धति को प्रस्तुत करता है, जो एक लचीला दो-चरणीय अनुमानक (estimator) है जो स्थिर, उत्तल (convex) काउंटरफैक्टुअल अनुमान प्राप्त करने के लिए लक्षित डीबायसिंग अपडेट के माध्यम से प्रारंभिक सिंथेटिक कंट्रोल वेट्स को परिष्कृत करता है और जो सटीकता में मौजूदा अत्याधुनिक विधियों से लगातार बेहतर प्रदर्शन करता है।

Yuxin Wang, Dennis Frauen, Emil Javurek, Konstantin Hess, Yuchen Ma, Stefan Feuerriegel2026-05-12
🤖 AI

SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization

यह शोध पत्र SE-Bench प्रस्तुत करता है, जो एक नैदानिक वातावरण (diagnostic environment) है जो पूर्व ज्ञान और तर्क जटिलता से ज्ञान के आंतरिककरण (knowledge internalization) को अलग करके स्वयं-विकास (self-evolution) का कड़ाई से बेंचमार्किंग करने के लिए NumPy लाइब्रेरी को अस्पष्ट (obfuscate) करता है, जिससे यह पता चलता है कि नए ज्ञान को मॉडल के भार (weights) में समाहित करने के लिए ओपन-बुक ट्रेनिंग या मानक RL की तुलना में क्लोज्ड-बुक ट्रेनिंग और सेल्फ-प्ले अधिक प्रभावी हैं।

Jiarui Yuan, Tailin Jin, Weize Chen, Zeyuan Liu2026-05-12
🤖 machine learning

Disentangled Representation Learning via Flow Matching

यह शोध पत्र डिसेंटैंगलमेंट (disentanglement) को एक कॉम्पैक्ट लेटेंट स्पेस में फैक्टर-कंडीशन्ड फ्लो सीखने के रूप में प्रस्तुत करते हुए और एक नॉन-ओवरलैप रेगुलराइज़र के माध्यम से स्पष्ट सिमेंटिक अलाइनमेंट लागू करते हुए, डिसेंटैंगलड रिप्रेजेंटेशन लर्निंग के लिए एक फ्लो मैचिंग-आधारित फ्रेमवर्क प्रस्तावित करता है, जो मौजूदा डिफ्यूजन-आधारित विधियों की तुलना में डिसेंटैंगलमेंट स्कोर, कंट्रोलेबिलिटी और सैंपल फिडेलिटी में बेहतर प्रदर्शन प्राप्त करता है।

Jinjin Chi, Taoping Liu, Mengtao Yin, Ximing Li, Yongcheng Jing, Jialie Shen, Leszek Rutkowski, Dacheng Tao2026-05-12
🤖 machine learning

CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers

यह शोध पत्र CORP का प्रस्ताव करता है, जो एक क्लोज्ड-फॉर्म वन-शॉट स्ट्रक्चर्ड प्रूनिंग विधि है जो बिना रिट्रेनिंग या फाइन-ट्यूनिंग के उच्च सटीकता प्राप्त करने के लिए केवल अनलेबल डेटा और एफ़ाइन रिकंस्ट्रक्शन का उपयोग करके ट्रांसफॉर्मर्स में MLP और अटेंशन घटकों को हटा देता है।

Boxiang Zhang, Baijian Yang2026-05-12
📊 statistics

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

यह शोध पत्र ff-GRPO और ff-HAL को पेश करके डाइवर्जेंस-आधारित प्रेफरेंस अलाइनमेंट (preference alignment) को सामान्य LLM अलाइनमेंट तक विस्तारित करता है, जो रिवॉर्ड-आधारित रीजनिंग (reward-based reasoning) में सुधार करने और सेफ्टी अलाइनमेंट में रिवॉर्ड हैकिंग (reward hacking) को कम करने के लिए ff-डाइवर्जेंस एस्टीमेशन का लाभ उठाते हैं।

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song2026-05-12
🔢 mathematics

Achieving Better Local Regret Bound for Online Non-Convex Bilevel Optimization

यह शोध पत्र अनुकूलित (adaptive) और सिंगल-लूप एल्गोरिदम प्रस्तावित करके ऑनलाइन नॉन-कॉन्वेक्स बाइलेवल ऑप्टिमाइज़ेशन के लिए इष्टतम स्थानीय रिग्रेट बाउंड्स स्थापित करता है, जो कुशल ग्रेडिएंट मूल्यांकन जटिलताओं के साथ मानक और विंडो-एवरेज सेटिंग्स दोनों में बेहतर प्रदर्शन प्राप्त करते हैं।

Tingkai Jia, Haiguang Wang, Cheng Chen2026-05-12