🤖 machine learning

Active Learners as Efficient PRP Rerankers

यह शोध पत्र पेयरवाइज़ रैंकिंग प्रॉम्प्टिंग (PRP) को एक एक्टिव लर्निंग समस्या के रूप में पुनर्गठित करता है ताकि एक शोर-रोधी (noise-robust) रीरैंकिंग फ्रेमवर्क विकसित किया जा सके जो सिंगल-कॉल रैंडमाइज्ड-डायरेक्शन ओरैकल का उपयोग करके टॉप-K रैंकिंग दक्षता में सुधार करता है और पोजीशन बायस को कम करता है।

Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero Santiago Mauricio Barron Bucolo, Juan Wisznia, Luciano del (…)2026-05-15
⚡ electrical engineering

Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability

यह शोध पत्र एक हल्के, एक्शन-कंडीशन्ड रिस्क-गेटिंग सुदृढीकरण शिक्षण (reinforcement learning) तरीके का प्रस्ताव करता है जो एक कॉम्पैक्ट हिस्ट्री-आधारित रिस्क प्रेडिक्टर का उपयोग करके आंशिक अवलोकन (partial observability) के तहत सुरक्षा-महत्वपूर्ण नियंत्रण का अनुमान लगाता है ताकि रिवॉर्ड-सीकिंग और रूढ़िवादी व्यवहारों के बीच गतिशील रूप से संतुलन बनाया जा सके, जिससे ग्लूकोज विनियमन और नेविगेशन कार्यों में बिलीफ-स्पेस प्लानिंग और मानक सेफ-आरएल बेसलाइनों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Yushen Liu, Yin-Jen Chen, Ziyi Chen, Tao Wang, Heng Huang, Xugui Zhou, Yanfu Zhang2026-05-15
🤖 machine learning

Not All Timesteps Matter Equally: Selective Alignment Knowledge Distillation for Spiking Neural Networks

यह शोध पत्र सेलेक्टिव एलाइनमेंट नॉलेज डिस्टिलेशन (SeAl-KD) का प्रस्ताव करता है, जो स्पाइकिंग न्यूरल नेटवर्क के लिए एक नवीन विधि है जो सभी टाइमस्टेप्स पर समान एलाइनमेंट लागू करने के बजाय, टाइमस्टेप कॉन्फिडेंस और समानता के आधार पर क्लास-लेवल और टेम्पोरल नॉलेज को चयनात्मक रूप से संरेखित करके प्रदर्शन में सुधार करती है।

Kai Sun, Peibo Duan, Yongsheng Huang, Guowei Zhang, Benjamin Smith, Nanxu Gong, Levin Kuhlmann2026-05-15
🤖 machine learning

Dynamics of the Transformer Residual Stream: Coupling Spectral Geometry to Network Topology

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के जैकोबियन आइजनडिकंपोजिशन (Jacobian eigendecomposition) का विश्लेषण करता है यह प्रकट करने के लिए कि प्रशिक्षण रोटेशन-प्रधान प्रारंभिक परतों से सममित (सिमेट्रिक) अंतिम परतों तक एक एकदिष्ट स्पेक्ट्रल ग्रेडिएंट (monotonic spectral gradient) प्रेरित करता है, जो एक लो-रैंक बॉटलनेक (low-rank bottleneck) बनाता है जो नेटवर्क के कार्यात्मक टोपोलॉजी (functional topology) को विक्षोभ प्रसार (perturbation propagation) और संपीड़न (compression) से गतिशील रूप से जोड़ता है।

Jesseba Fernando, Grigori Guitchounts2026-05-15
💻 computer science

Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

यह शोध पत्र AIVAT वेरिएंस रिडक्शन तकनीक में महत्वपूर्ण कमजोरियों की पहचान करता है, विशेष रूप से पैथोलॉजिकल सैंपल वेरिएंस और p-हैकिंग के जोखिमों को, जब डेटा अवलोकन से पहले ह्यूरिस्टिक वैल्यू फंक्शन को स्थिर नहीं किया जाता है, और मल्टीएजेंट प्रदर्शन मूल्यांकन में महत्वपूर्ण अतिरिक्त वेरिएंस रिडक्शन प्राप्त करने के लिए ह्यूरिस्टिक अनिश्चितता को प्रसारित करने की एक विधि प्रस्तावित करता है।

Juho Kim, Tuomas Sandholm2026-05-15
💻 computer science

Parallelizing Counterfactual Regret Minimization

यह शोध पत्र एक सामान्यीकृत समानांतरकरण ढांचे (parallelization framework) को प्रस्तुत करता है जो काउंटरफैक्चुअल रिग्रेट मिनिमाइजेशन (CFR) एल्गोरिदम को लीनियर अलजेब्रा ऑपरेशन्स के रूप में पुनर्गठित करता है, जिससे GPU-त्वरित कार्यान्वयन सक्षम होता है जो मौजूदा CPU-आधारित विधियों की तुलना में चार गुना अधिक क्रम (orders of magnitude) तक की गति वृद्धि प्राप्त करता है।

Juho Kim, Tuomas Sandholm2026-05-15
💻 computer science

Watermarking Game-Playing Agents in Perfect-Information Extensive-Form Games

यह शोध पत्र LLM वॉटरमार्किंग तकनीकों को अनुकूलित करके परफेक्ट-इंफॉर्मेशन एक्सटेंसिव-फॉर्म गेम्स में गेम-प्लेइंग एजेंट्स को वॉटरमार्क करने की एक विधि प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण रणनीति की गुणवत्ता पर नगण्य प्रभाव के साथ अनधिकृत AI उपयोग का विश्वसनीय पता लगाने की अनुमति देता है।

Juho Kim, Fei Fang, Tuomas Sandholm2026-05-15
🤖 machine learning

MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification

MetaMoE एक गोपनीयता-संरक्षण ढांचा है जो सार्वजनिक प्रॉक्सी डेटा के विविधता-जागरूक चयन का लाभ उठाकर स्वतंत्र रूप से प्रशिक्षित, डोमेन-विशिष्ट विशेषज्ञों को एक एकल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल में एकीकृत करता है ताकि संवेदनशील क्लाइंट डेटा तक पहुँच बनाए बिना निजी वितरण का अनुमान लगाया जा सके और विशेषज्ञ शिक्षण को समन्वित किया जा सके।

Weisen Jiang, Shuhao Chen, Sinno Jialin Pan2026-05-15
💬 NLP

Web Agents Should Adopt the Plan-Then-Execute Paradigm

यह शोध पत्र तर्क देता है कि वेब एजेंटों को प्रॉम्प्ट इंजेक्शन जोखिमों को कम करने के लिए डिफ़ॉल्ट ReAct दृष्टिकोण के बजाय "योजना-फिर-निष्पादन" (plan-then-execute) प्रतिमान को अपनाना चाहिए, और यह दावा करता है कि इस बदलाव में प्राथमिक बाधा एआई मॉडलिंग की सीमाएं नहीं बल्कि टाइप किए गए, सिमेंटिक वेबसाइट एपीआई का अभाव है।

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner2026-05-15
💬 NLP

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

यह शोध पत्र MMGuard का प्रस्ताव करता है, जो एक सक्रिय रक्षा तंत्र है जो बड़े विजन-लैंग्वेज मॉडल्स (Large Vision-Language Models) के अनधिकृत फाइन-ट्यूनिंग को रोकने के लिए मानव-अदृश्य विक्षोभों (human-imperceptible perturbations) को इंजेक्ट करके और क्रॉस-मोडल बाइंडिंग्स को बाधित करके अनलर्नेबल मल्टीमॉडल उदाहरण उत्पन्न करता है, जिससे डेटा मालिकों के कॉपीराइट और गोपनीयता की रक्षा होती है।

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu2026-05-15