🤖 machine learning

Unlocking the Potential of Continual Model Merging: An ODE Perspective

यह शोध पत्र ODE-M का प्रस्ताव करता है, जो एक नवीन निरंतर मॉडल विलय (continual model merging) ढांचा है जो पैरामीटर स्पेस में लो-लॉस पथों को ट्रैक करने के लिए एक साधारण अवकल समीकरण (Ordinary Differential Equation) परिप्रेक्ष्य का लाभ उठाता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम किया जा सके और विषम कार्य बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

Lihong Lin, Haidong Kang2026-05-20
🤖 AI

Conflict-Resilient Multi-Agent Reasoning via Signed Graph Modeling

यह शोध पत्र SIGMA को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट रीजनिंग फ्रेमवर्क है जो एजेंटों के बीच विश्वास और संघर्ष संबंधों को स्पष्ट रूप से कैप्चर करने के लिए साइन्ड ग्राफ मॉडलिंग का लाभ उठाता है, जिससे संघर्ष-जागरूक मैसेज पासिंग और वेटेड एग्रीगेशन सक्षम होता है जो सटीकता में मौजूदा तरीकों से और विरोधाभासी संकेतों के विरुद्ध लचीलेपन में उन्हें काफी बेहतर बनाता है।

Longgang He, Longzhu He, Daojing He, Chaozhuo Li2026-05-20
🤖 AI

KappaPlace: Learning Hyperspherical Uncertainty for Visual Place Recognition via Prototype-Anchored Supervision

KappaPlace एक नवीन फ्रेमवर्क है जो विजुअल प्लेस रिकग्निशन (Visual Place Recognition) के लिए बनाया गया है, जो एक प्रोटोटाइप-एंकरड सुपरविजन (Prototype-Anchored supervision) रणनीति पेश करके और इमेज डिस्क्रिप्टर्स को वॉन मिसेस-फिशर (von Mises-Fisher) वेरिएबल्स के रूप में मॉडल करके एलेटोरिक अनसर्टेन्टी (aleatoric uncertainty) की भविष्यवाणी करता है, जिससे मौजूदा विधियों में कैलिब्रेटेड अनसर्टेन्टी की कमी को दूर किया जाता है और विविध बेंचमार्क में उच्च रिट्रीवल रिकॉल (retrieval recall) बनाए रखते हुए कैलिब्रेशन त्रुटि को महत्वपूर्ण रूप से कम किया जाता है।

Maya Yanko, Yoli Shavit2026-05-20
🤖 machine learning

When the Majority Votes Wrong, the Intervention Timing for Test-Time Reinforcement Learning Hides in the Extinction Window

यह शोध पत्र तर्क देता है कि टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग (TTRL) के कथित लाभ अक्सर "करेक्ट-आंसर एक्सटिंक्शन विंडो" में सही उत्तरों के अपरिवर्तनीय दमन के कारण भ्रामक होते हैं, और TTRL-Guard का प्रस्ताव करता है, जो इस क्षति को कम करने और गणितीय तर्क संबंधी बेंचमार्क पर प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए फ्लिप-रेट मॉनिटरिंग और अल्पसंख्यक-संरक्षण तंत्रों का उपयोग करने वाला एक ढांचा है।

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang2026-05-20
🤖 AI

What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

यह शोध पत्र SERL को प्रस्तुत करता है, जो एक चयनात्मक वातावरण-पुनःभारित (selective environment-reweighted) शिक्षण ढांचा है जो दीर्घ-क्षितिज क्रेडिट असाइनमेंट चुनौतियों को संबोधित करने के लिए विशिष्ट, क्रिया-प्रासंगिक पर्यावरणीय फीडबैक को रणनीतिक रूप से आसवन (distill) करके मल्टी-टर्न LLM एजेंटों को उन्नत करता है, और ALFWorld एवं WebShop बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xiaozhe Li, Tianyi Lyu, Yang Li, Yichuan Ma, Peiji Li, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen2026-05-20
🤖 AI

Resilient Byzantine Agreement with Predictions

यह शोध पत्र उस व्यापार-संतुलन (trade-off) को स्पष्ट करता है जो बायज़ेंटाइन एग्रीमेंट (Byzantine Agreement) में स्थिरता (consistency) और सुदृढ़ता (robustness) के बीच होता है जब नोड्स दोषपूर्ण व्यवहार को चिह्नित करने के लिए एक प्रेडिक्टर (predictor) का उपयोग करते हैं, जो सटीक एल्गोरिदम और असंभवता के परिणाम (impossibility results) प्रदान करता है जो यह प्रदर्शित करते हैं कि गैर-प्रमाणित (non-authenticated) और प्रमाणित (authenticated) दोनों सेटिंग्स में गलत भविष्यवाणियों की संख्या के साथ लचीलापन (resilience) रैखिक रूप से कैसे घटता है।

Julien Dallot, Darya Melnyk, Tijana Milentijevic, Stefan Schmid, Patrik Welters2026-05-20
🤖 AI

Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

यह शोध पत्र DMPO को प्रस्तुत करता है, जो एक वितरण-मिलान नीति अनुकूलन (distribution-matching policy optimization) विधि है जो नीति को रिवॉर्ड-अनुपातिक लक्ष्य वितरण के साथ संरेखित करके ऑन-पॉलिसी सुदृढीकरण शिक्षण (on-policy reinforcement learning) में मोड कोलैप्स (mode collapse) को कम करती है, जिससे अन्वेषण (exploration) बना रहता है और NP-हार्ड ऑप्टिमाइज़ेशन और गणितीय तर्क जैसे विविध तर्क कार्यों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Xiaozhe Li, Yang Li, Xinyu Fang, Shengyuan Ding, Peiji Li, Yongkang Chen, Yichuan Ma, Tianyi Lyu, Linyang Li, Dahua Lin (…)2026-05-20
🤖 machine learning

Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models

यह शोध पत्र एक नियंत्रित ढांचा स्थापित करता है जो यह प्रदर्शित करता है कि स्व-पर्यवेक्षित प्री-ट्रेनिंग (self-supervised pre-training) टाइम सीरीज़ वर्गीकरण और विसंगति का पता लगाने (anomaly detection) के लिए पर्याप्त लाभ प्रदान करती है, लेकिन पूर्वानुमान (forecasting) के लिए यह मामूली लाभ ही देती है, एक ऐसा अंतर जो परिशुद्धता-अपरिवर्तनीयता (precision-invariance) के व्यापार-बंद (trade-off) द्वारा संचालित है जो जनरेटिव प्रतिमानों (generative paradigms) के बजाय लेटेंट अलाइनमेंट आर्किटेक्चर (latent alignment architectures) के पक्ष में है।

Noam Major, Kathy Razmadze, Yoli Shavit2026-05-20
🤖 machine learning

Sampling-Based Safe Reinforcement Learning

यह शोध पत्र सैंपलिंग-आधारित सेफ रिइन्फोर्समेंट लर्निंग (SBSRL) प्रस्तुत करता है, जो एक मॉडल-आधारित एल्गोरिदम है जो डायनेमिक्स सैंपल्स में बाधाओं को लागू करके और एपिस्टेमिक अनसर्टेन्टी (epistemic uncertainty) को प्रबंधित करके निरंतर नियंत्रण शिक्षण के दौरान सुरक्षा सुनिश्चित करता है, जिससे सैद्धांतिक सुरक्षा गारंटी प्रदान होती है और सिमुलेशन एवं वास्तविक दुनिया के रोबोटिक हार्डवेयर दोनों में कुशल अन्वेषण प्राप्त होता है।

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As2026-05-20
🤖 AI

BLINKG: A Benchmark for LLM-Integrated Knowledge Graph Generation

यह शोध पत्र BLINKG को प्रस्तुत करता है, जो विषम डेटा स्रोतों को ऑन्टोलॉजी शब्दों से मैप करके नॉलेज ग्राफ जनरेशन को स्वचालित करने में लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल आशाजनक दिखते हैं, फिर भी वे जटिल परिदृश्यों के साथ संघर्ष करते हैं और मजबूत अर्ध-स्वचालित निर्माण प्राप्त करने के लिए आगे के विकास की आवश्यकता है।

Carla Castedo, Enrique Iglesias, Manuel Lama, Alberto Bugarin-Diz, Maria-Esther Vidal, David Chaves-Fraga2026-05-20