🤖 machine learning

Speedrunning Tabular Foundation Model Pretraining

यह शोध पत्र nanoTabPFN मॉडल के लिए एक समुदाय-संचालित "स्पीडरन" चुनौती पेश करता है, जहाँ योगदानकर्ता एक निश्चित डाउनस्ट्रीम प्रदर्शन लक्ष्य प्राप्त करने के लिए प्रीट्रेनिंग समय और डेटा आवश्यकताओं को नाटकीय रूप से कम करने के लिए प्रतिस्पर्धा करते हैं, जिससे टैबुलर फाउंडेशन मॉडल अनुसंधान के लिए इटरेशन चक्र में तेजी आती है।

Salih Bora Ozturk, Alexander Pfefferle, Frank Hutter2026-06-03
🤖 machine learning

A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners

यह शोध पत्र इस बात की जांच करता है कि क्या सुपरवाइज्ड फाइन-ट्यून्ड (supervised fine-tuned) एलएलएम (LLMs) शास्त्रीय नियोजन (classical planning) के लिए आंतरिक विश्व मॉडल (internal world models) सीखते हैं, जो यह प्रकट करता है कि जबकि ये मॉडल क्रिया की वैधता और अवस्था विधेयों (state predicates) को रैखिक रूप से एनकोड करते हैं, अंतर्निहित विश्व मॉडल को पुनः प्राप्त करने की उनकी क्षमता प्रशिक्षण के दौरान व्यापक अवस्था स्थान कवरेज (state space coverage) द्वारा महत्वपूर्ण रूप से बढ़ जाती है।

Patrick Emami, Nan Qiang, Peter Graf2026-06-03
🤖 machine learning

Staying Alive: Uncensored Survival Analysis with Tabular Foundation Models

यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free) सर्वाइवल रिग्रेशन पद्धति प्रस्तुत करता है जो राइट-सेंसर्ड (right-censored) डेटा को पुनरावृत्ति से भरने (iteratively impute) और एक एसेलेरेटेड फेलियर टाइम (Accelerated Failure Time) मॉडल बनाने के लिए टैबुलर फाउंडेशन मॉडल्स का लाभ उठाता है, जो मानक बेंचमार्क पर पारंपरिक प्रशिक्षित मॉडलों के मुकाबले प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Mariana Vargas Vieyra2026-06-03
🤖 machine learning

Multi2^2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

यह शोधपत्र Multi2^2 प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट फ्रेमवर्क है जो ऑब्जेक्टिव ड्रिफ्ट (उद्देश्य विचलन) को कम करने और गतिशील संवादात्मक वातावरणों में सुदृढ़, दीर्घकालिक निर्णय लेने के लिए एक सुपरवाइज्ड फाइन-ट्यून्ड हाई-लेवल प्लानर को रीइन्फोर्समेंट लर्निंग-आधारित लो-लेवल एक्जीक्यूटर के साथ जोड़ता है, जिसके साथ तीन नए बेंचमार्क डेटासेट भी जारी किए गए हैं।

Sangeun Park, Minhae Kwon2026-06-03
📊 statistics

Resource-Constrained Adaptive Inference for Sequential Pricing

यह शोध पत्र एक लक्ष्य-जागरूक (target-aware) नियंत्रक का प्रस्ताव करके उन संसाधन-सीमित मूल्य निर्धारण नियंत्रकों की चुनौती को संबोधित करता है जो लक्षित मूल्य पड़ोस को अव्यवहार्य बना सकते हैं, जो व्यवहार्य बैंड प्रमाणित करता है, स्थानीय घनत्वों को लॉग करता है, और स्टूडेंटाइज्ड अंतराल (studentized intervals) तथा रिग्रेट बाउंड्स प्राप्त करने के लिए एक वास्तविक सूचना घड़ी (realized information clock) का उपयोग करता है, जिससे यह प्रदर्शित होता है कि पर्याप्त स्थानीय गति के बिना विश्वसनीय अनुमान के लिए सस्ता अन्वेषण अक्सर अपर्याप्त होता है।

Ruicheng Ao, Jiashuo Jiang, David Simchi-Levi2026-06-03
🤖 machine learning

Neural Navigation Functions for Zero-Shot Generalizable Motion Planning

यह शोध पत्र न्यूरल नेविगेशन फंक्शन्स (Neural Navigation Functions) को प्रस्तुत करता है, जो एक हाइब्रिड दृष्टिकोण है जो अनदेखी परिवेश ज्यामितिओं में मजबूत ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) करने में सक्षम, टकराव-मुक्त और वैश्विक रूप से सुसंगत नेविगेशन नीतियों को उत्पन्न करने के लिए एक संरचित एलिप्टिक प्लानर के भीतर डेटा-संचालित PDE गुणांकों को सीखता है।

Benjamin D. Shaffer, Pei-An Hsieh, Brooks Kinch, Nathaniel Trask, M. Ani Hsieh2026-06-03
🤖 machine learning

Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

यह शोध पत्र TAO-RL का प्रस्ताव करता है, जो एजेंटिक सुदृढीकरण लर्निंग (agentic reinforcement learning) के लिए एक एकीकृत ढांचा है, जो उच्च गुणवत्ता वाले डेटा को सुनिश्चित करने के लिए टूल-अवेयर ट्रैजेक्टरी फ़िल्टरिंग को उच्च-गुणवत्ता वाले डेटा के साथ संयोजित करके और महत्वपूर्ण टूल-इंटरैक्शन बिंदुओं पर विविध अन्वेषण को प्रोत्साहित करने के लिए एक एंट्रॉपी-गाइडेड बोनस को जोड़कर प्रशिक्षण स्थिरता और तर्क क्षमताओं को बढ़ाता है।

Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao2026-06-03
🔢 mathematics

Bregman meets Lévy: Stochastic mirror descent with heavy-tailed noise in continuous and discrete time

यह शोध पत्र एक निरंतर-समय लेवी मिरर फ्लो मॉडल (Lévy mirror flow model) पेश करके यह स्थापित करता है कि स्टोकेस्टिक मिरर डिसेंट (Stochastic Mirror Descent), भारी-पूंछ वाले (heavy-tailed), अनंत-विचरण (infinite-variance) शोर के तहत भी सुदृढ़ बना रहता है और यह सिद्ध करता है कि यह उत्तल (convex) और दृढ़ उत्तल (strongly convex) दोनों उद्देश्यों के लिए बहुपद समय (polynomial time) के भीतर ϵ\epsilon-इष्टतमता (optimality) प्राप्त करता है, जिसके साथ इसके डिस्क्रीट-टाइम वेरिएंट भी इन समान अभिसरण गारंटियों (convergence guarantees) को विरासत में प्राप्त करते हैं।

Pierre-Louis Cauvin, Panayotis Mertikopoulos2026-06-03
⚡ electrical engineering

Limit Analysis of Graph Neural Networks with Wireless Conflict Graphs

यह शोध पत्र स्पार्स रैंडम जियोमेट्रिक ग्राफ से प्राप्त कॉन्फ्लिक्ट ग्राफ का विश्लेषण करके, छोटे पैमाने से बड़े पैमाने के वायरलेस नेटवर्क में ग्राफ न्यूरल नेटवर्क की ट्रांसफ़रेबिलिटी (स्थानांतरणीयता) पर सैद्धांतिक सीमाएं स्थापित करता है, और लिंक शेड्यूलिंग प्रयोगों के माध्यम से यह प्रदर्शित करता है कि ये मॉडल मौजूदा बेंचमार्क से बेहतर प्रदर्शन करते हैं और विभिन्न पैमानों पर अपना प्रदर्शन बनाए रखते हैं।

Romina Garcia Camargo, Zhiyang Wang, Alejandro Ribeiro2026-06-03
🤖 machine learning

PURGE: Projected Unlearning via Retain-Guided Erasure

यह शोध पत्र PURGE को प्रस्तुत करता है, जो एक मशीन अनलर्निंग एल्गोरिदम है जो निरंतर सीखने (continual learning) और अनलर्निंग के बीच की द्वैतता का लाभ उठाते हुए ग्रेडिएंट प्रोजेक्शन बाधाओं को मल्टी-लेयर रिप्रेजेंटेशन इरेज़र और एक रिटेन-कंफ्यूजन लक्ष्य के साथ जोड़ता है ताकि मॉडल की उपयोगिता को बनाए रखते हुए और मेंबरशिप इंफरेंस हमलों का प्रतिरोध करते हुए विशिष्ट डेटा को प्रभावी ढंग से हटाया जा सके।

Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang2026-06-03