🤖 AI

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

यह शोधपत्र Counsel को प्रस्तुत करता है, जो एजेंटिक कार्यों (agentic tasks) पर LLM-as-a-judge आलोचनाओं के लिए मानव-सत्यापित मेटा-मूल्यांकनों का पहला सार्वजनिक डेटासेट है, जो त्रुटि के स्थान और तर्क की गुणवत्ता पर मानव निर्णयों के साथ उनके संरेखण का विश्लेषण करके स्वचालित मूल्यांकनकर्ताओं के अंशांकन (calibration) और सुधार को सक्षम बनाता है।

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis2026-06-23
🤖 AI

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

यह शोध पत्र ग्राउंडेड लेटेंट-एक्शन वर्ल्ड मॉडल्स (GLAM) को प्रस्तुत करता है, जो एक साझा, प्रेडिक्शन-ग्राउंडेड लेटेंट एक्शन स्पेस सीखने के लिए एक फ्रेमवर्क है ताकि भिन्न या लुप्त एक्शन लेबल्स वाले विषम डेटा स्रोतों से मजबूत इमिटेशन लर्निंग को सक्षम किया जा सके, जो सिमुलेशन और वास्तविक दुनिया के मैनिपुलेशन कार्यों में मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner2026-06-23
🤖 machine learning

Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

यह शोधपत्र वर्िफायर-कपल्ड रीजनिंग (verifier-coupled reasoning) को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि जबकि कंसिस्टेंसी ट्रेनिंग (consistency training) प्रभावी रूप से प्रोग्रामेटिक वर्िफायर जानकारी को लैंग्वेज मॉडल रैशनले रिप्रेजेंटेशन (language model rationale representations) से डिकोडेबल बनाती है, यह डिकोडेबिलिटी इस बात की गारंटी नहीं देती कि उत्पन्न स्पष्टीकरण वास्तव में मॉडल की वास्तविक आंतरिक तर्क प्रक्रिया को निष्ठापूर्वक दर्शाते हैं।

Vatsal Ananthula, Adarsh Kumarappan2026-06-23
🤖 machine learning

Expressivity Saturation: Reduced Affine Region Usage Under Increasing Task Complexity

यह शोध पत्र रेखा खंडों (line segments) के साथ अफ़ाइन क्षेत्रों (affine regions) पर एक कठोर ऊपरी सीमा स्थापित करके और यह प्रदर्शित करके कि कार्य की जटिलता में वृद्धि विरोधाभासी रूप से "अभिव्यक्ति संतृप्ति" (expressivity saturation) की ओर ले जाती है, जहाँ प्रशिक्षित मॉडल अपनी स्थापत्य क्षमता (architectural capacity) की तुलना में काफी कम अफ़ाइन क्षेत्रों का उपयोग करते हैं, जो अक्सर क्षयकारी निर्णय सीमाओं (degraded decision boundaries) का परिणाम होता है, पीसवाइज-अफ़ाइन न्यूरल नेटवर्क में सैद्धांतिक और वास्तविक अभिव्यक्ति के बीच के अंतर की जांच करता है।

Xuan Qi, Yi Wei, Fanqi Yu, Manuel Lecha2026-06-23
💬 NLP

Leveraging LaBSE with Progressive Curriculum Learning for Multicultural Polarization

यह शोध पत्र कम-संसाधन वाली भाषाओं में उन्नत क्रॉस-लिंगुअल लर्निंग के लिए LaBSE एम्बेडिंग्स का लाभ उठाने वाले एक नवीन आर्किटेक्चर का प्रस्ताव करके बहुभाषी और बहुसांस्कृतिक ऑनलाइन ध्रुवीकरण का पता लगाने की चुनौती को संबोधित करता है और एक रिट्रीवल-आधारित प्रॉम्प्टिंग फ्रेमवर्क के भीतर विविध Qwen एनकोडर मॉडलों का मूल्यांकन करता है।

Sachin Sundar, Sandeep Kumar, Mothish M2026-06-23
🔢 mathematics

Physics-Informed Neural Networks for Computing the Morse Index of the Critical Catenoid

यह शोध पत्र यह प्रदर्शित करता है कि भौतिकी-सूचित तंत्रिका नेटवर्क (physics-informed neural networks) इसके ज्ञात जैकोबी-स्टेकलोव स्पेक्ट्रम को पुनरुत्पादित करके और एक होमोटोपी के साथ आइजनवैल्यू क्रॉसिंग को ट्रैक करके क्रिटिकल कैटेनॉइड के मोर्स इंडेक्स और नलिटी की सटीक गणना कर सकते हैं, जिससे एक ऐसे पाइपलाइन का सत्यापन होता है जो अज्ञात इंडेक्स वाले अधिक जटिल ज्यामितीय परिवारों पर अनुप्रयोग के लिए तैयार है।

Miraj Samarakkody2026-06-23
🤖 machine learning

Embedding Linear Equality Constraints in Probabilistic Neural Networks for Dynamic Modelling

यह शोध पत्र एक संभाव्य न्यूरल नेटवर्क ढांचे का प्रस्ताव करता है जो रासायनिक प्रक्रियाओं में द्रव्यमान संतुलन (mass balances) जैसे रैखिक समानता बाधाओं के पालन की गारंटी देता है, जबकि प्रभावी रूप से एलियटोरिक अनिश्चितता (aleatoric uncertainty) को कैप्चर करता है और अत्याधुनिक तरीकों की तुलना में बेहतर सटीकता, अंशांकन (calibration) और प्रशिक्षण दक्षता प्रदर्शित करता है।

Matthew Marsh, Benoit Chachuat, Antonio del Rio Chanona2026-06-23
📊 statistics

AdaPrivate-TS: Private Thompson Sampling for Contextual Bandits with Privacy Amplification

AdaPrivate-TS एक डिफरेंशियल प्राइवेट कॉन्टेक्स्टुअल बैंडिट एल्गोरिदम है जो थॉम्पसन सैंपलिंग के भीतर बढ़ी हुई अनिश्चितता के रूप में प्राइवेसी नॉइज़ की व्याख्या का लाभ उठाता है, जो बैचड zCDP कंपोज़िशन और प्राइवेसी एम्प्लीफिकेशन के माध्यम से लॉगरिदमिक प्राइवेसी लागत के साथ निकट-इष्टतम प्रदर्शन प्राप्त करता है।

Mohammadreza Riyazat, Eranga Ukwatta2026-06-23
🤖 machine learning

Beyond the Next Step: Variable-Length Latent World Models for Long-Horizon Planning

यह शोध पत्र वेरिएबल-लेंथ लेटेंट वर्ल्ड मॉडल्स (VLWMs) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो करिकुलम ट्रेनिंग के माध्यम से परिवर्तनीय एक्शन होराइजन्स (variable action horizons) पर भविष्य के लेटेंट स्टेट्स की भविष्यवाणी करना सीखता है, जिससे पारंपरिक वन-स्टेप मॉडल्स की संचयी त्रुटियों (compounding errors) को दूर किया जा सके और लॉन्ग-होरिज़न प्लानिंग प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Tianqi Du, Qi Zhang, Yifei Wang, Yisen Wang2026-06-23
🤖 machine learning

A Causal DAG Prior for Synthetic Time-Series Classification Datasets

यह शोध पत्र एक कॉज़ल DAG-आधारित प्रायर (prior) प्रस्तुत करता है जो क्रॉस-मोडल टेम्पोरल संरचनाओं वाले मल्टीवेरिएट, मल्टी-क्लास टाइम-सीरीज़ क्लासिफिकेशन डेटासेट्स को सिंथेसाइज करता है, और यह प्रदर्शित करता है कि इन सिंथेटिक डेटासेट्स पर TabPFN v2.5 को फाइनट्यून करने से मौजूदा मॉडलों की तुलना में वास्तविक दुनिया के बेंचमार्क पर प्रदर्शन में उल्लेखनीय सुधार होता है।

Franco Martino O'Rourke, Ana Trisovic, Dimitris Bertsimas2026-06-23