🤖 machine learning

Prototype Latent World Model Replay for Class-Incremental Learning

यह शोध पत्र प्रोटोटाइप लेटेंट वर्ल्ड मॉडल रिप्ले (Prototype Latent World Model Replay) का प्रस्ताव करता है, जो एक मेमोरी-फ्री क्लास-इन्क्रीमेंटल लर्निंग फ्रेमवर्क है जो पुराने वर्गों को एक फ्रोजन लेटेंट स्पेस में प्रोटोटाइप-केंद्रित वितरणों के रूप में संग्रहीत करता है ताकि प्रशिक्षण के लिए सिंथेटिक अवस्थाओं को सैंपल किया जा सके, जिससे बिना कच्चे उदाहरणों को रखे स्प्लिट CIFAR-100 पर प्रदर्शन में उल्लेखनीय सुधार होता है।

Weizhi Nie, Hui Wang, Weijie Wang, Yuting Su2026-06-30
⚛️ nuclear experiments

Self-Supervised Calibration of Scientific Instruments Using Physical Consistency Constraints

यह शोध पत्र एक भौतिकी-सूचित स्व-पर्यवेक्षित ढांचे (physics-informed self-supervised framework) को प्रस्तुत करता है जो ज्ञात भौतिक बाधाओं का उपयोग करके छद्म-लेबल (pseudo-labels) उत्पन्न करने के लिए कच्चे मापन से डिटेक्टर अंशांकन मापदंडों और कार्य-विशिष्ट भविष्यवाणियों को संयुक्त रूप से सीखता है, जिससे विशेषज्ञ हस्तक्षेप या मैन्युअल रूप से लेबल किए गए डेटा की आवश्यकता के बिना वैज्ञानिक उपकरणों का स्वायत्त अंशांकन और निगरानी सक्षम होती है।

M. Rejmund (GANIL, CEA/DRF - CNRS/IN2P3, Bd Henri Becquerel, BP 55027, F-14076, Caen Cedex 5, France), A. Lemasson (GANI (…)2026-06-30
🤖 machine learning

Structured Proper Loss Geometries for Multiclass Classification: Theory and Controlled Empirical Evaluation

यह शोध पत्र मल्टीक्लास वर्गीकरण के लिए तीन स्ट्रक्चर्ड प्रॉपर लॉस फंक्शन्स के ज्यामितीय गुणों का सैद्धांतिक विश्लेषण करता है और उनका अनुभवजन्य मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि वे कुछ शोर वाले या असंतुलित परिदृश्यों में विशिष्ट लाभ प्रदान करते हैं, लेकिन वे मानक क्रॉस-एन्ट्रॉपी पर सामान्य श्रेष्ठता प्रदर्शित नहीं करते हैं।

Soumyadip Sarkar2026-06-30
🤖 machine learning

The Calibrated Deepfake Trust Score (CDTS): Competence-Coupled Trust Degradation Across Deepfake Detectors

यह शोध पत्र कैलिब्रेटेड डीपफेक ट्रस्ट स्कोर (CDTS) फ्रेमवर्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि डीपफेक डिटेक्टर कैलिब्रेशन मौलिक रूप से डिस्क्रिमिनेटिव कॉम्पिटेंस (विभेदात्मक क्षमता) के साथ जुड़ा हुआ है, जिससे कॉम्पिटेंस को वास्तविक दुनिया के सत्यापन पाइपलाइनों में विश्वसनीयता, न्यायसंगत प्रदर्शन और प्रभावी रूटिंग सुनिश्चित करने के लिए एक महत्वपूर्ण, लेबल-मुक्त मीट्रिक के रूप में स्थापित किया गया है।

Md Anas Biswas2026-06-30
🤖 machine learning

Reported Confidence in LLMs Tracks Commitment More Than Correctness

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) में मौखिक आत्मविश्वास रिपोर्ट मुख्य रूप से उत्तर देने के निर्णय को प्रेरित करने वाली एक आंतरिक "कमिट-रेडीनेस" (प्रतिबद्धता-तत्परता) अवस्था को दर्शाती हैं, न कि उत्तर की वास्तविक शुद्धता को, जो उन्हें लॉग-प्रोबेबिलिटीज़ (log-probabilities) से मौलिक रूप से अलग करती है जो उत्तर के साक्ष्य को ट्रैक करती हैं।

Dharshan Kumaran2026-06-30
🤖 machine learning

Reinforcement Learning in Super Mario Bros: Curriculum, Pedagogy, and Optimal Level Design in World 1-1

यह शोध पत्र यह प्रदर्शित करके सुपर मारियो ब्रदर्स वर्ल्ड 1-1 के मानक डिज़ाइन की शैक्षणिक प्रभावकारिता को अनुभवजन्य रूप से मान्य करता है कि एक मोंटे कार्लो सुदृढीकरण लर्निंग एजेंट केवल तभी बेहतर शिक्षण दक्षता और शून्य विनाशकारी विफलताओं को प्राप्त करता है जब स्तर के खंडों को यादृच्छिक क्रम के बजाय उनके मूल, प्रगतिशील क्रम में प्रस्तुत किया जाता है।

Jesse Ponnock, Lucas Ho2026-06-30
🤖 machine learning

Anti-Collapse Dynamics and the Emergence of Multi-Time-Scale Learning in Recurrent Neural Networks

यह शोध पत्र प्रदर्शित करता है कि आवर्ती तंत्रिका नेटवर्क (recurrent neural networks) स्वाभाविक रूप से एक "एंटी-कोलैप्स्ड" (anti-collapsed) शासन में उभरकर लंबी दूरी के सीखने के अभिशाप (curse of long-range learning) पर विजय प्राप्त कर सकते हैं, जहाँ प्रशिक्षण गतिकी में भारी-पूंछ वाले उतार-चढ़ाव (heavy-tailed fluctuations) अल्प समय-पैमानों की ओर ऑप्टिमाइज़र के खिंचाव को संतुलित करते हैं, जिसके परिणामस्वरूप एक एकल स्पेक्ट्रल घातांक (spectral exponent) द्वारा नियंत्रित स्मृति का पावर-लॉ क्षय (power-law decay) होता है।

Lorenzo Livi2026-06-30
🤖 machine learning

Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

यह शोध पत्र यह प्रदर्शित करता है कि स्क्रैचपैड में मध्यवर्ती अवस्थाओं (intermediate states) को लिखने के लिए प्रशिक्षित बड़े भाषा मॉडल वास्तव में उन लिखित अवस्थाओं का उपयोग बाद के तर्क चरणों के लिए कारण इनपुट (causal inputs) के रूप में करते हैं, न कि केवल मानवीय पठनीयता के लिए उन्हें उत्पन्न करते हैं।

Benjamin Shih, John Winnicki, Eric Darve2026-06-30
🤖 machine learning

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

यह शोध पत्र LLM सुदृढीकरण शिक्षण (reinforcement learning) में प्रशिक्षण-अनुमान अंतराल (training-inference mismatch) को अस्थिरता के एक महत्वपूर्ण कारण के रूप में पहचानता है और एक नया ढांचा प्रस्तावित करता है जिसे मोनोटोनिक इन्फरेंस पॉलिसी अपडेट (MIPU) कहा जाता है, ताकि यह सुनिश्चित किया जा सके कि प्रशिक्षण में सुधार सीधे बेहतर अनुमान प्रदर्शन में परिवर्तित हो सके।

Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye (…)2026-06-30
🤖 machine learning

Improved Multi-Dimensional Forecasting for Swap Regret

यह शोध पत्र उन्नत बहुपद-समय (polynomial-time) पूर्वानुमान एल्गोरिदम प्रस्तुत करता है जो कम-आयामी और अनिश्चित-आयामी दोनों परिणाम स्थानों में अज्ञात उद्देश्यों वाले डाउनस्ट्रीम एजेंटों के लिए उप-रैखिक (sublinear) स्वैप रिग्रेट प्राप्त करते हैं, जो कार्यों की संख्या और समय के संदर्भ में रिग्रेट निर्भरता के मामले में पूर्व सीमाओं से काफी बेहतर प्रदर्शन करते हुए घातीय रनटाइम (exponential runtimes) से बचते हैं।

Joey Rivkin, Ramiro N. Deo-Campo Vuong, Robert Kleinberg, Chido Onyeze, Erald Sinanaj, Eva Tardos2026-06-30