🤖 machine learning

Structured Proper Loss Geometries for Multiclass Classification: Theory and Controlled Empirical Evaluation

यह शोध पत्र मल्टीक्लास वर्गीकरण के लिए तीन स्ट्रक्चर्ड प्रॉपर लॉस फंक्शन्स के ज्यामितीय गुणों का सैद्धांतिक विश्लेषण करता है और उनका अनुभवजन्य मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि वे कुछ शोर वाले या असंतुलित परिदृश्यों में विशिष्ट लाभ प्रदान करते हैं, लेकिन वे मानक क्रॉस-एन्ट्रॉपी पर सामान्य श्रेष्ठता प्रदर्शित नहीं करते हैं।

Soumyadip Sarkar2026-06-30
🤖 machine learning

The Calibrated Deepfake Trust Score (CDTS): Competence-Coupled Trust Degradation Across Deepfake Detectors

यह शोध पत्र कैलिब्रेटेड डीपफेक ट्रस्ट स्कोर (CDTS) फ्रेमवर्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि डीपफेक डिटेक्टर कैलिब्रेशन मौलिक रूप से डिस्क्रिमिनेटिव कॉम्पिटेंस (विभेदात्मक क्षमता) के साथ जुड़ा हुआ है, जिससे कॉम्पिटेंस को वास्तविक दुनिया के सत्यापन पाइपलाइनों में विश्वसनीयता, न्यायसंगत प्रदर्शन और प्रभावी रूटिंग सुनिश्चित करने के लिए एक महत्वपूर्ण, लेबल-मुक्त मीट्रिक के रूप में स्थापित किया गया है।

Md Anas Biswas2026-06-30
🤖 machine learning

Reported Confidence in LLMs Tracks Commitment More Than Correctness

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) में मौखिक आत्मविश्वास रिपोर्ट मुख्य रूप से उत्तर देने के निर्णय को प्रेरित करने वाली एक आंतरिक "कमिट-रेडीनेस" (प्रतिबद्धता-तत्परता) अवस्था को दर्शाती हैं, न कि उत्तर की वास्तविक शुद्धता को, जो उन्हें लॉग-प्रोबेबिलिटीज़ (log-probabilities) से मौलिक रूप से अलग करती है जो उत्तर के साक्ष्य को ट्रैक करती हैं।

Dharshan Kumaran2026-06-30
🤖 machine learning

Reinforcement Learning in Super Mario Bros: Curriculum, Pedagogy, and Optimal Level Design in World 1-1

यह शोध पत्र यह प्रदर्शित करके सुपर मारियो ब्रदर्स वर्ल्ड 1-1 के मानक डिज़ाइन की शैक्षणिक प्रभावकारिता को अनुभवजन्य रूप से मान्य करता है कि एक मोंटे कार्लो सुदृढीकरण लर्निंग एजेंट केवल तभी बेहतर शिक्षण दक्षता और शून्य विनाशकारी विफलताओं को प्राप्त करता है जब स्तर के खंडों को यादृच्छिक क्रम के बजाय उनके मूल, प्रगतिशील क्रम में प्रस्तुत किया जाता है।

Jesse Ponnock, Lucas Ho2026-06-30
🤖 machine learning

Anti-Collapse Dynamics and the Emergence of Multi-Time-Scale Learning in Recurrent Neural Networks

यह शोध पत्र प्रदर्शित करता है कि आवर्ती तंत्रिका नेटवर्क (recurrent neural networks) स्वाभाविक रूप से एक "एंटी-कोलैप्स्ड" (anti-collapsed) शासन में उभरकर लंबी दूरी के सीखने के अभिशाप (curse of long-range learning) पर विजय प्राप्त कर सकते हैं, जहाँ प्रशिक्षण गतिकी में भारी-पूंछ वाले उतार-चढ़ाव (heavy-tailed fluctuations) अल्प समय-पैमानों की ओर ऑप्टिमाइज़र के खिंचाव को संतुलित करते हैं, जिसके परिणामस्वरूप एक एकल स्पेक्ट्रल घातांक (spectral exponent) द्वारा नियंत्रित स्मृति का पावर-लॉ क्षय (power-law decay) होता है।

Lorenzo Livi2026-06-30
🤖 machine learning

Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

यह शोध पत्र यह प्रदर्शित करता है कि स्क्रैचपैड में मध्यवर्ती अवस्थाओं (intermediate states) को लिखने के लिए प्रशिक्षित बड़े भाषा मॉडल वास्तव में उन लिखित अवस्थाओं का उपयोग बाद के तर्क चरणों के लिए कारण इनपुट (causal inputs) के रूप में करते हैं, न कि केवल मानवीय पठनीयता के लिए उन्हें उत्पन्न करते हैं।

Benjamin Shih, John Winnicki, Eric Darve2026-06-30
🤖 machine learning

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

यह शोध पत्र LLM सुदृढीकरण शिक्षण (reinforcement learning) में प्रशिक्षण-अनुमान अंतराल (training-inference mismatch) को अस्थिरता के एक महत्वपूर्ण कारण के रूप में पहचानता है और एक नया ढांचा प्रस्तावित करता है जिसे मोनोटोनिक इन्फरेंस पॉलिसी अपडेट (MIPU) कहा जाता है, ताकि यह सुनिश्चित किया जा सके कि प्रशिक्षण में सुधार सीधे बेहतर अनुमान प्रदर्शन में परिवर्तित हो सके।

Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye (…)2026-06-30
🤖 machine learning

Improved Multi-Dimensional Forecasting for Swap Regret

यह शोध पत्र उन्नत बहुपद-समय (polynomial-time) पूर्वानुमान एल्गोरिदम प्रस्तुत करता है जो कम-आयामी और अनिश्चित-आयामी दोनों परिणाम स्थानों में अज्ञात उद्देश्यों वाले डाउनस्ट्रीम एजेंटों के लिए उप-रैखिक (sublinear) स्वैप रिग्रेट प्राप्त करते हैं, जो कार्यों की संख्या और समय के संदर्भ में रिग्रेट निर्भरता के मामले में पूर्व सीमाओं से काफी बेहतर प्रदर्शन करते हुए घातीय रनटाइम (exponential runtimes) से बचते हैं।

Joey Rivkin, Ramiro N. Deo-Campo Vuong, Robert Kleinberg, Chido Onyeze, Erald Sinanaj, Eva Tardos2026-06-30
📊 statistics

Optimizer Memory Makes Shuffle Order a First-Order Source of Fine-Tuning Noise

यह शोध पत्र प्रकट करता है कि AdamW जैसे एल्गोरिदम में फिक्स्ड-क्लॉक ऑप्टिमाइज़र मेमोरी, शफल ऑर्डर (shuffle order) को एक नगण्य द्वितीय-क्रम के प्रभाव से बदलकर फाइन-ट्यूनिंग शोर (fine-tuning noise) के एक प्रमुख प्रथम-क्रम के स्रोत के रूप में ऊपर उठा देती है, जिससे इस परिवर्तनशीलता के सटीक और फिट-मुक्त परिमाणीकरण को सक्षम बनाया जा सके ताकि A/B तुलनाओं की विश्वसनीयता में सुधार किया जा सके।

John Sweeney2026-06-30
🤖 machine learning

Bilevel Optimization for Neural Architecture Search

यह शोध पत्र बाइलेवल ऑप्टिमाइज़ेशन (bilevel optimization) के दृष्टिकोण से न्यूरल आर्किटेक्चर सर्च (NAS) का एक संरचित अवलोकन प्रस्तुत करता है, जो मौजूदा विधियों को सैंपलिंग-आधारित और सिद्धांत-आधारित दृष्टिकोणों में वर्गीकृत करता है और एक नवीन सहायक गणितीय प्रोग्रामिंग ढांचे की वकालत करता है जो पारंपरिक सैंपलिंग विधियों की तुलना में बेहतर सटीकता और दक्षता प्राप्त करने के लिए सेकंड-ऑर्डर जानकारी का लाभ उठाता है।

Abhishek Shukla, Ankur Sinha, Faiz Hamid2026-06-30