🤖 machine learning

Lookahead Branching for Neural Network Verification

यह शोध पत्र न्यूरल नेटवर्क सत्यापन के लिए एक सामान्य लुकअहेड ब्रांचिंग रणनीति प्रस्तुत करता है जो ब्रांच-एंड-बाउंड वेरीफायर को बेहतर निर्णय लेने और अतिरिक्त लेम्मा उत्पन्न करने में सुधार करके मौजूदा वेरीफायर को उन्नत करता है, जिसके परिणामस्वरूप निरंतर गति वृद्धि और 57% तक अधिक हल किए गए उदाहरण प्राप्त होते हैं।

Liam Davis, Duo Zhou, Huan Zhang, Guy Katz, Clark Barrett, Haoze Wu2026-07-21
💬 NLP

DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

यह शोध पत्र DRNOISE को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि डीप रिसर्च एजेंट ओपन-वेब वातावरण में विश्वसनीय दिखने वाले भ्रामक दस्तावेज़ों का सामना करने पर सटीकता में महत्वपूर्ण गिरावट का शिकार होते हैं, जिसका मुख्य कारण "वेरिफिकेशन इनर्शिया" (सत्यापन जड़ता) नामक एक विफलता मोड है जहाँ एजेंट पुष्टिकारक साक्ष्यों के साथ सक्रिय रूप से सामंजस्य बिठाने के बजाय सीधे गलत दावों के प्रति समयपूर्व समर्पण कर देते हैं।

Jun Nie, Zhiqin Yang, Zhenheng Tang, Yonggang Zhang, Xiaowen Chu, Xinmei Tian, Bo Han2026-07-21
📈 economics

Rationalizing Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies

यह शोध पत्र पर्यावरणीय संयोग और एजेंट के चयन के बीच अंतर स्पष्ट करके मानक सॉफ्टमैक्स नीति (softmax policy) और मार्कोव निर्णय प्रक्रिया (Markov decision process) के सिद्धांतों के बीच के सैद्धांतिक तनाव को हल करता है, यह प्रदर्शित करते हुए कि चयनात्मक नोड्स पर अप्रासंगिक विकल्पों की स्वतंत्रता (independence of irrelevant alternatives) और एकतत्व (monotonicity) को लागू करना अनन्य रूप से बोल्ट्ज़मैन नीति (Boltzmann policy) और एंट्रॉपी-नियमित प्रतिनिधित्व (entropy-regularized representation) को एक मानक डिजाइन विकल्प के रूप में व्युत्पन्न करता है जो यह दर्शाता है कि क्या एक एजेंट स्वयं के चुनने की क्षमता को महत्व देता है।

Silviu Pitis2026-07-21
🤖 machine learning

Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints

यह शोध पत्र तर्क देता है कि ट्रांसफर कार्यों के लिए सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम का मूल्यांकन करने के लिए सैंपल दक्षता से परे व्यावहारिक वॉल-क्लॉक प्रशिक्षण समय और डोमेन रैंडमाइजेशन के तहत मजबूती को शामिल करना आवश्यक है, जो यह प्रदर्शित करता है कि सैंपल-अकुशल PPO, SAC और TD-MPC2 जैसे अधिक सैंपल-कुशल एल्गोरिदम की तुलना में गति में बेहतर प्रदर्शन कर सकता है, जबकि तीनों प्रतिमान (पैराडाइम) डोमेन रैंडमाइजेशन से समान रूप से लाभान्वित होते हैं।

Hany Hamed, Abhishek Naik, Colin Bellinger, A. Rupam Mahmood2026-07-21
⚛️ quantum physics

Interpreting Quantum Learning Models via Stochastic Processes

यह शोध पत्र एक संभाव्य ढांचे का प्रस्ताव करता है जो क्वांटम गतिकी को ऋणात्मक प्रायिकताओं वाले मार्कोवियन मानचित्रों के रूप में या उच्च-क्रम स्मृति निर्भरताओं वाले धनात्मक स्टोकेस्टिक प्रक्रियाओं के रूप में प्रस्तुत करने के बीच एक संतुलन स्थापित करके क्वांटम लर्निंग मॉडलों की व्याख्या स्टोकेस्टिक प्रक्रियाओं के रूप में करता है, जिससे क्वांटम यांत्रिकी और प्रोजेक्टिव सिमुलेशन जैसे शास्त्रीय लर्निंग मॉडलों के बीच एक सेतु बनता है।

Johannes Fankhauser, Lukas J. Fiderer, Hans J. Briegel2026-07-21
🤖 machine learning

When Drift Detectors cry Wolf: False Alarm Rates in continuous ML Monitoring

यह शोध पत्र निरंतर निगरानी की स्थितियों में पांच सामान्य ड्रिफ्ट डिटेक्टरों की फॉल्स पॉजिटिव दरों का अनुभवजन्य विश्लेषण करता है, जो यह प्रकट करता है कि जबकि बड़े बैच आकारों के साथ PSI विश्वसनीय हो जाता है, अन्य डिटेक्टर निरंतर उतार-चढ़ाव प्रदर्शित करते हैं, और बोनफेरोनी जैसे सांख्यिकीय सुधार लागू करने से संवेदनशीलता की कीमत पर फॉल्स अलार्म कम हो जाते हैं, जो अंततः उत्पादन एमएल प्रणालियों में स्थिरता और संवेदनशीलता को संतुलित करने के लिए व्यावहारिक दिशा-निर्देश प्रदान करता है।

Raj Shekhar Singh2026-07-21
🤖 AI

Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution

यह शोध पत्र एक स्व-संशोधित (self-modifying) लीन (Lean) प्रूफ़ एजेंट प्रस्तुत करता है जो महारत-नियंत्रित (mastery-throttled) बेंचमार्क के साथ सह-विकसित होता है ताकि होल्ड-आउट टेस्ट पर 45.1% समाधान दर प्राप्त की जा सके, जो यह सुनिश्चित करते हुए अपने सीड (seed) और फिक्स्ड-बेंचमार्क समकक्षों से काफी बेहतर प्रदर्शन करता है कि सभी स्व-सुधार विश्वसनीय लीन सत्यापन (Lean verification) में निहित रहें।

Yuqing Li, Zeguan Wu, Yu Gan, Junyu Liu2026-07-21
💬 NLP

Team DACTYL at PAN 2026: Bayesian Data Mixing and Empirical X-risk Minimization for AI-text Detection

टीम DACTYL डेटासेट क्यूरेशन के लिए बेयसियन डेटा मिक्सिंग और एम्पिरिकल X-रिस्क मिनिमाइजेशन को नियोजित करके AI-टेक्स्ट डिटेक्शन में आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन अंतराल को संबोधित करती है, जिससे एक MCGrad-कैलिब्रेटेड ModernBERT-large मॉडल के साथ शीर्ष लीडरबोर्ड रैंक प्राप्त की गई जिसने PAN 2026 टेस्ट सेट पर 0.974 का माध्य स्कोर प्राप्त किया।

Shantanu Thorat2026-07-21
📊 statistics

Kernel Regression with Tensor Trains and Hadamard Overparameterization

यह शोध पत्र KReTTaH को प्रस्तुत करता है, जो मल्टी-वे डेटा इम्प्यूटेशन (multi-way data imputation) के लिए एक ट्रेनिंग-डेटा-मुक्त, व्याख्या योग्य ढांचा है, जो इस समस्या को टेंसर-ट्रेन गुणांकों (tensor-train coefficients) और हैडमार्ड ओवरपैरामीट्राइजेशन (Hadamard overparameterization) के साथ कर्नेल रिग्रेशन के रूप में पुनर्गठित करता है, जो उच्च-आयामी fMRI और डायनेमिक ग्राफ अनुप्रयोगों में महंगी क्रॉस-वैलिडेशन के बिना अत्याधुनिक सटीकता प्राप्त करने के लिए रिमानियन मैनिफोल्ड्स (Riemannian manifolds) पर इन घटकों को संयुक्त रूप से अनुकूलित करता है।

Duc Thien Nguyen, Konstantinos Slavakis, Eleftherios Kofidis, Dimitris Pados2026-07-21
🤖 machine learning

CoEvoP&R: Co-Evolving Placement Objectives with Routing Feedback via Large Language Models

CoEvoP&R एक नवीन फ्रेमवर्क है जो रूटिंग और टाइमिंग फीडबैक द्वारा निर्देशित पठनीय, डिफरेंशिएबल प्लेसमेंट उद्देश्यों को स्वचालित रूप से विकसित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो नेटिव एनालिटिकल प्लेसर्स की तुलना में पोस्ट-रूट वायरलेंथ, कंजेशन और टाइमिंग मेट्रिक्स में महत्वपूर्ण सुधार करता है।

Ruogu Chen, Weihua Xiao, Ramesh Karri, Jie Han2026-07-21