📊 statistics

Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies

यह शोधपत्र नियतकालिक नीतियों (deterministic policies) के साथ विस्तारित मीन फील्ड कंट्रोल (mean field control) के लिए एक मॉडल-मुक्त, निरंतर-समय एक्टर-क्रिटिक सुदृढीकरण शिक्षण ढांचे का प्रस्ताव करता है, जो माप व्युत्पन्न (measure derivatives) से जुड़े एक परिष्कृत पॉलिसी ग्रेडिएंट फॉर्मूला का लाभ उठाता है ताकि उन समस्याओं के लिए कुशल और सुदृढ़ समाधान सक्षम किए जा सकें जहाँ गतिकी (dynamics) और पुरस्कार संयुक्त अवस्था-क्रिया वितरण (joint state-action distribution) पर निर्भर करते हैं।

Ziheng Cheng, Xin Guo, Huyên Pham, Yufei Zhang2026-07-14
⚛️ quantum physics

Overcoming Fourier Locking in Quantum Data Re-uploading Classifiers via Spectral Homotopy

यह शोध पत्र डेटा री-अपलोडिंग क्वांटम क्लासिफायर में "फूरियर लॉकिंग" को प्राथमिक अनुकूलन बाधा (ऑप्टिमाइज़ेशन बॉटलनैक) के रूप में पहचानता है, जहाँ रैंडम इनिशियलाइज़ेशन स्पेक्ट्रल मिसअलाइनमेंट के कारण मॉडलों को स्प्यूरियस मिनिमा (मिथ्या स्थानीय न्यूनतम) में फँसा देता है, और एक स्पेक्ट्रल होमोटॉपी करिकुलम का प्रस्ताव करता है जो लॉस लैंडस्केप को उत्तलता (कॉन्वेक्सिफाई) बनाने और एस्केप रेट्स में महत्वपूर्ण सुधार करने के लिए लक्षित आवृत्तियों को क्रमिक रूप से बढ़ाता है।

Spencer Topel2026-07-14
💬 NLP

Can a Language Model Learn Facts Continually in Its Weights?

यह शोध पत्र यह प्रदर्शित करता है कि जबकि व्यापक प्रशिक्षण डेटा भाषा मॉडलों को नग्न कथनों की तुलना में अपने भार (weights) में नए तथ्यों को अधिक प्रभावी ढंग से संग्रहीत करने में सक्षम बनाता है, निरंतर भार-आधारित सीखना अपरिहार्य रूप से विनाशकारी विस्मृति (catastrophic forgetting) और हस्तक्षेप का कारण बनता है, जिससे संदर्भ (context) क्रमिक अपडेट के माध्यम से ज्ञान को संरक्षित करने और संयोजित करने के लिए एकमात्र विश्वसनीय माध्यम बन जाता है।

Charles O'Neill2026-07-14
💬 NLP

When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR

यह पूर्व-पंजीकृत कारण संबंधी अध्ययन (causal study) प्रदर्शित करता है कि कोड रिवॉर्ड सूट्स में प्राकृतिक 'फॉल्स पॉजिटिव' (false positives) व्यवस्थित रूप से RLVR प्रदर्शन मेट्रिक्स को बढ़ा देते हैं क्योंकि वे केवल सूट आर्टिफैक्ट्स के बजाय वास्तव में त्रुटिपूर्ण कोड को पुरस्कृत करते हैं, एक ऐसी घटना जिसे सस्ते स्टैटिक ऑडिट के माध्यम से पहचाना जा सकता है लेकिन जिसे सुधारने पर क्षमता में न्यूनतम लाभ प्राप्त होता है।

Chuyifei Zhang2026-07-14
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

यह शोध पत्र MMRM का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो विविध सहयोगात्मक संकेतों के साथ मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को संरेखित करता है ताकि मल्टीप्लेक्स आइटम और यूजर रिप्रेजेंटेशन उत्पन्न किए जा सकें, जिससे JD सर्च इंजन में ई-कॉमर्स सर्च रैंकिंग प्रदर्शन और दक्षता में महत्वपूर्ण सुधार होता है।

Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao2026-07-14
💬 NLP

Domain-Aware Scaling Laws Uncover Data Synergy

यह शोध पत्र विविध ओपन-वेट (open-weight) एलएलएम (LLM) के अवलोकन संबंधी डेटा का लाभ उठाकर, यह अनुमान लगाने के लिए कि विभिन्न डोमेन संयोजन कैसे परस्पर क्रिया करते हैं, भाषा मॉडल प्रीट्रेनिंग में "डेटा सिनर्जी" (data synergy) को औपचारिक रूप देता है और परिमाणित करता है, जो यह प्रदर्शित करता है कि उनका प्रस्तावित ढांचा डोमेन-अज्ञेयवादी स्केलिंग लॉज़ (domain-agnostic scaling laws) से बेहतर प्रदर्शन करता है और इष्टतम बनाम प्रति-इष्टतम (optimal versus anti-optimal) डेटा मिश्रण के आधार पर मॉडल प्रदर्शन रैंकिंग की सटीक भविष्यवाणी करता है।

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis2026-07-14
🤖 machine learning

Link Adaptation Using Joint-Thompson Sampling

यह शोध पत्र लिंक अनुकूलन (link adaptation) के लिए जॉइंट-थॉमसन सैंपलिंग (Joint-Thompson Sampling - Joint-TS) एल्गोरिदम का प्रस्ताव करता है, जो मॉड्यूलेशन एंड कोडिंग स्कीम (Modulation and Coding Scheme) की सफलता की संभावनाओं की अंतर्निहित एकदिष्टता (monotonicity) को बनाए रखने के लिए एक बहुभिन्नचर क्रमबद्ध बीटा वितरण (multivariate ordered Beta distribution) का उपयोग करके पारंपरिक मल्टी-आर्म्ड बैंडिट दृष्टिकोणों में सुधार करता है, जिससे विभिन्न चैनल स्थितियों में सुदृढ़ और सुसंगत थ्रूपुट प्राप्त होता है।

Vignatha Vinjam, Manjunath Kolavennu, Myna Vajha, Karthik Periyapattana Narayanaprasad2026-07-14
🧬 biology

Adapting Evidential Neural Networks to Test-Time Neighbor Fusion Improves Molecular Property Prediction

यह शोध पत्र PG-EVIKAL को प्रस्तुत करता है, जो एक टेस्ट-टाइम नेबर फ्यूजन विधि है जो आणविक गुण भविष्यवाणियों को परिष्कृत करने के लिए एविडेंशियल न्यूरल नेटवर्क अनिश्चितताओं और एक सीखे हुए प्रॉपर्टी-डिस्टेंस मेट्रिक का लाभ उठाती है, जो बिना पुन: प्रशिक्षण के 16 डेटासेट में महत्वपूर्ण सटीकता और अंशांकन सुधार प्राप्त करती है।

Cameron Gruich, Weichi Yao, Yixin Wang, Bryan Goldsmith2026-07-14
⚛️ quantum physics

When cheap gradients fail: the measurement cost of attacking quantum classifiers

यह शोध पत्र प्रदर्शित करता है कि परिमित क्वांटम मापन सांख्यिकी (शॉट नॉइज़) वेरिएशनल क्वांटम क्लासिफायर पर ग्रेडिएंट-आधारित हमलों के विरुद्ध एक अंतर्निहित रक्षा के रूप में कार्य करती है, क्योंकि यह एक ऐसा मापन लागत लागू करती है जो इनपुट आयाम के साथ सुपर-लीनियर रूप से स्केल करती है, जिससे व्हाइट-बॉक्स एडवरसेरियल हमले शास्त्रीय समकक्षों की तुलना में अत्यधिक महंगे हो जाते हैं।

Bacui Li, Chandra Thapa, Tansu Alpcan, Udaya Parampalli2026-07-14
🤖 machine learning

Neural Discovery of Memory and Nonlocal Kernels in Integro-Differential Equations with Constrained Kolmogorov--Arnold Networks

यह शोधपत्र विरल और शोर युक्त अवलोकनों से व्याख्यात्मक मेमोरी और नॉनलोकल कर्नेल को मजबूती से खोजने के लिए बाधा-युक्त कोलमोगोरोव-आर्नोल्ड नेटवर्क (विशेष रूप से हार्ड-कंस्ट्रेंड MC-KAN और सॉफ्ट-पेनल्टी Cheb-KAN) का उपयोग करते हुए एक डिफरेंशिएबल-सॉल्वर फ्रेमवर्क प्रस्तावित करता है, जो यह प्रदर्शित करता है कि निर्माण द्वारा भौतिक आकार संबंधी बाधाओं को लागू करना सॉफ्ट पेनल्टी की तुलना में बेहतर सटीकता प्रदान करता है, विशेष रूप से बहु-आयामी समस्याओं के लिए।

Aruzhan Tleubek, Salah A Faroughi2026-07-14