🤖 machine learning

Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis

यह शोध पत्र Q-Learning Lab प्रस्तुत करता है, जो एक ब्राउज़र-आधारित शैक्षिक उपकरण है जो लाइव बेलमैन अपडेट्स को प्रदर्शित करके और छात्रों को अपने स्वयं के एजेंट ट्रेसेस को निर्यात और विश्लेषण करने में सक्षम बनाकर टैबुलर Q-लर्निंग के शिक्षण को बढ़ाता है, जिससे निष्क्रिय विज़ुअलाइज़ेशन को एक सक्रिय, डेटा-संचालित शिक्षण अनुभव में बदल दिया जाता है जिसे एल्गोरिद्मिक शुद्धता और शैक्षणिक डिज़ाइन के माध्यम से प्रमाणित किया गया है।

Ekkachai Jueng2026-07-14
🤖 machine learning

When does distribution shift break graph neural networks calibration?

यह शोध पत्र इस बात का पहला क्लोज्ड-फॉर्म सैद्धांतिक लक्षण वर्णन प्रस्तुत करता है कि वितरण परिवर्तन (डिस्ट्रीब्यूशन शिफ्ट) ग्राफ न्यूरल नेटवर्क अंशांकन (कैलिब्रेशन) को कैसे प्रभावित करते हैं, जो मॉडल आत्मविश्वास व्यवहार की व्याख्या करने वाले और STAC के विकास को निर्देशित करने वाले एक एकल शासी स्केलर (गवर्निंग स्केलर) की पहचान करता है, जो एक सोर्स-फ्री अंशांकन विधि है जो सिंथेटिक बेंचमार्क पर प्रदर्शन में सुधार करती है जबकि वास्तविक दुनिया के डेटासेट पर चल रही चुनौतियों को उजागर करती है।

Abderaouf Bahi2026-07-14
🤖 machine learning

Lower Bound on the Cumulative Constrained Violation for the OGD+Projection algorithm for Constrained Online Convex Optimization (COCO)

यह शोध पत्र संकुचित ऑनलाइन उत्तल अनुकूलन (constrained online convex optimization) में OGD+प्रोजेक्शन एल्गोरिदम के लिए संचयी बाधा उल्लंघन (cumulative constraint violation) पर Ω(Td12d)\Omega(T^{\frac{d-1}{2d}}) का पहला निचला स्तर (lower bound) स्थापित करता है, जो यह प्रदर्शित करता है कि इसका प्रदर्शन समस्या की आयामीता (dimensionality) द्वारा मौलिक रूप से सीमित है।

Haricharan Balasundaram, Karthick Krishna Mahendran, Rahul Vaze2026-07-14
🤖 AI

Route, Communicate, and Reason: Gated Routing and Adaptive Depth for Efficient Multi-Agent Reasoning

यह शोधपत्र GRADE को प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट सिस्टम है जो एजेंट चयन, तर्क की गहराई और संचार को गतिशील रूप से अनुकूलित करने के लिए सीखे गए गेटिंग मैकेनिज्म और एक नवीन क्रिटिक-मुक्त प्रशिक्षण एल्गोरिदम का उपयोग करता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम सक्रिय कंप्यूट के साथ जटिल बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Sudipto Ghosh, Tanmoy Chakraborty2026-07-14
🤖 machine learning

Predictive Divergence Masks for LLM RL

यह शोध पत्र प्रेडिक्टिव डायवर्जेंस मास्क (Predictive Divergence Masks) का प्रस्ताव करता है, जो एलएलएम (LLM) सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन विधि है जो प्रॉक्सिमिटी मानदंड (proximity criterion) के रूप में उपयोग किए जाने वाले संभाव्यता विचलन (probability divergence) को अगला ग्रेडिएंट स्टेप बढ़ाएगा या घटाएगा, इसके लिए एक क्लोज्ड-फॉर्म भविष्यवाणी के माध्यम से PPO के अनुपात-आधारित दिशा मानदंड को प्रतिस्थापित करता है, जिससे मॉडल के पैमानों (scales) में प्रशिक्षण स्थिरता और प्रदर्शन में सुधार होता है।

Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang2026-07-14
🤖 machine learning

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting

यह शोध पत्र 'वैरिएंस-करेक्टिव टाइम शिफ्टिंग' नामक एक प्रशिक्षण-मुक्त विधि प्रस्तुत करता है जो प्रभावी तापमान सैंपलिंग (टेम्परेचर सैंपलिंग) को सक्षम करने के लिए डिफ्यूजन मॉडल्स का उपयोग करती है ताकि वेरिएंस को बढ़ाए बिना प्रमुख मोड्स को सपाट करके विविधता को बढ़ाया जा सके, जिससे उच्च गुणवत्ता और कंडीशन फिडेलिटी बनाए रखते हुए विभिन्न आर्किटेक्चर में सैंपल विविधता में सुधार किया जा सके।

Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung2026-07-14
🤖 machine learning

Reliability Scaling Laws for Quantized Large Language Models

यह शोध पत्र अनिश्चितता, अंशांकन (कैलिब्रेशन) और सुदृढ़ता के व्यापक मूल्यांकन के माध्यम से क्वांटाइज़्ड लार्ज लैंग्वेज मॉडल्स की विश्वसनीयता की जांच करता है, जो यह प्रकट करता है कि जबकि प्रदर्शन कुल मॉडल बिट्स के साथ निरंतर बढ़ता है, विश्वसनीयता 4-बिट क्वांटाइजेशन पर चरम पर होती है और क्वांटाइजेशन वास्तव में प्राकृतिक इनपुट व्यवधानों के विरुद्ध सुदृढ़ता को बढ़ाता है।

Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier2026-07-14
🧬 biology

Transferable Implicit Solvent Machine Learning Potential for Drugs and Proteins Approaching Ab Initio Accuracy

यह शोध पत्र TWIN को प्रस्तुत करता है, जो विशेष रूप से *ab initio* और प्रयोगात्मक डेटा पर प्रशिक्षित एक हस्तांतरणीय (transferable) मशीन लर्निंग पोटेंशियल है, जो इमप्लिसिट वॉटर (implicit water) में ड्रग और प्रोटीन मॉडलिंग के लिए नियर-DFT सटीकता प्राप्त करता है और स्पष्ट विलायक (explicit solvent) विधियों की तुलना में दो-क्रम-परिमाण (two-order-of-magnitude) का स्पीडअप प्रदान करता है।

Jan Eckwert, Julija Zavadlav2026-07-14
🤖 machine learning

ZoRRO: A Zero-Weight Personalized Recommender System for Scalable News Recommendation

ZoRRO एक प्रशिक्षण-मुक्त (training-free), शून्य-भार (zero-weight) ढांचा है जो स्केलेबल समाचार अनुशंसा (news recommendation) के लिए है, जो अत्याधुनिक डीप लर्निंग मॉडलों के तुलनीय ऑनलाइन प्रदर्शन प्राप्त करता है जबकि यह 600 गुना अधिक तेज़ी से कार्य करता है, जो अनुशंसा प्रणालियों (recommender systems) को सटीकता मेट्रिक्स से परे मूल्यांकन करने की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Johannes Kruse, Ryotaro Shimizu, Kasper Lindskow, Jon Tofteskov, Michael Riis Andersen, Julian McAuley, Jes Frellsen2026-07-14
🤖 machine learning

Normative Alignment of Recommender Systems via Internal Label Shift

NAILS एक स्केलेबल, रिट्रेनिंग-मुक्त विधि है जो आंतरिक लेबल शिफ्ट के माध्यम से आइटम एट्रिब्यूट्स पर एक लक्षित वितरण प्रेरित करके अनुशंसा प्रणाली (रेकमेंडर सिस्टम) के आउटपुट को निष्पक्षता और विविधता जैसे मानद उद्देश्यों के साथ संरेखित करती है, जिससे वैश्विक मूल्यों और उपयोगकर्ता जुड़ाव के बीच संतुलन बनाया जाता है।

Johannes Kruse, Kasper Lindskow, Michael Riis Andersen, Ryotaro Shimizu, Julian McAuley, Pierre-Alexandre Mattei, Jes Fr (…)2026-07-14