🤖 machine learning

Message Passing Enables Efficient Reasoning

यह शोध पत्र मैसेज पासिंग लैंग्वेज मॉडल्स (MPLMs) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो हल्के प्रिमिटिव्स के माध्यम से प्रत्यक्ष इंटर-थ्रेड संचार सक्षम करके LLM तर्क दक्षता को बढ़ाता है, जिससे संदर्भ अतिरेक कम होता है और आशाजनक न दिखने वाली शाखाओं को समय से पहले समाप्त करने की अनुमति मिलती है ताकि सुडोकू और 3-SAT जैसे जटिल कार्यों पर पारंपरिक अनुक्रमिक और फोर्क-जॉइन दृष्टिकोणों से बेहतर प्रदर्शन किया जा सके।

Xuecheng Liu, Daman Arora, Gokul Swamy, Andrea Zanette2026-07-02
🤖 machine learning

Balancing Expressivity and Learnability in Quantum Kernel Bandit Optimization

यह शोध पत्र गॉसियन प्रोसेस बैंडिट ऑप्टिमाइज़ेशन में अभिव्यंजकता (expressivity) और सीखने की क्षमता (learnability) के बीच संतुलन बनाने के लिए प्रक्षिप्त (projected) और अनुमानित (approximated) क्वांटम कर्नेल्स का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि फीचर आयामीयता (feature dimensionality) को कम करने से पूर्ण क्वांटम कर्नेल्स की उच्च रिग्रेट (regret) और कम्प्यूटेशनल लागतों को कम किया जा सकता है और साथ ही NISQ-युग के अनुप्रयोगों के लिए उनके लाभों को भी सुरक्षित रखा जा सकता है।

Yuqi Huang, Vincent Y. F. Tan, Sharu Theresa Jose2026-07-02
🤖 machine learning

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

यह शोध पत्र O(Sη)O(S \cdot \eta) के क्रम के प्रति-चरण ग्रेडिएंट बायस (per-step gradient bias) को व्युत्पन्न करके और रोलआउट लैग (rollout lag) तथा संचयी लर्नर ड्रिफ्ट (cumulative learner drift) पर आधारित लर्निंग रेट के लिए एक दो-प्रतिबंध स्थिरता स्थिति (two-constraint stability condition) को परिभाषित करने वाले एक सशर्त कोलैप्स-टाइम स्केलिंग लॉ (conditional collapse-time scaling law) को स्थापित करके, एसिंक्रोनस GRPO-आधारित RLHF में स्टेल रोलआउट्स (stale rollouts) के प्रभाव का विश्लेषण करता है।

Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Z (…)2026-07-02
🤖 machine learning

SynLaD: Latent Diffusion for Generating Synthesizable Molecules Conditioned on 3D Pharmacophore Profiles

SynLaD एक लेटेंट डिफ्यूजन फ्रेमवर्क है जो 3D फार्माकोफोर-कंडीशन्ड मॉलिक्यूलर जनरेशन को सिंथेटिक एक्सेसिबिलिटी के साथ एकीकृत करता है, जो आकार-संरेखित अणुओं और व्यवहार्य संश्लेषण पथों को समान रूप से उत्पन्न करने के लिए एक साझा लेटेंट स्पेस सीखने के माध्यम से कार्य करता है।

Miruna Cretu, John Bradshaw, Patricia Suriana, Saeed Saremi, Omar Mahmood, Kirill Shmilovich, Kangway Chuang, Vishnu Sre (…)2026-07-02
🤖 machine learning

Muon as a Residual Connection

यह शोध पत्र म्यूऑन (Muon) ऑप्टिमाइज़र की एक यांत्रिक व्याख्या प्रस्तावित करता है जो इसे एक अंतर्निहित अवशिष्ट जुड़ाव (implicit residual connection) के रूप में देखता है जो डाउनस्ट्रीम परतों के लिए प्रतिनिधित्व संरक्षण (representation preservation) में सुधार करने हेतु तात्कालिक ग्रेडिएंट निष्ठा (gradient fidelity) का त्याग करता है, जिससे इसकी प्रभावकारिता के लिए एक वैचारिक स्पष्टीकरण और स्थानीय अवतरण (local descent) एवं डाउनस्ट्रीम उपयोगिता के बीच संतुलन बनाने के लिए एक नया डिज़ाइन परिप्रेक्ष्य प्राप्त होता है।

Hao Huang2026-07-02
🤖 machine learning

ZO-Act: Efficient Zeroth-Order Fine-Tuning via One-Shot Activation-Informed Low-Rank Subspaces

ZO-Act एक कुशल ज़ीरो-ऑर्डर फाइन-ट्यूनिंग विधि है जो गड़बड़ी (perturbations) को एक निश्चित, एक्टिवेशन-सूचित लो-रैंक सबस्पेस तक सीमित करके मौजूदा दृष्टिकोणों में सुधार करती है, जिससे एस्टिमेटर वेरिएंस कम होता है और मोमेंटम-आधारित अनुकूलन सक्षम होता है, साथ ही यह क्वांटाइज्ड लार्ज लैंग्वेज मॉडल्स का समर्थन भी करती है।

Xun Dong, Yibo Xu, Naigang Wang, Xin Li, Penghang Yin, Zi Yang2026-07-02
🤖 machine learning

GAIA: Geometry-Adaptive Operator Learning for Forward and Inverse Problems

यह शोध पत्र GAIA को प्रस्तुत करता है, जो एक ज्यामिति-अनुकूलनकारी ऑपरेटर लर्निंग मॉडल है जो सीमा और आंतरिक विशेषताओं को टोकन में एनकोड करके इंटीग्रल ट्रांसफॉर्म्स को कंडिशन करके, किसी भी मनमाने डोमेन पर फॉरवर्ड और इनवर्स पार्शियल डिफरेंशियल इक्वेशन समाधान को एकीकृत करता है, जिससे बिना पुनरप्रशिक्षण या पुनरावृत्ति अनुकूलन के अत्याधुनिक सटीकता प्राप्त होती है।

Meenakshi Krishnan, Pranav Pulijala, Ke Chen, Haizhao Yang, Ramani Duraiswami2026-07-02
⚡ electrical engineering

A Lightweight Self-Supervised Learning Framework for Multivariate Time Series using Hierarchical-JEPA on ECG Data

यह शोध पत्र ER-JEPA प्रस्तुत करता है, जो हृदय रोग विशेषज्ञों के नैदानिक दृष्टिकोण से प्रेरित एक हल्का स्व-पर्यवेक्षित शिक्षण ढांचा (self-supervised learning framework) है, जो न्यूनतम कम्प्यूटेशनल संसाधनों के साथ 12-लीड ईसीजी (ECG) डेटा पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए विजन ट्रांसफार्मर बैकबोन के साथ एक पदानुक्रमित-JEPA आर्किटेक्चर का उपयोग करता है।

Siwon Kim2026-07-02
📊 statistics

Decision-Aware Training for Sample-Based Generative Models

यह शोध पत्र नमूना-आधारित जनरेटिव मॉडलों के लिए एक निर्णय-जागरूक (decision-aware) प्रशिक्षण ढांचे का प्रस्ताव करता है जो मानक प्रॉपर स्कोरिंग नियमों को एक अवकलनीय निर्णय हानि (differentiable decision loss) के साथ संवर्धित करता है ताकि संभाव्य पूर्वानुमानों को डाउनस्ट्रीम लागत संरचनाओं के साथ संरेखित किया जा सके, जिससे पूर्ण संभाव्य निष्ठा बनाए रखते हुए लागत-संवेदनशील क्षेत्रों में प्रदर्शन में सुधार किया जा सके।

Kornelius Raeth, Nicole Ludwig2026-07-02
🤖 machine learning

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

यह शोध पत्र एक एडवरसेरियल जनरेटर-डिस्क्रिमिनेटर फ्रेमवर्क प्रस्तावित करता है जो विविधता पतन (diversity collapse) और रिवॉर्ड हैकिंग (reward hacking) जैसे सामान्य RLVR विफलता मोड को कम करने के लिए मानव प्रदर्शनों से प्राप्त एक सीखे हुए संकेत के साथ सत्यापन योग्य पुरस्कारों को बढ़ाता है, जिससे कार्य सटीकता और शैली एवं संरचना जैसे गैर-सत्यापन योग्य मानव-समान गुणों दोनों को सफलतापूर्वक अनुकूलित किया जा सके।

Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas2026-07-02