🤖 machine learning

Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization

यह शोध पत्र डिस्ट्रीब्यूशन मैचिंग पॉलिसी ऑप्टिमाइज़ेशन (DMPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो उनके नीति वितरण (policy distribution) को एक इष्टतम रिवॉर्ड-टिल्टेड लक्ष्य के साथ संरेखित करके डिफ्यूजन लार्ज लैंग्वेज मॉडल्स की तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, जिससे सुपरवाइज्ड फाइन-ट्यूनिंग के बिना मौजूदा बेसलाइन की तुलना में पर्याप्त सटीकता सुधार प्राप्त होता है।

Yuchen Zhu, Wei Guo, Jaemoo Choi, Petr Molodyk, Bo Yuan, Molei Tao, Yongxin Chen2026-07-14
🤖 machine learning

Learnable Mixed Nash Equilibria are Collectively Rational

यह शोध पत्र यह प्रदर्शित करता है कि व्यक्तिगत रूप से उपयोगिता चाहने वाली गतिकी (dynamics) में समान रूप से स्थिर मिश्रित नैश संतुलन (mixed Nash equilibria) स्वाभाविक रूप से सामूहिक तर्कसंगतता रखते हुए दुर्बल पारेटो इष्टतम (weakly Pareto optimal) होते हैं, जिससे प्रिज़नर्स डिलेमा (prisoner's dilemma) में देखे जाने वाले सामाजिक रूप से अक्षम परिणामों को रोका जा सकता है।

Geelon So, Yi-An Ma2026-07-14
📊 statistics

Online conformal inference with retrospective adjustment for faster adaptation to distribution shift

यह शोध पत्र एक नवीन ऑनलाइन कॉन्फॉर्मल इन्फरेंस पद्धति प्रस्तावित करता है जो वितरण परिवर्तनों (डिस्ट्रीब्यूशन शिफ्ट्स) के अनुकूल तेजी से होने के लिए कुशल लीव-वन-आउट अपडेट के माध्यम से रेट्रोस्पेक्टिव एडजस्टमेंट का उपयोग करती है, जिससे मौजूदा फॉरवर्ड-ओनली दृष्टिकोणों की तुलना में भविष्यवाणियों के अंतराल की चौड़ाई को काफी कम करते हुए लगभग नाममात्र कवरेज प्राप्त किया जाता है।

Jungbin Jun, Ilsang Ohn2026-07-14
🤖 machine learning

Controllably Efficient Language Models

यह शोध पत्र कंप्रेस एंड अटेंड ट्रांसफॉर्मर (CAT) को पेश करता है, जो एक मेटा-सीक्वेंस मिक्सर है जो संकुचित टोकन चंक्स (compressed token chunks) से डिकोड करके गुणवत्ता-लागत के बीच संतुलन पर टेस्ट-टाइम नियंत्रण सक्षम बनाता है, जिससे एक एकल मॉडल विविध कुशल आर्किटेक्चर के प्रदर्शन से मेल खाने के साथ-साथ डेंस ट्रांसफॉर्मर्स की तुलना में उच्च थ्रूपुट प्रदान करता है।

Jatin Prakash, Aahlad Puli, Rajesh Ranganath2026-07-14
🤖 machine learning

Enhancing Adversarial Transferability through Block Stretch and Shrink

यह शोध पत्र FRO का प्रस्ताव करता है, जो एक फ्रंटएंड रिस्पॉन्स-ओरिएंटेड इनपुट ट्रांसफॉर्मेशन विधि है जो एक इम्पलिसिट एन्सेम्बल परिप्रेक्ष्य के माध्यम से मॉडल फ्रंटएंड रिस्पॉन्स को समृद्ध करने के लिए ब्लॉक-वाइज स्ट्रेच-एंड-श्रिंक और पर्सपेक्टिव डीफॉर्मेशन ऑपरेटर्स का उपयोग करके एडवर्सरियल ट्रांसफरैबिलिटी को बढ़ाता है।

Quan Liu, Feng Ye, Chenhao Lu, Shuming Zhen, Guanliang Huang, Lunzhe Chen, Xudong Ke2026-07-14
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

यह शोध पत्र CUDA-L2 को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो हाफ-प्रिसिजन जनरल मैट्रिक्स मल्टीप्लाई (HGEMM) कर्नेल्स को स्वचालित रूप से अनुकूलित करने के लिए लार्ज लैंग्वेज मॉडल्स और रीइन्फोर्समेंट लर्निंग का लाभ उठाता है, जिससे torch.matmul, cuBLAS और cuBLASLt जैसे स्थापित बेसलाइन्स की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है, क्योंकि यह उन पैमानों पर कॉन्फ़िगरेशन स्पेस का व्यवस्थित रूप से अन्वेषण करता है जो मानव इंजीनियरों के लिए अव्यवहारिक हैं।

Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum2026-07-14
⚛️ quantum physics

Graph-Based Bayesian Optimization for Quantum Circuit Architecture Search with Uncertainty Calibrated Surrogates

यह शोध पत्र साइबर सुरक्षा वर्गीकरण कार्यों के लिए कुशल और सुदृढ़ वेरिएशनल क्वांटम सर्किट को स्वचालित रूप से खोजने हेतु अनिश्चितता अंशांकन (अनसर्टेन्टी कैलिब्रेशन) के लिए मोंटे कार्लो ड्रॉपआउट के साथ एक GNN सरोगेट का उपयोग करने वाले एक ग्राफ-आधारित बेयसियन ऑप्टिमाइज़ेशन फ्रेमवर्क प्रस्तुत करता है।

Prashant Kumar Choudhary, Nouhaila Innan, Muhammad Shafique, Rajeev Singh2026-07-14
🤖 machine learning

From Confounding to Learning: Dynamic Service Fee Pricing on Third-Party Platforms

यह शोधपत्र मांग संबंधी भ्रम (demand confounding) के तहत सेवा शुल्क मूल्य निर्धारण को अनुकूलित करने के लिए तीसरे पक्ष के प्लेटफार्मों हेतु एक नवीन एल्गोरिदम का प्रस्ताव करता है, जो इष्टतम रिग्रेट (optimal regret) प्राप्त करने के लिए गैर-आईआईडी (non-i.i.d.) क्रियाओं को इंस्ट्रूमेंटल वेरिएबल्स के रूप में और एक होमियोमॉर्फिक निर्माण (homeomorphic construction) का उपयोग करता है, यहाँ तक कि डीप न्यूरल नेटवर्क और आपूर्ति-पक्ष के शोर (supply-side noise) की उपस्थिति में भी।

Rui Ai, David Simchi-Levi, Feng Zhu2026-07-14
🤖 machine learning

Self-Creating Random Walks for Decentralized Learning under Pac-Man Attacks

यह शोध पत्र "पैक-मैन" हमलों के प्रति रैंडम वॉक-आधारित विकेंद्रीकृत शिक्षण की संवेदनशीलता को संबोधित करता है, जहाँ दुर्भावनापूर्ण नोड्स वॉक को समाप्त कर देते हैं, और CREATE-IF-LATE (CIL) एल्गोरिदम का प्रस्ताव करता है जो वॉक आबादी की गैर-विलुप्ति सुनिश्चित करता है और केवल रैखिक समय विलंब के साथ अभिसरण की गारंटी देता है।

Xingran Chen, Parimal Parag, Rohit Bhagat, Salim El Rouayheb2026-07-14
📊 statistics

Reinforcement Learning in the Real World: A Survey of Statistical Challenges and Future Directions

यह शोध पत्र व्यावहारिक अनुप्रयोग को ऑनलाइन अनुकूलन, ऑफलाइन विश्लेषण और पुनरावृत्ति पुनर्नियोजन की एक चक्रीय प्रक्रिया के रूप में रूपरेखाबद्ध करके, सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) अनुसंधान और वास्तविक दुनिया की तैनाती के बीच के अंतर को पाटने में आने वाली सांख्यिकीय चुनौतियों और पद्धतिगत प्रगति का सर्वेक्षण करता है, साथ ही प्रभावशाली, उपयोग-प्रेरित अनुसंधान के लिए भविष्य की दिशाओं को रेखांकित करता है।

Asim H. Gazi, Yongyi Guo, Daiqi Gao, Ziping Xu, Kelly W. Zhang, Susan A. Murphy2026-07-14