🤖 machine learning

Disentangled Unsupervised Skill Discovery for Efficient Hierarchical Reinforcement Learning

यह शोध पत्र डिसेंटैंगल्ड अनसुपरवाइज्ड स्किल डिस्कवरी (DUSDi) का प्रस्ताव करता है, जो एक म्यूचुअल-इन्फॉर्मेशन-आधारित ऑब्जेक्टिव और वैल्यू फैक्टराइजेशन के माध्यम से पुन: प्रयोज्य, फैक्टर-विशिष्ट कौशल सीखने की एक नवीन विधि है, जो डाउनस्ट्रीम पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) कार्यों को कुशलतापूर्वक हल करने में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

Jiaheng Hu, Zizhao Wang, Peter Stone, Roberto Martín-Martín2026-07-14
📊 statistics

Low-dimensional adaptation of diffusion models: Convergence in total variation

यह शोध पत्र यह स्थापित करता है कि DDIM और DDPM दोनों सैंपलर, परिवेशी आयाम (ambient dimension) के बजाय लक्षित वितरण की अंतर्निहित निम्न-आयामी संरचना पर निर्भर त्वरित अभिसरण दरएं (accelerated convergence rates) प्राप्त करते हैं, जो DDIM-प्रकार के सैंपलर के लिए इस अनुकूलनशीलता का पहला कठोर प्रमाण प्रदान करता है और कर्नेल-आधारित अनुमानकों (kernel-based estimators) के माध्यम से सीखे गए स्कोर फलनों (learned score functions) वाले परिवेशों में इन गारंटियों का विस्तार करता है।

Jiadong Liang, Zhihan Huang, Yuxin Chen2026-07-14
🤖 machine learning

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

यह शोध पत्र TMO को प्रस्तुत करता है, जो एक डिवाइस-क्लाउड सहयोगात्मक LLM इन्फरेंस सिस्टम है जो मल्टी-मोडल, मल्टी-टास्क और मल्टी-टर्न बातचीत के बीच ऑफलोडिंग निर्णयों को गतिशील रूप से अनुकूलित करने के लिए एक संसाधन-सीमित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) रणनीति का उपयोग करता है, जिससे ऑन-डिवाइस परिनियोजन की संसाधन सीमाओं और क्लाउड-ओनली समाधानों के संचार ओवरहेड को दूर करते हुए प्रतिक्रिया गुणवत्ता, विलंबता और लागत के बीच संतुलन बनाया जा सके।

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton2026-07-14
💬 NLP

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

यह शोध पत्र SpurLens का परिचय देता है, जो एक स्वचालित पाइपलाइन है जो यह प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) महत्वपूर्ण स्प्यूरियस बायस (spurious biases) से ग्रस्त हैं जिससे ऑब्जेक्ट रिकग्निशन की विफलताएं और एम्प्लीफाइड हैलुसिनेशन (amplified hallucinations) होते हैं, और साथ ही उनकी विश्वसनीयता बढ़ाने के लिए शमन रणनीतियों (mitigation strategies) का भी अन्वेषण करता है।

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi2026-07-14
🤖 AI

Measuring AI Ability to Complete Long Software Tasks

यह शोध पत्र मानव प्रयास के साथ उनकी तुलना करके एआई (AI) क्षमताओं को मापने के लिए "50%-कार्य-पूर्णता समय क्षितिज" (50%-task-completion time horizon) मीट्रिक प्रस्तुत करता है, जिसमें यह पाया गया है कि फ्रंटियर मॉडल अब उन कार्यों को 50 मिनट में पूरा कर सकते हैं जिन्हें पूरा करने में मनुष्यों को आमतौर पर 50 मिनट लगते हैं, और यह दोगुना होने का रुझान सुझाव देता है कि एआई पांच वर्षों के भीतर महीने भर के सॉफ्टवेयर कार्यों को स्वचालित कर सकता है।

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney (…)2026-07-14
🧬 biology

A computational model of infant sensorimotor exploration in the mobile paradigm

यह शोध पत्र एक कम्प्यूटेशनल मॉडल प्रस्तुत करता है जिसमें न्यूरल नेटवर्क, क्रिया-परिणाम भविष्यवाणी और जैविक रूप से प्रेरित मोटर नियंत्रण शामिल हैं, जो मोबाइल प्रतिमान (मोबाइल पैराडाइम) में शिशु व्यवहार को सफलतापूर्वक दोहराता है, जिसमें अंगों की पसंदीदा गति और विच्छेदन के बाद के विस्फोट (पोस्ट-डिस्कनेक्शन बर्स्ट्स) शामिल हैं, जिससे प्रारंभिक संवेदी-मोटर शिक्षण के अंतर्निहित प्रमुख तंत्रों की पहचान होती है।

Josua Spisak, Sergiu Tcaci Popescu, Stefan Wermter, Matej Hoffmann, J. Kevin O'Regan2026-07-14
🤖 machine learning

A Provably Convergent Plug-and-Play Framework for Stochastic Bilevel Optimization

यह शोध पत्र PnPBO को प्रस्तुत करता है, जो स्टोकेस्टिक बाइलेवल ऑप्टिमाइज़ेशन के लिए एक प्रमाणित रूप से अभिसारी (provably convergent) प्लग-एंड-प्ले फ्रेमवर्क है, जो एकल-स्तरीय अनुकूलन (single-level optimization) के समान इष्टतम सैंपल कॉम्प्लेक्सिटी प्राप्त करने के लिए विभिन्न स्टोकेस्टिक एस्टिमेटर्स को एकीकृत करता है, जिससे इस खुले प्रश्न का समाधान होता है कि क्या बाइलेवल ऑप्टिमाइज़ेशन एकल-स्तरीय विधियों की दक्षता का मुकाबला कर सकता है।

Tianshu Chu, Dachuan Xu, Wei Yao, Chengming Yu, Jin Zhang2026-07-14
🤖 machine learning

A Learning-Based Ansatz Satisfying Boundary Conditions in Variational Problems

यह शोध पत्र एक लर्निंग-आधारित एंसेट (ansatz) प्रस्तावित करता है जो वेरिएशनल समस्याओं के लिए सीमा स्थितियों (boundary conditions) को स्वाभाविक रूप से संतुष्ट करता है, जिससे दंड पदों (penalty terms) की आवश्यकता समाप्त हो जाती है और अनुकूलन स्थिरता एवं सटीकता सुनिश्चित करने के लिए कठोर सोबोलेव नॉर्म (Sobolev norm) गारंटी प्रदान की जाती है।

Rafael Florencio, Julio Guerrero2026-07-14
🤖 machine learning

Fair Supervised Learning Through Constraints on Smooth Nonconvex Unfairness-Measure Surrogates

यह शोध पत्र एक नई निष्पक्ष पर्यवेक्षित शिक्षण (supervised learning) रणनीति प्रस्तावित करता है जो अन्याय के मापों के लिए एक नवीन सुचारू गैर-उत्तल (smooth nonconvex) सरोगेट पर कठोर बाधाओं का उपयोग करती है, जिससे नियमितीकरण-आधारित दृष्टिकोणों से जुड़ी ट्यूनिंग की कठिनाइयों और अनुकूलन चुनौतियों के बिना कई निष्पक्षता सहनशीलता को सुलभ रूप से लागू करना सक्षम होता है।

Zahra Khatti, Daniel P. Robinson, Frank E. Curtis2026-07-14
🤖 machine learning

Adaptive Reinforcement Learning for Unobservable Random Delays

यह शोध पत्र एक सामान्य इंटरेक्शन लेयर फ्रेमवर्क और एक मॉडल-आधारित एक्टर-क्रिटिक विद डिले अडैप्टेशन (ACDA) एल्गोरिदम प्रस्तुत करता है जो सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एजेंटों को अदृश्य, समय-परिवर्तनीय विलंब (डिली) और पैकेट लॉस के प्रति गतिशील रूप से अनुकूल होने में सक्षम बनाता है, जो लोकोमोशन बेंचमार्क में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

John Wikman, Alexandre Proutiere, David Broman2026-07-14