💻 computer science

Graph Partitioning with Demands: Generalized Conductance and its Applications

यह शोध पत्र एक सामान्य मांग मॉडल (demand model) के तहत ग्राफ विभाजन के लिए 'सामान्यीकृत कंडक्टेंस समस्या' (Generalized Conductance Problem) प्रस्तुत करता है और एक O(logn)\mathcal{O}(\log n)-अनुमानित एल्गोरिदम (approximation algorithm) पेश करता है जो 'डिमांड के साथ ग्राफ विभाजन' (Graph Partitioning with Demands) और 'डिमांड के साथ पदानुक्रमित क्लस्टरिंग' (Hierarchical Clustering with Demands) के लिए द्वि-मानदंड अनुमानों (bicriteria approximations) तक विस्तृत है, जिसमें मल्टीप्लिकेटिव डिमांड्स और ट्रीज़ (trees) के लिए बेहतर गारंटी दी गई है।

Michał Szyfelbein, Dariusz Dereniowski2026-07-16
🤖 machine learning

Reassessing Muon for Matrix Factorization

यह शोध पत्र लो-रैंक मैट्रिक्स फैक्टराइजेशन पर म्यूऑन (Muon) ऑप्टिमाइज़र का पुनर्मूल्यांकन करता है ताकि इसके अपडेट नियम को भ्रमित करने वाले कारकों से अलग किया जा सके, जिससे यह प्रकट होता है कि यह लगातार एडमडब्ल्यू (AdamW) से बेहतर प्रदर्शन नहीं करता है और इसके रिपोर्ट किए गए लाभ अक्सर हाइपरपैरामीटर के चयन के प्रति संवेदनशील होते हैं।

Ali Parviz, Gal Mishne, Alex Cloninger2026-07-16
🤖 AI

Adapting Generalist Vehicle Models for High-Speed MPC Across Terrains

यह शोध पत्र OptCar प्रस्तुत करता है, जो एक हिस्ट्री-कंडीशन्ड डायनेमिक्स अडैप्टेशन मॉड्यूल और सिंथेटिक रोलआउट्स के साथ सीमित वास्तविक दुनिया के डेटा का उपयोग करके, विविध भूभागों और पेलोडों में सुदृढ़, उच्च-गति क्लोज्ड-लूप नियंत्रण प्राप्त करने के माध्यम से जनरलिटिस्ट और स्पेशलिस्ट वाहन मॉडलों के बीच के अंतर को पाटता है।

Rwik Rana, Jesse Quattrociocchi, Christian Ellis, Nathan Tsoi, Garrett Warnell, Joydeep Biswas2026-07-16
🤖 machine learning

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

यह शोध पत्र एक FLOP-अकाउंटिंग फ्रेमवर्क और RACE डायग्नोस्टिक प्रोटोकॉल प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि एक निश्चित बजट के तहत इष्टतम RL पोस्ट-ट्रेनिंग रणनीतियाँ सार्वभौमिक नहीं हैं बल्कि मॉडल का आकार, खोज की गहराई, लर्निंग अपडेट्स और फीडबैक मैकेनिज्म के बीच एक जटिल परस्पर क्रिया पर निर्भर करती हैं, जो शोधकर्ताओं से केवल कुल FLOPs के बजाय विस्तृत कंप्यूट आवंटन रिपोर्ट करने का आग्रह करती है।

Patrick Wilhelm, Odej Kao2026-07-16
💬 NLP

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL एक स्केलेबल, स्थिर GFlowNet-शैली का सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम बड़े भाषा मॉडलों के लिए पेश करता है जो इन-बैच मोंटे कार्लो अनुमानों और विशिष्ट स्टेबलाइजर्स का उपयोग करके सीखे गए पार्टिशन फंक्शन की आवश्यकता को समाप्त करता है, जिससे 235B पैरामीटर्स तक घने (dense) और विरल (sparse) दोनों आर्किटेक्चर में गणित, कोड और प्रतिकूल (adversarial) बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao2026-07-16
🤖 machine learning

Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

मानवीय "अहा मोमेंट" (aha moment) से प्रेरित होकर, यह शोध पत्र "एनलाइटनमेंट" (Enlightenment) का प्रस्ताव करता है, जो एक नवीन प्रशिक्षण-मुक्त पोस्ट-ट्यूनिंग प्रतिमान है जो भार (weights) को अपडेट करने के बजाय आर्किटेक्चरल शॉर्टकट्स को संशोधित करके बड़े पैमाने के मॉडलों में अंतर्निहित क्षमताओं को अनलॉक करता है, जिसके परिणामस्वरूप भाषा और विजन-लैंग्वेज कार्यों में अचानक और महत्वपूर्ण प्रदर्शन सुधार होता है।

Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang, Feifei Zhang, Hang-Cheng Dong, Feng-Lei Fan2026-07-16
💬 NLP

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

यह शोध पत्र ऑन-पॉलिसी डिस्टिलेशन (OPD) का एक अन्वेषण उत्प्रेरक के रूप में व्यवस्थित विश्लेषण करता है, हल्के सिग्नल रेगुलेशन के माध्यम से दो प्रमुख विकृतियों—स्टूडेंट-टीचर मिसमैच और लेंथ एक्सप्लोइटेशन—की पहचान और समाधान करता है, यह प्रदर्शित करते हुए कि स्थिर और प्रभावी LLM पोस्ट-ट्रेनिंग प्राप्त करने के लिए उच्च-गुणवत्ता वाले गाइडिंग सिग्नल्स, टीचर स्केल की तुलना में अधिक महत्वपूर्ण हैं।

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong2026-07-16
📊 statistics

Price of Fairness in Bandits: A Tight Minimax Characterization

यह शोध पत्र सख्त निष्पक्षता व्यवस्थाओं (strict fairness regimes) के लिए Ω(σkmax(1,q)/T)\Omega(\sigma\sqrt{k^{\max(1,q)}/T}) का एक एल्गोरिदम-स्वतंत्र निचला स्तर (lower bound) सिद्ध करके और \textsf{UCB-HARE} एल्गोरिदम को पेश करके मल्टी-आर्म्ड बैंडिट्स में निष्पक्षता की कीमत (price of fairness) का एक सटीक मिनिमैक्स लक्षण वर्णन (minimax characterization) स्थापित करता है, जो लॉगरिदमिक कारकों तक इस इष्टतम रिग्रेट दर (optimal regret rate) को प्राप्त करता है।

Dhruv Sarkar, Soumyadeep Dutta, Sayak Ray Chowdhury2026-07-16
🤖 machine learning

Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors

यह शोध पत्र METR टास्क स्टैंडर्ड पर आधारित एक ओपन इवैल्यूएशन टास्क पेश करता है जो यह परीक्षण करता है कि क्या फ्रंटियर एआई एजेंट्स हमलों को लागू करके, सुरक्षा स्कोर की गणना करके और रिपोर्ट तैयार करके स्वायत्त रूप से संरचित क्लिनिकल एआई सुरक्षा ऑडिट कर सकते हैं, जो यह प्रदर्शित करता है कि क्लाउड सोनेट 4.6 और GPT-4.1 जैसे मॉडल्स कई डेटासेट्स और आर्किटेक्चर में पूर्ण स्कोर प्राप्त कर सकते हैं।

Michael O. Eniolade2026-07-16
🤖 machine learning

Is the Statistical Advantage Worth the Cost? An Empirical Comparison of KANs and MLPs for Structured Data Classification

यह अनुभवजन्य अध्ययन यह प्रदर्शित करता है कि जहाँ कोलमोगोरोव-आर्नोल्ड नेटवर्क (KANs), संरचित सारणीबद्ध वर्गीकरण कार्यों में मल्टी-लेयर पर्सेप्ट्रॉन्स (MLPs) की तुलना में सांख्यिकीय रूप से बेहतर प्रदर्शन करते हैं, वहीं उनकी श्रेष्ठ सामान्यीकरण क्षमता उच्च कम्प्यूटेशनल और पैरामीटर लागतों के साथ आती है, जिससे KANs उच्च-परिशुद्धता अनुप्रयोगों के लिए आदर्श और MLPs संसाधन-सीमित वातावरण के लिए बेहतर बन जाते हैं।

Matthew Steven P. Toledo, Justine Raphael H. Jacinto, Vivekjeet Singh Chambal, Rodolfo C. Camaclang III, Jamlech Iram N. (…)2026-07-16