📊 statistics

Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems

यह शोधपत्र पास-एट-के (Pass-at-k) पॉलिसी ऑप्टिमाइजेशन (PKPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पृथक प्रयासों के बजाय नमूना सेटों की सामूहिक सफलता (pass@k) को सीधे अनुकूलित करने के लिए निष्पक्ष अनुमानकों (unbiased estimators) को व्युत्पन्न करता है, जिससे k-एनीलिंग (k-annealing) के माध्यम से pass@1 प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए अन्वेषण को बढ़ावा मिलता है और कठिन समस्याओं को हल करने में मदद मिलती है।

Christian Walder, Deep Karkhanis2026-06-11
🤖 AI

\texttt{Range-Arithmetic}: Verifiable Deep Learning Inference on an Untrusted Party

यह शोध पत्र \texttt{Range-Arithmetic} को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो गैर-अंकगणितीय ऑपरेशनों को सम-चेक प्रोटोकॉल (sum-check protocols) और रेंज प्रमाणों (range proofs) के अनुकूल अंकगणितीय चरणों में परिवर्तित करके अविश्वसनीय पक्षों (untrusted parties) पर कुशल और सत्यापन योग्य डीप लर्निंग इन्फरेंस को सक्षम बनाता है, जिससे मौजूदा विधियों की तुलना में कम्प्यूटेशनल लागत और संचार ओवरहेड कम हो जाता है।

Ali Rahimi, Babak H. Khalaj, Mohammad Ali Maddah-Ali2026-06-11
🤖 AI

MLaGA: Multimodal Large Language and Graph Assistant

यह शोध पत्र MLaGA को प्रस्तुत करता है, जो एक नवीन मल्टीमॉडल असिस्टेंट है जो एक स्ट्रक्चर-अवेयर एनकोडर और इंस्ट्रक्शन-ट्यूनिंग का उपयोग करके विविध टेक्स्ट और इमेज एट्रिब्यूट्स वाले जटिल ग्राफ स्ट्रक्चर्स पर प्रभावी ढंग से तर्क करने के माध्यम से ग्राफ विश्लेषण के अंतराल को पाटता है।

Dongzhe Fan, Yi Fang, Jiajin Liu, Djellel Difallah, Qiaoyu Tan2026-06-11
🤖 AI

T-ILR: a Neurosymbolic Integration for LTLf

यह शोध पत्र T-ILR को प्रस्तुत करता है, जो एक न्यूरोसिंबोलिक फ्रेमवर्क है जो अनुक्रम-आधारित कार्यों के लिए डीप लर्निंग आर्किटेक्चर में लीनियर टेम्पोरल लॉजिक ओवर फाइनाइट ट्रेसेस (LTLf) को सीधे एकीकृत करता है, और मौजूदा अत्याधुनिक विधियों की तुलना में बेहतर सटीकता और कम्प्यूटेशनल दक्षता प्रदर्शित करता है।

Riccardo Andreoni, Andrei Buliga, Alessandro Daniele, Chiara Ghidini, Marco Montali, Massimiliano Ronzani2026-06-11
🤖 machine learning

The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network

यह अध्ययन प्रदर्शित करता है कि लीला चेस ज़ीरो (Leela Chess Zero) में, न्यूरल नेटवर्क का आंतरिक एल्गोरिद्मिक लुक-अहेड (look-ahead) शतरंज की पहेलियों को सही ढंग से हल करता है, लेकिन ये समाधान अंतिम आउटपुट में सीखे गए सुरक्षा पूर्वाग्रहों (safety priors) द्वारा व्यवस्थित रूप से ओवरराइड कर दिए जाते हैं, जो यह सिद्ध करता है कि एल्गोरिद्मिक संरचना की उपस्थिति एल्गोरिद्मिक व्यवहार की गारंटी नहीं देती है।

Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek2026-06-11
🤖 machine learning

Generalizing Beyond Suboptimality: Offline Reinforcement Learning Learns Effective Scheduling through Random Solutions

यह शोध पत्र CDQAC को प्रस्तुत करता है, जो एक ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो स्थिर, उप-इष्टतम (suboptimal) डेटासेट से प्रभावी जॉब शॉप और फ्लेक्सिबल जॉब शॉप शेड्यूलिंग नीतियां सीखता है, और यह प्रदर्शित करता है कि उच्च प्रदर्शन और नमूना दक्षता (sample efficiency) के लिए प्रक्षेपवक्र गुणवत्ता (trajectory quality) की तुलना में व्यापक अवस्था-क्रिया कवरेज (state-action coverage) अधिक महत्वपूर्ण है।

Jesse van Remmerden, Zaharah Bukhsh, Yingqian Zhang2026-06-11
🤖 AI

GPO: Learning from Critical Steps to Improve LLM Reasoning

यह शोध पत्र गाइडेड पिवोटल ऑप्टिमाइज़ेशन (GPO) को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग रणनीति है जो एडवांटेज एस्टीमेशन के माध्यम से रीजनिंग ट्राजेक्टरीज के भीतर महत्वपूर्ण चरणों की पहचान करके और इन पिवोटल क्षणों पर लर्निंग को प्राथमिकता देकर LLM रीजनिंग को बेहतर बनाती है, जिससे विभिन्न ऑप्टिमाइज़ेशन विधियों और बेंचमार्क में प्रदर्शन में उल्लेखनीय सुधार होता है।

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing2026-06-11
💬 NLP

Geometric Metrics and LLMs: What They Measure and When They Work

यह शोध पत्र LLM मूल्यांकन के लिए ज्यामितीय मेट्रिक्स का व्यवस्थित रूप से मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि कुछ मुख्य रूप से आउटपुट की लंबाई को दर्शाते हैं, अन्य मानक पाठ सांख्यिकी से परे मामूली लेकिन वास्तविक मूल्य प्रदान करते हैं, जिसमें विफलता का पता लगाना उनके सबसे आशाजनक निकट-अवधि अनुप्रयोग के रूप में पहचाना गया है।

Viacheslav Yusupov, Anna Antipina, Ameliia Alaeva, Danil Maksimov, Anna Vasileva, Tatyana Zaitseva, Alina Ermilova, Evge (…)2026-06-11
🤖 machine learning

Noise-Guided Transport for Imitation Learning

यह शोध पत्र नॉइज़-गाइडेड ट्रांसपोर्ट (NGT) को प्रस्तुत करता है, जो एक हल्का ऑफ-पॉलिसी इमिटेशन लर्निंग मेथड है जो कार्य को एक ऑप्टिमल ट्रांसपोर्ट समस्या के रूप में तैयार करता है जिसे एडवरसैरियल ट्रेनिंग के माध्यम से हल किया जाता है, और प्रीट्रेनिंग या विशेष आर्किटेक्चर की आवश्यकता के बिना कम-डेटा वाले परिदृश्यों में मजबूत प्रदर्शन प्राप्त करता है।

Lionel Blondé, Joao A. Candido Ramos, Alexandros Kalousis2026-06-11