💬 NLP

Adaptive Margin RLHF via Preference over Preferences

यह शोध पत्र 'अडेप्टिव मार्जिन RLHF' (Adaptive Margin RLHF) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो रिवॉर्ड मॉडलिंग और एलाइनमेंट के लिए गतिशील, डेटा-विशिष्ट मार्जिन को अनुमानित करने हेतु "प्रेफरेंस-ओवर-प्रेफरेंस" (preference-over-preference) एनोटेशन का लाभ उठाता है, और विशेष सैंपलिंग रणनीतियों के माध्यम से दोनों के बीच के ट्रेड-ऑफ को संबोधित करते हुए डिस्क्रिमिनेटिव और जनरेटिव प्रदर्शन दोनों को बढ़ाने के लिए DPO-PoP एल्गोरिदम पेश करता है।

Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum2026-07-07
🤖 AI

OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling

OctoPipe एक पाइपलाइन पैरेललिज्म सिस्टम है जो एक ग्राफ-आधारित सिम्युलेटर, एक इटरेटिव ट्यूनर और एक यूनिफाइड एक्सेक्यूटर के माध्यम से पार्टिशनिंग, प्लेसमेंट और शेड्यूलिंग को सह-अनुकूलित (co-optimize) करके हेट्रोजेनियस लार्ज लैंग्वेज मॉडल्स में ट्रेनिंग बबल्स को कम करता है, जिससे अत्याधुनिक दृष्टिकोणों की तुलना में 1.15–1.44x थ्रूपुट सुधार प्राप्त होता है।

Jihu Guo, Tenghui Ma, Wei Gao, Peng Sun, Xun Chen, Jiaxing Li, Zhisheng Ye, Yuyang Jin, Dahua Lin2026-07-07
🤖 AI

Activation-Deactivation: A General Framework for Robust Post-hoc Explainable AI

यह शोध पत्र एक्टिवेशन-डीएक्टिवेशन (AD) को प्रस्तुत करता है, जो एक नवीन पोस्ट-हॉक व्याख्यात्मकता ढांचा (explainability framework) है जो अधिक सुदृढ़ और हस्तांतरणीय स्पष्टीकरण उत्पन्न करने के लिए इनपुट गड़बड़ी (input perturbations) के स्थान पर आंतरिक मॉडल निष्क्रियता (internal model deactivation) का उपयोग करता है, जिसमें अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती है।

Akchunya Chanchal, David A. Kelly, Hana Chockler2026-07-07
🤖 AI

The Three Regimes of Offline-to-Online Reinforcement Learning

यह शोध पत्र एक स्थिरता-प्लास्टिसिटी (stability-plasticity) ढांचे का प्रस्ताव करता है जो ऑफलाइन डेटासेट और प्रीट्रेन्ड पॉलिसियों की सापेक्ष शक्ति के आधार पर ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) को तीन विशिष्ट श्रेणियों में वर्गीकृत करता है, एक ऐसा सिद्धांत जिसे बड़े पैमाने पर अनुभवजन्य परिणामों द्वारा प्रमाणित किया गया है जो अधिकांश मामलों में डिज़ाइन विकल्पों के साथ मजबूत संरेखण प्रदर्शित करते हैं।

Lu Li, Tianwei Ni, Yihao Sun, Pierre-Luc Bacon2026-07-07
🤖 AI

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

यह शोध पत्र SilvaScenes को प्रस्तुत करता है, जो प्राकृतिक वनों में 28 वृक्ष प्रजातियों वाली 1,421 अंडर-कैनोपी छवियों का एक व्यापक बेंचमार्क डेटासेट है, ताकि यह प्रदर्शित करके वानिकी स्वचालन (फॉरेस्ट्री ऑटोमेशन) में वर्तमान अंतराल को संबोधित किया जा सके कि जहाँ ट्रंक सेगमेंटेशन (तने का विभाजन) व्यवहार्य है, वहीं अवरोध (ऑक्लूजन) और प्रजातियों के असंतुलन के कारण सूक्ष्म-स्तरीय प्रजाति वर्गीकरण एक महत्वपूर्ण चुनौती बनी हुई है।

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defo (…)2026-07-07
🤖 AI

Conditional Clifford-Steerable CNNs for PDE Modeling

यह शोध पत्र कंडीशनल क्लिफोर्ड-स्टीयरेबल सीएनएन (C-CSCNNs) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो मानक स्वरूपों की सीमाओं को दूर करने के लिए इनपुट-निर्भर इक्विवेरिएंट निरूपणों के साथ कर्नेल आधारों को संवर्धित करके मॉडल की अभिव्यक्ति क्षमता को बढ़ाता है, जिससे द्रव गतिज विज्ञान और सापेक्षतावादी इलेक्ट्रोडायनामिक्स जैसे PDE पूर्वानुमान कार्यों में उत्कृष्ट प्रदर्शन प्राप्त होता है।

Bálint László Szarvas, Maksim Zhdanov2026-07-07
🤖 AI

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

यह ज्ञान का व्यवस्थितकरण (SoK) शोध पत्र एकीकृत वर्गीकरण (taxonomies) प्रस्तावित करके, मूल्यांकन मेटाडेटा को औपचारिक रूप देकर, और हमलों एवं सुरक्षा उपायों के पुनरुत्पादनीय, लागत-सचेत और तुलनात्मक मूल्यांकन को सक्षम करने के लिए नए डेटासेट और उपकरणों के साथ एक मॉड्यूलर प्लेटफॉर्म जारी करके, LLM प्रॉम्प्ट सुरक्षा के खंडित मूल्यांकन को संबोधित करता है।

Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong2026-07-07
🤖 AI

Resilient by Design -- Active Inference for Distributed Continuum Intelligence

यह कार्य-प्रगति (work-in-progress) शोधपत्र प्रोबेबिलिस्टिक एक्टिव इन्फरेंस रेजिलिएंस एजेंट (PAIR-Agent) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो वितरित कंप्यूटिंग निरंतरता (distributed computing continuum) में दोषों (faults) को स्वायत्त रूप से पहचानने और उन्हें ठीक करने के लिए कॉज़ल फॉल्ट ग्राफ्स और फ्री एनर्जी प्रिंसिपल का लाभ उठाता है, जिससे जटिल, विषम एआई-संचालित प्रणालियों में सेवा निरंतरता और स्थिरता सुनिश्चित होती है।

Praveen Kumar Donta, Alfreds Lapkovskis, Enzo Mingozzi, Schahram Dustdar2026-07-07
💬 NLP

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

SpatialThinker एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो डेंस स्पेशियल रिवॉर्ड्स के साथ ऑनलाइन रीइन्फोर्समेंट लर्निंग का उपयोग करके एक ही पास में सीन ग्राफ जनरेशन और विजुअल रीजनिंग को एकीकृत करता है, जिससे सीमित प्रशिक्षण डेटा के साथ भी स्थानिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark2026-07-07
🤖 AI

KAN vs LSTM Performance in Time Series Forecasting

यह अध्ययन प्रदर्शित करता है कि जबकि बेसलाइन कोलमोगोरोव-आर्नोल्ड नेटवर्क (KAN) प्रशिक्षण के दौरान तेजी से अभिसरित (converge) होते हैं, लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क स्टोकेस्टिक, गैर-स्थिर वित्तीय समय श्रृंखला (stochastic, non-stationary financial time series) के लिए उनकी तुलना में पूर्वानुमानित सटीकता में काफी बेहतर प्रदर्शन करते हैं, जिससे सटीकता-महत्वपूर्ण पूर्वानुमान कार्यों के लिए LSTM को एक श्रेष्ठ विकल्प के रूप में स्थापित किया गया है।

Tabish Ali Rather, S M Mahmudul Hasan Joy, Nadezda Sukhorukova, Federico Frascoli2026-07-07