💬 NLP

DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

यह शोध पत्र DynamixSFT का प्रस्ताव करता है, जो एक गतिशील और स्वचालित विधि है जो समस्या को प्रायर-स्केल्ड बोल्ट्ज़मैन एक्सप्लोरेशन (Prior-scaled Boltzmann Exploration) और 1-स्टेप लुक-अहेड रिवॉर्ड (1-Step Look-ahead Reward) के साथ एक मल्टी-आर्म्ड बैंडिट (multi-armed bandit) के रूप में फ्रेम करके इंस्ट्रक्शन-ट्यूनिंग डेटासेट मिश्रणों को अनुकूलित करती है, जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ कई बेंचमार्क पर मॉडल के प्रदर्शन को प्रभावी रूप से बढ़ाती है।

Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong2026-07-07
🤖 AI

EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention

EyeMulator एक मॉडल-अज्ञेय (model-agnostic) विधि है जो मानव आई-ट्रैकिंग डेटा को सिमेंटिक सैलिएंस (semantic salience) और गेज़-ट्रांज़िशन प्रायर्स (gaze-transition priors) में आसवित (distill) करके कोड लैंग्वेज मॉडल्स को बेहतर बनाती है ताकि टोकन-स्तरीय प्रशिक्षण लॉस को पुन: भारित (reweight) किया जा सके, जिसके परिणामस्वरूप विभिन्न मॉडल्स और कार्यों में निरंतर प्रदर्शन सुधार प्राप्त होता है।

Yifan Zhang, Chen Huang, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang2026-07-07
🔬 physics

Agentic Artificial Intelligence for Multistage Physics Experiments at a Large-Scale User Facility Particle Accelerator

यह शोध पत्र एक उत्पादन सिनक्रोट्रॉन लाइट सोर्स (production synchrotron light source) में तैनात पहले भाषा-मॉडल-संचालित एजेंटिक एआई (language-model-driven agentic AI) सिस्टम प्रस्तुत करता है जो प्राकृतिक भाषा के प्रॉम्प्ट्स को सुरक्षित, ऑडिट योग्य और पुनरुत्पादक वर्कफ़्लो में अनुवाद करके जटिल, बहु-चरणीय भौतिकी प्रयोगों को स्वायत्त रूप से निष्पादित करता है, जिससे ऑपरेटर सुरक्षा बाधाओं का कड़ाई से पालन करते हुए तैयारी के समय में दो-क्रम का (two-order-of-magnitude) ઘટાड़ा गया है।

Thorsten Hellert, Drew Bertwistle, Simon C. Leemann, Antonin Sulc, Marco Venturini2026-07-07
💬 NLP

Polarity Detection of Sustainable Development Goals in News Text

यह शोध पत्र सतत विकास लक्ष्यों (SDG) की ओर विशिष्ट प्रगति या प्रतिगमन को निर्धारित करने के लिए 'एसडीजी पोलैरिटी डिटेक्शन' (SDG polarity detection) के नवीन कार्य को प्रस्तुत करता है, जो SDG-POD बेंचमार्क डेटासेट पेश करता है और यह प्रदर्शित करता है कि फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स, विशेष रूप से सिंथेटिक डेटा के साथ संवर्धित QWQ-32B, इस चुनौती को प्रभावी ढंग से संबोधित करते हैं।

Andrea Cadeddu, Alessandro Chessa, Vincenzo De Leo, Gianni Fenu, Francesco Osborne, Diego Reforgiato Recupero, Angelo Sa (…)2026-07-07
💬 NLP

Adaptive Margin RLHF via Preference over Preferences

यह शोध पत्र 'अडेप्टिव मार्जिन RLHF' (Adaptive Margin RLHF) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो रिवॉर्ड मॉडलिंग और एलाइनमेंट के लिए गतिशील, डेटा-विशिष्ट मार्जिन को अनुमानित करने हेतु "प्रेफरेंस-ओवर-प्रेफरेंस" (preference-over-preference) एनोटेशन का लाभ उठाता है, और विशेष सैंपलिंग रणनीतियों के माध्यम से दोनों के बीच के ट्रेड-ऑफ को संबोधित करते हुए डिस्क्रिमिनेटिव और जनरेटिव प्रदर्शन दोनों को बढ़ाने के लिए DPO-PoP एल्गोरिदम पेश करता है।

Yaswanth Chittepu, Prasann Singhal, Greg Durrett, Scott Niekum2026-07-07
🤖 AI

OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling

OctoPipe एक पाइपलाइन पैरेललिज्म सिस्टम है जो एक ग्राफ-आधारित सिम्युलेटर, एक इटरेटिव ट्यूनर और एक यूनिफाइड एक्सेक्यूटर के माध्यम से पार्टिशनिंग, प्लेसमेंट और शेड्यूलिंग को सह-अनुकूलित (co-optimize) करके हेट्रोजेनियस लार्ज लैंग्वेज मॉडल्स में ट्रेनिंग बबल्स को कम करता है, जिससे अत्याधुनिक दृष्टिकोणों की तुलना में 1.15–1.44x थ्रूपुट सुधार प्राप्त होता है।

Jihu Guo, Tenghui Ma, Wei Gao, Peng Sun, Xun Chen, Jiaxing Li, Zhisheng Ye, Yuyang Jin, Dahua Lin2026-07-07
🤖 AI

Activation-Deactivation: A General Framework for Robust Post-hoc Explainable AI

यह शोध पत्र एक्टिवेशन-डीएक्टिवेशन (AD) को प्रस्तुत करता है, जो एक नवीन पोस्ट-हॉक व्याख्यात्मकता ढांचा (explainability framework) है जो अधिक सुदृढ़ और हस्तांतरणीय स्पष्टीकरण उत्पन्न करने के लिए इनपुट गड़बड़ी (input perturbations) के स्थान पर आंतरिक मॉडल निष्क्रियता (internal model deactivation) का उपयोग करता है, जिसमें अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती है।

Akchunya Chanchal, David A. Kelly, Hana Chockler2026-07-07
🤖 AI

The Three Regimes of Offline-to-Online Reinforcement Learning

यह शोध पत्र एक स्थिरता-प्लास्टिसिटी (stability-plasticity) ढांचे का प्रस्ताव करता है जो ऑफलाइन डेटासेट और प्रीट्रेन्ड पॉलिसियों की सापेक्ष शक्ति के आधार पर ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) को तीन विशिष्ट श्रेणियों में वर्गीकृत करता है, एक ऐसा सिद्धांत जिसे बड़े पैमाने पर अनुभवजन्य परिणामों द्वारा प्रमाणित किया गया है जो अधिकांश मामलों में डिज़ाइन विकल्पों के साथ मजबूत संरेखण प्रदर्शित करते हैं।

Lu Li, Tianwei Ni, Yihao Sun, Pierre-Luc Bacon2026-07-07
🤖 AI

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

यह शोध पत्र SilvaScenes को प्रस्तुत करता है, जो प्राकृतिक वनों में 28 वृक्ष प्रजातियों वाली 1,421 अंडर-कैनोपी छवियों का एक व्यापक बेंचमार्क डेटासेट है, ताकि यह प्रदर्शित करके वानिकी स्वचालन (फॉरेस्ट्री ऑटोमेशन) में वर्तमान अंतराल को संबोधित किया जा सके कि जहाँ ट्रंक सेगमेंटेशन (तने का विभाजन) व्यवहार्य है, वहीं अवरोध (ऑक्लूजन) और प्रजातियों के असंतुलन के कारण सूक्ष्म-स्तरीय प्रजाति वर्गीकरण एक महत्वपूर्ण चुनौती बनी हुई है।

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defo (…)2026-07-07
🤖 AI

Conditional Clifford-Steerable CNNs for PDE Modeling

यह शोध पत्र कंडीशनल क्लिफोर्ड-स्टीयरेबल सीएनएन (C-CSCNNs) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो मानक स्वरूपों की सीमाओं को दूर करने के लिए इनपुट-निर्भर इक्विवेरिएंट निरूपणों के साथ कर्नेल आधारों को संवर्धित करके मॉडल की अभिव्यक्ति क्षमता को बढ़ाता है, जिससे द्रव गतिज विज्ञान और सापेक्षतावादी इलेक्ट्रोडायनामिक्स जैसे PDE पूर्वानुमान कार्यों में उत्कृष्ट प्रदर्शन प्राप्त होता है।

Bálint László Szarvas, Maksim Zhdanov2026-07-07