🤖 machine learning

Incentivizing Vision Language Models to Search for Long Video Question Answering

यह शोध पत्र VSeek को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो न्यूरो-सिम्बोलिक रिवार्ड्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके लंबे वीडियो आधारित प्रश्न-उत्तर को उन्नत करता है, जिससे इस कार्य को एक बहु-चरण खोज प्रक्रिया में परिवर्तित किया जाता है जो औपचारिक टेम्पोरल लॉजिक विनिर्देशों के विरुद्ध पुनर्प्राप्त दृश्य साक्ष्यों को व्यवस्थित रूप से सत्यापित करती है।

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali2026-07-07
💬 NLP

Individual Parameters in Weight-Sparse Transformers Appear Interpretable

यह शोध पत्र एक स्वचालित LLM पाइपलाइन प्रस्तुत करता है जो यह सत्यापित करता है कि क्या ट्रांसफॉर्मर में व्यक्तिगत वेट्स (weights) के पास वैश्विक रूप से व्याख्या योग्य कार्य होते हैं, जिसमें यह पाया गया कि डेंस मॉडल्स की तुलना में वेट-स्पार्स (weight-sparse) मॉडल्स में ऐसे व्याख्या योग्य वेट्स का एक काफी अधिक हिस्सा (12–31%) होता है।

Arnau Marin-Llobet, Stefan Heimersheim2026-07-07
🧬 biology

Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation

यह शोधपत्र MolBasic को प्रस्तुत करता है, जो एक संरचना-प्रथम (structure-first) ढांचा है जो द्विदिशीय SMILES-ग्राफ अनुवाद और एक प्रगतिशील चेन-ऑफ-थॉट (Chain-of-Thought) शिक्षण योजना का उपयोग करके आणविक बड़े भाषा मॉडलों की संरचनात्मक समझ और डाउनस्ट्रीम प्रदर्शन को बढ़ाता है।

Wenda Wang, Jinjia Feng, Zhewei Wei2026-07-07
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

यह शोध पत्र यह प्रदर्शित करके मॉडल मर्जिंग और डिस्ट्रिब्यूटेड लर्निंग के बीच के अंतर को पाटता है कि नेस्टरोव मोमेंटम के साथ आइसो-सी (Iso-C) मर्जिंग तकनीक को अनुकूलित करना (IsoLoCo), कम-कम्युनिकेशन वाले डिस्ट्रिब्यूटेड ट्रेनिंग में मौजूदा डिलोको (DiLoCo) विधियों से काफी बेहतर प्रदर्शन करता है, विशेष रूप से जैसे-जैसे स्थानीय वर्कर्स की संख्या बढ़ती है।

Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky2026-07-07
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

ओम्नीफोकस (OmniFocus) एक प्रशिक्षण-मुक्त, क्वेरी-निर्देशित टोकन संपीड़न विधि है जो ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स के लिए ऑडियो और वीडियो टोकन के महत्व का स्वतंत्र रूप से आकलन करके मोडैलिटी-सिमेट्रिक संपीड़न प्राप्त करती है, जिससे क्रॉस-मोडल संरेखण को बनाए रखते हुए और सटीकता-दक्षता ट्रेड-ऑफ में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करते हुए अनुमान लागत को कम किया जाता है।

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun2026-07-07
🤖 AI

STELLA: Efficient Sensor-to-LLM Translation for On-Device Human Activity Recognition

STELLA एक कुशल ऑन-डिवाइस ह्यूमन एक्टिविटी रिकग्निशन फ्रेमवर्क है जो कच्चे सेंसर डेटा को एक फ्रोजन LLM के लिए कॉम्पैक्ट लेटेंट टोकन में संकुचित करके अत्याधुनिक प्रदर्शन और गोपनीयता-संरक्षित वैयक्तिकरण प्राप्त करता है, जिससे अनुकूलन का बोझ मॉडल से हटाकर एक हल्के, उपयोगकर्ता-विशिष्ट टोकेनाइज़र पर स्थानांतरित कर दिया जाता है।

Nirhoshan Sivaroopan, Albert Zomaya, Kanchana Thilakarathna2026-07-07
⚛️ high-energy theory

Graph Neural Networks for the Graphical Bootstrap

यह शोध पत्र प्रदर्शित करता है कि ग्राफ ट्रांसफॉर्मर सहित ग्राफ न्यूरल नेटवर्क, प्लेनर N=4\mathcal{N}=4 सुपर-यांग-मिल्स थ्योरी के 2 करोड़ से अधिक ग्राफों पर लगभग पूर्ण वर्गीकरण सटीकता प्राप्त कर सकते हैं और रेडंडेंट डेटा को 85.5% तक कम करके ग्राफिकल बूटस्ट्रैप एल्गोरिदम को महत्वपूर्ण रूप से त्वरित कर सकते हैं।

Rigers Aliaj, Gabriele Dian, Reza Doobary, Paul Heslop2026-07-07
📊 statistics

Dimension Reduction for Curves: Simplified and Generalized

यह शोध पत्र उच्च-आयामी बहुभुज वक्रों (polygonal curves) और खंडीय रैखिक सतहों (piecewise linear surfaces) के लिए आयाम न्यूनीकरण प्राप्त करने हेतु स्पार्स ऑब्लिवियस सबस्पेस एम्बेडिंग्स (sparse oblivious subspace embeddings) का उपयोग करते हुए एक सरलीकृत प्रमाण और एक सामान्यीकृत ढांचा प्रस्तुत करता है, जो फ्रेचेट (Fréchet), qq-DTW, और हॉउसडॉर्फ (Hausdorff) दूरियों सहित दूरियों के एक व्यापक वर्ग को संरक्षित करता है।

Matthijs Ebbens, Jie Lu, Alexander Munteanu2026-07-07
⚡ electrical engineering

Open-Set Source Tracing as Compositional Factors via Structured Prototypes

यह शोध पत्र एक नवीन ओपन-सेट सोर्स ट्रेसिंग फ्रेमवर्क प्रस्तावित करता है जो जनरेटिव ओरिजिन्स को कंपोजिशनल फैक्टर्स के रूप में पुनर्व्याख्या करता है और रोबस्ट कंपोजिशनल जनरलाइजेशन प्राप्त करने के लिए सबस्पेस पार्टीशनिंग के साथ स्ट्रक्चर्ड ऑर्थोनॉर्मल प्रोटोटाइप्स का उपयोग करता है, जो फ्यू-शॉट आइडेंटिफिकेशन कार्यों में मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Santiago Rubio, Antonio Almudévar, Antonio Miguel, Eduardo Lleida, Alfonso Ortega2026-07-07
📊 statistics

CuBAS: Information Geometric Curvature-Based Adaptive Sampling for Supervised Classification

CuBAS एक सूचनात्मक-ज्यामितीय (information-geometric) अनुकूली नमूनाकरण ढांचा है जो पर्यवेक्षित वर्गीकरण (supervised classification) के लिए पॉट्स मार्कोव रैंडम फील्ड मॉडल से प्राप्त स्थानीय वक्रता (local curvature) का लाभ उठाकर समरूप और सीमा-सूचनात्मक डेटा बिंदुओं दोनों की पहचान और चयन करता है, जिससे मौजूदा विधियों की तुलना में विविध डेटासेट पर बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Alexandre L. M. Levada2026-07-07