📊 statistics

Domain-Shift-Aware Conformal Prediction for Large Language Models

यह शोध पत्र डोमेन-शिफ्ट-अवेयर कॉन्फॉर्मल प्रेडिक्शन (DS-CP) का प्रस्ताव देता है, जो एक नवीन ढांचा है जो टेस्ट प्रॉम्प्ट्स के साथ अपनी निकटता के आधार पर कैलिब्रेशन सैंपल्स को व्यवस्थित रूप से पुन: भारित (reweighting) करके डोमेन शिफ्ट के तहत लार्ज लैंग्वेज मॉडल्स के लिए अनिश्चितता परिमाणीकरण की विश्वसनीयता को बढ़ाता है, जिससे वैध कवरेज गारंटी सुरक्षित रहते हुए अनुकूलन क्षमता में सुधार होता है।

Zhexiao Lin, Yuanyuan Li, Neeraj Sarna, Yuanyuan Gao, Michael von Gablenz2026-06-02
💬 NLP

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM एक एकीकृत विज़न-लैंग्वेज मॉडल फ्रेमवर्क है जो एक नवीन KV कैश पुन: उपयोग रणनीति और ओवरलैप्ड चंक्स पर सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रशिक्षण को स्ट्रीमिंग इन्फरेंस के साथ संरेखित करके अनंत वीडियो स्ट्रीम की वास्तविक समय में, स्थिर समझ को सक्षम बनाता है, जिससे कम विलंबता बनाए रखते हुए लंबी अवधि के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han2026-06-02
🤖 machine learning

Learning-To-Measure: In-Context Active Feature Acquisition

यह शोध पत्र लर्निंग-टू-मेज़र (L2M) को प्रस्तुत करता है, जो एक मेटा-लर्निंग फ्रेमवर्क है जो अनिश्चितता के परिमाणीकरण के लिए ऑटो-रिग्रेसिव प्री-ट्रेनिंग और कंडीशनल म्यूचुअल इंफॉर्मेशन को अधिकतम करने वाले एक ग्रीडी एजेंट का लाभ उठाकर विविध कार्यों में इन-कॉन्टेक्स्ट एक्टिव फीचर एक्विजिशन को सक्षम बनाता है, जिससे प्रति-कार्य रिट्रेनिंग की आवश्यकता समाप्त हो जाती है और कम लेबल और उच्च मिसिंगनेस के तहत बेसलाइन्स से बेहतर प्रदर्शन होता है।

Yuta Kobayashi, Zilin Jing, Jiayu Yao, Hongseok Namkoong, Shalmali Joshi2026-06-02
🤖 AI

Video Reasoning without Training

यह शोध पत्र V-Reason को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम अनुकूलन विधि है जो एडेप्टिव माइक्रो-एक्सप्लोरेशन और माइक्रो-एक्सप्लोइटेशन चक्रों के माध्यम से लार्ज मल्टीमॉडल मॉडल्स को निर्देशित करने के लिए एंट्रॉपी-आधारित संकेतों का लाभ उठाती है, जिससे बिना किसी महंगी ट्रेनिंग के अत्याधुनिक वीडियो रीजनिंग प्रदर्शन प्राप्त होता है और टोकन के उपयोग में भी उल्लेखनीय कमी आती है।

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague2026-06-02
🤖 machine learning

The Geometry of Grokking: Norm Minimization on the Zero-Loss Manifold

यह शोध पत्र यह सिद्ध करके 'ग्रोकिंग' (grokking) के रूप में ज्ञात विलंबित सामान्यीकरण (delayed generalization) की घटना की व्याख्या करता है कि, कम लर्निंग रेट और वेट डिके (weight decay) की सीमा में, ग्रेडिएंट डिसेंट शून्य-हानि मैनिफोल्ड (zero-loss manifold) पर वेट नॉर्म (weight norm) को न्यूनतम करता है, जो कि पोस्ट-मेमोराइजेशन डायनेमिक्स (post-memorization dynamics) के लिए व्युत्पन्न एक क्लोज्ड-फॉर्म अभिव्यक्ति और प्रयोगात्मक सिमुलेशन के माध्यम से प्रमाणित एक तंत्र है।

Tiberiu Musat2026-06-02
🤖 AI

Who Evaluates AI's Social Impacts? Mapping Coverage and Gaps in First and Third Party Evaluations

यह शोध पत्र 186 प्रथम-पक्षीय और 248 तृतीय-पक्ष मूल्यांकन स्रोतों का विश्लेषण करता है ताकि एक महत्वपूर्ण शासन अंतराल को उजागर किया जा सके जहाँ डेवलपर्स विरल और सतही सामाजिक प्रभाव रिपोर्टिंग प्रदान करते हैं जबकि स्वतंत्र मूल्यांकनकर्ता व्यापक लेकिन अपूर्ण आकलन प्रस्तुत करते हैं, जो अंततः पारदर्शिता को अनिवार्य बनाने और स्वतंत्र मूल्यांकन पारिस्थितिक तंत्रों को सुदृढ़ करने वाली नीतियों का आह्वान करता है।

Anka Reuel, Avijit Ghosh, Jenny Chim, Andrew Tran, Yanan Long, Jennifer Mickel, Usman Gohar, Srishti Yadav, Pawan Sasank (…)2026-06-02
💬 NLP

Optimizing Diversity and Quality through Base-Aligned Model Collaboration

यह शोध पत्र बेस-अलाइन्ड मॉडल कोलैबोरेशन (BACo) का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम फ्रेमवर्क है जो बिना किसी महंगे रिट्रेनिंग के आउटपुट विविधता और गुणवत्ता को एक साथ अनुकूलित करने के लिए एक बेस और एक अलाइन्ड लार्ज लैंग्वेज मॉडल के बीच टोकन-लेवल डिकोडिंग को गतिशील रूप से रूट करता है।

Yichen Wang, Chenghao Yang, Tenghao Huang, Muhao Chen, Jonathan May, Mina Lee2026-06-02
🤖 AI

RoboBenchMart: Benchmarking Robots in Retail Environment

यह शोध पत्र RoboBenchMart प्रस्तुत करता है, जो रिटेल डार्क-स्टोर वातावरण के लिए एक ओपन-सोर्स सिम्युलेटेड बेंचमार्क है जो जटिल मैनिपुलेशन कार्यों पर अत्याधुनिक विजन-लैंग्वेज-एक्शन मॉडल्स का मूल्यांकन करता है, और घरेलू सेटिंग्स से आगे सामान्यीकरण करने में उनकी वर्तमान सीमाओं को प्रकट करता है।

Konstantin Soshin, Alexander Krapukhin, Andrei Spiridonov, Gregorii Bukhtuev, Andrey Kuznetsov, Vlad Shakhuro, Denis She (…)2026-06-02
💬 NLP

Latent Reasoning in TRMs is Secretly a Policy Improvement Operator

यह शोध पत्र प्रदर्शित करता है कि छोटे मॉडलों में लेटेंट रिकर्सिव रीजनिंग (latent recursive reasoning) एक पॉलिसी इम्प्रूवमेंट ऑपरेटर के रूप में कार्य करती है, जो अप्रभावी कंप्यूटेशन स्टेप्स को समाप्त करने और प्रदर्शन को बनाए रखते हुए फॉरवर्ड पासेस को महत्वपूर्ण रूप से कम करने के लिए रिइन्फोर्समेंट लर्निंग और डिफ्यूजन ट्रेनिंग स्कीम्स के अनुप्रयोग को सक्षम बनाती है।

Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac2026-06-02
🤖 AI

A Unified Evaluation-Instructed Framework for Query-Dependent Prompt Optimization

यह शोध पत्र एक एकीकृत, मूल्यांकन-निर्देशित ढांचे का प्रस्ताव करता है जो बहु-आयामी प्रॉम्प्ट गुणवत्ता का पूर्वानुमान लगाने के लिए एक फाइन-ट्यून्ड, निष्पादन-मुक्त इवैल्यूएटर का लाभ उठाता है और एक व्याख्या योग्य, मीट्रिक-जागरूक ऑप्टिमाइज़र को निर्देशित करता है, जिससे यह विविध कार्यों और मॉडलों में मौजूदा स्टेटिक और क्वेरी-डिपेंडेंट विधियों से बेहतर प्रदर्शन करता है।

Ke Chen, Yifeng Wang, Hassan Almosapeeh, Haohan Wang2026-06-02