🤖 AI

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

यह शोध पत्र LyraV प्रस्तुत करता है, जो एक ऑनलाइन वीडियो-भाषा मॉडल है जिसमें एक फ्रेम-ड्रिवन ट्रांजिशन कंट्रोलर और एक स्ट्रीमिंग टोकन पेसर के साथ एक पदानुक्रमित नियंत्रण ढांचा (hierarchical control framework) है, ताकि धारणा (perception) को रोके बिना फ्रेम प्रोसेसिंग और वृद्धिशील टोकन जनरेशन को आपस में जोड़कर निर्बाध, वास्तविक समय की वीडियो-भाषा तुल्यकालिता (video-language synchrony) प्राप्त की जा सके।

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu2026-06-08
🤖 AI

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

यह शोध पत्र PTD-PO का प्रस्ताव करता है, जो एक नवीन ढांचा है जो अंतिम उत्तरों को उजागर किए बिना एक शिक्षक मॉडल से सघन, संरचित विशेषाधिकार प्राप्त संकेतों (privileged hints) को टोकन-स्तरीय पर्यवेक्षण में आसवित (distill) करके लार्ज विजन-लैंग्वेज मॉडल्स में मल्टीमॉडल तर्क क्षमता को बढ़ाता है, जिससे मौजूदा RLVR और डिस्टिलेशन विधियों की विरल पुरस्कारों (sparse rewards) की अक्षमताओं और उत्तर रिसाव (answer leakage) के जोखिमों पर विजय प्राप्त होती है।

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang2026-06-08
🤖 machine learning

A Geometric View for Understanding Concept Learning and Neuron Interpretation in Sparse Autoencoders

यह शोधपत्र एक एकीकृत गणितीय ढांचे का प्रस्ताव करता है जो स्पार्स ऑटोएनकोडर्स (sparse autoencoders) में कॉन्सेप्ट लर्निंग को एक सेट-अलाइनमेंट समस्या के रूप में औपचारिक रूप देता है, जो फीचर रिप्रेजेंटेशन के लिए ज्यामितीय स्थितियों को स्थापित करता है और सेट-थ्योरेटिक सिद्धांतों एवं औपचारिक अवधारणा विश्लेषण (formal concept analysis) के माध्यम से सामान्य SAE घटनाओं की व्याख्या करता है।

Chenhao Zhang, Chris Lin, Su-In Lee2026-06-08
🤖 AI

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

यह शोध पत्र फाउंडेशन मॉडल एजेंटों में सिम-टू-रियल गैप को औपचारिक रूप देने के लिए एक एकीकृत मार्कोव डिसीजन प्रोसेस (MDP) ढांचे का प्रस्ताव करता है, जो विश्वसनीय वास्तविक दुनिया के परिनियोजन के लिए अवलोकन, क्रिया, संक्रमण और पुरस्कार में विसंगतियों को पाटने हेतु शास्त्रीय रोबोटिक्स समाधानों और मानकीकृत बेंचमार्क के अनुकूलन की वकालत करता है।

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei2026-06-08
🤖 AI

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

यह शोध पत्र ZeroSight को प्रस्तुत करता है, जो वास्तविक ज़ीरो-शॉट कंपोज़्ड इमेज रिट्रीवल (Zero-Shot Composed Image Retrieval) के लिए एक नया बेंचमार्क है, जो वास्तविक ज़ीरो-शॉट स्थितियों और सुसंगत संदर्भ-लक्ष्य युग्मों (reference-target pairs) को सुनिश्चित करने के लिए पोस्ट-CLIP प्रशिक्षण वीडियो डेटा का उपयोग करता है, साथ ही एक प्लग-एंड-प्ले SC4CIR विधि भी प्रदान करता है जो मौजूदा डेटासेट और मॉडलों में बढ़ी-चढ़ी प्रदर्शन क्षमता को उजागर करती है।

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu2026-06-08
⚡ electrical engineering

dots.tts Technical Report

यह शोध पत्र dots.tts को प्रस्तुत करता है, जो एक 2B-पैरामीटर वाला निरंतर ऑटोरेग्रेसिव (autoregressive) टीटीएस (TTS) फाउंडेशन मॉडल है, जो AudioVAE प्रशिक्षण, फुल-हिस्ट्री कंडीशनिंग और रिवॉर्ड-फ्री सेल्फ-करेक्शन में नवाचारों के माध्यम से बहुभाषी स्पीच जनरेशन, वॉयस क्लोनिंग और भावनात्मक अभिव्यक्ति में अत्याधुनिक प्रदर्शन प्राप्त करता है, साथ ही MeanFlow डिस्टिलेशन के माध्यम से कम-विलंबता (low-latency) इन्फरेंस प्रदान करता है और सभी कोड एवं चेकपॉइंट्स को ओपन-सोर्स करता है।

Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu2026-06-08
🤖 machine learning

On the Geometry of On-Policy Distillation

यह शोध पत्र ऑन-पॉलिसी डिस्टिलेशन (OPD) की प्रशिक्षण गतिशीलता को एक विशिष्ट ज्यामितीय शासन के रूप में अभिलक्षित करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) से भिन्न है, यह प्रकट करते हुए कि OPD अपडेट तेजी से एक विशिष्ट निम्न-आयामी उप-स्थान (लो-डायमेंशनल सबस्पेस) में लॉक हो जाते हैं जो इसके प्रदर्शन के लिए कार्यात्मक रूप से पर्याप्त है।

Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung2026-06-08
🤖 AI

DyCon: Dynamic Reasoning Control via Evolving Difficulty Modeling

DyCon एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो तर्क की गहराई को नियंत्रित करने के लिए लेटेंट स्टेप-लेवल एम्बेडिंग्स से विकसित होती कार्य कठिनाई को गतिशील रूप से मॉडल करके लार्ज रीजनिंग मॉडल्स में "ओवरथिंकिंग" की समस्या को कम करता है, जिससे सटीकता से समझौता किए बिना दक्षता में उल्लेखनीय सुधार होता है।

Tengyao Tu, Yulin Li, Hui-Ling Zhen, Libo Qin, Zhoujun Wei, Jinghua Piao, Zhuotao Tian, Yong Li, Min Zhang2026-06-08
🤖 AI

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

यह शोध पत्र "ग्लासबॉक्स फ्रेमवर्क" (Glassbox Framework) का प्रस्ताव करता है, जो एक ante-hoc आर्किटेक्चर है जो उच्च-जोखिम वाले एआई अनुप्रयोगों के लिए अस्थिर post-hoc स्पष्टीकरणों को ऑडिट योग्य, संभाव्य तर्क (probabilistic reasoning) से बदलने के लिए जनरेटिव मॉडल्स में पारदर्शी मध्यस्थ परतों के रूप में बेयसियन नेटवर्क (Bayesian networks) को एकीकृत करता है।

Manuele Leonelli2026-06-08
🤖 AI

DIFFRACT: Neuralized Utility Maximization for Wireless Networks by Differentiable Programming

यह शोध पत्र DIFFRACT को प्रस्तुत करता है, जो एक न्यूरलाइज्ड यूटिलिटी मैक्सिमाइजेशन फ्रेमवर्क है जो अगली पीढ़ी के वायरलेस नेटवर्क में चुस्त संसाधन प्रबंधन के लिए वितरित, एंड-टू-एंड ग्रेडिएंट-आधारित लर्निंग को सक्षम करने हेतु डिफरेंशिएबल प्रोग्रामिंग और इंटरफेरेंस फंक्शन्स के एल्गोरिदम अनरोलिंग का लाभ उठाता है।

Chee Wei Tan, Siya Chen2026-06-08