💻 computer science

Conversational Human Audio-visual Talking Dialogue Generation

यह शोध पत्र CHAT को प्रस्तुत करता है, जो एक नवीन ढांचा है जो बड़े भाषा और टॉकिंग फेस मॉडलों को एकीकृत करके एकल टेक्स्ट प्रॉम्प्ट से विविध, संरेखित द्विपक्षीय ऑडियो-विजुअल संवाद क्लिप उत्पन्न करता है, जिससे यह लागत-प्रभावी वास्तविक दुनिया के डेटा संग्रह के लिए एक स्केलेबल और नैतिक रूप से सुदृढ़ विकल्प प्रदान करता है और डाउनस्ट्रीम कार्यों के लिए बेहतर प्रदर्शन और उपयोगिता प्रदर्शित करता है।

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei (…)2026-07-07
🤖 AI

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

यह शोध पत्र यह प्रदर्शित करके क्लाउड-एज लार्ज विजन-लैंग्वेज मॉडल (LVLM) इन्फरेंस में एक गंभीर भेद्यता को उजागर करता है कि एक ब्लैक-बॉक्स एडवर्सरी केवल 10% प्रसारित विजन टोकन को मैनिपुलेट करके विभिन्न अत्याधुनिक मॉडलों में सटीकता को 88.31% तक कम कर सकती है।

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu2026-07-07
💻 computer science

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR एक विषम सिमुलेशन पाइपलाइन का उपयोग करके प्रीट्रेन्ड विजन-लैंग्वेज-एक्शन मॉडल्स पर एक रेसिडुअल वेपॉइंट पॉलिसी को प्रशिक्षित करने वाले एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए एक स्केलेबल क्लोज्ड-लूप रीइन्फोर्समेंट लर्निंग फ्रेमवर्क पेश करता है, जो पारंपरिक इमिटेशन लर्निंग की डिस्ट्रीब्यूशन शिफ्ट सीमाओं को पार करके चुनौतीपूर्ण बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli2026-07-07
⚡ electrical engineering

Harmonic-Aware Transformer for Real-Time Catheter Localization in Interventional Procedures of Magnetic Particle Imaging

यह अध्ययन एक हार्मोनिक-अवेयर ट्रांसफॉर्मर फ्रेमवर्क प्रस्तावित करता है जो इमेज रिकंस्ट्रक्शन की विलंबता के बिना, कच्चे मैग्नेटिक पार्टिकल इमेजिंग संकेतों से सीधे कैथेटर टिप की स्थिति का अनुमान लगाता है, जिससे सब-मिलीमीटर सटीकता और रियल-टाइम प्रदर्शन (1800 fps) प्राप्त होता है।

Abuobaida M. Khair, Wenjing Jiang, Xiaoli Yang, Moritz Wildgruber, Xiaopeng Ma2026-07-07
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

यह शोध पत्र VideoSearcher प्रस्तुत करता है, जो एक क्लोज्ड-लूप एजेंटिक फ्रेमवर्क है जो टेम्पोरल लोकलाइजेशन (temporal localization), स्पेशियल फोकसिंग (spatial focusing) और मल्टीमॉडल सर्च को एकीकृत करके वीडियो डीप रिसर्च को आगे बढ़ाने के लिए मल्टी-टूल रीजनिंग और एक नवीन Bi-branch Sequence Policy Optimization (BiSPO) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम का लाभ उठाता है, जिसके साथ मूल्यांकन के लिए नया VideoSearch-QA बेंचमार्क भी दिया गया है।

Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xi (…)2026-07-07
🔬 materials science

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

यह शोध पत्र MatPhaseBench प्रस्तुत करता है, जो जटिल पदार्थ अवस्था आरेखों (materials phase diagrams) को समझने में विजन-लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन करने के लिए 3,681 पदार्थ विज्ञान संबंधी शोध पत्रों से प्राप्त एक उच्च-गुणवत्ता वाला, मानव-सत्यापित बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल गहरे ऊष्मागतिक तंत्र विश्लेषण (thermodynamic mechanism analysis) के बजाय केवल सतही दृश्य धारणा (surface visual perception) पर अपनी निर्भरता के कारण विशेषज्ञ-स्तरीय तर्क कौशल से काफी पीछे हैं।

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang2026-07-07
🤖 machine learning

Incentivizing Vision Language Models to Search for Long Video Question Answering

यह शोध पत्र VSeek को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो न्यूरो-सिम्बोलिक रिवार्ड्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके लंबे वीडियो आधारित प्रश्न-उत्तर को उन्नत करता है, जिससे इस कार्य को एक बहु-चरण खोज प्रक्रिया में परिवर्तित किया जाता है जो औपचारिक टेम्पोरल लॉजिक विनिर्देशों के विरुद्ध पुनर्प्राप्त दृश्य साक्ष्यों को व्यवस्थित रूप से सत्यापित करती है।

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali2026-07-07
💻 computer science

Overloading Large Vision-Language Models for Jailbreaking

यह शोध पत्र एक नवीन "सूचना ओवरलोडिंग" (information overloading) जेलब्रेक हमले का प्रस्ताव करता है जो लार्ज विजन-लैंग्वेज मॉडल्स को जटिल मल्टीमॉडल इनपुट के साथ अभिभूत करने के लिए रिकर्सिव इमेज-टाइपोग्राफी लेआउट का लाभ उठाता है, जिससे सुरक्षा संरेखण (safety alignment) को कमजोर करने के लिए गहन क्रॉस-मोडल प्रोसेसिंग का फायदा उठाकर ओपन-सोर्स और कमर्शियल मॉडल्स में अत्याधुनिक सफलता दर प्राप्त की जा सकती है।

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli2026-07-07
💻 computer science

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

यह शोध पत्र EMA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो डिफ्यूजन ट्रांसफॉर्मर्स में मैसिव एक्टिवेशन्स (Massive Activations) की अनूठी संरचना का व्यवस्थित रूप से विश्लेषण और लाभ उठाता है ताकि विज़ुअल अंडरस्टैंडिंग के लिए सूक्ष्म-स्तरीय जनरेशन गुणवत्ता और सघन फीचर डिस्क्रिमिनेशन (dense feature discrimination) को एक साथ बढ़ाया जा सके।

Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao L (…)2026-07-07
💻 computer science

Cross-device Collaborative Test-time Adaptation with Zeroth-order Optimization and Model Merging

यह शोध पत्र एक क्रॉस-डिवाइस सहयोगात्मक टेस्ट-टाइम एडेप्टेशन फ्रेमवर्क प्रस्तावित करता है जो बैकप्रोपैगेशन को बायपास करने के लिए ज़ीरोथ-ऑर्डर ऑप्टिमाइज़ेशन को एकीकृत करने और ऑप्टिमाइज़ेशन आयामों को कम करने के लिए मॉडल मर्जिंग का उपयोग करने के माध्यम से संसाधन-सीमित उपकरणों को डोमेन शिफ्ट को कम करने में सक्षम बनाता है, जिसे गैर-प्रभावशाली भार और रेडंडेंसी को ट्रिम करने वाली एक प्रीप्रोसेसिंग रणनीति द्वारा और अधिक बढ़ाया गया है।

Yu Mitsuzumi, Akisato Kimura, Yasuhiro Fujiwara, Hisashi Kashima2026-07-07