💻 computer science

Vision-Language Assistant for Emotional Reactions to Risky Driving

यह शोध पत्र "कीप येलिंग असिस्टेंट" (KYA) को प्रस्तुत करता है, जो एक विजन-लैंग्वेज पाइपलाइन है जो YOLOv8-आधारित जोखिमपूर्ण ड्राइविंग डिटेक्शन को बड़े भाषा मॉडलों (LLMs) के साथ जोड़ता है ताकि चालक की प्राथमिकताओं के अनुरूप वास्तविक समय में, भावनात्मक रूप से अनुकूलित मौखिक प्रतिक्रियाएं उत्पन्न की जा सकें, जिससे वाहनों में सुरक्षा और भावनात्मक कल्याण को बढ़ाया जा सके।

Harine Choi, Eun Hak Lee, Zhengzhong Tu2026-07-20
💻 computer science

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

यह शोध पत्र VideoTreeSearch (VTS) का प्रस्ताव करता है, जो एक स्व-सुधारात्मक एजेंट फ्रेमवर्क है जो ग्राउंडेड लॉन्ग-वीडियो QA को स्पष्ट बैकट्रैकिंग ऑपरेशन्स के साथ एक एडेप्टिव टेम्पोरल ट्री पर इटरेटिव सर्च के रूप में मॉडल करता है, जो शुरुआती गलतियों से उबरने में सक्षम बनाकर और कई बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करके पूर्व विधियों से काफी बेहतर प्रदर्शन करता है।

Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertas (…)2026-07-20
💻 computer science

MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction

MotionForesight एक ऐसी विधि है जो मानव-वस्तु अंतःक्रियाओं (human-object interactions) के लिए भविष्य के 3D सीन फ्लो का पूर्वानुमान लगाने हेतु प्रीट्रेंड वीडियो प्रेडिक्शन मॉडल्स को पुन: उपयोग करती है, जो बिना किसी सहायक इनपुट के विविध वस्तुओं और वातावरणों में कुशल सामान्यीकरण (generalization) सक्षम करने के लिए स्यूडो-ग्राउंड-ट्रुथ ट्रैक्स पर एक लाइटवेट एडॉप्टर को प्रशिक्षित करती है।

Homanga Bharadhwaj, Yash Jangir2026-07-20
💻 computer science

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa डिस्क्रीट डिफ्यूजन मैकेनिज्म पर आधारित विजन-लैंग्वेज मॉडल्स के एक नए परिवार को पेश करता है जो पारंपरिक ऑटोरेग्रेसिव मॉडल्स की तुलना में प्रतिस्पर्धी प्रदर्शन, तेज़ इन्फरेंस और बेहतर नियंत्रणीयता प्राप्त करने के लिए पैरेलल डिकोडिंग और द्विदिश संदर्भ (bidirectional context) का लाभ उठाता है।

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai- (…)2026-07-17
🤖 AI

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

यह शोध पत्र SEMA को प्रस्तुत करता है, जो एक स्केलेबल और कुशल अटेंशन मैकेनिज्म है जो वेट डिस्पर्सन (weight dispersion) को रोकने के लिए टोकन लोकलाइजेशन (token localization) को ग्लोबल कॉन्टेक्स्ट कैप्चर करने के लिए अरिथमेटिक एवरेजिंग (arithmetic averaging) के साथ जोड़ता है, जिससे यह इमेज क्लासिफिकेशन कार्यों में मौजूदा लीनियर अटेंशन और विजन मंबा मॉडल्स से बेहतर प्रदर्शन करता है।

Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin2026-07-17
🤖 machine learning

VideoGAN-based Trajectory Proposal for Automated Vehicles

यह शोध पत्र एक VideoGAN-आधारित पाइपलाइन का प्रस्ताव करता है जो लो-रिज़ॉल्यूशन बर्ड्स-आई व्यू ऑक्यूपेंसी ग्रिड वीडियो से सांख्यिकीय रूप से सटीक और भौतिक रूप से यथार्थवादी वाहन प्रक्षेपवक्र (ट्रैजेक्टरी) उत्पन्न करता है, जो भविष्य के ट्रैफ़िक परिदृश्यों के जटिल मल्टीमॉडल वितरण को प्रभावी ढंग से कैप्चर करते हुए तेज़ इन्फरेंस समय प्राप्त करता है।

Annajoyce Mariani, Kira Maag, Hanno Gottschalk2026-07-17
💻 computer science

GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations

GSVisLoc एक सामान्यीकरण योग्य विज़ुअल लोकलाइज़ेशन विधि है जो मोटे मिलान (coarse matching), सूक्ष्म मिलान (fine matching) और पोज़ रिफाइनमेंट (pose refinement) की तीन-चरणीय प्रक्रिया के माध्यम से एनकोडेड 3D गॉसियन फीचर्स को इमेज पैचेस के साथ मजबूती से मिलान करके 3D गॉसियन स्प्लेटिंग दृश्यों के लिए कैमरा पोज़ का अनुमान लगाती है, जो बिना मॉडल रिट्रेनिंग या अतिरिक्त संदर्भ छवियों की आवश्यकता के प्रतिस्पर्धी प्रदर्शन प्राप्त करती है।

Fadi Khatib, Dror Moran, Guy Trostianetsky, Yoni Kasten, Meirav Galun, Ronen Basri2026-07-17
💻 computer science

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

लविडा-ओ (Lavida-O) एक एकीकृत मास्कड डिफ्यूजन मॉडल है जिसमें एक नवीन इलास्टिक मिक्सचर-ऑफ-ट्रांसफॉर्मर्स आर्किटेक्चर और पुनरावृत्ति स्व-चिंतन (iterative self-reflection) क्षमताएं शामिल हैं, जो उच्च-रिज़ॉल्यूशन इमेज जनरेशन, ऑब्जेक्ट ग्राउंडिंग और इमेज एडिटिंग में मौजूदा ऑटोरिग्रेसिव और कंटीन्यूअस डिफ्यूजन मॉडल्स को पछाड़ते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है।

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen2026-07-17
🔬 physics

Energy-Efficient Federated Learning via Adaptive Encoder Freezing for MRI-to-CT Conversion: A Green AI-Guided Research

यह शोध पत्र एमआरआई-से-सीटी रूपांतरण के लिए फेडरेटेड लर्निंग हेतु एक ग्रीन एआई-निर्देशित अनुकूली एनकोडर फ्रीजिंग रणनीति प्रस्तावित करता है जो मॉडल प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए ऊर्जा खपत और CO2 उत्सर्जन को 23% तक काफी कम कर देता है, जिससे न्यायसंगत और टिकाऊ स्वास्थ्य सेवा एआई को बढ़ावा मिलता है।

Ciro Benito Raggio, Lucia Migliorelli, Nils Skupien, Mathias Krohmer Zabaleta, Oliver Blanck, Francesco Cicone, Giuseppe (…)2026-07-17
💻 computer science

The Inductive Bottleneck: Data-Driven Emergence of Representational Sparsity in Vision Transformers

यह शोध पत्र यह प्रदर्शित करता है कि विजन ट्रांसफॉर्मर्स (Vision Transformers) में देखी गई "U-आकार" की एंट्रॉपी प्रोफ़ाइल एक डेटा-संचालित अनुकूलन है जिसे "इंडक्टिव बॉटलनेक" (Inductive Bottleneck) के रूप में जाना जाता है, जहाँ नेटवर्क के संपीड़न की गहराई कार्य के लिए आवश्यक सिमेंटिक एब्स्ट्रैक्शन (semantic abstraction) के साथ सह-संबंधित होती है, जो प्रभावी रूप से टेक्सचर-भारी डेटासेट के लिए उच्च-रैंक वाले प्रतिनिधित्वों को संरक्षित करते हुए ऑब्जेक्ट-सेंट्रिक डेटासेट में सिमेंटिक फीचर्स को अलग करती है।

Kanishk Awadhiya2026-07-17