💻 computer science

Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection

यह शोध पत्र GenRes और इसके उन्नत संस्करण GenRes++ को प्रस्तुत करता है, जो जनरेटिव रेसिडुअल लर्निंग और अटेंशन मैकेनिज्म का उपयोग करने वाले नवीन फ्रेमवर्क हैं, जो मूल और रूपांतरित नमूनों के बीच सूक्ष्म संबंधात्मक विशेषताओं को मॉडल करके विविध और अनदेखे तरीकों के माध्यम से AI-जनित छवियों का प्रभावी ढंग से पता लगाते हैं।

Kutub Uddin, Nusrat Tasnim, Awais Khan, Mohammad Umar Farooq, Khalid Malik2026-07-10
🤖 machine learning

Pose-to-Biomechanics: Bridging 3D Human Pose Estimation and Biomechanical Attribute Prediction

यह शोध पत्र BioModule को प्रस्तुत करता है, जो एक हल्का, एस्टिमेटर-अज्ञेय (estimator-agnostic) टेम्पोरल ट्रांसफार्मर है जो मानक कंकालों (skeletons) से भौतिक गति गुणों का पूर्वानुमान लगाकर 3D मानव मुद्रा अनुमान और बायोमैकेनिकल विश्लेषण के बीच के अंतर को पाटता है, जिसे एक नए संरेखित डेटासेट और सात अत्याधुनिक पोज़ एस्टिमेटर्स के व्यवस्थित मूल्यांकन के माध्यम से प्रमाणित किया गया है।

Ayda Eghbalian, Kevin Desai2026-07-10
🤖 machine learning

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

यह शोध पत्र ARDY को प्रस्तुत करता है, जो एक स्ट्रीमिंग जनरेशन फ्रेमवर्क है जो ऑनलाइन टेक्स्ट प्रॉम्प्ट्स पर सटीक नियंत्रण और लचीले लॉन्ग-होरिज़न काइनेमैटिक कंस्ट्रेंट्स के साथ रियल-टाइम, हाई-फिडेलिटी 3D ह्यूमन मोशन जनरेशन प्राप्त करने के लिए एक हाइब्रिड रिप्रेजेंटेशन और टू-स्टेज ऑटोरेग्रेसिव ट्रांसफॉर्मर डिनोइज़र का उपयोग करता है।

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe2026-07-10
💻 computer science

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

यह शोध पत्र AUTOPILOT-VQA पेश करता है, जो एक नया घटना-केंद्रित विजुअल क्वेश्चन अनस्विरिंग (visual question answering) बेंचमार्क है जिसे स्वायत्त ड्राइविंग परिदृश्यों में विजन-लैंग्वेज मॉडल्स की सुरक्षा-जागरूक, टेम्पोरली ग्राउंडेड रीजनिंग क्षमताओं का मूल्यांकन करने और उन्हें सुधारने के लिए डिज़ाइन किया गया है।

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita2026-07-10
💻 computer science

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

यह शोध पत्र Canvas360 को प्रस्तुत करता है, जो एक नए निर्मित 1M-नमूना डेटासेट और ज्यामिति-जागरूक प्रीट्रेनिंग तकनीकों का लाभ उठाते हुए विविध इन-कॉन्टेक्स्ट पैनोरमिक जनरेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के साथ-साथ बेहतर ज्यामितीय निरंतरता और वैश्विक सुसंगतता सुनिश्चित करता है।

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi2026-07-10
💻 computer science

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V एक नवीन फ्रेमवर्क है जो उच्च गुणवत्ता वाले, टेम्पोरल रूप से सुसंगत इवेंट-आधारित वीडियो पुनर्निर्माण, भविष्यवाणी और फ्रेम इंटरपोलेशन के लिए बेहतर सामान्यीकरण प्राप्त करने हेतु ऑटोरिग्रेसिव अनरोलिंग और एडेप्टिव कॉन्टेक्स्ट स्विचिंग जैसी विशिष्ट प्रणालियों के साथ फाइन-ट्यून्ड वीडियो डिफ्यूजन मॉडल का लाभ उठाता है।

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu2026-07-10
💻 computer science

Wat3R: Underwater 3D Geometry Learning without Annotations

यह शोध पत्र Wat3R को प्रस्तुत करता है, जो एक क्रॉस-डोमेन सेमी-सुपरवाइज्ड लर्निंग फ्रेमवर्क है जो टीचर-स्टूडेंट आर्किटेक्चर और क्रॉस-व्यू कंसिस्टेंसी लॉस के माध्यम से हवा में प्रशिक्षित मॉडलों को अनलेबल वीडियो के अनुकूल बनाकर बिना किसी एनोटेटेड डेटा के पानी के नीचे के वातावरण में 3D ज्यामिति पुनर्निर्माण को सक्षम बनाता है, साथ ही Water3D नामक एक नए बेंचमार्क डेटासेट को भी जारी करता है।

Jiangwei Ren, Xingyu Jiang, Zijie Song, Wei Xu, Hongkai Lin, Dingkang Liang, Xiang Bai2026-07-10
🤖 machine learning

COVID-Net USPro: An Open-Source Explainable Few-Shot Deep Prototypical Network to Monitor and Detect COVID-19 Infection from Point-of-Care Ultrasound Images

यह शोध पत्र COVID-Net USPro को प्रस्तुत करता है, जो एक ओपन-सोर्स, व्याख्यात्मक (explainable) फ़्यू-शॉट डीप प्रोटोटाइपिकल नेटवर्क है जो न्यूनतम प्रशिक्षण डेटा का उपयोग करके पॉइंट-ऑफ-केयर अल्ट्रासाउंड छवियों से COVID-19 का पता लगाने में उच्च सटीकता, परिशुद्धता और रिकॉल प्राप्त करता है, जिससे नई बीमारियों के लिए सीमित एनोटेटेड डेटासेट की चुनौती का समाधान होता है।

Jessy Song, Ashkan Ebadi, Adrian Florea, Pengcheng Xi, Stéphane Tremblay, Alexander Wong2026-07-09
🤖 AI

Learning to Explore for Stochastic Gradient MCMC

यह शोध पत्र स्टोकेस्टिक ग्रेडिएंट MCMC को बेहतर बनाने के लिए एक मेटा-लर्निंग रणनीति प्रस्तावित करता है, जो बेयसियन न्यूरल नेटवर्क में उच्च-आयामी बहु-मोडल पोस्टीरियर वितरणों की कुशल खोज को सक्षम बनाता है और न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ विभिन्न कार्यों में श्रेष्ठ सैंपलिंग प्रदर्शन प्राप्त करता है।

SeungHyun Kim, Seohyeon Jung, Seonghyeon Kim, Juho Lee2026-07-09
💻 computer science

ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving

यह शोध पत्र ROAD-Waymo को प्रस्तुत करता है, जो Waymo ओपन डेटासेट पर आधारित एक बड़े पैमाने का डेटासेट है जो स्वायत्त ड्राइविंग धारणा (autonomous driving perception) को उन्नत करने और क्रॉस-कंट्री डोमेन एडाप्टेशन बेंचमार्क को सक्षम करने के लिए एजेंट, एक्शन, लोकेशन और इवेंट डिटेक्शन के लिए व्यापक एनोटेशन प्रदान करता है।

Salman Khan, Izzeddin Teeti, Reza Javanmard Alitappeh, Mihaela C. Stoian, Eleonora Giunchiglia, Gurkirt Singh, Andrew Br (…)2026-07-09