🤖 AI

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing

TeleMorpher एक नवीन वन-शॉट, प्रशिक्षण-मुक्त फ्रेमवर्क है जो विषयों को पृष्ठभूमि से अलग करके, पोज़ वार्पिंग के लिए मोशन प्रायर्स का लाभ उठाकर, और उच्च-गुणवत्ता वाले, नियंत्रणीय परिणाम सुनिश्चित करने के लिए नए LPIPS-आधारित मेट्रिक्स को पेश करके वीडियो में सुदृढ़ समवर्ती गति और स्थान संपादन सक्षम करता है।

Haengbok Chung2026-06-19
🤖 AI

GLARE: A Natural Language Interface for Querying Global Explanations

यह शोध पत्र GLARE प्रस्तुत करता है, जो एक LLM-मध्यस्थ प्राकृतिक भाषा इंटरफ़ेस है जो उपयोगकर्ता के प्रश्नों को स्थानीय स्पष्टीकरण डेटा (local explanation data) पर संरचित SQL में अनुवादित करता है ताकि ब्लैक-बॉक्स इमेज क्लासिफायर के लिए लचीले, सांख्यिकी-संवर्धित वैश्विक स्पष्टीकरण प्रदान किए जा सकें, जिससे मानव-केंद्रित XAI की सुलभता और उपयोगिता में वृद्धि होती है।

Bhavan Vasu, Rajesh Mangannavar2026-06-19
🤖 AI

ParaScale: Scale-Calibrated Camera-Motion Transfer via a Gauge-Invariant Parallax Number

ParaScale एक प्लग-एंड-प्ले मॉड्यूल है जो एक गेज-इनवेरिएंट (gauge-invariant) पैरलैक्स नंबर को संरक्षित करके, असंगत स्केल्स वाले वीडियो के बीच स्केल-कैलिब्रेटेड कैमरा-मोशन ट्रांसफर को सक्षम बनाता है, जिससे बिना किसी रिट्रेनिंग के मोशन एक्सैजरेशन (motion exaggeration) या सप्रेशन (suppression) को समाप्त किया जा सके।

Zijie Meng2026-06-19
💻 computer science

Neural Events: Discrete Asynchronous Autoencoders for Event-Based Vision

यह शोध पत्र एक ऐसे फ्रेमवर्क का प्रस्ताव करता है जो सीख सकने योग्य ऑटोएनकोडर्स (learnable autoencoders) का उपयोग करके कच्चे इवेंट कैमरा स्ट्रीम को अत्यधिक संकुचित, विविक्त "न्यूरल इवेंट्स" में पुन: टोकनाइज़ करता है, जिससे डेटा थ्रूपुट को आधे कारक से कम करते हुए ऑब्जेक्ट डिटेक्शन और क्लासिफिकेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Roberto Pellerito, Daniel Gehrig, Shintaro Shiba, Davide Scaramuzza2026-06-19
🤖 AI

PSCT-Net: Geometry-Aware Pediatric Skull CT Reconstruction via Differentiable Back-Projection and Attention-Guided Refinement

PSCT-Net एक ज्यामिति-जागरूक (geometry-aware) डीप लर्निंग फ्रेमवर्क है जो गहराई की अस्पष्टता को दूर करने और हड्डी की सीमा की सटीकता में सुधार करने के लिए डिफरेंशिएबल बैक-प्रोजेक्शन, अटेंशन-गाइडेड रिफाइनमेंट और एक बायडायरेक्शनल मंबा (Bidirectional Mamba) मॉड्यूल को एकीकृत करके स्पार्स द्वि-तलीय (bi-planar) एक्स-रे से 3D बाल चिकित्सा खोपड़ी CT का पुनर्निर्माण करता है, जबकि यह बाल-विशिष्ट प्रशिक्षण डेटा की कमी को दूर करने के लिए एक विशेष बाल चिकित्सा डेटासेट पेश करता है।

Dong Yeong Kim, Jaewon Choi, Youmin Shin, Jungyu Lee, Myeongseop Kim, Jinwook Choi, Joo Whan Kim, Young-Gon Kim2026-06-19✓ Author reviewed
💻 computer science

SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics

SurgVista एक नवीन सर्जिकल वर्ल्ड मॉडल है जो डिफॉर्मेशन कंसिस्टेंसी रेगुलराइजेशन और ड्रिफ्ट अडैप्टेशन ट्रेनिंग को पेश करके लॉन्ग-होरिज़न ऑटोनॉमस सर्जरी प्रेडिक्शन्स में स्थानिक असंगतता (spatial incoherence) और टेम्पोरल ड्रिफ्ट पर विजय प्राप्त करता है, जिससे नए SurgWorld-Bench द्वारा प्रमाणित श्रेष्ठ दृश्य और भौतिक निष्ठा (visual and physical fidelity) प्राप्त होती है।

Wentao Pan, Wuyang Li, Shengyuan Liu, Xinyu Liu, Hengyu Liu, Yixuan Yuan2026-06-19
💻 computer science

Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution

यह शोध पत्र एक नवीन इमेज सुपर-रिज़ॉल्यूशन नेटवर्क प्रस्तावित करता है जो 2D विज़न कार्यों में स्टैटिक पैरामीट्रिज़ेशन की सीमाओं को दूर करने के लिए एक लीनियर रिकरेंट यूनिट को एक सिमेंटिक मॉड्यूलेटिंग यूनिट के साथ एकीकृत करता है, जिससे मौजूदा विधियों के तुलनीय कम्प्यूटेशनल दक्षता के साथ स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

Mingyu Choi, Woo Kyoung Han, Sunghoon Im, Kyong Hwan Jin2026-06-19
💻 computer science

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

यह शोध पत्र CARE को प्रस्तुत करता है, जो एक क्षमता-जागरूक रिवॉर्ड शेपिंग फ्रेमवर्क है जो मॉडल के विकसित होते प्रदर्शन के आधार पर अन्वेषण-उन्मुख दीर्घ-रूप तर्क (long-form reasoning) से दक्षता-उन्मुख संक्षिप्त तर्क (concise reasoning) में संक्रमण करके वीडियो-MLLMs में तर्क की लंबाई को गतिशील रूप से अनुकूलित करता है, जिससे बिना किसी इन्फरेंस ओवरहेड के सटीकता, प्रशिक्षण स्थिरता और टोकन दक्षता में सुधार होता है।

Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua2026-06-19
🤖 AI

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

यह शोध पत्र STORM को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), स्थानिक-जागरूक (spatial-aware) टोकन रिडक्शन फ्रेमवर्क है जो ग्रिड टोपोलॉजी और पड़ोस की सुसंगतता (neighborhood coherence) को बनाए रखने के लिए स्थानीय बाधाओं को लागू करके संरचनात्मक रूप से संवर्धित मम्बा (Mamba) मॉडलों के प्रदर्शन पतन (performance collapse) को हल करता है।

Jindi Lv, Aoyu Li, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Qing Ye, Yueqi Duan, Wentao Feng, Jiancheng Lv2026-06-19
🤖 AI

Speeding up the annotation process in semantic segmentation industrial applications

यह शोध पत्र एक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि अनसुपरवाइज्ड कंप्यूटर विजन एल्गोरिदम का प्री-एनोटेशन स्टेप के रूप में उपयोग करने से उच्च-रिज़ॉल्यूशन वाले औद्योगिक स्टील माइक्रोस्ट्रक्चर इमेजेस के लिए सिमेंटिक सेगमेंटेशन लेबलिंग समय में लगभग 78% (170 से घटाकर 37 घंटे) की कमी आती है, और साथ ही अपने प्रकार के सबसे बड़े सार्वजनिक डेटासेट और एक प्रमाणित डीप लर्निंग मॉडल को भी मुक्त करता है।

Marta Fernandez-Moreno, Margarita Guerrero, Rosalia Rementeria, Pablo Mesejo, Raul Moreno2026-06-19