💻 computer science

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos

यह शोध पत्र "डू ऐज़ आई डू" (Do as I Do) प्रस्तुत करता है, जो एक ऐसा एल्गोरिदम है जो एकल (monocular) RGB मानव वीडियो से हाथ-वस्तु अंतःक्रियाओं (hand-object interactions) को पुनर्गठित करता है और उन्हें कुशल बहु-अंगुलियों वाले रोबोटिक हाथों के लिए निष्पादन योग्य क्रियाओं में रूपांतरित करता है, जो कुशलतापूर्वक हेरफेर डेटा (manipulation data) को बड़े पैमाने पर उत्पन्न करने के लिए मानव-से-रोबोट एम्बॉडिमेंट अंतराल को पाटता है।

Bhawna Paliwal, Haritheja Etukuru, William Liang, Pieter Abbeel, Nur Muhammad Mahi Shafiullah, Jitendra Malik2026-06-19
🤖 machine learning

ProMUSE: Progressive Multi-modal Uncertainty-guided Staged Evidential Alzheimer Disease Classification

ProMUSE एक प्रगतिशील, अनिश्चितता-निर्देशित बहु-मोडल नेटवर्क है जो कम लागत वाले नैदानिक डेटा के आधार पर केवल आवश्यकता होने पर ही महंगी एमआरआई (MRI) या पीईटी (PET) इमेजिंग को अनुकूल रूप से शामिल करता है, जिससे अल्जाइमर रोग के सटीक निदान के साथ-साथ इमेजिंग लागत और संसाधनों के उपयोग में महत्वपूर्ण कमी आती है।

Long Doan, Branden Chen, Ethan Litton, Huan Huang, Jiajing Huang, Yixin Xie, Weihua Zhou, Nandakumar Narayanan, Chen Zha (…)2026-06-19
⚡ electrical engineering

Full-Self Diagnostics (FSD): Physics-Grounded Visual Biomarker Inference from Smartphone Video via Inverse Problems and Operator Learning

यह शोध पत्र फुल-सेल्फ डायग्नोस्टिक्स (FSD) को प्रस्तुत करता है, जो एक एकीकृत गणितीय ढांचा है जो अनकन्स्ट्रेंड स्मार्टफोन फेशियल वीडियो से रक्त ग्लूकोज के स्तर जैसे गुप्त शारीरिक अवस्थाओं का सटीक रूप से अनुमान लगाने के लिए भौतिकी-आधारित इनवर्स प्रॉब्लम्स और ऑपरेटर लर्निंग का लाभ उठाता है, जिससे नैदानिक रूप से प्रासंगिक प्रदर्शन प्राप्त होता है जो युग्मित प्रशिक्षण डेटा की मात्रा के साथ बढ़ता है।

Jonathan Thomas, Harsh Thaker2026-06-19
🤖 machine learning

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

यह शोध पत्र 3D-DLP पेश करता है, जो एक स्व-पर्यवेक्षित (self-supervised) मॉडल है जो RGB-D या वोक्सेल दृश्यों को अलग-अलग वस्तुओं का प्रतिनिधित्व करने वाले व्याख्यात्मक 3D लेटेंट पार्टिकल्स (latent particles) में विभाजित करता है, जिससे नियंत्रित दृश्य निर्माण सक्षम होता है और वस्तु-केंद्रित संरचना की कमी वाले बेसलाइनों की तुलना में रोबोटिक हेरफेर (robotic manipulation) के प्रदर्शन में सुधार होता है।

Ellina Zhang, Madhaven Iyengar, Amir Zadeh, Chuan Li, Deepak Pathak, David Held, Tal Daniel2026-06-19
💻 computer science

LEAP: Layer-skipping Efficiency via Adaptive Progression for Vision Transformer Distillation

यह शोधपत्र LEAP का प्रस्ताव करता है, जो विजन ट्रांसफॉर्मर डिस्टिलेशन के लिए एक प्रशिक्षण पाठ्यक्रम है जो सरल से जटिल शिक्षक विशेषताओं की ओर छात्रों को प्रगतिशील रूप से निर्देशित करने के लिए अनुकूली लेयर-स्किपिंगिंग (adaptive layer-skipping) का उपयोग करता है, जिससे अभिसरण (convergence) में तेजी आती है, सटीकता में सुधार होता है और प्रशिक्षण लागत कम होती है।

Jiaqi Zhang, Ashton Lee, Anthony Wong, John Zou, Sami BuGhanem, Randall Balestriero2026-06-19
💻 computer science

LooseControlVideo: Directorial Video Control using Spatial Blocking

LooseControlVideo एक नवीन फ्रेमवर्क है जो टेक्स्ट-टू-वीडियो जनरेशन में सहज और सटीक 3D स्थानिक नियंत्रण सक्षम करने के लिए विरल (sparse), उन्मुख (oriented) 3D बॉक्सों को एक "ब्लॉकिंग" प्रॉक्सी के रूप में उपयोग करता है, जो मौजूदा 2D-आधारित विधियों की तुलना में प्रक्षेपवक्र सटीकता (trajectory accuracy), गति निरंतरता और ऑक्लूजन हैंडलिंग में महत्वपूर्ण सुधार करता है।

Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli2026-06-19
💻 computer science

Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

यह शोध पत्र Mix-QVLA का प्रस्ताव करता है, जो एक टास्क-एविडेंस-अवेयर (task-evidence-aware) मिक्स्ड-प्रिसिजन पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है, जो लेयर-वाइज सेंसिटिविटी और फेज-डिपेंडेंट टास्क एविडेंस के आधार पर बिट-विड्थ को गतिशील रूप से आवंटित करता है ताकि विजन-लैंग्वेज-एक्शन मॉडल्स में उच्च टास्क सक्सेस रेट को बनाए रखते हुए मेमोरी को महत्वपूर्ण रूप से कम किया जा सके और इन्फरेंस को त्वरित किया जा सके।

Navin Ranjan, Andreas Savakis2026-06-19
⚡ electrical engineering

FrequencyFormer: A Co-Designed Sensor-to-Processor Pipeline for Frequency-Domain Vision Transformer Inference

FrequencyFormer एक सह-डिज़ाइन किया गया सेंसर-टू-प्रोसेसर पाइपलाइन है जो मल्टी-स्केल DCT टोकेनाइज़र और नियर-सेंसर हार्डवेयर का लाभ उठाकर विज़ुअल डेटा को फ्रीक्वेंसी डोमेन में संकुचित करता है, जिससे ऑफ-चिप डेटा वॉल्यूम और ऊर्जा खपत में महत्वपूर्ण कमी आती है और एज सिस्टम पर कुशल विज़न ट्रांसफार्मर इन्फरेंस सक्षम होता है।

Chengwei Zhou, Ovishake Sen, Xuming Chen, Rishith Paramasivam, Shaahin Angizi, Swarup Bhunia, Baibhab Chatterjee, Gourav (…)2026-06-19
💻 computer science

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

SAFE-Cascade एक लागत-अनुकूलित, पारदर्शी चार्ट प्रश्न उत्तर प्रणाली है जो एक सीखे हुए राउटर का उपयोग करती है ताकि केवल आवश्यकता होने पर ही हल्के टेक्स्ट-ओनली मॉडल से क्वेरी को विजन-लैंग्वेज मॉडल तक चुनिंदा रूप से एस्केलेट किया जा सके, जिससे तुलनीय सटीकता बनाए रखते हुए कम्प्यूटेशनल लागत को कम किया जा सके।

Ayush Dwivedi, Qixin Wang, Ashvi Soni, Ruoteng Wang, Han Li, Animesh Mahapatra, Neeraj Agrawal, Xintao Wu2026-06-19
🤖 AI

BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation

यह शोध पत्र BrainG3N को प्रस्तुत करता है, जो एक दोहरा-उद्देश्य वाला टोकेनाइज़र है जो 3D मस्तिष्क MRI के लिए नैदानिक रूप से सूचनात्मक एम्बेडिंग उत्पन्न करने के लिए एक फ्रोजन (frozen) 3D मास्क्ड ऑटोएनकोडर का उपयोग करता है, जो उच्च-प्रदर्शन वाले डाउनस्ट्रीम नैदानिक कार्यों और लेटेंट डिफ्यूजन (latent diffusion) के माध्यम से नियंत्रणीय, रोगी-विशिष्ट अनुदैर्ध्य (longitudinal) पीढ़ी को सफलतापूर्वक सक्षम बनाता है।

Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert2026-06-19