💻 computer science

Viking Hill Dataset: A Lidar-Radar-Camera Dataset for Detection and Segmentation in Forest Scenes

यह शोध पत्र वाइकिंग हिल डेटासेट (Viking Hill Dataset) को प्रस्तुत करता है, जो वन परिवेश के लिए एक नवीन मल्टी-सेंसर (LiDAR, रडार और कैमरा) डेटासेट है जिसमें सह-पंजीकृत (co-registered) 4D इमेजिंग रडार डेटा और 3D वृक्ष एनोटेशन शामिल हैं, जो यह प्रदर्शित करता है कि रडार जमीन और कैनोपी जैसे प्रमुख वर्गों के लिए LiDAR के साथ प्रतिस्पर्धी सिमेंटिक सेगमेंटेशन प्रदर्शन प्राप्त कर सकता है, जबकि यह पेड़ के तने जैसी सूक्ष्म संरचनाओं का पता लगाने में चुनौतियों को भी उजागर करता है।

Vladimír Kubelka, Oleksandr Kotlyar, Unal Artan, Martin Magnusson2026-06-19
💻 computer science

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

यह शोधपत्र HT-Bench प्रस्तुत करता है, जो कुशल पूर्ण-हस्त स्पर्श संवेदन (dexterous full-hand tactile sensing) के लिए एक बड़े पैमाने का बहु-कार्य बेंचमार्क है, और HandTouch का प्रस्ताव करता है, जो एक वेक्टर-क्वांटाइज्ड विजन-टैक्टाइल एनकोडर है जो एगोसेंट्रिक विजन और पूर्ण-हस्त स्पर्श डेटा के माध्यम से स्पर्श प्रतिनिधित्व सीखने में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Ziyuan Jiao, Yuanxin Zhon (…)2026-06-19
💻 computer science

Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation

यह शोध पत्र एक नियतात्मक आर्म किनेमैटिक करेक्शन (AKC) विधि प्रस्तुत करता है जो एकल RGB-D कैमरा डेटा से बाधित जोड़ की गहराई को मजबूती से पुनर्गठित करने के लिए ज्यामितीय बाधाओं और स्थिर आर्म लंबाई का लाभ उठाता है, जिससे गंभीर स्व-अवरोध (self-occlusion) के तहत मार्कर रहित रोबोट टेलीऑपरेशन की सटीकता और विश्वसनीयता में वृद्धि होती है।

Thomas M. Kwok, Nicholas Koenig, Yue Hu2026-06-19
💻 computer science

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

OneCanvas एक नवीन 3D सीन अंडरस्टैंडिंग फ्रेमवर्क पेश करता है जो 3D पोजीशन एम्बेडिंग्स के साथ एक एकल पैनोरमिक कैनवास पर मल्टी-व्यू पैच फीचर्स को एकत्रित करता है, जिससे काफी कम प्रशिक्षण कंप्यूट के साथ अत्याधुनिक स्थानिक तर्क (spatial reasoning) सक्षम होता है और यह स्थितीय तर्क (situated reasoning) एवं प्रक्रियात्मक स्थानिक प्रीट्रेनिंग (procedural spatial pretraining) दोनों का समर्थन करता है।

Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner2026-06-19
💻 computer science

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

यह शोध पत्र Act2Answer प्रस्तुत करता है, जो एक नवीन मूल्यांकन प्रोटोकॉल है जो विजन-लैंग्वेज-एक्शन (VLA) मॉडलों में ज्ञान प्रतिधारण (knowledge retention) को व्यवस्थित रूप से मापने और विश्लेषण करने के लिए VLM बेंचमार्क को एक्शन-आधारित टेबलटॉप कार्यों में अनुकूलित करता है, जिससे यह पता चलता है कि जबकि ये मॉडल बुनियादी अवधारणाओं को बनाए रखते हैं, वे अपने स्रोत VLMs की तुलना में समृद्ध अर्थ संबंधी ज्ञान (semantic knowledge) में महत्वपूर्ण अंतराल प्रदर्शित करते हैं।

Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, De (…)2026-06-19
💻 computer science

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos

यह शोध पत्र "डू ऐज़ आई डू" (Do as I Do) प्रस्तुत करता है, जो एक ऐसा एल्गोरिदम है जो एकल (monocular) RGB मानव वीडियो से हाथ-वस्तु अंतःक्रियाओं (hand-object interactions) को पुनर्गठित करता है और उन्हें कुशल बहु-अंगुलियों वाले रोबोटिक हाथों के लिए निष्पादन योग्य क्रियाओं में रूपांतरित करता है, जो कुशलतापूर्वक हेरफेर डेटा (manipulation data) को बड़े पैमाने पर उत्पन्न करने के लिए मानव-से-रोबोट एम्बॉडिमेंट अंतराल को पाटता है।

Bhawna Paliwal, Haritheja Etukuru, William Liang, Pieter Abbeel, Nur Muhammad Mahi Shafiullah, Jitendra Malik2026-06-19
💻 computer science

Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

यह शोध पत्र लॉन्ग-होराइजन डेक्सट्रस मैनिपुलेशन (long-horizon dexterous manipulation) के लिए एक ज़ीरो-शॉट फ्रेमवर्क प्रस्तुत करता है जो मल्टी-व्यू 2D कीपॉइंट्स को 3D स्पेस में फ्यूज करके भाषा के निर्देशों को निष्पादनीय 3D टास्क प्लान में ग्राउंड करने के लिए विज़न-लैंग्वेज मॉडल का लाभ उठाता है, जिससे एंड-टू-एंड ट्रेनिंग के बिना अनदेखे ऑब्जेक्ट्स पर रोबस्ट पिक-एंड-प्लेस और टूल-यूज़ निष्पादन सक्षम होता है।

Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo2026-06-19
🤖 AI

Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots

यह शोध पत्र "फिजिकल अटाारी" (Physical Atari) को प्रस्तुत करता है, जो एक सुदृढ़ और किफायती $1,000 का प्लेटफॉर्म है जो अटाारी खेलों को भौतिक रूप से नियंत्रित करने के लिए एक कस्टम रोबोट का उपयोग करता है, जिससे वास्तविक दुनिया के सुदृढीकरण लर्निंग (reinforcement learning) प्रयोगों को सक्षम बनाया जा सके जो प्रशिक्षण और परिनियोजन के बीच वितरण बदलावों (distribution shifts) को संभालने के लिए ऑन-डिवाइस अनुकूलन की महत्वपूर्ण आवश्यकता को प्रदर्शित करते हैं।

Khurram Javed, Joseph Modayil, Gloria Kennickell, Richard S. Sutton, John Carmack2026-06-19
🤖 machine learning

FlexLAM: Resolving the Bottleneck Trade-off in Latent Action Learning

FlexLAM फिक्स्ड-कैपेसिटी बॉटलनैक्स को वेरिएबल-लेंथ, प्रीफिक्स-वैलिड लेटेंट एक्शन्स से बदलकर और नेस्टेड ड्रॉपआउट के माध्यम से प्रशिक्षित करके लेटेंट एक्शन लर्निंग में निहित ट्रेड-ऑफ को हल करता है, जो एक ही मॉडल को बिना किसी आर्किटेक्चरल बदलाव या रिट्रेनिंग के सूचना प्रतिधारण (इन्फॉर्मेशन रिटेंशन) और विवरण के बीच गतिशील रूप से संतुलन बनाने में सक्षम बनाता है।

Takanori Yoshimoto, Yang Hu, Naruya Kondo, Tatsuya Matsushima2026-06-19
🤖 machine learning

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

यह शोध पत्र 3D-DLP पेश करता है, जो एक स्व-पर्यवेक्षित (self-supervised) मॉडल है जो RGB-D या वोक्सेल दृश्यों को अलग-अलग वस्तुओं का प्रतिनिधित्व करने वाले व्याख्यात्मक 3D लेटेंट पार्टिकल्स (latent particles) में विभाजित करता है, जिससे नियंत्रित दृश्य निर्माण सक्षम होता है और वस्तु-केंद्रित संरचना की कमी वाले बेसलाइनों की तुलना में रोबोटिक हेरफेर (robotic manipulation) के प्रदर्शन में सुधार होता है।

Ellina Zhang, Madhaven Iyengar, Amir Zadeh, Chuan Li, Deepak Pathak, David Held, Tal Daniel2026-06-19