🤖 AI

Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode

यह शोध पत्र प्रकट करता है कि जहाँ फिजिकल एआई (Physical AI) का बैच-1 एलएलएम (LLM) इन्फरेंस मेमोरी-डॉमिनेटेड है, वहीं तेज़ जीपीयू (GPU) असंगत रूप से अधिक लॉन्च-साइड ओवरहेड्स से ग्रस्त होते हैं जो आनुपातिक लेटेंसी लाभ को रोकते हैं, और मानक क्वांटाइजेशन विधियाँ अक्सर अपेक्षित स्पीडअप प्राप्त करने में विफल रहती हैं जब तक कि उन्हें GPTQ+ExLlamaV2 जैसे अत्यधिक अनुकूलित कर्नेल्स के साथ जोड़ा न जाए।

Josef Chen2026-06-01
🤖 AI

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

यह शोध पत्र PInVerify प्रस्तुत करता है, जो एक ऑफलाइन एम्बॉडीड बेंचमार्क है जिसे एक्टिव इंस्टेंस वेरिफिकेशन (AIV) कार्यों का मूल्यांकन करने के लिए डिज़ाइन किया गया है जहाँ एजेंटों को सूक्ष्म वस्तु विशेषताओं को अलग करने के लिए मल्टी-व्यू निरीक्षण करना होता है, जिससे यह पता चलता है कि जबकि LoRA-फाइन-ट्यून किए गए एजेंट मजबूत प्रदर्शन प्राप्त करते हैं, वर्तमान नेक्स्ट-बेस्ट-व्यू रणनीतियाँ अभी तक स्टैटिक बेसलाइन की तुलना में विश्वसनीय लाभ प्रदान नहीं करती हैं।

Yuhang Jiang2026-06-01
🤖 machine learning

BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies

यह शोध पत्र BOKBO को प्रस्तुत करता है, जो K-सैंपल VLA इन्फरेंस के लिए पहला कॉन्फॉर्मल एब्स्टेंशन लेयर (conformal abstention layer) है, जो मौजूदा नॉनकॉन्फॉर्मिटी स्कोर्स में संरचनात्मक विफलताओं को संबोधित करके और फोर्स थ्रेशोल्डिंग में पद्धतिगत खामियों को सुधारकर निष्पादित-उल्लंघन दरों (executed-violation rates) पर परिमित-नमूना वितरण-मुक्त गारंटी प्रदान करता है, जिससे विविध बेंचमार्क और वितरण बदलावों (distribution shifts) में सुरक्षा अंशांकन (safety calibration) और कार्य सफलता में महत्वपूर्ण सुधार होता है।

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj2026-06-01
💻 computer science

WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation

WristCompass कलाई की गति और कैमरा ओरिएंटेशन के बीच काइनेमैटिक कपलिंग डायनेमिक्स पर आधारित एक सीखने योग्य विज़ुअल कॉन्सेप्ट पेश करता है, जो उच्च दक्षता और एनाटॉमिकल ग्राउंडिंग के साथ बाधित मैनिपुलेशन वीडियो में ज़ीरो-शॉट ईगो-कैमरा ओरिएंटेशन रिकवरी को सक्षम बनाता है।

Varun Nair, Vidyut Baradwaj, Jiahang He, Anya Singh, Jai Relan, Cabrel Happi2026-06-01
💻 computer science

Primitive Subspaces Mediate Few-Shot Transfer in VLAs

यह शोध पत्र यह प्रदर्शित करता है कि प्रिमिटिव-सेगमेंटेड एपिसोड के साथ विजन-लैंग्वेज-एक्शन (VLA) पॉलिसियों को प्रशिक्षित करना उप-कौशलों की एक हस्तांतरणीय लाइब्रेरी बनाता है जो फ्लैट ट्राजेक्टरी ट्रेनिंग की तुलना में काफी अधिक सैंपल-एफिशिएंट फ्यू-शॉट टास्क एडाप्टेशन सक्षम करता है, एक कारण संबंध जिसे सबस्पेस एब्लेशन अध्ययनों के माध्यम से पुष्ट किया गया है।

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj2026-06-01
💻 computer science

Object-Informed Model Predictive Path Integral Control for Non-Prehensile Robot Manipulation

यह शोध पत्र एक पदानुक्रमित मॉडल प्रेडिक्टिव पाथ इंटीग्रल (MPPI) नियंत्रण ढांचे का प्रस्ताव करता है जो रोबोट-स्तर के नियोजन को निर्देशित करने के लिए एक सरलीकृत ऑब्जेक्ट-लेवल योजना का लाभ उठाता है, जो सिमुलेशन और वास्तविक दुनिया के हार्डवेयर दोनों में दीर्घ-क्षित (long-horizon) गैर-पकड़ (non-prehensile) हेरफेर कार्यों के लिए सफलता दर और कम्प्यूटेशनल दक्षता में महत्वपूर्ण सुधार करता है।

Nikola Raicevic, Bharath Raam Radhakrishnan, Chenbin Yu, Ki Myung Brian Lee, Nikolay Atanasov2026-06-01
🤖 AI

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

यह शोध पत्र **Hide-and-Seek** को प्रस्तुत करता है, जो केवल प्रक्षेपवक्र-स्तर (trajectory-level) के लेबल का उपयोग करके विजन-लैंग्वेज-एक्शन (VLA) मॉडल के लिए विफलता-सूचक क्रियाओं को स्थानीयकृत करने और टेम्पोरल रूप से संरचित विफलता संकेतों को उत्पन्न करने वाला एक कोर्सली सुपरवाइज्ड (coarsely supervised) फ्रेमवर्क है, जिससे महंगे रीसैंपलिंग या स्टेप-लेवल एनोटेशन की आवश्यकता के बिना मजबूत, वास्तविक समय में विफलता का पता लगाना सक्षम होता है।

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li2026-06-01
💻 computer science

Wall-OSS-0.5 Technical Report

यह शोध पत्र Wall-OSS-0.5 को प्रस्तुत करता है, जो एक ओपन-सोर्स 4B विजन-लैंग्वेज-एक्शन मॉडल है जो यह प्रदर्शित करता है कि VLA प्रीट्रेनिंग स्वयं विविध एम्बॉडिमेंट्स (embodiments) के बीच सीधे निष्पादन योग्य ज़ीरो-शॉट रोबोट व्यवहार उत्पन्न करती है और साथ ही डाउनस्ट्रीम फाइन-ट्यूनिंग प्रदर्शन को बढ़ाती है तथा ग्राउंडेड विजन-लैंग्वेज क्षमताओं को सुरक्षित रखती है।

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerr (…)2026-06-01
💻 computer science

Seeing Fast and Slow: Bimodal 3D Scene Graphs for Open-set Tasks

यह शोध पत्र BiMoSG पेश करता है, जो एक द्वि-मोडल (bimodal) 3D सीन ग्राफ जनरेशन फ्रेमवर्क है जो कुशल, वास्तविक समय के ओपन-सेट कार्य निष्पादन को सक्षम करने के लिए एक तेज़, मोटे (coarse) मोड और एक धीमे, सूक्ष्म-स्तरीय (fine-grained) ओपन-वोकैबुलरी मोड के बीच गतिशील रूप से स्विच करता है।

Marcel Bartholomeus Prasetyo, Shrutika Vishal Thengane, A Manicka Praveen, Yi Loo, Malika Meghjani2026-06-01
💻 computer science

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving

यह शोध पत्र न्यूरल टोकन रिकंस्ट्रक्शन (NTR) को प्रस्तुत करता है, जो एक धारणा-मुक्त (perception-free) एंड-टू-एंड ड्राइविंग फ्रेमवर्क है जो सेल्फ-डिस्टिलेशन मास्क रिकंस्ट्रक्शन ऑब्जेक्टिव और फाउंडेशन-मॉडल-व्युत्पन्न सिमेंटिक प्रायर्स के माध्यम से कॉम्पैक्ट सीन टोकन लर्निंग को बढ़ाता है, जो इन्फरेंस-टाइम प्लानर को बदले बिना बॉटलनेक को समृद्ध और कम रेडंडेंट विजुअल जानकारी संरक्षित करने के लिए मजबूर करके कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jiahui Li, Jiawei Sun, Zixiang Ren, Ming Liu, Jiamin Shi, Ruiteng Zhao, Zhiyang Liu, Liying Liu, Zuoguan Wang, Kaidi Yan (…)2026-06-01