💻 computer science

Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery

सेंटिनल-वीएलए (Sentinel-VLA) एक मेटाकॉग्निटिव विजन-लैंग्वेज-एक्शन मॉडल है जिसमें ऑन-डिमांड डायनेमिक रीजनिंग और एरर रिकवरी के लिए एक एक्टिव स्टेटस मॉनिटरिंग मॉड्यूल है, जिसे ऑटोमैटिकली जेनरेटेड डेटा पर प्रशिक्षित किया गया है और स्टेट-ऑफ-द-आर्ट मॉडल्स की तुलना में सफलता दर में 30% सुधार प्राप्त करने के लिए एक सेल्फ-इवॉल्विंग कॉन्टिनुअल लर्निंग एल्गोरिदम के साथ उन्नत किया गया है।

Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu2026-05-29
💻 computer science

VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

यह शोध पत्र VLA-ATTC को प्रस्तुत करता है, जो एक अनिश्चितता-आधारित "कॉग्निटिव क्लच" (cognitive clutch) और युग्मवार क्रिया चयन के लिए एक नवीन 'रिलेटिव एक्शन क्रिटिक' (Relative Action Critic) के माध्यम से अडैप्टिव टेस्ट-टाइम कंप्यूट के साथ विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जो बिना किसी मैनुअल एनोटेशन के जटिल हेरफेर कार्यों में विफलता दर को महत्वपूर्ण रूप से कम करता है।

Wenhao Li, Xiu Su, Yichao Cao, Hongyan Xu, Xiaobo Xia, Shan You, Yi Chen, Chang Xu2026-05-29
🤖 machine learning

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

यह शोध पत्र फ्लो-एंकोर्ड नॉइज़-कंडीशन्ड क्यू-लर्निंग (FAN) प्रस्तुत करता है, जो एक कुशल ऑफलाइन रीइन्फोर्समेंट लर्निंग एल्गोरिदम है जो फ्लो पॉलिसियों और डिस्ट्रीब्यूशनल क्रिटिक्स को केवल एक इटरेशन और नॉइज़ सैंपल की आवश्यकता के लिए अनुकूलित करके रोबोटिक कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है, जिससे सटीकता से समझौता किए बिना कम्प्यूटेशनल लागतों को काफी कम किया जा सकता है।

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali2026-05-29
💻 computer science

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

यह शोध पत्र पहला व्यवस्थित ब्लैक-बॉक्स अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्वायत्त ड्राइविंग के लिए रीजनिंग-सक्षम विजन-लैंग्वेज-एक्शन मॉडल यथार्थवादी टेक्स्ट इनपुट व्यवधानों के प्रति अत्यधिक संवेदनशील हैं, जो तर्क करने की क्षमताओं और ड्राइविंग सुरक्षा को महत्वपूर्ण रूप से कम कर देते हैं, जिससे मजबूत मूल्यांकन ढांचे और बेहतर सुरक्षा उपायों की तत्काल आवश्यकता रेखांकित होती है।

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr2026-05-29
💻 computer science

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

ElegantVLA एक प्लग-इन, फेज़-एडेप्टिव इन्फरेंस फ्रेमवर्क है जो टेम्पोरल स्टेबिलिटी और टास्क प्रोग्रेस के आधार पर परसेप्शन और एक्शन मॉड्यूल्स के बीच कंप्यूटेशनल रिसोर्सेस को डायनामिकली शेड्यूल करके विजन-लैंग्वेज-एक्शन मॉडल्स को तेज़ करता है, जिससे बेस मॉडल को फिर से ट्रेन किए बिना कंट्रोल फ्रीक्वेंसी में महत्वपूर्ण रूप से वृद्धि होती है।

Ye Li, Huanan Liu, Kangye Ji, Yuan Meng, Jiajun Fan, Yuansong Wang, Shiyu Qin, Chenglei Wu, Shu-Tao Xia, Zhi Wang2026-05-29
🤖 AI

Planning with the Views via Scene Self-Exploration

यह शोध पत्र ViewSuite प्रस्तुत करता है, जो एक 3D बेंचमार्क है जो यह दर्शाता है कि विजन-लैंग्वेज मॉडल मल्टी-टर्न प्लानिंग के लिए व्यू-एक्शन ट्रांसफॉर्मेशन को कंपोज़ करने में संघर्ष करते हैं, और एक व्यू ग्राफ डिस्टिलेशन के साथ एक इटरेटिव सेल्फ-एक्सप्लोरेशन फ्रेमवर्क प्रस्तावित करता है जो स्पार्स रिवार्ड्स को दूर करके और GPT-4o जैसे अग्रणी मॉडलों से आगे निकलकर प्लानिंग परफॉरमेंस को महत्वपूर्ण रूप से बढ़ाता है।

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Ma (…)2026-05-29
💻 computer science

VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation

यह शोध पत्र VE2VF प्रस्तुत करता है, जो एक ह्यूम-इन-द-लूप सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विजन-सक्षम शिक्षक से ज्ञान को एक सुदृढ़, विजन-मुक्त छात्र नीति में संकुचित (distill) करता है, जिसे पूरी तरह से वास्तविक दुनिया में प्रशिक्षित किया गया है, और जो डोमेन रैंडमाइजेशन या डेटा ऑग्मेंटेशन पर निर्भर हुए बिना संपर्क-समृद्ध हेरफेर कार्यों (contact-rich manipulation tasks) पर उच्च सफलता दर और मजबूत सामान्यीकरण प्राप्त करता है।

Victor Kowalski, Chengxi Li, Dongheui Lee2026-05-29
💻 computer science

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration

यह शोध पत्र FLIP को प्रस्तुत करता है, जो बड़े पैमाने के झुंडों (swarms) के लिए एक लचीली और कुशल वितरित फॉर्मेशन प्लानिंग पद्धति है, जो अनुकूलतम स्थिति अनुक्रम गणना को पॉइंट क्लाउड रजिस्ट्रेशन समस्या में परिवर्तित करती है ताकि अत्यधिक कम्प्यूटेशनल भार के बिना तीव्र, आउटलायर-प्रतिरोधी प्रक्षेपवक्र अनुकूलन सक्षम किया जा सके।

Yuan Zhou, Guangtong Xu, Zhenyu Hou, Jialiang Hou, Fei Gao2026-05-29
💻 computer science

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

यह शोध पत्र फ्यूचर-एक्सपीरियंस कंडीशनिंग (FEC) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-स्टेप रोबोट मैनिपुलेशन कार्यों में अन्वेषण (exploration) और पॉलिसी अनुकूलन को महत्वपूर्ण रूप से बढ़ाने के लिए LLM-निर्देशित, लघु-क्षितिज भविष्य के वीडियो अनुमानों को संरचित प्रायर्स (structured priors) के रूप में उपयोग करता है, यह प्रदर्शित करते हुए कि त्रुटिपूर्ण भविष्य के परिकल्पनाएं भी प्रदर्शन में सुधार करती हैं जबकि असंगत परिकल्पनाएं इसे कम करती हैं।

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz2026-05-29
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Gaze2Act एक नवीन विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो मानव दृष्टि (human gaze) को एक गतिशील इरादे के संकेत के रूप में एकीकृत करके रोबोटिक हेरफेर (robot manipulation) को बढ़ाता है, जो यूनिट्री G1 ह्यूमनॉइड पर ऑब्जेक्ट डिसएम्बिग्यूएशन (object disambiguation), सूक्ष्म-स्तरीय इंटरेक्शन और गतिशील इरादा स्टीयरिंग (dynamic intent steering) प्राप्त करने के लिए ईगो-एक्सो व्यू अंतराल को पाटता है।

Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng L (…)2026-05-29