⚡ electrical engineering

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control

यह शोध पत्र WA-LQR नामक एक प्रशिक्षण-मुक्त स्टीयरिंग पद्धति प्रस्तावित करता है जो उनके सक्रियण स्थानों (activation spaces) में निम्न-आयामी रैखिक पृथक्करणीयता (low-dimensional linear separability) का लाभ उठाकर वर्ल्ड एक्शन मॉडल्स की वितरण बदलावों (distribution shifts) के विरुद्ध सुदृढ़ता बढ़ाने के लिए यांत्रिक व्याख्यात्मकता (mechanistic interpretability) और इष्टतम नियंत्रण (optimal control) का उपयोग करता है।

Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou2026-07-17
💻 computer science

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA एक स्थानिक रूप से जागरूक विजन-लैंग्वेज-एक्शन मॉडल है जो डेप्थ-अवेयर प्रीट्रेनिंग, करिकुलम-आधारित फाइन-ट्यूनिंग, चेन-ऑफ-थॉट रीजनिंग और क्लोज्ड-लूप रीइन्फोर्समेंट लर्निंग को एकीकृत करके जटिल, बाधित शहरी वातावरण में UAV लक्ष्य ट्रैकिंग को बढ़ाता है ताकि मौजूदा नीतियों की तुलना में विस्थापन त्रुटियों को काफी कम किया जा सके और सफलता दर में सुधार किया जा सके।

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo (…)2026-07-17
🤖 machine learning

DriftWorld: Fast World Modeling through Drifting

DriftWorld एक अभिनव एक्शन-कंडीशन्ड वर्ल्ड मॉडल पेश करता है जो भविष्य के फ्रेम को सिंगल फॉरवर्ड पास में जेनरेट करने के लिए ड्रिफ्टिंग जनरेटिव मॉडल्स का लाभ उठाता है, जिससे डिफ्यूजन-आधारित बेसलाइन्स की तुलना में 17 गुना तेज़ इन्फरेंस प्राप्त होता है और साथ ही रोबोटिक प्लानिंग और पॉलिसी इवैल्यूएशन में स्टेट-ऑफ-द-आर्ट प्रदर्शन बनाए रखा जाता है।

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du2026-07-17
💻 computer science

Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older Adults

यह शोध पत्र एक ऐसे सोशल रोबोट फ्रेमवर्क को प्रस्तुत और मूल्यांकित करता है जो वृद्ध वयस्कों को मानकीकृत दुर्बलता (फ्रैलिटी) और गिरने के जोखिम के आकलन के माध्यम से सफलतापूर्वक निर्देशित करता है, जो नैदानिक संदर्भ उपकरणों और चिकित्सकों के साथ उत्कृष्ट सहमति प्रदर्शित करने के साथ-साथ पारंपरिक परिणामों से परे विस्तृत बायोमैकेनिकल मेट्रिक्स को भी कैप्चर करता है।

Aniol Civit, Antonio Andriella, Alba Martínez, Joan Ars, Aida Ribera, Cristian Barrué, Guillem AlenyÃ2026-07-17
🤖 machine learning

BadWAM: When World-Action Models Dream Right but Act Wrong

यह शोध पत्र BadWAM प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो यह प्रदर्शित करता है कि वर्ल्ड-एक्शन मॉडल्स (WAMs) उन प्रतिकूल हमलों के प्रति संवेदनशील हैं जहाँ छोटे दृश्य व्यवधान (visual perturbations) मॉडल की कल्पित भविष्य और उसके द्वारा निष्पादित कार्यों को अलग कर सकते हैं, जिससे महत्वपूर्ण कार्य विफलताओं का कारण बनता है, भले ही मॉडल के आंतरिक अनुमान तर्कसंगत बने रहें।

Qi Li, Xingyi Yang, Xinchao Wang2026-07-17
🤖 machine learning

RoboTTT: Context Scaling for Robot Policies

यह शोध पत्र RoboTTT को प्रस्तुत करता है, जो एक रोबोट नीति ढांचा (robot policy framework) है जो विज़ुओमोटर संदर्भ (visuomotor context) को 8,000 टाइमस्टेप्स तक स्केल करने के लिए टेस्ट-टाइम ट्रेनिंग (Test-Time Training) को एकीकृत करता है, जिससे वन-शॉट इमिटेशन (one-shot imitation), ऑन-द-फ्लाई सुधार, और लॉन्ग-होरिज़ॉन कार्यों पर काफी बेहतर प्रदर्शन सक्षम होता है, जो इन्फरेंस लेटेंसी (inference latency) को बढ़ाए बिना फास्ट वेट्स (fast weights) में हिस्ट्री को कंप्रेस करता है।

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuk (…)2026-07-17
💻 computer science

PokeNet: Learning Kinematic Models of Articulated Objects from Human Observations

पोकेनेट (PokeNet) एक एंड-टू-एंड फ्रेमवर्क है जो बिना किसी पूर्व वस्तु ज्ञान या मल्टी-व्यू डेटा की आवश्यकता के, एक एकल मानव प्रदर्शन और पॉइंट क्लाउड अवलोकनों से, जोड़ मापदंडों (joint parameters), हेरफेर क्रम (manipulation order) और स्टेट ट्रैकिंग सहित, आर्टिकुलेटेड वस्तुओं के काइनेमैटिक मॉडल सीखता है।

Anmol Gupta, Weiwei Gu, Omkar Patil, Jun Ki Lee, Nakul Gopalan2026-07-16
💻 computer science

When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs

यह शोध पत्र LIBERO-CF प्रस्तुत करता है, जो विज़न-लैंग्वेज-एक्शन मॉडल्स के लिए पहला काउंटरफैक्चुअल बेंचमार्क है, और काउंटरफैक्चुअल एक्शन गाइडेंस (CAG) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री ड्यूल-ब्रांच इन्फरेंस विधि है जो विज़ुअल शॉर्टकट्स के विरुद्ध लैंग्वेज कंडीशनिंग को स्पष्ट रूप से रेगुलराइज़ करके लैंग्वेज-फॉलोइंग विफलताओं को महत्वपूर्ण रूप से कम करती है।

Yu Fang, Yuchun Feng, Dong Jing, Jiaqi Liu, Yue Yang, Zhenyu Wei, Daniel Szafir, Mingyu Ding2026-07-16
💻 computer science

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

यह शोध पत्र HRIBench प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जिसमें संरचित इंटरेक्शन परिदृश्य और विशिष्ट मेट्रिक्स शामिल हैं ताकि वर्तमान विजन-लैंग्वेज-एक्शन मॉडल्स द्वारा पकड़ने में विफल रहने वाले इरादे की समझ (इंटेंट अंडरस्टैंडिंग), टेम्पोरल सिंक्रोनाइज़ेशन और प्रोटोकॉल पालन के महत्वपूर्ण अंतराल को संबोधित करते हुए मानव-रोबोट सहयोग का मूल्यांकन और सुधार किया जा सके।

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin2026-07-16
💻 computer science

A 3DGS-Driven Dynamic Viewpoint and Vibrotactile Framework for Subsea Teleoperation Validated via fNIRS

यह शोध पत्र एक मल्टीमॉडल टेलीऑपरेशन फ्रेमवर्क प्रस्तुत करता है जो 3DGS-संचालित डायनेमिक व्यूपॉइंट सिस्टम और वाइब्रोटैक्टाइल फीडबैक को संयोजित करता है, जिसे एक मानव-विषय अध्ययन द्वारा उप-समुद्री संचार विलंबता (subsea communication latency) के तहत ऑपरेटर के प्रदर्शन और संज्ञानात्मक सहनशक्ति को बढ़ाने के रूप में महत्वपूर्ण रूप से प्रमाणित किया गया है, क्योंकि यह बाधा-मुक्त एक्सोसेंट्रिक विज़ुअलाइज़ेशन और सहज हैप्टिक संकेत प्रदान करता है।

Fang Xu, Tianyu Zhou, Ruitong Tian, Md Jahidul Islam, Jing Du2026-07-16