💻 computer science

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control

एन्फोल्ड (Enfold) एक नवीन ढांचा है जो विश्व-जनरेटिव मॉडलों की बहु-स्तरीय कम्प्यूटेशनल प्रक्रिया को केवल वर्तमान दृश्य और भाषाई संदर्भ से अनुमानित एक भविष्य कहनेवाला प्रतिनिधित्व (predictive representation) में संकुचित करता है, जिससे एम्बोडीड एजेंटों को भविष्य के प्रक्षेप पथों (trajectories) को प्रत्येक चरण पर साकार करने की आवश्यकता के बिना, भविष्य-जनरेटिव संरचना को आंतरिक रूप से आत्मसात करके, काफी कम विलंबता के साथ सुदृढ़ नियंत्रण प्राप्त करने में सक्षम बनाया जा सके।

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin W (…)2026-07-30
💻 computer science

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

यह शोध पत्र ActSWM को प्रस्तुत करता है, जो एक एक्शन-सेंसिटिव लेटेंट वर्ल्ड मॉडल है जो एक ट्रांजिशन-सेपरेशन सिद्धांत को लागू करके "कॉन्टेक्स्ट कोलैप्स" विफलता मोड को संबोधित करता है ताकि यह सुनिश्चित किया जा सके कि विभिन्न एक्शन सीक्वेंसों के बीच लॉन्ग-होरिज़न रोलआउट्स अलग-अलग पहचाने जा सकें, जिससे ओपन-वर्ल्ड गेम्स में प्लानिंग प्रदर्शन में सुधार होता है और ऑफलाइन वीडियो से एक्शन रिकवरी सक्षम होती है।

Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang2026-07-30
⚡ electrical engineering

Global Sensitive-Based Input Shaping for UAV-Payload Precision Motion Control

यह शोध पत्र 3D UAV-पेलोड प्रणालियों के लिए शापली मानों (Shapley values) द्वारा संवर्धित एक वैश्विक संवेदनशीलता-आधारित इनपुट शेपिंग विधि प्रस्तावित करता है, जो संख्यात्मक सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि यह गैर-मजबूत (non-robust), मानक मजबूत और मिनिमैक्स डिजाइनों की तुलना में पेलोड द्रव्यमान और रस्सी की लंबाई में अनिश्चितताओं के विरुद्ध मजबूती में महत्वपूर्ण सुधार करता है।

Karan Baker, Sanjay Maharjan, Tariq Hlayel, Oladapo Ogunbodede, Dutch Dunphy, Adrian Stein2026-07-30
💻 computer science

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

यह शोध पत्र HERO को प्रस्तुत करता है, जो एक स्व-सुधार करने वाला पदानुक्रमित एम्बोडीड एजेंट (hierarchical embodied agent) है, जो ह्यूरिस्टिक रीजनिंग (heuristic reasoning), उदाहरण पुन: उपयोग (exemplar reuse) और रिफ्लेक्सिव निष्पादन (reflexive execution) को व्यवस्थित करके शून्य मानव प्रदर्शनों से कुशल क्लोज्ड-लूप नीतियों में रोबोटिक हेरफेर क्षमताओं को स्वायत्त रूप से बूटस्ट्रैप और समेकित करता है।

Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian2026-07-30
💻 computer science

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

यह शोध पत्र एक कोर्स-टू-फाइन (coarse-to-fine) विजुअल फ्लोरप्लान लोकलाइजेशन फ्रेमवर्क प्रस्तावित करता है जो एक इमेज-कंडीशन्ड पोज डिफ्यूजन मॉडल का उपयोग करके एक कोर्स स्टेज में मल्टीमॉडलल पोज अस्पष्टताओं को हल करने के लिए रिसोर्स-इंटेंसिव रे मैचिंग की आवश्यकता को समाप्त करता है, जिसके बाद सटीक सब-मीटर समायोजन के लिए एक लोकलाइज्ड रिफाइनर का उपयोग किया जाता है, जिससे S3D और ZInD बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang2026-07-30
🤖 AI

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

पेगासस (Pegasus) एक कम-संसाधन वाला फ्रेमवर्क है जो एक संरचित, ग्राफ-आधारित ज्ञान हस्तांतरण पाइपलाइन के माध्यम से, जिसे एक भौतिक सत्यापनकर्ता (physics verifier) द्वारा उन्नत किया गया है, मानव प्रदर्शन वीडियो को रोबोट-सक्षम डेटा में अनुवादित करके मानव और रोबोट हेरफेर के बीच के एम्बॉडिमेंट अंतराल (embodiment gap) को पाटता है।

Jia Luo2026-07-30
🤖 machine learning

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

यह शोध पत्र पहचान करता है कि LeWorldModel में मामूली गॉसियन रेगुलराइजेशन (Gaussian regularization) मल्टी-टास्क सेटिंग्स में रिप्रेजेंटेशन एलियासिंगिंग (representation aliasing) का कारण बनता है और एक टेम्पोरली सेंटर्ड SIGReg दृष्टिकोण प्रस्तावित करता है जो इसके बजाय रेसिडुअल्स (residuals) पर रेगुलराइजेशन लागू करता है, जिससे बिना किसी बाहरी प्रीट्रेनिंग के LIBERO बेंचमार्क पर डाउनस्ट्रीम मल्टी-टास्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu2026-07-30
💻 computer science

HumanCLAW: Can Vision-Language Models Act Through a Body?

यह शोधपत्र HumanCLAW प्रस्तुत करता है, जो एम्बोडीड इंटेलिजेंस (embodied intelligence) के मूल्यांकन के लिए विजन-लैंग्वेज मॉडल के निर्णय लेने की प्रक्रिया को मोटर निष्पादन (motor execution) से अलग करता है, जिससे यह पता चलता है कि वर्तमान मॉडल मुख्य रूप से पहचान क्षमताओं के बजाय एम्बोडीड आत्म-जागरूकता (embodied self-awareness) की कमी के कारण लंबी अवधि के भौतिक कार्यों में विफल होते हैं।

Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, M (…)2026-07-30
🤖 machine learning

A context-adaptive policy framework for robust and reactive robotic manipulation via uncertainty-aware imitation learning

यह शोध पत्र एक संदर्भ-अनुकूल नीति ढांचे (context-adaptive policy framework) का प्रस्ताव करता है जो बदलते पर्यावरणीय परिस्थितियों के अनुकूल होने में सक्षम मजबूत और प्रतिक्रियाशील रोबोटिक हेरफेर रणनीतियों को उत्पन्न करने के लिए कार्य-प्राचलीकृत अनुकरण शिक्षण (task-parameterized imitation learning) को अनिश्चितता-जागरूक विशेषज्ञों के मिश्रण (uncertainty-aware Mixture of Experts) के साथ एकीकृत करता है।

Tim R. Winter, Leonard Klüpfel, Ashok M. Sundaram, Werner Friedl, Maximo A. Roa, Freek Stulp, João Silvério2026-07-29
🤖 AI

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

यह शोध पत्र NVIDIA Omniverse में जनरेट किए गए एक सार्वजनिक रूप से उपलब्ध सिंथेटिक डेटासेट को प्रस्तुत करता है जिसका उपयोग स्थानिक तर्क (spatial reasoning) और विजुअल पर्सपेक्टिव टेकिंग (Visual Perspective Taking) पर विजन-लैंग्वेज मॉडल्स को प्रशिक्षित करने के लिए किया जाता है, जो मानव-रोबोट इंटरेक्शन में एम्बोडीड कॉग्निशन (embodied cognition) की दिशा में एक आधारभूत कदम के रूप में कार्य करता है।

Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska2026-07-29