💻 computer science

BoxTwin: Learning Elastoplastic Articulated Object Dynamics from Videos

BoxTwin एक इंटरैक्टिव डिजिटल ट्विन फ्रेमवर्क है जो वीडियो से आर्टिकुलेटेड वस्तुओं की पूर्ण इलास्टोप्लास्टिक डायनेमिक्स को सीखता है, जिससे रोबोट भौतिक इंटरैक्शन के दौरान जॉइंट ट्रैजेक्टरीज को सटीक रूप से ट्रैक करने और दीर्घकालिक प्लास्टिक विरूपण (डिफॉर्मेशन) और क्षति का पूर्वानुमान लगाने में सक्षम होते हैं।

Heng Zhang, Gehan Zheng, Kaifeng Zhang, Jay Song, Shivansh Patel, Sonny Hu, Yunzhu Li, Changxi Zheng, Peter Yichen Chen2026-07-21
💻 computer science

VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model

VIDAR एक विजुअल-इनर्शियल डेंस रिकंस्ट्रक्शन फ्रेमवर्क है जो ग्राउंड-ट्रुथ पोजीशंस की आवश्यकता के बिना सटीक मेट्रिक-स्केल मोनोक्यूलर रिकंस्ट्रक्शन प्राप्त करने के लिए डेप्थ एनीथिंग 3 फाउंडेशन मॉडल के प्रेडिक्शन्स को अलाइन और फ्यूज करने हेतु SVO+IMU ओडोमेट्री को एक मेट्रिक एंकर के रूप में उपयोग करता है।

Diyari Mohammed Salih, Lingxiang Hu, Naima AitOufroukh-Mammar, Fabien Bonardi2026-07-21
⚡ electrical engineering

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

यह शोध पत्र रोबोटिक मैनिपुलेशन के लिए एक ओपन-वोकैबुलरी शेयर्ड ऑटोनॉमी फ्रेमवर्क प्रस्तुत करता है जो पहनने योग्य उपकरणों के बिना जेस्चर कंट्रोल, विजन-लैंग्वेज टारगेट ग्राउंडिंग, और जीपीयू-एक्सेलेरेटेड मॉडल-प्रेडिक्टिव कंट्रोल को जोड़ता है ताकि ऑपरेटरों को अव्यवस्थित औद्योगिक वातावरण में सटीक, टकराव-मुक्त ग्रैस्प प्राप्त करने में सहायता मिल सके।

Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker2026-07-21
🤖 machine learning

Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints

यह शोध पत्र तर्क देता है कि ट्रांसफर कार्यों के लिए सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम का मूल्यांकन करने के लिए सैंपल दक्षता से परे व्यावहारिक वॉल-क्लॉक प्रशिक्षण समय और डोमेन रैंडमाइजेशन के तहत मजबूती को शामिल करना आवश्यक है, जो यह प्रदर्शित करता है कि सैंपल-अकुशल PPO, SAC और TD-MPC2 जैसे अधिक सैंपल-कुशल एल्गोरिदम की तुलना में गति में बेहतर प्रदर्शन कर सकता है, जबकि तीनों प्रतिमान (पैराडाइम) डोमेन रैंडमाइजेशन से समान रूप से लाभान्वित होते हैं।

Hany Hamed, Abhishek Naik, Colin Bellinger, A. Rupam Mahmood2026-07-21
💻 computer science

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

यह शोध पत्र \methodgated को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो ज़ीरो-शॉट ज्यामितीय निरंतरता जांच (zero-shot geometric consistency check) के माध्यम से टेस्ट-टाइम स्केलिंग को चुनिंदा रूप से लागू करके वर्ल्ड एक्शन मॉडल्स को बेहतर बनाता है, जिससे कार्य सफलता दर में सुधार होता है और अनावश्यक कम्प्यूटेशनल लागतों में काफी कमी आती है।

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao2026-07-21
🤖 AI

COLIP-2: Olfaction-Vision-Language Embeddings

यह शोध पत्र COLIP-2 को प्रस्तुत करता है, जो एक मल्टीमॉडल एम्बेडिंग मॉडल है जो घ्राण (सूंघने की शक्ति), दृष्टि और भाषा को एकीकृत करता है ताकि रोबोट्स को वस्तुओं के स्थान पर गंध का संभाव्य रूप से पता लगाने में सक्षम बनाया जा सके, साथ ही यह ओपन-सोर्स डेटा की वर्तमान सीमाओं और घ्राण संबंधी धारणा को आगे बढ़ाने के लिए नए डेटासेट्स की आवश्यकता पर प्रकाश डालता है।

Kordel Kade France2026-07-21✓ Author reviewed ⓘ
🤖 machine learning

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

यह शोध पत्र मल्टीटास्क डिस्क्रिमिनेटर प्रॉक्सिमिटी-गाइडेड IRL (MPG) प्रस्तुत करता है, जो एक फ्यू-शॉट इनवर्स रीइन्फोर्समेंट लर्निंग विधि है जो सीमित लक्ष्य प्रदर्शनों और संबंधित मल्टी-टास्क डेटा से पर्याप्त विविधताओं वाले नए कार्यों को प्रभावी ढंग से सीखने के लिए एक सामान्यीकरण योग्य डिस्क्रिमिनेटर और एक प्रॉक्सिमिटी फंक्शन को जोड़ता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी उच्च सफलता दर प्राप्त होती है।

Ziyi Liu, Grace Zhang2026-07-21
💻 computer science

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

यह शोध पत्र VLN-AVP का प्रस्ताव करता है, जो एक ज़ीरो-शॉट नेविगेशन फ्रेमवर्क है जो स्वायत्त वैलेट पार्किंग के लिए बर्ड्स-आई-व्यू परसेप्शन को विज़न-लैंग्वेज मॉडल्स और एक हाइब्रिड मेमोरी सिस्टम के साथ जोड़ता है ताकि मैप की निर्भरता को समाप्त किया जा सके, प्राकृतिक भाषा निर्देशों की व्याख्या की जा सके, और सिमुलेशन एवं वास्तविक दुनिया के भूमिगत पार्किंग वातावरण दोनों में उत्कृष्ट प्रदर्शन प्राप्त किया जा सके।

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin2026-07-21
💻 computer science

Polar Coordinate-based Differential Evolution for Moving Target Search Using Vision Sensor on Unmanned Aerial Vehicles

यह शोध पत्र एक पोलर कोऑर्डिनेट-आधारित डिफरेंशियल इवोल्यूशन (PDE) एल्गोरिदम का प्रस्ताव करता है जो गतिशील लक्ष्यों के लिए खोज पथों को अनुकूलित करने हेतु लक्ष्य गतिशीलता मॉडलिंग, बेयसियन फिटनेस फंक्शन और UAV किनेमैटिक बाधाओं को एकीकृत करता है, जो सिमुलेशन और वास्तविक दुनिया के UAV प्रयोगों दोनों में बेहतर पहचान संभावना और निष्पादन समय प्रदर्शित करता है।

Thu Hang Khuat, Duy-Nam Bui, Thuy Ngan Duong, Manh Duong Phung2026-07-21
🤖 machine learning

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

यह शोध पत्र इस अंतर्ज्ञान को चुनौती देता है कि तर्क (reasoning) विजन-लैंग्वेज-एक्शन मॉडलों में मजबूती (robustness) को बढ़ाता है, यह प्रदर्शित करते हुए कि लेटेंट-इटरेटिव रीजनिंग आर्किटेक्चर, नॉन-रीजनिंग या टेक्स्ट-आधारित चेन-ऑफ-थॉट मॉडलों की तुलना में संरचनात्मक रूप से विक्षोभों (perturbations) के प्रति अधिक नाजुक हैं, और साथ ही यह भी प्रकट करता है कि सुरक्षा संकेतों के रूप में रीजनिंग आउटपुट की निगरानी करने वाली वर्तमान विधियाँ एडेप्टिव हमलों के तहत विफल हो जाती हैं।

Tuan Duong Trinh, Naveed Akhtar, Basim Azam2026-07-21