🤖 AI

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

ह्यूमनॉइड-जीपीटी (Humanoid-GPT) एक बिलियन-स्केल, जीपीटी-शैली का ट्रांसफॉर्मर है जिसे 2 बिलियन-फ्रेम के एकीकृत मोशन कॉर्पस पर प्रशिक्षित किया गया है, जो अभूतपूर्व ज़ीरो-शॉट सामान्यीकरण और अत्यधिक गतिशील होल-बॉडी व्यवहारों की सुदृढ़ ट्रैकिंग प्राप्त करता है, जो डेटा की कमी और चपलता-सामान्यीकरण ट्रेड-ऑफ से बाधित पूर्ववर्ती शैलो एमएलपी ट्रैकर्स से कहीं बेहतर है।

Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Z (…)2026-06-03
💻 computer science

SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image

SimuScene एक नवीन कंपोजिशनल 3D पुनर्निर्माण पाइपलाइन पेश करता है जो जेनेरेटिव प्रक्रिया में सीधे एक भौतिक इंजन (physics engine) को एकीकृत करता है ताकि इंटरपेनेट्रेशन (interpenetration) और अस्थिरता जैसी ज्यामितीय त्रुटियों का निदान और सुधार किया जा सके, जिससे रोबोटिक मैनिपुलेशन कार्यों के लिए एकल छवि से स्थिर, सिमुलेशन-रेडी 3D दृश्यों का निर्माण संभव हो सके।

Inhee Lee, Sangwon Baik, Sungjoo Kim, Hyeonwoo Kim, Hyunsoo Cha, Hanbyul Joo2026-06-03
🤖 AI

DeepIPCv2: LiDAR-powered Robust Environmental Perception and Navigational Control for Autonomous Vehicle

DeepIPCv2 एक एंड-टू-एंड ऑटोनॉमस ड्राइविंग फ्रेमवर्क है जो विविध प्रकाश स्थितियों में कैमरा-निर्भर मॉडलों जैसे कि TransFuser की तुलना में कम ड्राइविंग इंटरवेंशन के साथ मजबूत पर्यावरणीय धारणा और सटीक नेविगेशनल नियंत्रण प्राप्त करने के लिए LiDAR-आधारित पॉइंट क्लाउड सेगमेंटेशन और कमांड-विशिष्ट नियंत्रण लर्निंग का लाभ उठाता है।

Oskar Natan, Jun Miura2026-06-02
🤖 machine learning

LeARN: Learnable and Adaptive Representations for Nonlinear Dynamics in System Identification

यह शोधपत्र LeARN को प्रस्तुत करता है, जो एक नवीन सिस्टम आइडेंटिफिकेशन फ्रेमवर्क है जो मेटा-लर्निंग और एक हल्के डीप न्यूरल नेटवर्क का लाभ उठाकर डेटा से बेसिस फंक्शन्स को स्वचालित रूप से सीखने और अनुकूलित करने के लिए, पारंपरिक SINDy विधियों की डोमेन-विशिष्ट ज्ञान संबंधी सीमाओं को पार करते हुए गैररेखीय डायनेमिकल सिस्टम्स के मॉडलिंग में प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Arunabh Singh, Joyjit Mukherjee2026-06-02
🤖 machine learning

GIFT: Geometry-Induced Functional Transfer for Category-level Object Manipulation

यह शोध पत्र GIFT प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ज्यामिति-आधारित इंटरेक्शन ट्रांसफर के लिए फंक्शनल मैप्स और सुचारू पथ निर्माण के लिए स्क्रू इंटरपोलेशन का लाभ उठाकर, रोबोटों को एकल मानव प्रदर्शन से नए ऑब्जेक्ट्स के लिए जटिल हेरफेर कौशल को सामान्य बनाने में सक्षम बनाता है।

Cristiana de Farias, Luis Figueredo, Riddhiman Laha, Maxime Adjigble, Brahim Tamadazte, Rustam Stolkin, Sami Haddadin, N (…)2026-06-02
⚡ electrical engineering

Line-Search Filter Differential Dynamic Programming for Optimal Control with Nonlinear Equality Constraints

यह शोध पत्र FilterDDP को पेश करता है, जो एक सुदृढ़ डिफरेंशियल डायनेमिक प्रोग्रामिंग एल्गोरिदम है जो गैररेखीय समानता-प्रतिबंधित इष्टतम नियंत्रण समस्याओं को हल करने के लिए एक स्टेप फ़िल्टर और लाइन सर्च का उपयोग करता है, जिसमें लैग्रेंजियन-आधारित स्वीकृति मानदंड और हेसियन गड़बड़ी जैसे विशिष्ट डिज़ाइन विकल्प शामिल हैं जो स्थानीय द्विघाती अभिसरण सुनिश्चित करते हैं और रोबोटिक्स अनुप्रयोगों के लिए असमानता प्रतिबंधों के विस्तार को सक्षम करते हैं।

Ming Xu, Stephen Gould, Iman Shames2026-06-02
🤖 AI

MARFT: Multi-Agent Reinforcement Fine-Tuning

यह शोधपत्र मल्टी-एजेंट रिइन्फोर्समेंट फाइन-ट्यूनिंग (MARFT) प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें फ्लेक्स-एमजी (Flex-MG) नामक एक नया मार्कोव गेम फॉर्मूलेशन और एक सार्वभौमिक एल्गोरिद्मिक दृष्टिकोण शामिल है, जिसे लार्ज लैंग्वेज मॉडल-आधारित मल्टी-एजेंट सिस्टम पर रिइन्फोर्समेंट लर्निंग लागू करने की अनूठी चुनौतियों से निपटने के लिए डिज़ाइन किया गया है।

Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang2026-06-02
💻 computer science

CrazyMARL: Decentralized Direct Motor Control Policies for Cooperative Aerial Transport of Cable-Suspended Payloads

यह शोध पत्र CrazyMARL को प्रस्तुत करता है, जो एक विकेंद्रीकृत सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है जो जटिल गैररेखीय गतिकी (nonlinear dynamics), केबल ढीले-तनाव संक्रमणों (cable slack-taut transitions) और बाहरी व्यवधानों को ज़ीरो-शॉट सिम-टू-रियल ट्रांसफर के माध्यम से सफलतापूर्वक संभालते हुए, अनस्ट्रक्चर्ड वातावरण में मल्टी-UAV टीमों को मजबूती से केबल-लटकते पेलोड को ले जाने में सक्षम बनाता है।

Viktor Lorentz, Khaled Wahba, Sayantan Auddy, Marc Toussaint, Wolfgang Hönig2026-06-02
💻 computer science

CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping

यह शोध पत्र CLAW को प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो एक फाइन-ट्यून्ड CLIP मॉडल का उपयोग करके सिम्बोलिक वेट रीजनिंग (symbolic weight reasoning) को एक्शन जनरेशन से अलग करता है ताकि स्केल रीडिंग की निगरानी की जा सके और एक फ्लो-आधारित VLA पॉलिसी के लिए डिस्क्रीट डायरेक्टिव्स (discrete directives) उत्पन्न किए जा सकें, जिससे रोबोटिक सिस्टम्स को उन वेट-अवेयर ग्रैस्पिंग कार्यों को विश्वसनीय रूप से निष्पादित करने में सक्षम बनाया जा सके जो मानक VLA मॉडल्स की क्षमताओं से परे हैं।

Zijian An, Ran Yang, Yiming Feng, Lifeng Zhou2026-06-02
⚡ electrical engineering

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

HuMam एक स्टेट-सेंट्रिक एंड-टू-एंड रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो ह्यूमनॉइड लोकोमोशन के लिए है, जो रोबोट स्टेट्स को फुटस्टेप टारगेट्स और एक फेज क्लॉक के साथ फ्यूज करने के लिए सिंगल-लेयर माम्बा एनकोडर का लाभ उठाता है, जिससे JVRC-1 रोबोट पर फीडफॉरवर्ड बेसलाइन्स की तुलना में बेहतर ट्रेनिंग स्थिरता, दक्षता और ऊर्जा बचत प्राप्त होती है।

Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao2026-06-02