🤖 AI

Towards Predictive, Aligned, and Scalable Robot Learning

यह शोध पत्र Lumo-2 को प्रस्तुत करता है, जो एक हल्का लेटेंट वर्ल्ड-एक्शन मॉडल है, जो लेटेंट स्पेस को व्यवस्थित करने और क्रिया (actions), विज़न और भाषा के बीच क्रॉस-मोडल निरंतरता सुनिश्चित करने के लिए एक मल्टी-स्टेज प्री-अलाइनमेंट रणनीति का उपयोग करके जटिल वास्तविक दुनिया के कार्यों पर बेहतर प्रेडिक्टिव रीजनिंग और कंट्रोल प्रदर्शन प्राप्त करता है।

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang2026-07-14
🤖 AI

A Glimpse into Long-term Physical Coexistence with Intelligent Robots

यह शोध पत्र PHILIA को प्रस्तुत करता है, जो एक रोबोट गेटवे एब्स्ट्रैक्शन के इर्द-गिर्द निर्मित एक मल्टी-रोबोट एजेंट आर्किटेक्चर है जो उच्च-स्तरीय तर्क (high-level reasoning) को निम्न-स्तरीय निष्पादन (low-level execution) से अलग करता है ताकि विविध स्वरूपों (embodiments) और इंटरफेसों के बीच बुद्धिमान रोबोटों के साथ संरचनात्मक, दीर्घकालिक भौतिक सह-अस्तित्व को सक्षम बनाया जा सके।

Weiqi Jin, Peijun Tang, Kuncheng Luo, Baifu Huang, Binyan Sun, Haotian Yang, Shangjin Xie, Jianan Wang2026-07-14
🤖 AI

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

यह शोध पत्र रोबोट-केंद्रित पॉइंटमैप्स (robot-centric pointmaps) का परिचय देता है, जो एक ऐसा प्रतिनिधित्व है जो रोबोट के समन्वय फ्रेम (coordinate frame) में 3D दृश्य ज्यामिति को एनकोड करता है और प्रीट्रेन्ड विजन-लैंग्वेज-एक्शन मॉडल्स द्वारा आवश्यक 2D ग्रिड संरचना को संरक्षित करता है, जिससे फ्रेम मिसमैच की समस्या हल होती है और सिमुलेशन एवं वास्तविक-रोबोट प्रयोगों दोनों में विविध कैमरा व्यू पॉइंट्स के बीच सामान्यीकरण (generalization) में महत्वपूर्ण सुधार होता है।

Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo2026-07-14
💻 computer science

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

यह शोध पत्र ERR@HRI 3.0 चुनौती प्रस्तुत करता है, जिसने रोबोट की त्रुटियों पर बाइस्टैंडर (दर्शक) की प्रतिक्रियाओं का पता लगाने और संभावित विफलताओं का पूर्वानुमान लगाने के लिए एंड-टू-एंड मल्टीमॉडल मशीन लर्निंग को आगे बढ़ाने हेतु दो प्राकृतिक, क्राउडसोर्स्ड वीडियो डेटासेट पेश किए, जो यह प्रदर्शित करता है कि सबमिट किए गए मॉडल बेसलाइन सिस्टम से बेहतर प्रदर्शन करते हैं।

Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju2026-07-14
💻 computer science

IBPA: Real-time Free-form Manifold Mesh Reconstruction via Incremental Ball Pivoting with Integrated Hole Detection

यह शोध पत्र IBPA प्रस्तुत करता है, जो एक वास्तविक समय की वृद्धिशील सतह पुनर्निर्माण विधि है जो स्ट्रीमिंग अंडरवॉटर पॉइंट क्लाउड डेटा से मुक्त-रूप मैनिफोल्ड मेश उत्पन्न करने के लिए बॉल पिवोटिंग एल्गोरिदम को अनुकूलित करती है, जिससे छिद्रों का पता लगाया जा सके, और इस प्रकार बेहतर परिचालन निर्णय लेने के लिए पारंपरिक डिजिटल टेरेन मॉडल की ऊंचाई-क्षेत्र सीमाओं को दूर किया जा सके।

Mauhing Yip, Mohit Singh, Kostas Alexis, Christian Schellewald, Annette Stahl2026-07-14
💻 computer science

Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues

यह शोध पत्र एक वास्तविक दुनिया के डेटा-संचालित सिस्टम को प्रस्तुत करता है जो सक्रिय सेवा रोबोट प्रतिक्रियाओं को ट्रिगर करने के लिए ग्राहकों के गैर-मौखिक संकेतों का पता लगाता है, यह प्रदर्शित करते हुए कि 15.3% बातचीत बिना बोले शुरू की जाती है और एक ऐसा ढांचा प्रस्तावित करता है जो इन दृश्य संकेतों को LLM-आधारित संवाद पीढ़ी में एकीकृत करता है।

Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira2026-07-14
⚡ electrical engineering

Coordinated Incremental Trajectory Tracking of a Tailsitter Drone

यह शोधपत्र टेल्सिटर (tailsitter) यूएवी के लिए रोटेशन मैट्रिसेस पर आधारित एक विश्लेणात्मक डिफरेंशियल फ्लैटनेस फ्रेमवर्क प्रस्तुत करता है जो महत्वपूर्ण ऊर्ध्वाधर वेग वाले उड़ान परिदृश्यों तक अत्याधुनिक प्रक्षेपवक्र ट्रैकिंग क्षमताओं का विस्तार करता है, जिसे प्रायोगिक परिणामों के माध्यम से मान्य किया गया है।

Evangelos Ntouros, Ewoud J. J. Smeur2026-07-14
💻 computer science

A Model for Mediating Multi-Modal Human Intent into Safe Maneuvers for UAVs

यह शोध पत्र एक आवश्यकताओं-शासित मॉडल प्रस्तुत करता है जो ऑपरेटर इनपुट को औपचारिक सुरक्षा विशिष्टताओं के माध्यम से एक संरचित अनुरोध-मूल्यांकन-निष्पादन पाइपलाइन के माध्यम से पर्यावरणीय और उड़ान बाधाओं के विरुद्ध मान्य सीमित अनुरोधों के रूप में मानकर, बहु-मोडल मानव इरादे को सुरक्षित यूएवी (UAV) युद्धाभ्यास में मध्यस्थता प्रदान करता है।

Sofia Nelson, Dalal Alrajeh, Pedro Antonio Alarcon Granadeno, Jane Cleland-Huang2026-07-14
🤖 machine learning

Self-Healing Visual Recovery for Autonomous Ground Vehicles Using Camera-Only Visual Odometry

यह शोध पत्र कैमरा-ओनली ऑटोनॉमस ग्राउंड व्हीकल्स के लिए एक हल्का, दो-चरणीय स्व-उपचार (सेल्फ-हीलिंग) फ्रेमवर्क प्रस्तुत करता है जो एडेप्टिव इन-प्लेस सर्चिंग को मोनोक्यूलर विजुअल ओडोमेट्री-आधारित ब्रेडक्रंब नेविगेशन के साथ जोड़कर, बाहरी बुनियादी ढांचे के बिना केवल CPU-ओनली हार्डवेयर पर 20 Hz पर संचालित होते हुए, फॉल्ट-इंजेक्टेड मामलों में 86.6% मामलों में खोई हुई लाइन-फॉलोइंग गाइडेंस से सफलतापूर्वक उबरता है।

Jakob Solberg Berntzen, Safia Fatima, Leon Moonen2026-07-14
💻 computer science

High-level spatial Dubins airplane-based reference smoothing with low-level geometric tracking for quadrotor control

यह शोध पत्र एक पदानुक्रमित क्वाडकॉप्टर नियंत्रण पद्धति प्रस्तुत करता है जो कुशल और बाधित पथ ट्रैकिंग (जैसे कि बाधाओं के आकार का अनुसरण करना) को सक्षम करने के लिए एक उच्च-स्तरीय स्थानिक डबिन्स एयरप्लेन-आधारित संदर्भ स्मूथिंग चरण को निम्न-स्तरीय ज्यामितीय ट्रैकिंग नियंत्रक के साथ जोड़ता है, जिसे ऑफलाइन या ऑनलाइन रिसीडिंग होराइजन प्लानिंग के माध्यम से किया जा सकता है।

Mogens Plessen2026-07-14