🤖 machine learning

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

यह शोध पत्र सैंपलिंग-गाइडेड पॉलिसी सर्च (SGPS) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो जटिल रोबोटिक लोकोमोशन और मैनिपुलेशन कार्यों के लिए विजुअल पॉलिसियों को कुशलतापूर्वक प्रशिक्षित करने हेतु सैंपलिंग-आधारित मॉडल प्रेडिक्टिव कंट्रोल को फर्स्ट-ऑर्डर पॉलिसी ऑप्टिमाइज़ेशन के साथ जोड़ता है, जिससे वास्तविक दुनिया के हार्डवेयर पर ज़ीरो-शॉट ट्रांसफर प्राप्त होता है।

Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham2026-09-18
💻 computer science

Bayesian Continuum Robot Dynamics and State Estimation

यह शोध पत्र एक बेयसियन ढांचे (Bayesian framework) को प्रस्तुत करता है जो जड़त्वीय (inertial) और डैम्पिंग प्रभावों को तुल्य भार के रूप में पुनर्गठित करके कोसेराट रॉड गतिकी (Cosserat rod dynamics) का सन्निकटन करता है, जिससे उन गतिशील गतियों के दौरान निरंतर रोबोटों (continuum robots) के लिए सटीक जॉइंट स्टेट एस्टीमेशन और बाहरी भार अनुमान सक्षम होता है जहाँ पारंपरिक अर्ध-स्थैतिक (quasi-static) विधियाँ विफल हो जाती हैं।

James M. Ferguson, Tucker Hermans, Alan Kuntz2026-09-18
💻 computer science

TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces

TraceFlow एक टेस्ट-टाइम गाइडेंस विधि पेश करता है जो TraceBank में संग्रहीत सफल और असफल रोलआउट ट्रेसेस से प्राप्त प्रोग्रेस-अलाइन्ड करेक्शन फील्ड का लाभ उठाकर फ्रोजन फ्लो-मैचिंग रोबोट पॉलिसियों को उन्नत करता है, जिससे बिना किसी मॉडल वेट अपडेट के वास्तविक दुनिया के पैकिंग और विशिष्ट सिमुलेशन बेंचमार्क पर कार्य सफलता दरों में महत्वपूर्ण सुधार होता है।

Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang2026-09-18
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

HIL-UMI एक रोबोट-मुक्त, ह्यूमन-इन-द-लूप फ्रेमवर्क पेश करता है जो पोस्ट-ट्रेनिंग विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक हैंडहेल्ड यूनिवर्सल मैनिपुलेशन इंटरफेस और एक पॉलिसी-गाइडेड एनर्जी स्कोर का लाभ उठाता है ताकि लक्षित डेटा को कुशलतापूर्वक एकत्र किया जा सके और एडवांटेज एस्टिमेटर्स को परिष्कृत किया जा सके, जिससे स्टेटिक सुपरवाइज्ड फाइन-ट्यूनिंग की सीमाओं को दूर किया जा सके और भौतिक रोबोट तैनाती के बिना स्केलेबल, इटरेटिव सुधार को सक्षम बनाया जा सके।

Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai L (…)2026-09-18
🤖 AI

FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

FAMOS एक फीड-फॉरवर्ड मॉडल है जो एक मल्टी-स्टेट आर्टिकुलेशन ट्रांसफार्मर के माध्यम से कई अवलोकनों पर संयुक्त रूप से तर्क देकर और डेटासेट की सीमाओं को दूर करने के लिए एक प्रक्रियात्मक डेटा जनरेटर का लाभ उठाकर, विरल, अव्यवस्थित आंशिक पॉइंट क्लाउड्स से 3D आर्टिकुलेशन पैरामीटर्स और मूवेबल-पार्ट सेगमेंटेशन की भविष्यवाणी करता है।

Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou, Sayan Deb Sarkar, Konrad Schindler, Iro Armeni2026-09-18
🤖 AI

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

यह शोध पत्र "वर्कस्पेस टोकन" (workspace tokens) प्रस्तुत करता है, जो VLMs से सलिअन्सी-ड्रिवन (saliency-driven) पर्यवेक्षण के माध्यम से प्रशिक्षित एक हल्का लेटेंट मेमोरी रिप्रजेंटेशन है, जो रोबोटिक पॉलिसियों को बिना इन-द-लूप VLM रीजनिंग की आवश्यकता के, डिप्लॉयमेंट के दौरान कुशलतापूर्वक दीर्घकालिक मेमोरी कार्यों को हल करने में सक्षम बनाता है, और साथ ही समग्र प्रदर्शन में भी सुधार करता है।

Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz2026-09-18
⚡ electrical engineering

Towards smart and adaptive agents for active sensing on edge devices

यह शोध पत्र एक कॉम्पैक्ट, एक्टिव इन्फरेंस-आधारित एजेंटिक सिस्टम पेश करता है जो संसाधन-सीमित एज डिवाइसेस पर रीयल-टाइम, एडेप्टिव एक्टिव सेंसिंग को सक्षम बनाता है, जिससे वे पारंपरिक TinyML दृष्टिकोणों की सीमाओं को दूर करने के लिए कैमरा मूवमेंट को गतिशील रूप से प्लान और कंट्रोल कर सकते हैं।

Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen2026-09-17
🤖 AI

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

यह शोधपत्र SurgRAW प्रस्तुत करता है, जो एक मल्टी-एजेंट वर्कफ़्लो है जो चेन-ऑफ-थॉट रीजनिंग और एक नए बेंचमार्क (SurgCoTBench) का लाभ उठाकर, पदानुक्रमित सहयोग (hierarchical collaboration) और रिट्रीवल-ऑगमेंटेड जनरेशन के माध्यम से पृथक मॉडलों और सामान्य विजन-लैंग्वेज मॉडलों की सीमाओं को पार करते हुए, रोबोटिक सर्जिकल दृश्यों की श्रेष्ठ, नैदानिक रूप से संरेखित ज़ीरो-शॉट समझ प्राप्त करता है।

Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin2026-09-17
💻 computer science

VLEM: Real-Time 3D Vision-Language Embedding Mapping

VLEM एक वास्तविक समय का फ्रेमवर्क है जो कच्चे RGB-D स्ट्रीम से पिक्सेल-अलाइन्ड 2D विजन-लैंग्वेज एम्बेडिंग्स को एक वैश्विक रूप से सुसंगत, मीट्रिक-सटीक 3D प्रतिनिधित्व में एकीकृत करता है, जो बिना किसी ग्राउंड ट्रुथ पोज़ की आवश्यकता के उत्कृष्ट ओपन-सेट सेगमेंटेशन और इंटरैक्टिव रोबोटिक मैनिपुलेशन को सक्षम बनाता है।

Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert2026-09-17
💻 computer science

End2Race: An End-to-End Learning Framework for Multi-Vehicle Autonomous Racing

यह शोध पत्र End2Race को प्रस्तुत करता है, जो मल्टी-व्हीकल ऑटोनॉमस रेसिंग के लिए एक एंड-टू-एंड लर्निंग फ्रेमवर्क है, जो सब-मिलीसेकंड इन्फरेंस लेटेंसी प्राप्त करता है और हेड-टू-हेड प्रतियोगिताओं में मजबूत सामान्यीकरण, उच्च गति और अनुकूलन योग्य ओवरटेकिंग प्रदर्शित करके मौजूदा नियम-आधारित और सिंगल-व्हीकल लर्निंग विधियों से बेहतर प्रदर्शन करता है।

Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu2026-09-17