🤖 AI

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

यह शोध पत्र एक धारणा-क्रिया पाइपलाइन (perception-action pipeline) प्रस्तुत करता है जो अव्यवस्थित सुविधा स्टोर वातावरण में रोबोटिक पिक-एंड-प्लेस कार्यों के लिए है, जो लक्ष्यों की पहचान करने के लिए एनोटेशन-गाइडेड विजुअल प्रॉम्प्टिंग को मानव प्रदर्शनों से अनुकूलन योग्य, डेटा-संचालित ग्रैस्पिंग अनुक्रमों को उत्पन्न करने के लिए एक्शन चंकिंग विद ट्रांसफॉर्मर्स (ACT) के साथ जोड़ता है।

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae2026-08-19
⚡ electrical engineering

Efficient Collision-Avoidance Constraints for Ellipsoidal Obstacles in Optimal Control: Application to Path-Following MPC and UAVs

यह शोध पत्र एक मॉड्यूलर इष्टतम नियंत्रण ढांचे (optimal control framework) को प्रस्तुत करता है जिसमें दीर्घवृत्तीय बाधाओं (ellipsoidal obstacles) के लिए एक गणनात्मक रूप से कुशल, निरंतर अवकलनीय (continuously differentiable) टकराव-बचाव स्थिति है, जिसे संख्यात्मक चुनौतियों से निपटने के लिए एक नवीन दो-चरणीय अनुकूलन दृष्टिकोण का उपयोग करते हुए सिमुलेशन और क्रेजीफ्लाई (Crazyflie) क्वाड्रोटर पर वास्तविक 3D प्रयोगों के माध्यम से मान्य किया गया है।

David Leprich, Mario Rosenfelder, Markus Herrmann-Wicklmayr, Kathrin Flaßkamp, Peter Eberhard, Henrik Ebel2026-08-19
💻 computer science

KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV

यह शोध पत्र KAN-We-Flow को प्रस्तुत करता है, जो रोबोटिक मैनिपुलेशन के लिए एक हल्का और कुशल 3D फ्लो-मैचिंग पॉलिसी है, जो काफी कम मापदंडों (parameters) के साथ अत्याधुनिक प्रदर्शन प्राप्त करने के लिए भारी UNet बैकबोन के स्थान पर एक नवीन RWKV-KAN आर्किटेक्चर और एक्शन कंसिस्टेंसी रेगुलराइजेशन का उपयोग करता है।

Zhihao Chen, Yiyuan Ge, Ziyang Wang, Youwei Zhang2026-08-19
💻 computer science

Multi-Observer Vehicle Localization Case Study with Roadside Radar and Connected Vehicle Sensing

यह शोध पत्र एक मल्टी-ऑब्जर्वर वाहन स्थानीयकरण ढांचे को प्रस्तुत करता है जो एक्सटेंडेड कलमन फिल्टर का उपयोग करके रोडसाइड रडार और कनेक्टेड व्हीकल लिडार डेटा को संलयित (फ्यूज) करता है, और हेलसिंकी चौराहे के वास्तविक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि जहाँ आदर्श स्थितियों में फ्यूजन, मजबूत लिडार-ओनली बेसलाइन की तुलना में सीमित लाभ प्रदान करता है, वहीं यह सेंसर अवरोधों या कम अपडेट दरों के दौरान मूल्यवान मजबूती और प्रदर्शन सुधार प्रदान करता है।

Aleksi Pippuri, Nilusha Jayawickrama, Risto Ojala2026-08-19
🤖 machine learning

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP एक प्रशिक्षण-मुक्त रोबोट मैनिपुलेशन पॉलिसी पेश करता है जो एक विजन-लैंग्वेज मॉडल को फ्रीज रखता है और मल्टी-व्यू ऑब्जर्वेशन्स के आधार पर हर KK स्टेप्स में अपने स्वयं के पायथन कंट्रोल कोड को गतिशील रूप से फिर से लिखकर क्लोज्ड-लूप कंट्रोल सक्षम करता है, जिससे इन-एपिसोड फेलियर रिकवरी के माध्यम से ओपन-लूप बेसलाइन्स की तुलना में सफलता दर में दस गुना सुधार प्राप्त होता है।

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis2026-08-19
🤖 machine learning

Lambda-Hold Control: Human-Like Movement Emerges from a Minimal Task Reward in Predictive Musculoskeletal Simulation

यह शोध पत्र λ\lambda-होल्ड कंट्रोलर प्रस्तुत करता है, जो एक शारीरिक रूप से प्रेरित सुदृढ़ीकरण लर्निंग (reinforcement learning) दृष्टिकोण है जो मस्कुलोस्केलेटल मॉडलों के उच्च-आयामी एक्शन स्पेस को कुशलतापूर्वक नेविगेट करने के लिए इक्विलिब्रियम-पॉइंट परिकल्पना का लाभ उठाता है, जिससे उन्हें एक घंटे से भी कम समय में न्यूनतम पुरस्कारों के साथ मानव-समान स्प्रिंटिंग सीखने में सक्षम बनाया जा सके।

Jun Hyuk Lee, Chihyeong Lee, Jooeun Ahn2026-08-19
💻 computer science

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

यह शोध पत्र PROBE को प्रस्तुत करता है, जो एक उच्च-सटीक सिम्युलेटर (PROBE-Sim), एक बेंचमार्क (PROBE-Bench), और एक फाइन-ट्यूनिंग रेसिपी (PROBE-Agent) से बना एक ढांचा है, जो मैनिपुलेशन-ग्राउंडेड विजुअल क्वेश्चन अनस्वर्सिंग में विजन-लैंग्वेज मॉडल एजेंटों को उन्नत करने के लिए है, और यह प्रदर्शित करता है कि एजेंटिक टूल-आधारित मैनिपुलेशन गतिशील, अव्यवस्थित वातावरण में केवल धारणा-आधारित दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है।

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay2026-08-19
🤖 AI

ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback

यह शोध पत्र ORPA को प्रस्तुत करता है, जो एक हल्का, फीडबैक-कंडीशन्ड मॉड्यूल जोड़कर प्री-ट्रेन की गई रोबोटिक मैनिपुलेशन पॉलिसियों को बढ़ाता है, जो वास्तविक समय में जॉइंट-स्पेस रेसिडुअल एडजस्टमेंट का पूर्वानुमान लगाने में सक्षम है, जिससे पूर्ण पॉलिसी रिट्रेनिंग की आवश्यकता के बिना तत्काल त्रुटि सुधार और डिस्ट्रीब्यूशन शिफ्ट के प्रति अनुकूलन संभव हो पाता है।

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae2026-08-19
💻 computer science

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

यह शोध पत्र ManiGuard प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और डेटा सूट है जो सुरक्षा विशिष्टताओं को कार्य सफलता से अलग करके रोबोटिक मैनिपुलेशन नीतियों की सुरक्षा का कठोरता से मूल्यांकन और सुधार करता है, और औपचारिक रनटाइम मॉनिटरिंग का उपयोग करके यह प्रकट करता है कि जबकि फाइन-ट्यूनिंग सुरक्षा को बढ़ाती है, अधिक डेटा और वितरण बदलावों (distribution shifts) के बावजूद महत्वपूर्ण अंतराल बने रहते हैं।

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xin (…)2026-08-19
🤖 machine learning

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

प्रिज्म-जीआरपीओ (Prism-GRPO) बाइनरी सफलता पुरस्कारों को निष्पादन-गुणवत्ता स्कोर के साथ बढ़ाकर विजन-लैंग्वेज-एक्शन पॉलिसी अनुकूलन को त्वरित करता है ताकि समान-परिणाम समूहों को विभाजित किया जा सके, जिससे त्याग दिए गए रोलआउट्स से प्रशिक्षण संकेतों को पुनः प्राप्त किया जा सके और लक्षित सफलता दर तक पहुँचने के लिए 56% तक कम रोलआउट्स की आवश्यकता हो।

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan2026-08-19