← नवीनतम पेपर
💻 computer science

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation

यह शोध पत्र लेटेंट एक्शन गाइडेड फ्लो मैचिंग (LAFM) प्रस्तुत करता है, जो एक नवीन रोबोटिक मैनिपुलेशन फ्रेमवर्क है जो एक्शन स्पेस में संरचनात्मक विसंगतियों को दूर करने के लिए फिक्स्ड गॉसियन प्रायर को एक लेटेंट एक्शन मॉडल द्वारा समर्थित सीखे गए वितरणों की एक एडेप्टिव लाइब्रेरी से बदल देता है, जिससे मानक फ्लो मैचिंग और बड़े प्री-ट्रेन्ड मॉडल्स की तुलना में प्रशिक्षण दक्षता और कार्य सफलता दर में महत्वपूर्ण सुधार होता है।

मूल लेखक: Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को जटिल कार्य करना सिखा रहे हैं, जैसे कि कटोरे सजाना या दराज खोलना। ऐसा करने के लिए, रोबोट को एक "पॉलिसी" (policy) सीखने की आवश्यकता होती है—जो नियमों का एक समूह है जो रोबोट को बताता है कि उसे अपनी वर्तमान स्थिति से वहां तक कैसे पहुँचना है जहाँ उसे होना चाहिए।

हाल के वर्षों में, रोबोट को यह सिखाने का सबसे अच्छा तरीका "फ्लो मैचिंग" (Flow Matching) रहा है। फ्लो मैचिंग को एक GPS नेविगेशन सिस्टम की तरह समझें। रोब tersebut रोबोट एक "नॉइज़" (noise) स्थान (संभावित गतिविधियों का एक रैंडम, उलझा हुआ ढेर) से शुरू होता है और उसे एक "टारगेट" (target) स्थान (कार्य को पूरा करने के लिए एकदम सुचारू गति) तक पहुँचना होता है। AI उस "सड़क" (वेक्टर फील्ड) को सीखता है जो शोर (noise) को लक्ष्य (target) से जोड़ती है।

समस्या: एक ही आकार सबके लिए सही नहीं होता (One Size Does Not Fit All)

वर्तमान मानक GPS (मानक फ्लो मैचिंग) में एक बड़ी खामी है: यह मान लेता है कि हर एक यात्रा बिल्कुल एक ही रैंडम स्थान से शुरू होती है।

कल्पना कीजिए कि आप एक टैक्सी ड्राइवर हैं। कभी-कभी आपको एक शांत लाइब्रेरी (एक बहुत ही विशिष्ट, सटीक गति) तक जाना होता है। अन्य समय में, आपको एक अराजक संगीत समारोह (एक विस्तृत, विविध गति) तक जाना होता है।

  • पुराना तरीका: GPS आपको हर यात्रा के लिए रेगिस्तान के बीचों-बीच एक ही रैंडम पार्किंग लॉट से शुरू होने के लिए मजबूर करता है, चाहे आप लाइब्रेरी जा रहे हों या फेस्टिवल। आपको अपने विशिष्ट यात्रा के लिए सही शुरुआती बिंदु तक पहुँचने के लिए पूरे रेगिस्तान को पार करना पड़ता है। यह रोबोट के सीखने के पथ (AI के लर्निंग पाथ) को अविश्वसनीय रूप से उलझा हुआ, भ्रमित करने वाला और अक्षम बना देता है।
  • वास्तविकता: रोबोटिक कार्य "हेटरोसेडास्टिक" (heteroscedastic) होते हैं। यह एक फैंसी शब्द है जिसका अर्थ है कि कुछ कार्य बहुत अनुमानित होते हैं (कम विचलन/low variance), जबकि अन्य बहुत अनिश्चित और विविध होते हैं (उच्च विचलन/high variance)। एक एकल शुरुआती बिंदु दोनों को अच्छी तरह से संभाल नहीं सकता।

समाधान: LAFM (Latent Action Guided Flow Matching)

इस शोध पत्र के लेखक LAFM पेश करते हैं, जो आपके टैक्सी बेड़े के लिए एक स्मार्ट डिस्पैचर (स्मार्ट व्यवस्थापक) की तरह काम करता है।

हर यात्रा को एक ही रैंडम रेगिस्तानी स्थान से शुरू करने के बजाय, LAFM एक लेटेंट एक्शन मॉडल (LAM) का उपयोग करता है। LAM को एक "मूवमेंट लाइब्रेरियन" (गति का पुस्तकालयाध्यक्ष) के रूप में समझें।

  1. लाइब्रेरियन: रोबोट के हिलने से पहले ही, LAM वर्तमान दृश्य को देखता है और पूछता है, "यह किस तरह की गति है?" क्या यह एक नाजुक "पिक-अप" (उठाने वाली) गति है? एक "पुश" (धकेलने वाली) गति है? या एक "स्टैक" (सजाने वाली) गति है?
  2. लाइब्रेरी: LAM के पास विभिन्न "शुरुआती क्षेत्रों" (प्रायर डिस्ट्रीब्यूशंस) की एक लाइब्रेरी है। प्रत्येक क्षेत्र एक विशिष्ट प्रकार की गति के लिए विशेष है।
  3. मैच: यदि रोबोट को एक नाजुक "पिक-अप" करनी है, तो LAM उसे लाइब्रेरी के ठीक बगल वाले शुरुआती क्षेत्र में भेज देता है। यदि उसे एक जंगली "डांस" करना है, तो वह उसे फेस्टिवल के पास वाले शुरुआती क्षेत्र में भेज देता है।

कार्य से मेल खाने वाले एक "स्मार्ट" शुरुआती बिंदु से रोबोट की यात्रा शुरू करके, रोबोट को रेगिस्तान पार करने की आवश्यकता नहीं होती है। पथ छोटा, सीधा और बहुत कम उलझा हुआ हो जाता है।

उन्होंने इसे कैसे सिद्ध किया

शोधकर्ताओं ने इस नए "स्मार्ट डिस्पैचर" सिस्टम का दो तरीकों से परीक्षण किया:

  1. वास्तविक दुनिया के रोबोट: उन्होंने चार कार्यों को करने के लिए एक वास्तविक रोबोटिक आर्म (Franka Emika Panda) का उपयोग किया: ड्रेनर में प्लेटें रखना, स्क्रूड्राइवर के साथ दराज खोलना, कैन फेंकना और कटोरे सजाना।

    • परिणाम: नया तरीका (LAFM) पुराने मानक तरीके की तुलना में 23.4% अधिक सफल रहा। यह एक विशाल, प्री-ट्रेंड AI मॉडल π0\pi_0 से भी बेहतर था, जिसके पास 30 गुना अधिक पैरामीटर्स (मेमोरी) हैं, भले ही LAFM बहुत छोटा है।
  2. सिम्युलेटेड बेंचमार्क (LIBERO): उन्होंने 90 अलग-अलग कार्यों के साथ एक जटिल वीडियो गेम सिमुलेशन में रोबोट का परीक्षण किया।

    • परिणाम: LAFM ने मानक विधि की तुलना में 10.4% उच्च सफलता दर प्राप्त की। इसने लगभग सभी अन्य शीर्ष-स्तरीय रोबोट AI को पछाड़ दिया, जिसमें वे भी शामिल हैं जो विशाल डेटासेट पर प्री-ट्रेंड हैं।

मुख्य निष्कर्ष

यह पेपर दावा करता है कि केवल यह बदलकर कि रोबोट अपनी सीखने की यात्रा कहाँ से शुरू करता है (एक एकल रैंडम स्थान से एक स्मार्ट शुरुआती स्थानों की लाइब्रेरी तक), आप रोबोट को तेज़ी से सीखने, अधिक सुचारू रूप से चलने और कार्यों में बहुत अधिक बार सफल होने में मदद कर सकते हैं।

उन्होंने केवल थोड़ा अतिरिक्त प्रशिक्षण नहीं जोड़ा; उन्होंने सीखने की प्रक्रिया की ज्यामिति (geometry) को मौलिक रूप से बदल दिया। रोबोट को अब संभावनाओं के उलझे हुए ढेर को सुलझाने की आवश्यकता नहीं है; उसे एक पूर्व-निर्धारित मार्ग दिया जाता है जो विशिष्ट कार्य के अनुकूल होता है।

संक्षेप में: LAFM रोबोट को यह अनुमान लगाने से रोकता है कि कहाँ से शुरू करना है। यह रोबोट को जो वह देख रहा है उसके आधार पर एक "हेड स्टार्ट" (शुरुआती बढ़त) देता है, जिससे सीखने की पूरी प्रक्रिया बहुत अधिक कुशल और सफल हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →