← नवीनतम पेपर
🤖 machine learning

Flow with the Force Field: Learning 3D Compliant Flow Matching Policies from Force and Demonstration-Guided Simulation Data

यह शोध पत्र एक ऐसे ढांचे को प्रस्तुत करता है जो अनुपालनशील (compliant) विसुमोटर नीतियों को प्रशिक्षित करने के लिए एकल मानव प्रदर्शन से बल-सूचित (force-informed) सिंथेटिक डेटा उत्पन्न करता है, जिससे रोबोट विश्वसनीय बल अनुकूलन और कम सिम-टू-रियल (Sim2Real) अंतराल के साथ संपर्क-समृद्ध हेरफेर कार्यों को प्रभावी ढंग से करने में सक्षम होते हैं।

मूल लेखक: Tianyu Li, Yihan Li, Zizhe Zhang, Nadia Figueroa

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianyu Li, Yihan Li, Zizhe Zhang, Nadia Figueroa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक भारी लकड़ी के ब्लॉक को अपनी तरफ पलटने या दो हाथों से एक बड़े, अजीब आकार के डिब्बे को उठाने के लिए सिखा रहे हैं। यदि आप केवल रोबोट को कहेंगे, "अपने हाथ को बिंदु X पर ले जाओ, फिर बिंदु Y पर," तो वह संभवतः ब्लॉक से टकरा जाएगा, उससे टकराकर उछल जाएगा, या उसे कुचल देगा। उसमें एहसास (feel) की कमी है। उसे नहीं पता कि कब ज़ोर से धक्का देना है और कब कोमलता बरतनी है।

यह शोध पत्र एक नया तरीका प्रस्तुत करता है जिससे आप रोबोट को वास्तविक दुनिया में हज़ारों घंटों के अभ्यास के बिना ये "स्पर्श-संवेदी" (touchy-feely) कार्य सिखा सकते हैं। यहाँ उनके तरीके का सरल विवरण दिया गया है:

1. समस्या: रोबोट "भद्दा" (Clumsy) है

अधिकांश आधुनिक रोबोट उस पियानो वादक की तरह हैं जो केवल चाबियों को दबाना जानते हैं लेकिन यह नहीं जानते कि उन्हें कितनी कोमलता से दबाना है। वे खाली स्थान में एक बिंदु से दूसरे बिंदु तक जाने में माहिर हैं, लेकिन जैसे ही वे किसी चीज़ को छूते हैं, वे सख्त हो जाते हैं और चीज़ों को तोड़ देते हैं। वे अनुपालन (compliance) (दबाव के तहत झुकने या ढलने की क्षमता) को अनदेखा कर देते हैं।

2. समाधान: "फोर्स फील्ड सिम्युलेटर"

लेखकों ने एक ऐसा सिस्टम बनाया है जो रोबोट को कंप्यूटर सिमुलेशन में केवल एक उदाहरण का उपयोग करके "महसूस" करना सिखाता है।

  • एकल डेमो (The Single Demo): वास्तविक दुनिया में मानव से 500 बार कार्य करने के लिए कहने के बजाय (जो धीमा और महंगा है), वे एक मानव से एक वीडियो गेम जैसे सिम्युलेटर (IsaacGym) के भीतर इसे एक बार करने के लिए कहते हैं।
  • जादुई ट्रिक (डेटा जनरेशन): एक बार जब उनके पास वह एक चाल आ जाती है, तो वे लैपलेसियन एडिटिंग (Laplacian Editing) नामक एक चतुर गणितीय ट्रिक का उपयोग करते हैं। कल्पना कीजिए कि आपके पास रोबोट की गति की एक मिट्टी की मूर्ति है। आप उसी क्रिया के सैकड़ों नए संस्करण बनाने के लिए उस मिट्टी को खींच सकते हैं, सिकोड़ सकते हैं और घुमा सकते हैं, जबकि क्रिया के मूल "एहसास" को बनाए रखा जाता है।
  • इसमें "बल" (Force) को शामिल करना: महत्वपूर्ण बात यह है कि वे केवल स्थिति को नहीं बदलते; वे बल को भी बदलते हैं। वे "आभासी लक्ष्य" जोड़ते हैं जो रोबोट को बताते हैं, "यदि आप यहाँ धक्का देते हैं, तो आपको ज़्यादा ज़ोर से धक्का देना होगा," या "यदि आप इस सतह से टकराते हैं, तो आपको अपनी पकड़ को नरम करना होगा।" यह केवल एक मानव डेमो से "बल-जागरूक" (force-aware) प्रशिक्षण डेटा का एक विशाल पुस्तकालय बनाता है।

3. मस्तिष्क: "फ्लो मैचिंग" पॉलिसी (The Flow Matching Policy)

अब जब उनके पास "चीजों को कोमलता से कैसे छुआ जाए" का एक बड़ा डेटासेट है, तो उन्हें इसे सीखने के लिए एक मस्तिष्क की आवश्यकता है।

  • वे फ्लो मैचिंग (Flow Matching) तकनीक का उपयोग करते हैं। इसे एक नदी की तरह समझें। रोबोट की गति संभावनाओं के एक अराजक भंवर (शोर/noise) से शुरू होकर सही क्रिया की ओर सुचारू रूप से बहती है।
  • रोबोट की "आंखें" 3D पॉइंट क्लाउड्स (वस्तु के आकार को दर्शाने वाले बिंदुओं का एक डिजिटल मानचित्र) हैं, न कि केवल सपाट तस्वीरें। यह रोबोट को वस्तु के 3D आकार को समझने में मदद करता है, भले ही रोशनी बदल जाए।
  • रोबोट की "त्वचा" फोर्स सेंसर (Force Sensors) है। यह एक साथ 3D आकार को देखने और दबाव को महसूस करना सीखता है।

4. निष्पादन: "पैसिव इम्पीडेंस" सुरक्षा जाल (The Passive Impedance Safety Net)

सुरक्षा के लिए यह सबसे महत्वपूर्ण हिस्सा है। भले ही रोबोट का मस्तिष्क सोचता हो कि वह क्या करने जा रहा है, वास्तविक दुनिया अव्यवست है।

  • पुराना तरीका: रोबोट एक कठोर पथ का पालन करने की कोशिश करता है। यदि वह किसी दीवार से टकराता है, तो वह और ज़ोर से धक्का देता है, जिससे दीवार या खुद को नुकसान पहुँच सकता है।
  • नया तरीका (पैसिव इम्पीडेंस): लेखक रोबोट की गति को एक स्प्रिंग जैसी डोरी (springy leash) की तरह मानते हैं। रोबोट की एक "वांछित वेग" (desired velocity) होती है (जहाँ वह जाना चाहता है), लेकिन वह उस लक्ष्य से एक स्प्रिंग द्वारा जुड़ा होता है।
    • यदि रोबोट किसी बाधा से टकराता है, तो स्प्रिंग खिंच जाती है। रोबोट बाधा से लड़ता नहीं है; वह कोमलता से झुक जाता है, उसके चारों ओर फिसलता है, या अपनी पकड़ को समायोजित करता है।
    • यह रोबोट को बहुत अधिक ऊर्जा डालने (टकराने) से रोकता है और इसे गलतियों से स्वाभाविक रूप से उबरने की अनुमति देता है।

परिणाम: सिमुलेशन से वास्तविकता तक

उन्होंने दो कार्यों पर इसका परीक्षण किया:

  1. ब्लॉक को पलटना: एक एकल हाथ ब्लॉक को सपाट से सीधा खड़ा करने के लिए पलटता है।
  2. डिब्बा ले जाना: दो हाथ एक बड़े ऑब्जेक्ट को ले जाने के लिए मिलकर काम करते हैं।

जादू: उन्होंने रोबोट को पूरी तरह से "मिट्टी की तरह खींचे गए" (clay-stretched) सिमुलेशन डेटा पर प्रशिक्षित किया। फिर वे रोबोट को वास्तविक दुनिया में ले गए और उसे शून्य वास्तविक दुनिया का प्रशिक्षण दिया।

  • स्थानिक सामान्यीकरण (Spatial Generalization): उन्होंने ब्लॉक को उन स्थानों पर स्थानांतरित किया जिन्हें रोबोट ने सिम्युलेटर में कभी नहीं देखा था, और फिर भी यह सफल रहा।
  • वस्तु सामान्यीकरण (Object Generalization): उन्होंने रोबोट को अलग-अलग आकार के डिब्बे दिए (कुछ प्रशिक्षण डेटा से बड़े, कुछ छोटे), और उसने तुरंत अनुकूलन किया।
  • सुरक्षा: "स्प्रिंग जैसी डोरी" वाले कंट्रोलर ने रोबोट को वस्तुओं को कुचलने से रोका, और कठोर कंट्रोलर्स की तुलना में कम ऊर्जा का उपयोग किया और अधिक बार सफल हुआ।

मुख्य निष्कर्ष

यह शोध पत्र दिखाता है कि नाजुक वस्तुओं को संभालने के लिए रोबोट को वास्तविक दुनिया में लाखों बार अभ्यास करने की आवश्यकता नहीं है। सिम्युलेटर में एक एकल मानव डेमो का उपयोग करके, गणित के साथ उस डेटा को खींचकर, और रोबोट को एक स्प्रिंग जैसी, लचीली बॉडी देकर, हम रोबोट को मानव हाथ की गरिमा के साथ वास्तविक दुनिया को संभालने के लिए सिखा सकते हैं।

संक्षेप में: उन्होंने रोबोट को चीजों को छूने के लाखों अलग-अलग तरीकों का अनुकरण करके "महसूस" करना सिखाया, और फिर रोबोट को एक "स्प्रिंग जैसी डोरी" पर अभ्यास करने दिया ताकि जब वह अंततः वास्तविक दुनिया में आए तो कुछ भी न टूटे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →