← नवीनतम पेपर
💻 computer science

PhaForce: Phase-Scheduled Visual-Force Policy Learning with Slow Planning and Fast Correction for Contact-Rich Manipulation

PhaForce एक चरण-निर्धारित (phase-scheduled) विज़ुओमोटर पॉलिसी है जो एक धीमी, दृष्टि-प्रधान डिफ्यूजन योजनाकार (diffusion planner) को एक तेज़, बल-संचालित सुधारक (force-driven corrector) के साथ समन्वित करके संपर्क-समृद्ध हेरफेर (contact-rich manipulation) को बेहतर बनाती है ताकि उच्च-आवृत्ति वाले, चरण-जागरूक अवशिष्ट सुधार (phase-aware residual corrections) सक्षम किए जा सकें, जिससे 86% सफलता दर और मौजूदा बेसलाइन की तुलना में श्रेष्ठ अनुकूलन क्षमता प्राप्त होती है।

मूल लेखक: Mingxin Wang, Zhirun Yue, Renhao Lu, Yizhe Li, Zihan Wang, Guoping Pan, Kangkang Dong, Jun Cheng, Yi Cheng, Houde Liu

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingxin Wang, Zhirun Yue, Renhao Lu, Yizhe Li, Zihan Wang, Guoping Pan, Kangkang Dong, Jun Cheng, Yi Cheng, Houde Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को बहुत ही नाजुक काम करना सिखा रहे हैं, जैसे कि दीवार के सॉकेट में चार्जर लगाना, एक चिपचिपा दराज खोलना, या व्हाइटबोर्ड को साफ करना।

यदि आप रोबोट को केवल आंखें (कैमरे) देते हैं, तो यह सुई में धागा पिरोने की कोशिश करने जैसा है, लेकिन अंधेरे में। रोबोट छेद को देख तो सकता है, लेकिन उसे यह नहीं पता होगा कि प्लग फंस गया है, या वह थोड़ा तिरछा है, या वह बहुत जोर से दबाव डाल रहा है। वह कुछ चीज़ों को तोड़ने के लिए बस धक्का देता रह सकता है।

यदि आप रोबोट को केवल महसूस करने की शक्ति (फोर्स सेंसर्स) देते हैं, तो यह आंखें बंद करके कार चलाने जैसा है—आप सड़क को महसूस तो कर सकते हैं लेकिन आपको पता नहीं होगा कि आप कहाँ जा रहे हैं। वह दीवार को महसूस तो कर सकता है, लेकिन उसे यह नहीं पता होगा कि कौन सी दीवार और उसे उसके चारों ओर कैसे जाना है।

PhaForce रोबots के लिए एक नया "दिमाग" है जो दृष्टि (sight) और स्पर्श (touch) को पूरी तरह से जोड़ता है। यह समस्या को इस तरह हल करता है जैसे कि यह दो विशेषज्ञों की एक टीम के रूप में काम करता है: एक रणनीतिक योजनाकार (Strategic Planner) और एक प्रतिवर्त पायलट (Reflexive Pilot)।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "धीमा दिमाग, तेज़ हाथ" का बेमेल होना (The "Slow Brain, Fast Hands" Mismatch)

ज्यादातर रोबोट के दिमाग धीमे होते हैं। वे एक तस्वीर लेते हैं, एक पल के लिए सोचते हैं, और फिर एक बड़े मूवमेंट का निर्णय लेते हैं (जैसे "5 इंच आगे बढ़ें")। ऐसा शायद प्रति सेकंड 6 बार होता है।

लेकिन रोबोट के हाथ बहुत तेजी से चलते हैं (प्रति सेकंड 24 बार)। यदि रोबोट किसी बाधा से टकरा जाता है या फंस जाता है, तो "धीमा दिमाग" प्रतिक्रिया देने के लिए बहुत सुस्त होता है। यह एक ऐसी कार चलाने जैसा है जहाँ आप सड़क की जांच हर 10 सेकंड में एक बार करते हैं। जब तक आप गड्ढे को देखते हैं, तब तक आप दुर्घटना कर चुके होते हैं।

साथ ही, मौजूदा रोबोट अक्सर बल सेंसरों (force sensors) का अंधाधुंध उपयोग करते हैं। वे खुले स्थान में (जहाँ कोई संपर्क नहीं है) भी काम करने के लिए "महसूस" करने की कोशिश कर सकते हैं, जिससे केवल शोर और भ्रम पैदा होता है।

2. समाधान: "PhaForce" की टीम

PhaForce एक फेज शेड्यूल (Phase Schedule) पेश करता है। एक कार्य को एक गाने की तरह समझें जिसमें अलग-अलग छंद और कोरस होते हैं। आप पूरे गाने के लिए एक ही सुर नहीं बजाते; आप गाने के हिस्से के आधार पर अपनी शैली बदलते हैं।

PhaForce के तीन मुख्य भाग हैं:

A. "ट्रैफिक पुलिस" (Contact-Aware Phase Predictor)

यह सिस्टम का सबसे स्मार्ट हिस्सा है। यह लगातार पूछता है:

  • "क्या हम अभी किसी चीज़ को छू रहे हैं?"
  • "हम कार्य के किस चरण में हैं? (जैसे, क्या हम सॉकेट के करीब पहुँच रहे हैं, सॉकेट को ढूँढ रहे हैं, या अंदर डाल रहे हैं?)"

यह एक ट्रैफिक पुलिस की तरह काम करता है जो रोबोट को निर्देशित करता है। यह रोबोट को बताता है: "अभी, हम 'खोजने' (Search) के चरण में हैं, इसलिए अपने अगल-बगल के अहसासों पर ध्यान दें। लेकिन एक बार जब हम 'डालने' (Inserting) के चरण में पहुँच जाएँ, तो अगल-बगल के अहसासों को अनदेखा करें और सीधे नीचे की ओर दबाव डालने पर ध्यान केंद्रित करें।"

B. "रणनीतिक योजनाकार" (The Strategic Planner - धीमा दिमाग)

यह मुख्य दिमाग है जो बड़े कदमों की योजना बनाता है। यह कैमरे और फोर्स सेंसर्स को देखता है, लेकिन यह बहुत सावधान रहता है।

  • चाल (The Trick): यह एक विशेष फिल्टर (जिसे ऑर्थोगोनल रेसिडुअल इंजेक्शन कहा जाता है) का उपयोग करता है। कल्पना कीजिए कि आप एक चित्र बना रहे हैं (विजुअल प्लान)। यदि आप इसमें फोर्स डेटा जोड़ते हैं, तो आप पूरे पेंटिंग को खराब नहीं करना चाहते। इसके बजाय, आप इसके ऊपर "फोर्स जानकारी" की एक पतली, पारदर्शी परत जोड़ते हैं जो केवल उसी चीज़ को बदलती है जिसे बदलने की आवश्यकता है, बिना मूल चित्र को खराब किए।
  • यह सुनिश्चित करता है कि रोबोट फोर्स सेंसरों से भ्रमित न हो और यह न भूल जाए कि उसे विजुअल रूप से कहाँ जाना है।

C. "प्रतिवर्त पायलट" (The Reflexive Pilot - तेज़ सुधारक)

यह रोबोट का "त्वरित प्रतिक्रिया" (knee-jerk reaction) सिस्टम है। यह रणनीतिक योजनाकार की तुलना में 4 गुना तेजी से चलता है।

  • जबकि योजनाकार अगले बड़े कदम के बारे में सोच रहा होता है, पायलट लगातार सूक्ष्म समायोजन (micro-adjustments) करता रहता है।
  • यदि रोबोट को अचानक कोई झटका महसूस होता है (जैसे प्लग सॉकेट के किनारे से टकराना), तो पायलट तुरंत रोबोट को किनारे की ओर धकेलता है ताकि वह छेद को ढूंढ सके, इससे पहले कि रणनीतिक योजनाकार को पता चले कि कोई समस्या आई है।
  • महत्वपूर्ण बात यह है कि ट्रैफिक पुलिस पायलट को बताता है कि उसे कहाँ धकेलना है। यदि हम "खोजने" के चरण में हैं, तो पायलट केवल अगल-बगल हिलेगा। यदि हम "डालने" के चरण में हैं, तो यह केवल ऊपर-नीचे हिलेगा। यह रोबोट को अजीब और भ्रमित करने वाली हरकतें करने से रोकता है।

3. वास्तविक दुनिया के परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने इसका परीक्षण एक वास्तविक रोबोटिक आर्म पर पाँच अलग-अलग कार्यों के लिए किया। यहाँ क्या हुआ:

  • चार्जर लगाना: पुराने रोबोट अक्सर छेद के प्रवेश द्वार पर फंस जाते थे, जिससे प्लग जाम हो जाता था। PhaForce ने महसूस किया कि वह फंस गया है, "खोज मोड" (Search Mode) में स्विच किया, और प्लग को तब तक हिलाया जब तक कि उसे छेद नहीं मिल गया।
  • चिपचिपा दराज खोलना: रोबोट ने घर्षण (friction) को महसूस किया और बिना हैंडल को झटके से खींचे, उसे सुचारू रूप से खींचने के लिए खुद को समायोजित किया।
  • व्हाइटबोर्ड साफ करना ("सरप्राइज" टेस्ट): उन्होंने बोर्ड को रोबोट द्वारा पहले देखे गए स्तर से 3 इंच ऊपर कर दिया।
    • पुराने रोबोट: बोर्ड से टकरा गए, बहुत अधिक दबाव डाला, या बिल्कुल साफ नहीं कर पाए।
    • PhaForce: महसूस किया कि बोर्ड ऊँचा है, तुरंत अपने दबाव को समायोजित किया, और बोर्ड को पूरी तरह से साफ कर दिया।

बड़ी तस्वीर (The Big Picture)

PhaForce को एक मास्टर शेफ और उसके सहायक (sous-chef) के रूप में सोचें।

  • शेफ (धीमा योजनाकार) रेसिपी और बड़े चरणों का निर्णय लेता है: "प्याज काटें, फिर उन्हें भूनें।"
  • सहायक (तेज़ सुधारक) सीधे चूल्हे के पास होता है, हर सेकंड सॉस को चखता है। यदि यह बहुत नमकीन है, तो सहायक तुरंत पानी मिला देता है।
  • रेसिपी कार्ड (फेज शेड्यूल) उन्हें ठीक से बताता है कि कब चखना है और क्या सुधारना है।

एक धीमे, स्मार्ट प्लान को तेज़, स्मार्ट रिफ्लेक्स के साथ जोड़कर, और यह जानकर कि किस समय किस इंद्रिय का उपयोग करना है, PhaForce रोबोट्स को उन जटिल कार्यों को संभालने की क्षमता देता है जो पहले असंभव थे। यह केवल देखने के बारे में नहीं है; यह सही समय पर सही चीज़ को महसूस करने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →