← नवीनतम पेपर
💻 computer science

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

यह शोध पत्र HABIT को प्रस्तुत करता है, जो 10,000 से अधिक मानव-उपस्थित रोबोट हेरफेर प्रकरणों (episodes) का एक बड़े पैमाने का डेटासेट है जिसे सहयोगी (Collaborator), सहकर्मी (Coworker), और पर्यवेक्षक (Supervisor) भूमिकाओं में व्यवस्थित किया गया है, जो नीतियों को सिंक्रोनाइज़ेशन (synchronization), रास्ता देना (yielding), और जेस्चर ग्राउंडिंग (gesture grounding) जैसे आवश्यक मानव-जागरूक व्यवहार सीखने में सक्षम बनाता है जो पारंपरिक मानव-अनुपस्थित डेटासेट्स में अनुपस्थित होते हैं।

मूल लेखक: Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं। आज के अधिकांश रोबोट एक "घोस्ट टाउन" (भूतिया शहर) परिदृश्य में प्रशिक्षित होते हैं: वे एक खाली कमरे में बक्से हिलाने, मेज पोंछने और कचरा छांटने का अभ्यास करते हैं जहाँ कोई इंसान मौजूद नहीं होता। वे शारीरिक गतिविधियों में बहुत कुशल हो जाते हैं, लेकिन उन्हें यह पता नहीं होता कि तब क्या करना है जब कोई व्यक्ति उनके ठीक बगल में खड़ा हो। वे आपसे टकरा सकते हैं, आपके हाथों के इशारों को अनदेखा कर सकते हैं, या उस औज़ार को पकड़ने की कोशिश कर सकते हैं जिसे आपने अभी पकड़ा हुआ है।

यह शोध पत्र HABIT (ह्यूमन-अवेयर बिहेवियर एंड इंटरैक्शन ट्रेनिंग) पेश करता है, जो एक नया डेटासेट है जिसे इस समस्या को ठीक करने के लिए बनाया गया है। HABIT को केवल रोबोटिक मूव्स की एक लाइब्रेरी के रूप में नहीं, बल्कि डांस स्टेप्स की एक लाइब्रेरी के रूप में सोचें जहाँ रोबोट और उसका मानव साथी एक साथ मूव करना सीख रहे हैं।

तीन "डांस स्टाइल्स"

शोधकर्ताओं ने कार्यों को तीन अलग-अलग भूमिकाओं में व्यवस्थित किया, जो विभिन्न नृत्य शैलियों की तरह हैं, ताकि रोबोट को विभिन्न सामाजिक स्थितियों को संभालने के तरीके सिखाए जा सकें:

  1. सहयोगी (द टैंगो - The Collaborator):

    • परिदृश्य: इंसान और रोबोट को एक ही समय में एक ही वस्तु पर मिलकर काम करना चाहिए।
    • उपमा: कल्पना करें कि दो लोग सीढ़ियों पर एक भारी सोफा उठाने की कोशिश कर रहे हैं। यदि एक व्यक्ति बहुत तेज़ या बहुत धीमा चलता है, तो वे लड़खड़ा जाते हैं। इस भूमिका में, रोबलेट यह सीखता है कि इंसान द्वारा कोने को उठाने का इंतज़ार करने के बाद ही वह आगे बढ़े, या ठीक उसी समय औज़ार थमा दे जब इंसान अपना हाथ बढ़ा रहा हो। यह सब तालमेल (synchronization) के बारे में है।
    • उदाहरण: एक इंसान ट्रे में नैपकिन रखता है, और रोबोट मदद के लिए ट्रे उठाता है।
  2. सहकर्मी (द कॉंगा लाइन - The Coworker):

    • परिदृश्य: इंसान और रोबोट एक ही कमरे में अलग-अलग कार्य कर रहे हैं, लेकिन वे एक ही स्थान साझा करते हैं।
    • उपमा: कल्पना करें कि दो लोग एक छोटे से किचन में खाना बना रहे हैं। एक सब्जियां काट रहा है, और दूसरा बर्तन चला रहा है। वे एक-दूसरे को छू नहीं रहे हैं, लेकिन उन्हें आपस में टकराने से बचने के लिए एक-दूसरे के आसपास से रास्ता बनाना होगा। रोबोट सीखता है कि यदि इंसान उसके रास्ते में आता है, तो वह आगे बढ़ने के बजाय रास्ता देना (yield) सीखता है।
    • उदाहरण: एक इंसान मेज के एक तरफ कचरा छांटता है जबकि रोबोट दूसरी तरफ बॉक्स पैक करता है, और वे लगातार एक-दूसरे के रास्ते से हटते रहते हैं।
  3. पर्यवेक्षक (द कंडक्टर - The Supervisor):

    • परिदृश्य: इंसान निर्देश देता है, और रोबोट उनका पालन करता है।
    • उपमा: कल्पना करें कि एक कंडक्टर ऑर्केस्ट्रा को यह बताने के लिए बैटन लहरा रहा है कि कब बजाना है। रोबोट इंसान के हाथों और आँखों को देखना सीखता है। यदि इंसान किसी विशिष्ट डोनट की ओर इशारा करता है, तो रोबोट केवल पहला दिखने वाला डोनट नहीं उठाता; वह उंगली की दिशा देखता है और वही विशिष्ट डोनट उठाता है। वह जेस्चर ग्राउंडिंग (gesture grounding) सीखता है।
    • उदाहरण: एक इंसान एक विशिष्ट कंटेनर की ओर इशारा करता है, और रोबोट उसके अंदर ब्रेड रखता है।

उन्होंने डेटा कैसे एकत्र किया

यह सुनिश्चित करने के लिए कि रोबोट वास्तव में ये सामाजिक कौशल सीख ले, शोधकर्ताओं ने केवल इंसान और रोबोट को बेतरतीब ढंग से खेलने नहीं दिया। उन्होंने एक सख्त "स्क्रिप्ट" (जिसे वर्कफ़्लो कहा जाता है) का उपयोग किया जिसने इंसान और रोबोट को वास्तविक समय में एक-दूसरे पर प्रतिक्रिया करने के लिए मजबूर किया।

  • कोई "चीट कोड" नहीं: मानव ऑपरेटर केवल यह अनुमान नहीं लगा सकता था कि रोबट आगे क्या करेगा। उन्हें रोबोट के हिलने का इंतज़ार करना था और इसके विपरीत भी। इसने यह सुनिश्चित किया कि रोबोट वास्तविक मानवीय संकेतों पर प्रतिक्रिया करना सीखे, न कि केवल याद किए गए पैटर्न पर।
  • सुरक्षा सर्वोपरि: यदि रोबोट ऐसा लग रहा था कि वह इंसान से टकराने वाला है, तो मानव ऑपरेटर तुरंत रोबोट को पीछे खींच लेता था। इसने रोबोट को सिखाया कि "रुकना" एक वैध और महत्वपूर्ण कदम है।

जब उन्होंने इसका परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने दो मौजूदा रोबोट मस्तिष्क (AI मॉडल) लिए और उन्हें इस नए HABIT डेटा पर प्रशिक्षित किया। उन्होंने इन "HABIT-प्रशिक्षित" रोबोटों की तुलना उन रोबोटों से की जो केवल पुराने "घोस्ट टाउन" डेटा पर प्रशिक्षित थे।

  • परिणाम: HABIT-प्रशिक्षित रोबोट काफी बेहतर थे।
    • सहकर्मी (Coworker) भूमिका में, वे इंसानों से टकराना बंद कर दिए।
    • पर्यवेक्षक (Supervisor) भूमिका में, वे वास्तव में वहां देखते थे जहां इंसान इशारा कर रहा था, बजाय अनुमान लगाने के।
    • सहयोगी (Collaborator) भूमिका में, उन्होंने अपने मूव्स को इंसान के साथ पूरी तरह से टाइम किया।
  • "सुपरपावर": सबसे दिलचस्प खोज सैंपल एफिशिएंसी (sample efficiency) थी। जब उन्होंने HABIT-प्रशिक्षित रोबोटों को एक नया कार्य सिखाने की कोशिश की जो उन्होंने पहले नहीं देखा था, तो उन्होंने पुराने डेटा पर प्रशिक्षित रोबोटों की तुलना में बहुत तेज़ी से सीखा (कम उदाहरणों का उपयोग करके)। ऐसा है जैसे HABIT ने रोबोट को "विनम्र और जागरूक होने" की अवधारणा सिखाई, जिससे विशिष्ट नए कामों को सीखना बहुत आसान हो गया।

निष्कर्ष

यह शोध पत्र तर्क देता है कि घरों और कार्यालयों में उपयोगी होने के लिए रोबोटों को केवल मजबूत और सटीक ही नहीं, बल्कि सामाजिक रूप से जागरूक भी होना चाहिए। हमें ऐसे डेटा पर रोबोट को प्रशिक्षित करके, जहाँ इंसान वास्तव में मौजूद हैं और बातचीत कर रहे हैं, हमें ऐसे रोबोट मिलते हैं जो केवल हमारे आस-पास काम नहीं करते, बल्कि हमारे साथ काम करते हैं।

सीमाएं: लेखक स्वीकार करते हैं कि यह एक नियंत्रित लैब में एक विशिष्ट प्रकार के रोबोट और सीमित संख्या में मानव ऑपरेटरों के साथ किया गया था। हालांकि उन्होंने अनुकूलन क्षमता का परीक्षण करने के लिए इंसानों के कपड़े और शरीर के प्रकारों में बदलाव किया, लेकिन वास्तविक दुनिया के वातावरण उनके सेटअप की तुलना में अधिक जटिल होते हैं। फिर भी, मुख्य संदेश स्पष्ट है: रोबोट को अच्छा साथी बनने के लिए इंसानों को देखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →