← नवीनतम पेपर
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Gaze2Act एक नवीन विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो मानव दृष्टि (human gaze) को एक गतिशील इरादे के संकेत के रूप में एकीकृत करके रोबोटिक हेरफेर (robot manipulation) को बढ़ाता है, जो यूनिट्री G1 ह्यूमनॉइड पर ऑब्जेक्ट डिसएम्बिग्यूएशन (object disambiguation), सूक्ष्म-स्तरीय इंटरेक्शन और गतिशील इरादा स्टीयरिंग (dynamic intent steering) प्राप्त करने के लिए ईगो-एक्सो व्यू अंतराल को पाटता है।

मूल लेखक: Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रसोई में आपकी मदद करने के लिए सिखाने की कोशिश कर रहे हैं। आप कहते हैं, "मुझे वह कप पकड़ाओ।" लेकिन मेज पर पाँच कप रखे हैं: एक लाल, एक नीला, एक जिसमें दरार है, और दो एक जैसे सफेद कप। यदि आप सिर्फ "वह कप" कहते हैं, तो रोबोट गलत वाला उठा सकता है, या इससे भी बुरा, वह वह उठा सकता है जो आप नहीं चाहते।

यही वह समस्या है जिसे Gaze2Act पेपर हल करने की कोशिश करता है। यह तर्क देता है कि मानव भाषा अक्सर रोबोट के समझने के लिए बहुत अस्पष्ट होती है, खासकर जब हमें सटीक होने की आवश्यकता हो या जब काम के बीच में ही हमारे विचार बदल जाते हैं।

यहाँ यह पेपर सरल उपमाओं (analogies) का उपयोग करके अपने समाधान को समझाता है:

मुख्य विचार: "आंखें हाथों का मार्गदर्शन करती हैं"

लेखकों ने गौर किया कि इंसान स्वाभाविक रूप से कुछ ऐसा करते हैं: हम किसी चीज़ को छूने से पहले देखते हैं जिसे हम छूने वाले होते हैं। यदि आप एक विशिष्ट सेब उठाना चाहते हैं, तो आपका हाथ आगे बढ़ने से ठीक एक पल पहले आपकी आँखें उस पर टिक जाती हैं।

पेपर प्रस्तावित करता है कि केवल रोबोट से बात करने के बजाय, हमें रोबोट को यह "देखने" देना चाहिए कि हमारी आँखें कहाँ देख रही हैं। वे इसे Gaze2Act कहते हैं। यह ऐसा है जैसे रोबोट को "मन पढ़ने वाले चश्मे" देना जो उसे वास्तविक समय (real-time) में दिखा सके कि आप वास्तव में किस चीज़ पर ध्यान केंद्रित कर रहे हैं।

यह कैसे काम करता है: तीन-चरणीय जादू का खेल

पेपर एक ऐसे सिस्टम का वर्णन करता है जो आपके देखने के नजरिए और रोबोट के देखने के नजरिए के बीच के अंतर को पाटता है।

1. अनुवादक (Cross-View Grounding)

  • समस्या: आप स्मार्ट चश्मा पहने हुए हैं और अपने नजरिए से एक कप को देख रहे हैं। रोबोट उसी कप को एक अलग कोण (angle) से देख रहा है। आपका "गेज़ पॉइंट" (जहाँ आपकी आँखें देख रही हैं) रोबोट के कैमरा व्यू के साथ मेल नहीं खाता।
  • समाधान: सिस्टम एक सुपर-स्मार्ट अनुवादक की तरह काम करता है। यह आपके गेज़ पॉइंट को लेता है और एक "विजुअल मैचिंग" टूल का उपयोग करके रोबोट के कैमरा व्यू में ठीक उसी वस्तु को ढूंढ लेता है। यह उस वस्तु के चारों ओर एक डिजिटल मास्क (एक हाइलाइटर की तरह) बनाता है जिसे आप देख रहे हैं और उस सटीक स्थान को चिह्नित करता है जहाँ आप घूर रहे हैं।
  • उपमा: कल्पना कीजिए कि आप एक पहाड़ी से जंगल में एक विशिष्ट पेड़ की ओर इशारा कर रहे हैं। रोबोट पहाड़ी के नीचे है। सिस्टम तुरंत रोबोट के दृश्य में उस सटीक पेड़ के चारों ओर एक चमकता हुआ घेरा बना देता है, भले ही कोण पूरी तरह से अलग हों।

2. हाइलाइटर (Perception-Level Prompting)

  • समस्या: केवल यह जानना कि "कहाँ" देखना है, पर्याप्त नहीं है; रोबोट को यह जानने की भी आवश्यकता है कि उस जानकारी के साथ क्या करना है।
  • समाधान: सिस्टम उस डिजिटल हाईलाइट को लेता है और उसे सीधे उस छवि पर पेंट कर देता है जिसे रोबोट देख रहा है।
    • यदि आपको पूरी वस्तु को पकड़ना है, तो यह उसके चारों ओर एक रंगीन रूपरेखा (outline) बनाता है।
    • यदि आपको किसी वस्तु के बहुत छोटे, विशिष्ट हिस्से को छूना है (जैसे हथौड़े का हैंडल), तो यह उस हैंडल पर एक हीट मैप (एक चमकता हुआ लाल धब्बा) पेंट करता है।
  • उपमा: यह एक शिक्षक की तरह है जो मानचित्र पर किसी शहर के चारों ओर लाल घेरा बनाकर इशारा करता है कि आप किस शहर में जाना चाहते हैं, ताकि रोबोट को यह अनुमान न लगाना पड़े कि आपका मतलब किस शहर से था।

3. आंतरिक आवाज (Action-Level Conditioning)

  • समस्या: कभी-कभी, रोबोट को केवल एक तस्वीर दिखाना ही काफी नहीं होता; वह अभी भी थोड़ा भ्रमित हो सकता है।
  • समाधान: सिस्टम केवल रोबोट को तस्वीर नहीं दिखाता; यह रोबोट के "दिमाग" (इसके एक्शन-जेनरेटिंग कोड) में सीधे एक गुप्त निर्देश भी फुसफुसाता है। यह रोबोट को बताता है, "हे, बाकी सब को अनदेखा करो, केवल इस विशिष्ट चमकते हुए बिंदु पर ध्यान केंद्रित करो।"
  • उपमा: यह एक कोच की तरह है जो न केवल लक्ष्य की ओर इशारा करता है, बल्कि खिलाड़ी के कंधे को थपथपाकर कहता भी है, "सीधे उस जगह की ओर दौड़ो, न कि उसके बगल वाली जगह की ओर।"

उन्होंने क्या परीक्षण किया (वास्तविक दुनिया का प्रमाण)

शोधकर्ताओं ने इसका परीक्षण Unitite G1 पर किया, जो एक ह्युमनॉइड रोबोट है जो इंसान जैसा दिखता है। उन्होंने इसे 16 अलग-अलग कार्य दिए, जिनमें शामिल थे:

  • कई समान दिखने वाली वस्तुओं के बीच सही कप चुनना (disambiguation)।
  • किसी वस्तु के विशिष्ट हिस्सों को पकड़ना, जैसे हथौड़े के सिर के बजाय उसका हैंडल पकड़ना (fine-grained interaction)।
  • चलते-चलते लक्ष्य बदलना। कल्पना कीजिए कि रोबोट एक लाल कप की ओर बढ़ रहा है, लेकिन अचानक आप एक नीले कप की ओर देखते हैं। रोबोट रुक जाता है, समझ जाता है कि आपने अपना विचार बदल लिया है, और नीले कप की ओर मुड़ जाता है।

परिणाम

पेपर का दावा है कि Gaze2Act उन रोबोटों की तुलना में बहुत बेहतर था जो केवल भाषा सुनते हैं या जो टेक्स्ट विवरण के आधार पर अनुमान लगाने की कोशिश करते हैं।

  • केवल भाषा वाले रोबोट आसानी से भ्रमित हो गए (कठिन कार्यों पर लगभग 33% सफलता दर)।
  • Gaze2Act लगभग हर बार सही था (लगभग 89% सफलता दर)।
  • यह विचार बदलने (changing its mind) के मामले में विशेष रूप से अच्छा था, जब उपयोगकर्ता की दृष्टि बदल गई, जो अन्य रोबोटों के लिए कठिन था।

निचोड़ (The Bottom Line)

पेपर निष्कर्ष निकालता है कि दृष्टि (gaze) एक प्राकृतिक और कम प्रयास वाला तरीका है जिससे आप रोबोट को ठीक-ठीक बता सकते हैं कि आप क्या चाहते हैं। यह अनुमान लगाने की गुंजाइश को खत्म कर देता है। आपको रोबोट प्रोग्रामर होने या सटीक कोड बोलने की आवश्यकता नहीं है; आपको बस उस चीज़ को देखना है जो आप चाहते हैं कि रोबोट करे, और रोबोट आपकी आँखों का अनुसरण करेगा।

पेपर में बताई गई सीमाएँ:
यह सिस्टम अभी पूरी तरह से परफेक्ट नहीं है। यदि आप अपना सिर बहुत तेज़ी से घुमाते हैं, या यदि कोई चीज़ आपके दृश्य को बाधित करती है (occlusion), तो रोबोट भ्रमित हो सकता है। इसके अलावा, यह सिस्टम यह मानकर चलता है कि आप उसी चीज़ को देख रहे हैं जिसे आप छूना चाहते हैं, लेकिन कभी-कभी लोगों की आँखें इधर-उधर भटक जाती हैं या वे उन चीजों को देखते हैं जिन्हें वे वास्तव में पकड़ना नहीं चाहते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →