← नवीनतम पेपर
🤖 AI

AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Afford Correspondence

AffordGen, सेमेंटिक कीपॉइंट पत्राचार (semantic keypoint correspondence) के माध्यम से विविध, अफोर्डेंस-जागरूक प्रदर्शन डेटासेट बनाने के लिए 3D जनरेटिव मॉडल्स और विजन फाउंडेशन मॉडल्स का लाभ उठाता है, जिससे रोबोट मैनिपुलेशन पॉलिसीज़ को अनदेखी वस्तुओं के प्रति बेहतर डेटा दक्षता के साथ सुदृढ़ ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Jiawei Zhang, Kaizhe Hu, Yingqian Huang, Yuanchen Ju, Zhengrong Xue, Huazhe Xu

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiawei Zhang, Kaizhe Hu, Yingqian Huang, Yuanchen Ju, Zhengrong Xue, Huazhe Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चाय डालना सिखा रहे हैं। पुराने दिनों में, आपको रोबोट का हाथ पकड़कर उसे सैकड़ों अलग-अलग केतली, कप और कोणों के साथ उस क्रिया के माध्यम से निर्देशित करना पड़ता था। यदि आप उसे बाईं ओर हैंडल वाली एक केतली दिखाते, तो वह दाईं ओर हैंडल वाली केतली के सामने आने पर भ्रमित हो सकता था। यह एक बच्चे को साइकिल चलाना सिखाने जैसा है जहाँ आप केवल एक विशिष्ट साइकिल पर ही उसका अभ्यास कराते हैं; यदि आप उसे कोई दूसरा मॉडल देते हैं, तो वह गिर सकता है।

यही वह समस्या है जिसे AffordGen हल करता है। यह एक ऐसा नया सिस्टम है जो रोबट को केवल एक प्रदर्शन (demonstration) से सीखने देता है और फिर तुरंत इसे हजारों अलग-अलग वस्तुओं के साथ करने का तरीका समझ लेता है जिन्हें उसने पहले कभी नहीं देखा है।

यह कैसे काम करता है, यहाँ रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. "जादुई अनुवादक" (Affordance Correspondence)

आमतौर पर, रोबोट वस्तुओं को केवल 3D बिंदुओं के ढेर (पॉइंट क्लाउड) के रूप में देखते हैं। वे वास्तव में यह नहीं समझते कि वस्तु क्या है या इसका उपयोग कैसे करना है।

AffordGen एक "जादुई अनुवादक" (जो उन्नत AI विज़न मॉडल द्वारा संचालित है) का उपयोग करता है। केवल आकार को देखने के बजाय, यह कार्यात्मक लैंडमार्क्स (functional landmarks) को खोजता है।

  • उदाहरण: कल्पना कीजिए कि आप किसी को एक नए उपकरण का उपयोग करना सिखा रहे हैं। आप यह नहीं कहते, "लाल धातु वाले हिस्से को पकड़ो।" आप कहते हैं, "हैंडल को पकड़ो।"
  • यह कैसे काम करता है: सिस्टम मूल केतली पर "हैंडल" (जहाँ से आप पकड़ते हैं) और "स्प्राउट/नोजल" (जहाँ से चाय निकलती है) की पहचान करता है। फिर यह अपने "जादुई अनुवादक" का उपयोग करके एक पूरी तरह से अलग वस्तु, जैसे कि एक अजीब आकार के मग या कांच की बनी केतली पर, ठीक उसी "हैंडल" और "स्प्राउट" को ढूंढ लेता है। यह समझ जाता है कि कार्यात्मक रूप से, ये दो अलग-अलग आकार एक ही हैं।

2. "आकार बदलने वाला नकलची" (Generative Data)

एक बार जब रोबोट जान जाता है कि नई वस्तु पर कहाँ पकड़ना है और कहाँ से डालना है, तो उसे अभ्यास करने की आवश्यकता होती है। लेकिन हम रोबोट को फिर से घंटों तक फिल्माना नहीं चाहते।

AffordGen एक जेनेरेटिव नकलची (generative copycat) की तरह कार्य करता है।

  • उदाहरण: कल्पना कीजिए कि आपके पास एक नर्तक के एक विशिष्ट नृत्य (routine) का वीडियो है। केवल उस वीडियो को वापस चलाने के बजाय, आप एक कंप्यूटर प्रोग्राम का उपयोग करते हैं जो तुरंत उसी नृत्य को एक विशाल व्यक्ति, एक छोटे व्यक्ति, और अलग शरीर के आकार वाले व्यक्ति पर सटीक रूप से दोहराता है, जबकि नृत्य के स्टेप्स एकदम सही रहते हैं।
  • यह कैसे काम करता है: सिस्टम आपके द्वारा दिए गए एक वीडियो को लेता है, नई 3D मॉडल पर "हैंडल" और "स्प्राउट" को ढूंढता है, और फिर उस नई आकृति के अनुकूल होने के लिए रोबोट की गति को गणितीय रूप से "मॉर्फ" (बदलता) करता है। यह इसे हजारों बार करता है, जिससे उन वस्तुओं के लिए अभ्यास वीडियो का एक विशाल पुस्तकालय बन जाता है जिन्हें रोबोट ने वास्तव में कभी छुआ भी नहीं है।

3. "प्रतिक्रियाशील एथलीट" बनाम "स्क्रिप्टेड अभिनेता"

रोबोट को सिखाने के दो तरीके हैं:

  • स्क्रिप्टेड अभिनेता (पुराना तरीका): आप रोबोट को एक पूर्व-लिखित स्क्रिप्ट देते हैं: "हाथ को 5 इंच बाईं ओर ले जाएं, फिर 2 इंच नीचे ले जाएं।" यदि वस्तु थोड़ी सी भी हिल जाती है, तो रोबलेट चूक जाएगा क्योंकि वह केवल अंधे होकर स्क्रिप्ट का पालन कर रहा है।
  • प्रतिक्रियाशील एथलीट (AffordGen का तरीका): AffordGen उन हजारों जनरेटेड अभ्यास वीडियो का उपयोग रोबोट को एक एथलीट बनाने के लिए करता है। यह कार्य के 'अहसास' को सीखता है। यदि कप थोड़ा सा झुका हुआ है या हैंडल एक अजीब जगह पर है, तो रोबोट वास्तविक समय में प्रतिक्रिया देता है, ठीक वैसे ही जैसे एक इंसान करेगा, क्योंकि उसने अपने प्रशिक्षण के दौरान कार्य के इतने सारे विविध रूपों को "देखा" है।

यह एक बड़ी बात क्यों है?

  • दक्षता (Efficiency): मानव प्रदर्शन के 1,000 घंटों के बजाय, आपको केवल एक घंटे की आवश्यकता हो सकती है। सिस्टम बाकी 999 घंटों का अभ्यास डेटा स्वचालित रूप से उत्पन्न करता है।
  • सामान्यीकरण (Generalization): यह उन चीजों पर काम करता है जिन्हें रोबोट ने पहले कभी नहीं देखा है। यदि आप उसे सिरेमिक के बर्तन से चाय डालना सिखाते हैं, तो वह प्लास्टिक की बोतल या धातु के जग से चाय डालने का तरीका समझ सकता है, क्योंकि वह केवल बर्तन के विशिष्ट आकार को नहीं, बल्कि "डालने" की अवधारणा को समझता है।
  • वास्तविक दुनिया के लिए तैयार: पेपर यह दिखाता है कि यह न केवल कंप्यूटर सिमुलेशन में, बल्कि वास्तविक दुनिया में वास्तविक रोबोटों पर भी सफलतापूर्वक काम करता है, जो उन वस्तुओं को सफलतापूर्वक संभालते हैं जिनका उसने पहले कभी सामना नहीं किया है।

संक्षेप में

AffordGen रोबोट को दुनिया के साथ बातचीत करने के लिए एक "यूनिवर्सल मैनुअल" देने जैसा है। हर एक वस्तु को याद करने के बजाय, यह परस्पर क्रिया के नियमों (जैसे "हैंडल को पकड़ें," "स्प्राउट से डालें") को सीखता है। एक बार जब यह नियमों को जान जाता है, तो यह किसी भी नई वस्तु पर उन नियमों को लागू कर सकता है जिसका सामना यह करता है, जिससे रोबोट हमारी अव्यवस्थित और विविध दुनिया में बहुत अधिक अनुकूलनीय और उपयोगी बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →