← नवीनतम पेपर
💻 computer science

H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows

H2OFlow एक नवीन ढांचा है जो सिंथेटिक डेटा से समृद्ध इंटरेक्शन पैटर्न निकालने के लिए पॉइंट क्लाउड्स पर एक डेंस डिफ्यूजन प्रक्रिया का उपयोग करके व्यापक 3D मानव-वस्तु अफोर्डेंस—जिसमें संपर्क, ओरिएंटेशन और स्थानिक अधिभोग शामिल हैं—सीखता है, जिससे मैन्युअल एनोटेशन की आवश्यकता समाप्त हो जाती है क्योंकि यह 3D जनरेटिव मॉडल द्वारा उत्पन्न डेटा का उपयोग करता है।

मूल लेखक: Harry Zhang, Luca Carlone

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Harry Zhang, Luca Carlone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सिखा रहे हैं कि एक मानव घर में कैसे रहा जाए। यदि आप उसे केवल यह सिखाते हैं कि "कुर्सी" वह है जिसे आप अपने हाथों से छूते हैं, तो रोबोट तब बहुत भ्रमित हो जाएगा जब वह किसी इंसान को उस पर बैठते हुए, या उस पर झुकते हुए, या किसी ऊंचे शेल्फ तक पहुँचने के लिए उसका उपयोग करते हुए देखेगा।

पेपर "H2OFLOW" इस बारे में है कि AI को यह सिखाना कि हम चीजों के साथ केवल कहाँ स्पर्श करते हैं, यह नहीं, बल्कि उनके साथ हमारे संवाद का "वाइब" (vibe) क्या है।

यहाँ बताया गया है कि उन्होंने इसे रोजमर्रा के उपमाओं (analogies) का उपयोग करके कैसे किया।

1. समस्या: "केवल स्पर्श करने वाला" रोबोट

अधिकांश वर्तमान AI मॉडल उन छात्रों की तरह हैं जो केवल पाठ्यपुस्तक के "संपर्क" वाले हिस्से का अध्ययन करते हैं। वे जानते हैं कि हथौड़े का उपयोग करने के लिए, आपको उसके हैंडल को छूना होगा। लेकिन वे नृत्य की ज्यामिति (geometry of the dance) को नहीं समझते हैं: उन्हें यह अहसास नहीं है कि आपको एक निश्चित दूरी पर खड़ा होना चाहिए, या प्रभावी ढंग से स्विंग करने के लिए अपनी कलाई को एक विशिष्ट कोण पर रखना चाहिए।

क्योंकि ये रोबोट केवल मानव-लेबल वाले डेटा से सीखते हैं (जो कि एक छात्र के लिए लाखों हस्तलिखित नोट्स पढ़कर सीखने की कोशिश करने जैसा है), वे सीखने में धीमे होते हैं और जब वे कोई नई, अजीब दिखने वाली वस्तु देखते हैं जिसे उन्होंने पहले नहीं देखा है, तो संघर्ष करते हैं।

2. समाधान: "सपनों वाला" शिक्षक (3D जनरेटिव मॉडल)

इंसानों को लैब में हजारों फोटो लेबल करने के लिए बैठाने के बजाय, शोधकर्ताओं ने एक 3D जनरेटिव मॉडल का उपयोग किया।

इसे एक "ड्रीम मशीन" (Dream Machine) की तरह समझें। AI को वास्तविक फोटो दिखाने के बजाय, उन्होंने AI को लाखों अलग-अलग परिदृश्य "सपनों" में देखने दिया: एक व्यक्ति कुर्सी उठा रहा है, एक व्यक्ति स्टूल पर बैठा है, एक व्यक्ति मेज पर झुक रहा है। क्योंकि ये 3D "सपने" हैं, AI संपर्क के पूर्ण आकार और गति को सीखता है, न कि केवल एक सपाट तस्वीर को।

3. सीक्रेट सॉस: "डेंस डिफ्यूज्ड फ्लोज़" (Dense Diffused Flows)

यह सबसे तकनीकी हिस्सा है, लेकिन इसे "भूतिया ब्लूप्रिंट" (The Ghostly Blueprint) के रूप में सोचें।

एक एकल, कठोर मुद्रा (जैसे एक जमी हुई मूर्ति) की भविष्यवाणी करने के बजाय, शोधकर्ता "फ्लोज़" (Flows) नामक चीज़ का उपयोग करते हैं। कल्पना कीजिए कि आपके पास रेत का एक ढेर (मानव शरीर) है और आप इसे एक विशिष्ट आकार (इंटरैक्शन) में बदलना चाहते हैं। "फ्लो" उन अदृश्य तीरों का समूह है जो रेत के हर एक कण को ठीक से बताता है कि लक्ष्य तक पहुँचने के लिए उसे किस दिशा में जाना है।

डिफ्यूजन (Diffusion) का उपयोग करके (वही तकनीक जो Midjourney जैसे AI आर्ट जनरेटर के पीछे है), AI केवल एक तरीके का अनुमान नहीं लगाता; यह "संभावनाओं के बादल" को सीखता है। यह जानता है कि कप को पकड़ने के कई तरीके हैं—अपने बाएं हाथ से, अपने दाएं हाथ से, या यहाँ तक कि अपनी उंगलियों से भी—और यह उन सभी के लिए "फ्लो" सीखता है।

4. समझ की तीन परतें

H2OFlow केवल एक चीज़ नहीं सीखता; यह इंटरैक्शन के "ट्रिपल थ्रेट" को सीखता है:

  • संपर्क (The Touch): "मेरे हाथ वास्तव में वस्तु को कहाँ छूते हैं?"
  • अभिविन्यास/ओरिएंटेशन (The Angle): "मेरा शरीर कैसे झुका होना चाहिए? (जैसे, टीवी की ओर मुख करके बनाम इसकी साइड की ओर मुख करके)।"
  • स्थानिक/स्पेशियल (The Bubble): "इस वस्तु के आसपास का 'पर्सनल स्पेस' क्या है जो मेरा शरीर आमतौर पर घेरता है?"

5. यह क्यों मायने रखता है? (द रियल वर्ल्ड टेस्ट)

शोधकर्ताओं ने इसका परीक्षण iPhone द्वारा स्कैन की गई वास्तविक वस्तुओं पर किया। क्योंकि AI ने गति के तर्क (फ्लो) को सीखा था (न कि केवल विशिष्ट आकारों को रटा था), यह अव्यवस्थित, शोर वाले वास्तविक दुनिया के स्कैन पर भी काम कर गया।

संक्षेप में: H2OFlow रोबोट्स को केवल "छूने" से आगे बढ़कर मानव जीवन के स्थानिक नृत्य (spatial dance) को "समझने" की शिक्षा दे रहा है। यह एक ऐसे रोबोट के बीच का अंतर है जो जानता है कि कप को पकड़ना कैसे है और एक ऐसे रोबोट के बीच का अंतर है जो जानता है कि किचन का उपयोग कैसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →