← नवीनतम पेपर
🤖 AI

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video

यह शोध पत्र EgoTactile पेश करता है, जो एक नया बेंचमार्क और एक कंडीशनल डिफ्यूजन फ्रेमवर्क है जिसे EgoPressureDiff कहा जाता है, जो विविध रोज़मर्रा की वस्तुओं के लिए पूर्ण-हस्त ग्रैस्प दबाव (full-hand grasp pressure) का सटीक अनुमान लगाने के लिए एगोसेंट्रिक वीडियो और भौतिक रूप से-सूचित बाधाओं (physically-informed constraints) का लाभ उठाता है, जो मौजूदा विज़न-आधारित विधियों की सीमाओं को दूर करता है।

मूल लेखक: Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने स्मार्ट चश्मा पहना हुआ है जो आपकी अपनी आँखों से सब कुछ रिकॉर्ड करता है (एक "एगोसेंट्रिक" या स्व-केंद्रित दृश्य)। अब, कल्पना कीजिए कि आपने एक हाथ से भारी डंबल और दूसरे हाथ से एक हल्का पंख उठाया। एक कैमरे के लिए, दोनों क्रियाएं लगभग एक जैसी दिख सकती हैं: आपका हाथ किसी वस्तु को पकड़ रहा है। लेकिन आपके मस्तिष्क के लिए, दबाव का "एहसास" पूरी तरह से अलग है।

यह शोध पत्र, EgoTactile, एक बड़ा सवाल पूछता है: क्या एक कंप्यूटर आपके हाथ से चीजें पकड़ने के वीडियो को देखकर यह अंदाजा लगा सकता है कि आप कितनी जोर से दबा रहे हैं, भले ही वह कुछ महसूस न कर सके?

यहाँ इसका एक सरल विवरण दिया गया है कि उन्होंने इस पहेली को कैसे सुलझाया, रोजमर्रा के उदाहरणों का उपयोग करते हुए।

समस्या: एक "अंधा" कैमरा

कंप्यूटर को यह कौशल सिखाने के पिछले प्रयासों में दो मुख्य कमियां थीं:

  1. केवल सपाट सतहें: उन्होंने ज्यादातर सपाट मेजों पर परीक्षण किया जहाँ आप पूरे हाथ को नीचे दबते हुए देख सकते थे। लेकिन वास्तविक जीवन में, हम 3D वस्तुओं (जैसे कॉफी मग या केला) को पकड़ते हैं जहाँ आपके हाथ का कुछ हिस्सा वस्तु के पीछे छिपा होता है।
  2. केवल उंगलियों के पोर: वे ज्यादातर केवल उंगलियों के सिरों को देखते थे। लेकिन जब आप कुछ पकड़ते हैं, तो आपकी पूरी हथेली और सभी उंगलियां मिलकर काम करती हैं।

शोधकर्ताओं ने महसूस किया कि यदि कंप्यूटर आपके हाथ के उस हिस्से को नहीं देख सकता जो वस्तु को छू रहा है (क्योंकि वस्तु दृश्य को बाधित कर रही है), तो वह केवल "अनुमान" नहीं लगा सकता। उसे सोचने का एक स्मार्ट तरीका चाहिए।

समाधान: AI के लिए एक नया "जिम"

इसे ठीक करने के लिए, टीम ने EegoTactile नामक एक नया प्रशिक्षण मैदान बनाया।

  • सेटअप: उनके पास 12 लोग थे जिन्होंने 162 छोटे प्रेशर सेंसर वाले विशेष दस्ताने पहने थे (जैसे 162 छोटे माइक्रोफोन जो आपके दबाव को सुन रहे हों)।
  • वीडियो: ये दस्ताने पहनते समय, लोगों ने अपने सिर या गर्दन पर लगे कैमरे से 63 अलग-अलग रोजमर्रा की वस्तुओं (हल्की प्लास्टिक की बोतलों से लेकर भारी डंबल्स तक) को पकड़ा।
  • "जादुई" ट्रिक: उन्होंने एक विशेष "खाली हाथ" वाला परीक्षण भी बनाया। इस परीक्षण में, एक व्यक्ति का हाथ खाली (कैमरे को दिखाई देने वाला) था, जबकि एक दूसरे व्यक्ति का दस्ताना पहना हुआ हाथ ठीक उसी समय उसी वस्तु को पकड़ रहा था (जो कैमरे की नजर से बाहर था)। इसने AI को यह सिखाया कि खाली हाथ के दबाव का अंदाजा वीडियो देखकर कैसे लगाया जाए, भले ही "प्रेशर डेटा" किसी दूसरे व्यक्ति के दस्ताने से आया हो।

दो AI मॉडल: जासूस बनाम कलाकार

टीम ने इस पहेली को सुलझाने के लिए दो अलग-अलग प्रकार के AI मॉडल का परीक्षण किया।

1. जासूस: EgoPressureFormer

इस मॉडल को एक जासूस के रूप में सोचें। यह वीडियो को फ्रेम दर फ्रेम देखता है, सुरागों (जैसे त्वचा का खिंचाव या छाया का हिलना) का विश्लेषण करता है, और हर सेंसर के लिए सटीक दबाव संख्या की गणना करने की कोशिश करता है।

  • परिणाम: यह अच्छा है, लेकिन जब हाथ किसी वस्तु के पीछे छिपा होता है, तो जासूस भ्रमित हो जाता है और अस्पष्ट, धुंधले उत्तर देता है। इसे कठिनाई होती है क्योंकि यह एक एकल "सही" उत्तर देने की कोशिश करता है जब दृश्य सुराग गायब होते हैं।

2. कलाकार: EgoPressureDiff (मुख्य आकर्षण)

यह मॉडल एक कलाकार है जो "डिफ्यूजन" नामक तकनीक का उपयोग करता है। एक कलाकार की कल्पना करें जो स्टैटिक शोर (जैसे टीवी के शोर) से ढके एक खाली कैनवास से शुरू करता है। वे वीडियो के मार्गदर्शन से शोर को धीरे-धीरे साफ करते हैं, जब तक कि दबाव का एक स्पष्ट नक्शा उभर न आए।

  • यह बेहतर क्यों है: क्योंकि यह एक कलाकार है, यह केवल एक नंबर का अनुमान नहीं लगाता है। यह अपनी "कल्पना" (जो लाखों अन्य वीडियो पर प्रशिक्षित है) का उपयोग करके खाली जगहों को भरने के लिए करता है। यदि कैमरा वस्तु के कारण आपकी हथेली को नहीं देख पा रहा है, तो कलाकार "कल्पना" करता है कि उस प्रकार की वस्तु को पकड़ने के तरीके के आधार पर दबाव कैसा संभवतः होगा।
  • "फिजिक्स चीट शीट": यह सुनिश्चित करने के लिए कि कलाकार केवल सुंदर चित्र न बनाए जो भौतिक रूप से गलत हों, उन्होंने PIFR नामक एक विशेष परत जोड़ी। यह कलाकार को एक "चीट शीट" देने जैसा है जो कहती है, "यह वस्तु भारी है," या "यह व्यक्ति ताकतवर है।" भले ही वीडियो एक जैसा दिखे, चीट शीट कलाकार को भारी वस्तु के लिए एक "अधिक भारी" दबाव मानचित्र बनाने का निर्देश देती है।

परिणाम: कौन जीता?

टीम ने ऐसे परीक्षण किए जहाँ AI को उन वस्तुओं के लिए दबाव का अनुमान लगाना था जिन्हें उसने पहले कभी नहीं देखा था, और उन लोगों के लिए जिन्हें वह कभी नहीं मिला था।

  • जासूस (Former) हाथ के छिपे होने पर अटक गया। इसने बहुत ही साधारण अनुमान लगाए जो अक्सर बहुत कमजोर या धुंधले थे।
  • कलाकार (Diff) बहुत बेहतर था। इसने सफलतापूर्वक "लुप्त हिस्सों को भरने" का काम किया जब हाथ छिपा हुआ था।
    • यह अनुमान लगाने में सटीक था कि दबाव कहाँ था (जैसे कि ठीक कौन सी उंगली दब रही है)।
    • यह यह अनुमान लगाने में भी सटीक था कि दबाव कितना तेज था, भले ही वस्तु दिखने में हल्की वस्तु जैसी ही क्यों न हो (चीट शीट की मदद से)।
    • यह "वाइल्ड" वीडियो पर भी आश्चर्यजनक रूप से अच्छा काम करता है जहाँ बैकग्राउंड अस्त-व्यस्त और लाइटिंग खराब थी, न कि केवल साफ लैब सेटिंग में।

निष्कर्ष

यह शोध पत्र दिखाता है कि एक वीडियो कैमरे को एक "जेनरेटिव" AI (एक ऐसा AI जो गायब विवरणों की कल्पना कर सकता है) के साथ जोड़ने और उसे भौतिक तथ्यों (जैसे वजन) के साथ थोड़ी मदद देने से, हम कंप्यूटर को केवल देखकर दबाव को "महसूस" करना सिखा सकते हैं। यह वर्चुअल रियलिटी (VR) ग्लव्स को भारी सेंसर के बिना वास्तविक महसूस कराने, या रोबोट को नाजुक वस्तुओं को कुचले बिना पकड़ना सीखने में मदद करने की दिशा में एक बड़ा कदम है।

संक्षेप में: उन्होंने एक कंप्यूटर को यह सिखाया कि वह आपके हाथ के वीडियो को देखकर यह अंदाजा कैसे लगाए कि आप केले को कितनी जोर से दबा रहे हैं, भले ही केला आपकी उंगलियों को छिपा रहा हो, और इसके लिए उन्होंने एक ऐसे AI का उपयोग किया जो भौतिकी के आधार पर गायब हिस्सों की "कल्पना" कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →