← नवीनतम पेपर
🤖 AI

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker एक स्पर्श संबंधी-भाषा ढांचा (tactile-language framework) है जो मिलियन-स्केल TouchThinker-1M डेटासेट और प्रतिनिधित्व दक्षता एवं सामान्यीकरण को बढ़ाने के लिए एक एक्शन-अवेयर मॉडलिंग तंत्र पेश करके ओपन-वर्ल्ड सेटिंग्स में स्पर्श संबंधी सामान्य ज्ञान तर्क (tactile commonsense reasoning) को स्केल करने की चुनौतियों का समाधान करता है।

मूल लेखक: Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को केवल "देखना" ही नहीं, बल्कि उसे "महसूस" करना सिखाने की कोशिश कर रहे हैं। आप जानते हैं कि जब आप एक स्पंज को छूते हैं, तो आप तुरंत जान जाते हैं कि वह नरम और लचीला है, या जब आप एक पत्थर को छूते हैं, तो आप जानते हैं कि वह कठोर और ठंडा है? यह टैक्टाइल रीजनिंग (स्पर्श तर्क) है।

यह पेपर TouchThinker नामक एक नई प्रणाली पेश करता है। इसे एक "सुपर-सेंस" अपग्रेड के रूप में समझें जो रोबोट के लिए बनाया गया है ताकि वह मनुष्यों की तरह स्पर्श के माध्यम से भौतिक दुनिया को समझ सके। यह कैसे काम करता है, यहाँ इसके सरल भाग दिए गए हैं:

1. समस्या: रोबोट का "स्पर्श" बहुत अव्यवस्थित था

इससे पहले, स्पर्श से सीखने की कोशिश करने वाले रोबोटों के पास दो बड़ी समस्याएँ थीं:

  • अभ्यास की कमी: उनके पास केवल बहुत छोटे, सीमित "पाठ्यपुस्तकें" (डेटासेट) थीं। यह ऐसा था जैसे केवल टोस्ट की एक रेसिपी पढ़कर खाना बनाना सीखने की कोशिश करना। वे नई वस्तुओं या स्थितियों के साथ तालमेल नहीं बिठा पा रहे थे।
  • खराब सुनने की क्षमता: जब एक रोबोट किसी चीज़ को छूता है, तो उसे डेटा का एक सैलाब मिलता है। लेकिन सारा डेटा उपयोगी नहीं होता। यदि आप एक स्पंज को दबाते हैं, तो "दबाने" वाला हिस्सा आपको बताता है कि वह नरम है। यदि आप अपनी उंगली फिसलाते हैं, तो "फिसलने" वाला हिस्सा आपको बताता है कि वह खुरदरा है। पुराने सिस्टम सब कुछ एक साथ सुनने की कोशिश करते थे, जिससे वे शोर (noise) के कारण भ्रमित हो जाते थे। यह एक भीड़ भरे कमरे में विशिष्ट बातचीत को सुनने की कोशिश करने जैसा है जबकि आपके बगल में कोई तेज़ संगीत बजा रहा हो।

2. समाधान: एक विशाल पुस्तकालय और एक स्मार्ट फ़िल्टर

लेखकों ने TouchThinker को इन दो मुख्य उपकरणों के साथ बनाने के लिए बनाया है:

A. "TouchThinker-1M" लाइब्रेरी (डेटा)

उन्होंने रोबोट द्वारा चीजों को छूने के 10 लाख (1 मिलियन) उदाहरणों वाली एक विशाल लाइब्रेरी बनाई।

  • उपमा: कल्पना करें कि एक किताब पढ़ने के बजाय, रोबोट को 400+ विभिन्न वस्तुओं (जैसे स्पंज, पत्थर, कपड़े) को 7 अलग-अलग प्रकार की "उंगलियों" (सेंसर) का उपयोग करके छूने की 10 लाख अलग-अलग कहानियों वाली एक लाइब्रेरी मिलती है।
  • यह क्यों मायने रखता है: यह विविधता रोबोट को सिखाती है कि "नरम" महसूस होना "नरम" ही रहता है, चाहे वह कैमरा-आधारित सेंसर द्वारा महसूस किया गया हो या प्रेशर पैड द्वारा। यह रोबोट को केवल सेंसर को रटने के बजाय, वास्तविक "एहसास" को सीखने में मदद करता है।

B. "एक्शन-अवेयर" फ़िल्टर (विधि)

यह ऑपरेशन का मस्तिष्क है। सिस्टम जानता है कि अलग-अलग सवालों के लिए वीडियो के अलग-अलग हिस्सों की आवश्यकता होती है।

  • उपमा: एक जासूस के बारे में सोचें जो सुरक्षा वीडियो देख रहा है।
    • यदि सवाल है "क्या यह वस्तु कठोर है?", तो जासूस केवल उस क्षण की परवाह करता है जब रोबोट नीचे की ओर दबाता (press) है।
    • यदि सवाल है "क्या यह फिसलन भरा है?", तो जासूस केवल उस क्षण की परवाह करता है जब रोबोट अपनी उंगली फिसलाता (slide) है।
  • यह कैसे काम करता है: TouchThinker एक विशेष "फ़िल्टर" (जिसे Gaussian Temporal MoE कहा जाता है) का उपयोग करता है जो वीडियो के उबाऊ हिस्सों को अनदेखा कर देता है और केवल उस विशिष्ट क्रिया पर ज़ूम करता है जो प्रश्न का उत्तर देती है। यह शोर को काट देता है ताकि रोबोट उस सुराग पर ध्यान केंद्रित कर सके जो महत्वपूर्ण है।

3. परिणाम: एक स्मार्ट, अधिक विश्वसनीय रोबोट

लेखकों ने इस प्रणाली का परीक्षण एक नए "परीक्षा" के माध्यम से किया जिसे उन्होंने TouchThinker-Bench नाम दिया है।

  • परीक्षा: उन्होंने रोबोट से उन वस्तुओं के बारे में कठिन सवाल पूछे जिन्हें उन्होंने पहले कभी नहीं देखा था, और ऐसे सेंसरों का उपयोग किया जिन्हें उन्होंने पहले कभी इस्तेमाल नहीं किया था।
  • स्कोर: TouchThinker ने प्रतिस्पर्धा के मुकाबले काफी अधिक स्कोर किया।
    • इसने केवल अनुमान नहीं लगाया; यह समझा भी सका कि कोई चीज़ एक निश्चित तरीके से क्यों महसूस हुई (जैसे, "यह चिपचिपा महसूस होता है क्योंकि घर्षण/friction अधिक है")।
    • जब सेंसर बदला, तो यह भ्रमित नहीं हुआ। इसने केवल एक विशिष्ट कैमरा दृश्य को याद करने के बजाय "चिपचिपेपन" की अवधारणा (concept) को सीखा।

4. वे वास्तव में क्या दावा करते हैं (और क्या नहीं)

  • वे दावा करते हैं: उन्होंने एक विशाल डेटासेट, स्पर्श डेटा को प्रोसेस करने का एक नया तरीका जो सही क्रियाओं पर ध्यान केंद्रित करता है, और एक ऐसी प्रणाली बनाई है जो वर्तमान मॉडलों की तुलना में स्पर्श के बारे में तर्क करने में बेहतर है।
  • वे दावा नहीं करते हैं (इस टेक्स्ट के आधार पर): वे यह दावा नहीं करते हैं कि इसका वर्तमान में अस्पतालों, दृष्टिहीनों की छड़ियों या कारखानों में उपयोग किया जा रहा है। वे अपने "सीमाओं" (Limitations) अनुभाग में स्पष्ट रूप से बताते हैं कि यह प्रणाली अभी भी प्रयोगात्मक है, वर्तमान में छोटी अंतःक्रियाओं (6-7 सेकंड) तक सीमित है, और शायद अभी छोटे रोबोटों द्वारा चलाने के लिए बहुत भारी है।

संक्षेप में: TouchThinker एक विशाल स्पर्श अनुभवों की लाइब्रेरी और "स्मार्ट चश्मे" का एक संयोजन है जो इसे शोर को अनदेखा करने और प्रश्न का उत्तर देने के लिए आवश्यक विशिष्ट स्पर्श क्रिया पर ध्यान केंद्रित करने में मदद करता है। यह रोबोट को अपने "फिंगर्स" के माध्यम से भौतिक दुनिया को समझने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →