← नवीनतम पेपर
💻 computer science

Human-Centric Grasp State Assessment: Toward Transferring Subjective Evaluation to Robots

यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो विजन-लैंग्वेज मॉडल का उपयोग करके प्रशिक्षण डेटा के निर्माण को अर्ध-स्वचालित बनाकर मानव व्यक्तिपरक अपेक्षाओं और रोबोटिक मापों के बीच के अंतर को पाटता है, जिससे रोबट न्यूनतम मानव-एनोटेटेड परीक्षणों के आधार पर विरूपणीय वस्तुओं (deformable objects) के लिए अपनी पकड़ने की शक्ति (grasping force) को तेजी से अनुकूलित करने में सक्षम होते हैं।

मूल लेखक: Ryohei Kobayashi, Kosei Isomoto, Yuga Yano, Yuichiro Tanaka, Hakaru Tamukoh

प्रकाशित 2026-09-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ryohei Kobayashi, Kosei Isomoto, Yuga Yano, Yuichiro Tanaka, Hakaru Tamukoh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

घर के शांत, बिखरे हुए कोनों में या किसी सुविधा स्टोर की संकरी गलियों में, एक रोबोट एक ऐसी चुनौती का सामना करता है जो इंसान के लिए सरल है लेकिन मशीन के लिए समझ से बाहर है: एक सैंडविच को बिना कुचले उठाना, या एक पेपर कप को बिना फिसले उठाना। दशकों से, इंजीनियरों ने रोबots को यह सिखाया है कि वस्तुओं को पकड़ने के लिए संख्याओं को कैसे मापा जाए—कितना बल लगाया जा रहा है, कितना घर्षण मौजूद है, और क्या वस्तु हिल रही है। ये माप सटीक और विश्वसनीय होते हैं, लेकिन वे समीकरण के सबसे महत्वपूर्ण हिस्से को छोड़ देते हैं: इंसान का "बिल्कुल सही" महसूस करने का अहसास। एक रोबोट वह बल लगा सकता है जो किसी वस्तु को थामे रखने के लिए भौतिक रूप से पर्याप्त हो, फिर भी एक मानव पर्यवेक्षक के लिए, वस्तु थोड़ी दबी हुई या विकृत दिखाई दे सकती है, जो संकेत देती है कि पकड़ बहुत सख्त है। रोबोट द्वारा मापे जाने वाले डेटा और इंसान की अपेक्षाओं के बीच यह अंतर वास्तविक सहयोग के मार्ग में एक बाधा उत्पन्न करता है। यदि एक रोबोट यह नहीं समझ सकता कि एक कुचला हुआ सैंडविच एक विफलता है, भले ही वह गिरा न हो, तो उसे कभी भी नाजुक दैनिक कार्यों के लिए भरोसेमंद नहीं माना जाएगा।

जापान के क्यूशू इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने इस अंतर को पाटने का एक नया तरीका विकसित किया है। उन्होंने एक ऐसी प्रणाली बनाई है जो रोबोट को मानव पकड़ के व्यक्तिपरक, दृश्य मानकों को सीखने और फिर केवल अपने स्वयं के मैकेनिकल सेंसरों का उपयोग करके उन मानकों को लागू करने की अनुमति देती है। रोबोट को दुनिया की अनंत विविधताओं के लिए हर संभव वस्तु हेतु कठोर नियमों के साथ प्रोग्राम करने के बजाय, शोधकर्ताओं ने एक ऐसा ढांचा बनाया जो मानवीय अंतर्ज्ञान को मशीन में स्थानांतरित करता है। यह प्रणाली पहले एक इंसान को यह दिखाकर काम करती है कि पकड़ का निर्णय कैसे किया जाए, और फिर उस निर्णय का उपयोग करके रोबोट को यह सिखाती है कि उसे अपने स्वयं के डेटा में क्या देखना चाहिए। इसका परिणाम एक ऐसा रोबोट है जो केवल कुछ उदाहरण देखने के बाद एक नए, अज्ञात वस्तु के अनुकूल हो सकता है, और ठीक उसी क्षण रुकना सीख जाता है जब एक इंसान यह तय करेगा कि पकड़ 'परफेक्ट' है।

शोधकर्ताओं ने इस विचार का परीक्षण तीन सामान्य वस्तुओं पर किया जो अनस्ट्रक्चर्ड वातावरण में पाई जाती हैं: एक राइस बॉल (चावल का गोला), एक सैंडविच, और एक पेपर कप। इन वस्तुओं को इसलिए चुना गया क्योंकि वे नरम, लचीली हैं और दबाव के तहत अलग-अलग तरह से व्यवहार करती हैं। रोबोट को सिखाने के लिए, टीम ने पहले रोबोट द्वारा इन वस्तुओं को पकड़ते समय के वीडियो रिकॉर्ड किए, जिसमें बल को छोटे, सटीक चरणों में बढ़ाया गया था। एक मानव पर्यवेक्षक ने इन वीडियो को देखा और दो महत्वपूर्ण क्षणों को चिह्नित किया: वह सटीक सेकंड जब ग्रिपर ने वस्तु को सुरक्षित रूप से पकड़ा था, और वह पहला क्षण जब वस्तु में क्षति के दृश्य संकेत दिखने लगे थे, जैसे कि कोई गड्ढा या आकार में परिवर्तन। इन क्षणों ने रोबोट के लिए तीन अवस्थाएँ (states) निर्धारित कीं: स्लाइडिंग (पर्याप्त मजबूती से नहीं पकड़ना), एप्रोप्रियेट (बिल्कुल सही पकड़ना), और एक्ससेसिव (बहुत ज़ोर से दबाना)।

मुख्य नवाचार इस बात में निहित है कि रोबोट इन परिभाषाओं को हजारों मानव-लेबल वाले उदाहरणों की आवश्यकता के बिना कैसे सीखता है। शोधकर्ताओं ने एक बड़े लैंग्वेज और विजन मॉडल का उपयोग किया, जो कृत्रिम बुद्धिमत्ता (AI) का एक प्रकार है जो छवियों और टेक्स्ट को समझने में सक्षम है, ताकि एक सेतु के रूप में कार्य किया जा सके। उन्होंने इस AI को मानव के निर्णयों के कुछ उदाहरण दिखाए—दो या तीन वीडियो जहाँ एक इंसान ने पहले ही 'परफेक्ट' क्षणों को चिह्नित कर दिया था। फिर AI ने इन उदाहरणों का उपयोग शेष वीडियो डेटा को स्वचालित रूप से लेबल करने के लिए एक मार्गदर्शक के रूप में किया। यह प्रक्रिया, जिसे टीम ने 'सेमी-ऑटोमेटेड सुपरवाइजर जनरेटर' कहा है, उन्हें न्यूनतम मानवीय प्रयास के साथ प्रत्येक वस्तु के लिए एक पूर्ण प्रशिक्षण डेटासेट बनाने की अनुमति देती है। AI ने विकृति के सूक्ष्म दृश्य संकेतों को पहचानना सीखा जो एक इंसान देख सकता है, प्रभावी रूप से मानव की "दृष्टि" को लेबल के एक सेट में अनुवादित किया जिसे रोबोट समझ सकता है।

एक बार जब रोबोट के पास यह लेबल किया गया डेटा आ गया, तो उसने केवल अपने आंतरिक सेंसरों का उपयोग करके वास्तविक समय में पकड़ की स्थिति का अनुमान लगाना सीख लिया। रोबोट के पास गड्ढे को देखने के लिए आँखें नहीं हैं; इसके बजाय, यह अपनी उंगलियों में टैक्टाइल (स्पर्श) सेंसर और लगाए जा रहे बल के माप पर निर्भर करता है। शोधकर्ताओं ने एक हल्का प्रेडिक्शन मॉडल प्रशिक्षित किया जो इन सेंसर रीडिंग के इतिहास को देखे और अगले एक सेकंड के अंश में क्या होने वाला है, इसका अनुमान लगाए। यदि दबाव और स्पर्श का पैटर्न बताता है कि वस्तु विकृत होने वाली है, तो रोबोट जानता है कि बल बढ़ाना बंद कर देना चाहिए। यह भविष्यवाणी एक सेकंड के बहुत छोटे हिस्से में होती है, जिससे रोबोट को वस्तु को उठाते और ले जाते समय अपनी पकड़ को लगातार समायोजित करने की अनुमति मिलती है।

प्रयोगों से पता चला कि यह दृष्टिकोण उल्लेखनीय रूप से अच्छा काम करता है। जब शोधकर्ताओं ने तीन वस्तुओं पर इस प्रणाली का परीक्षण किया, तो अधिक डेटा देखने के साथ रोबोट की सही स्थिति का अनुमान लगाने की क्षमता तेजी से सुधरी। केवल एक मानव निर्णय के उदाहरण के साथ, रोबмॉट कार्य को समझना शुरू कर सकता था, लेकिन उसके अनुमान कभी-कभी अस्थिर थे। दो उदाहरण दिए जाने पर, रोबोट का प्रदर्शन अत्यधिक सटीक हो गया, जो मानव के निर्णय से लगभग पूरी तरह मेल खाता था। उन परीक्षणों में जहाँ रोबोट ने वास्तव में वस्तुओं को उठाया और हिलाया, उसने लगभग हर प्रयास में "एप्रोप्रियेट" पकड़ बनाए रखने में सफलता प्राप्त की। पेपर कप और सैंडविच के लिए, रोबोट ने वस्तु को सुरक्षित रखने और बिना नुकसान पहुँचाए हासिल करने में पूर्ण स्कोर प्राप्त किया। राइस बॉल के लिए, जिसका आकार अधिक अनियमित और घनत्व असमान है, रोबोट थोड़ा अधिक सतर्क था, उसने मानव से थोड़ा पहले अपनी पकड़ रोक दी, लेकिन फिर भी उसने वस्तु को गिराए या कुचले बिना सफलतापूर्वक पहुँचाया।

यह पुष्टि करने के लिए कि रोबोट वास्तव में मानवीय अपेक्षाओं को पूरा कर रहा है, शोधकर्ताओं ने पच्चीस लोगों से इन कार्यों को करते हुए रोबोट के वीडियो देखने को कहा। प्रतिभागियों से यह तय करने के लिए कहा गया कि रोबोट की पकड़ स्लाइडिंग, एप्रोप्रियेट, या एक्ससेसिव थी। लगभग हर मामले में, नब्बे प्रतिशत से अधिक लोग इस बात पर सहमत थे कि रोबोट वस्तु को सही ढंग से पकड़ रहा था। एकमात्र अपवाद सैंडविच के साथ एक परीक्षण था जहाँ रोबोट ने इसे थोड़ा केंद्र से हटकर पकड़ा था, जिससे एक दृश्य विकृति हुई जिसे कुछ लोगों ने बहुत अधिक बल के रूप में व्याख्या किया। यह परिणाम बताता है कि सिस्टम ने सफलतापूर्वक रोबोट की मैकेनिकल क्रियाओं को मानव दृश्य अपेक्षाओं के साथ संरेखित किया, जिससे एक ऐसी पकड़ बनी जो देखने वाले व्यक्ति को 'सही' महसूस होती है।

अध्ययन ने इस वर्तमान दृष्टिकोण की सीमाओं को भी रेखांकित किया। शोधकर्ताओं ने नोट किया कि यह प्रणाली तब सबसे अच्छा काम करती है जब वस्तुएं उन वस्तुओं के समान होती हैं जिन्हें इसने पहले देखा है। यदि किसी पूरी तरह से अलग बनावट या कठोरता वाला नया प्रकार का सैंडविच पेश किया जाता है, तो रोबोट को नए नियम सीखने के लिए कुछ और उदाहरणों की आवश्यकता हो सकती है। टीम ने यह भी बताया कि उनकी वर्तमान पद्धति एक सरल तीन-अवस्था वर्गीकरण (three-state classification) पर निर्भर करती है, जो एक अच्छी शुरुआत है लेकिन मानवीय पसंद की पूरी जटिलता को नहीं पकड़ती है। भविष्य के कार्य का लक्ष्य कार्य के दौरान मनुष्यों से फीडबैक को शामिल करके और वस्तुओं की श्रेणी का विस्तार करके सिस्टम को अधिक मजबूत बनाना होगा।

अंततः, यह शोध उन रोबोटों के लिए एक रास्ता दिखाता है जिन्हें अव्यवस्थित, अप्रत्याशित वातावरण में लोगों के साथ काम करने की आवश्यकता है। मशीनों को मानवीय दृष्टिकोण को महत्व देना सिखाकर—न केवल वस्तु की भौतिक सुरक्षा, बल्कि उसके स्वरूप और अखंडता को भी—शोधकर्ताओं ने उन रोबोटों की दिशा में एक महत्वपूर्ण कदम उठाया है जो दैनिक जीवन की बारीकियों को वास्तव में समझ सकते हैं। रोबोट को किसी विशिष्ट वस्तु को कितनी जोर से दबाना है, यह बताने की आवश्यकता नहीं है; उसे केवल यह सीखने की आवश्यकता है कि "बहुत अधिक" क्या दिखता है, और फिर वह उस सबक को किसी भी चीज़ पर लागू कर सकता है जिसका वह सामना करता है। मानवीय मानदंडों को वस्तुनिष्ठ मशीन नियंत्रण में स्थानांतरित करने की यह क्षमता एक ऐसे भविष्य का सुझाव देती है जहाँ रोबोट हमारी सबसे नाजुक चीजों को हमारे जैसी ही देखभाल के साथ संभाल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →