← नवीनतम पेपर
💻 computer science

CERNet: Class-Embedding Predictive-Coding RNN for Unified Robot Motion, Recognition, and Confidence Estimation

यह शोध पत्र CERNet को प्रस्तुत करता है, जो एक एकीकृत पदानुक्रमित प्रेडिक्टिव-कोडिंग रिकरेंट न्यूरल नेटवर्क है जो एक ही संक्षिप्त ढांचे के भीतर वास्तविक समय में रोबोट गति निर्माण, ऑनलाइन इरादा पहचान और आंतरिक आत्मविश्वास अनुमान को एकीकृत करता है, जो एक ह्यूमनाइड रोबोट पर उत्कृष्ट प्रक्षेपवक्र पुनरुत्पादन और पहचान सटीकता प्रदर्शित करता है।

मूल लेखक: Hiroki Sawada, Alexandre Pitti, Mathias Quoy

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hiroki Sawada, Alexandre Pitti, Mathias Quoy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए एक ऐसे रोबोट की जो सिर्फ एक बेजान मशीन की तरह अपने हाथ को हिलाता नहीं है, बल्कि वास्तव में समझता है कि वह क्या कर रहा है, अपनी गलतियों से वास्तविक समय (real-time) में सीखता है, और यहाँ तक कि यह भी जानता है कि वह कब अनिश्चित है।

यह पेपर ठीक यही पेश करता है: CERNet।

CERNet को एक रोबोटिक हाथ के लिए "सुपर-ब्रेन" (महा-मस्तिष्क) के रूप में समझें। तीन अलग-अलग दिमाग रखने के बजाय—एक हिलने-डुलने के लिए, एक पहचानने के लिए, और एक यह अनुमान लगाने के लिए कि वह कितना आश्वस्त है—CERNet इन सभी को एक ही सुंदर, एकीकृत प्रणाली में मिला देता है।

यह कैसे काम करता है, यहाँ कुछ रोजमर्रा के उदाहरणों के साथ दिया गया है:

1. मूल विचार: "क्लास एम्बेडिंग" (मास्टर की/मुख्य चाबी)

कल्पना कीजिए कि आप वर्णमाला लिखना सीख रहे हैं। आपके पास अक्षर "A" के लिए एक मानसिक "चाबी" है, "B" के लिए एक अलग "चाबी" है, और इसी तरह।

  • CERNet में: रोबोट के पास हर उस अक्षर के लिए एक विशेष डिजिटल "चाबी" (जिसे Class Embedding Vector कहा जाता है) होती है जिसे वह जानता है।
  • यह कैसे काम करता है: जब रोबोट कोई अक्षर लिखना चाहता है, तो वह सही चाबी उठाता है। यह चाबी एक मार्गदर्शक की तरह काम करती है, जो रोबोट के आंतरिक गियर को बताता है कि उस विशिष्ट आकार को बनाने के लिए उसे कैसे हिलना चाहिए।
  • जादू: यदि रोबोट किसी और को अक्षर लिखते हुए देख रहा है, तो वह खुद ही सही चाबी खोजने की कोशिश करता है। वह चाबी को तब तक घुमाता रहता है जब तक कि जो गति वह "देख" रहा है, वह उस गति से मेल न खा जाए जिसकी वह "अपेक्षा" कर रहा था। एक बार जब चाबी पूरी तरह फिट हो जाती है, तो रोबट को पता चल जाता है, "आह! यह एक 'A' है!"

2. दो मोड: "पेंटर" और "डिटेक्टिव"

CERNet दो मोडों के बीच स्विच करता है, बिल्कुल वैसे ही जैसे एक व्यक्ति जो पेंटिंग भी कर सकता है और कला की आलोचना भी कर सकता है।

  • मोड A: पेंटर (जनरेशन/निर्माण)
    रोबोट एक चाबी चुनता है (जैसे, अक्षर "G") और बनाना शुरू करता है। वह केवल एक पूर्व-रिकॉर्ड किए गए वीडियो का पालन नहीं करता है; वह भविष्यवाणी करता है कि उसका हाथ आगे कहाँ होना चाहिए। यदि हाथ थोड़ा भटक जाता है, तो रोबोट रेखा पर बने रहने के लिए तुरंत खुद को ठीक करता है।
  • मोड B: डिटेक्टिव (इन्फरेंस/अनुमान)
    रोबोट एक इंसान (या दूसरे रोबोट) को लिखता हुआ देखता है। वह अभी तक नहीं जानता कि वह क्या है। वह अपने दिमाग में अलग-अलग "चाबियों" को आज़माता है। जैसे-जैसे वह स्ट्रोक्स को देखता है, वह अपने अनुमान को परिष्कृत करता है। अंततः, वह "चाबी" जो सबसे अच्छी तरह फिट बैठती है, अक्षर की पहचान उजागर कर देती है।

3. सीक्रेट सॉस: प्रेडिक्टिव कोडिंग ("अपेक्षा बनाम वास्तविकता" लूप)

यह सबसे महत्वपूर्ण हिस्सा है। CERNet प्रिडिक्टिव कोडिंग (Predictive Coding) की अवधारणा पर बना है।

  • उपमा: कल्पना कीजिए कि आप अंधेरे में चल रहे हैं। आप अपेक्षा करते हैं कि फर्श समतल होगा। आप एक कदम उठाते हैं। यदि आपका पैर ठीक वहीं फर्श से टकराता है जहाँ आपने अपेक्षा की थी, तो आप आत्मविश्वास महसूस करते हैं और चलते रहते हैं। लेकिन यदि आपका पैर किसी ऐसी ऊबड़-खाबड़ जगह पर टकराता है जिसकी आपने अपेक्षा नहीं की थी, तो आपका मस्तिष्क चिल्लाता है, "रुको, कुछ गलत है!"
  • रोबोट में: रोबोट लगातार भविष्यवाणी करता है कि उसका हाथ कहाँ होगा।
    • यदि वह सही है: तो वह सुचारू रूप से चलता है।
    • यदि वह गलत है (कोई बाधा, धक्का, या अजीब कोण): तो "एरर सिग्नल" (त्रुटि संकेत) बढ़ जाता है। रोबोट तुरंत अपनी गलती को सुधारने के लिए अपने आंतरिक मानचित्र को अपडेट करता है।
    • परिणाम: यदि कोई लिखते समय रोबोट के हाथ को रास्ते से हटा देता है, तो वह क्रैश या रुक नहीं जाता। वह "त्रुटि" को महसूस करता है, अपने आंतरिक प्लान को अपडेट करता है, और सुचारू रूप से सही पथ पर वापस आता है। यह एक रस्सी पर चलने वाले कलाकार की तरह है जो डगमगाता तो है लेकिन तुरंत अपना संतुलन ठीक कर लेता है।

4. "गट फीलिंग" (आत्मविश्वास का अनुमान)

अधिकांश रोबोट यह जानने में बहुत खराब होते हैं कि वे कब भ्रमित हैं। वे बस अनुमान लगा लेते हैं। CERNet अलग है।

  • उपमा: एक छात्र के टेस्ट देने के बारे में सोचें। यदि उन्हें उत्तर सही मिलता है, तो वे शांत महसूस करते हैं। यदि वे गलत होते हैं, तो उन्हें पेट में एक अजीब सी घबराहट महसूस होती है।
  • CERNet में: रोबोट Prediction Error का उपयोग करके अपने स्वयं के "पेट की घबराहट" को मापता है।
    • कम त्रुटि (Low Error): रोबोट की भविष्यवाणी वास्तविकता से पूरी तरह मेल खाती है। वह कहता है, "मुझे 100% यकीन है कि यह एक 'B' है।"
    • उच्च त्रुटि (High Error): रोबोट अपनी भविष्यवाणी को जो वह देख रहा है उससे मिलाने के लिए संघर्ष कर रहा है। वह कहता है, "मैं पक्का नहीं हूँ। शायद यह 'B' है, शायद यह '8' है।"
  • यह क्यों मायने रखता है: यह रोबोट को यह कहने की अनुमति देता है कि, "मुझे नहीं पता," या मदद मांगना, बजाय इसके कि वह आत्मविश्वास के साथ गलत काम करे।

5. प्रयोग: एक रोबोट को लिखना सिखाना

शोधकर्ताओं ने एक वास्तविक रोबोट (जिसका नाम Reachy है) को वर्णमाला के सभी 26 अक्षर लिखना सिखाया (एक प्रक्रिया जिसे किनेस्थेटिक टीचिंग कहा जाता है)।

  • परीक्षण: उन्होंने रोबोट को उसके हाथ को रास्ते से हटाकर (परेशान करके) अक्षर लिखवाए।
  • परिणाम:
    • पुराने प्रकार के रोबोट (सिंगल-लेयर): भ्रमित हो गए, गंदे अक्षर लिखे, और धक्के से उबर नहीं सके।
    • CERNet (मल्टी-लेयर): स्पष्ट, पठनीय अक्षर लिखे। जब उन्हें धक्का दिया गया, तो वे डगमगाए लेकिन तुरंत खुद को ठीक किया और अक्षर को पूरी तरह से पूरा किया।
    • पहचान (Recognition): किसी और को लिखते हुए देखते समय, उसने पहली बार में ही 68% बार सही ढंग से अक्षर का अनुमान लगाया (और यदि आप शीर्ष दो अनुमानों को गिनते हैं तो 81% तक)।
    • आत्मविश्वास: जिन अक्षरों का उसने सही अनुमान लगाया, उनमें गलत अनुमान लगाने वाले अक्षरों की तुलना में बहुत कम "एरर सिग्नल" (शांत पेट) थे।

सारांश

CERNet एक बड़ी उपलब्धि है क्योंकि यह उन तीन चीजों को एक सूत्र में बांधता है जिनके लिए आमतौर पर तीन अलग-अलग प्रणालियों की आवश्यकता होती है:

  1. करना (हाथ को हिलाना)।
  2. समझना (क्या किया जा रहा है उसे पहचानना)।
  3. आत्म-जागरूकता (यह जानना कि वह कितना आश्वस्त है)।

यह यह सब एक ही, संक्षिप्त मस्तिष्क का उपयोग करके करता है जो वास्तविक समय में अपनी गलतियों से सीखता है। यह हमें उन रोबोटों के करीब लाता है जो मनुष्यों के साथ सुरक्षित रूप से काम कर सकते हैं, हमारे इरादों को समझ सकते हैं और जानते हैं कि उन्हें कब पूछना चाहिए, "क्या आप चाहते थे कि मैं ऐसा करूँ?"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →