← नवीनतम पेपर
💻 computer science

Eval-Actions: Fine-Grained Execution Quality Evaluation for Robotic Manipulation

यह शोध पत्र Eval-Actions को प्रस्तुत करता है, जो एक व्यापक रियल-रोबोट बेंचमार्क और नैदानिक पद्धति है जो बाइनरी सफलता दरों से आगे बढ़कर विशेषज्ञ ग्रेडिंग, रैंक-निर्देशित लेबल और चेन-ऑफ-थॉट एनोटेशन के माध्यम से रोबोटिक मैनिपुलेशन नीतियों के सूक्ष्म-स्तरीय, व्याख्या योग्य मूल्यांकन के साथ-साथ एक स्वचालित मल्टीमॉडल इवैल्यूएटर (AutoEval) प्रदान करता है जो गुणवत्ता स्कोर और स्पष्टीकरणों की भविष्यवाणी करता है।

मूल लेखक: Mengyuan Liu, Juyi Sheng, Peiming Li, Ziyi Wang, Tianming Xu, Tiantian Xu, Hong Liu

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengyuan Liu, Juyi Sheng, Peiming Li, Ziyi Wang, Tianming Xu, Tiantian Xu, Hong Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कोच हैं जो दो एथलीटों को दौड़ते हुए देख रहे हैं। दोनों फिनिश लाइन पार करते हैं। रोबोटों को जज करने के पुराने तरीके में, कोच बस दोनों को "अच्छा काम किया!" चिल्लाकर कहेगा क्योंकि दोनों ने काम पूरा कर लिया। कोच इस बात की परवाह नहीं करेगा कि एक धावक सुचारू रूप से दौड़ा जबकि दूसरा लड़खड़ाया, गिरा, टकराया, और अंततः जीतने से पहले तीन बार फिर से शुरू करने के लिए मजबूर हुआ।

समस्या: "पास/फेल" का जाल
यह शोध पत्र तर्क देता है कि वर्तमान रोबोट मूल्यांकन इस "पास/फेल" मानसिकता में फंसा हुआ है। यह केवल यह जाँचता है कि रोबोट ने काम पूरा किया या नहीं (जैसे कप उठाना)। यह इस बात की अनदेखी करता है कि रोबोट ने इसे कैसे किया। यह खतरनाक है क्योंकि एक रोबोट जो टकराकर जीतता है, वह चीजों को तोड़ सकता है या अविश्वसनीय हो सकता है, जबकि एक सुचारू रोबोट सुरक्षित और कुशल होता है। हमें केवल परिणाम को नहीं, बल्कि प्रदर्शन को ग्रेड देने के तरीके की आवश्यकता है।

समाधान: "इवल-एक्शन्स" (रोबोट का रिपोर्ट कार्ड)
लेखकों ने एक नया सिस्टम बनाया जिसे Eval-Actions कहा जाता है। इसे रोबोटों के लिए एक साधारण पास/फेल ग्रेड के बजाय एक विस्तृत रिपोर्ट कार्ड के रूप में समझें। यह रोबोट के प्रदर्शन को तीन विशिष्ट प्रकार के फीडबैक में विभाजित करता है:

  1. द एक्सपर्ट ग्रेडर (EG): कल्पना कीजिए कि 10 मानव कोचों का एक पैनल रोबोट के वीडियो को देख रहा है। वे एक सख्त नियम पुस्तिका के आधार पर इसे 1 से 10 तक स्कोर देते हैं। वे देखते हैं कि:

    • क्या इसने कार्य पूरा किया?
    • क्या गति सुचारू थी (झटकेदार नहीं)?
    • क्या यह किसी चीज़ से टकराया?
    • क्या यह तेज़ था या इसने समय बर्बाद किया?
    • परिणाम: एक एकल संख्यात्मक स्कोर (जैसे, "इस रोबोट को 7/10 मिला")।
  2. द मैथ-मैच (RG): कभी-कभी, इंसान व्यक्तिपरक (subjective) होते हैं। इसे ठीक करने के लिए, टीम ने एक "रैंक-गाइडेड" सिस्टम बनाया। उन्होंने एक कंप्यूटर को रोबोट की भौतिक गतिविधियों (इसके जोड़ों के कितनी तेज़ी से हिलने, इसके कितना हिलने-डुलने) को देखने और गणित को तब तक समायोजित करने के लिए प्रशिक्षित किया जब तक कि कंप्यूटर की रैंकिंग मानव कोचों की रैंकिंग से मेल न खा जाए।

    • परिणाम: एक स्कोर जो ठोस नंबरों पर आधारित है लेकिन ऐसा महसूस होता है जैसे वह किसी इंसान की सोच हो।
  3. द "चेन-ऑफ-थॉट" एक्सप्लेनर (CoT): यह सबसे रचनात्मक हिस्सा है। केवल एक नंबर देने के बजाय, सिस्टम को एक छोटा पैराग्राफ लिखने के लिए प्रशिक्षित किया जाता है कि उसने वह स्कोर क्यों दिया।

    • उदाहरण: "रोबोट सफल रहा, लेकिन इसका स्कोर कम रहा क्योंकि इसने एक बार कप गिरा दिया, इसे दोबारा उठाना पड़ा, और कप रखते समय इसकी बांह जोर से हिली।"
    • परिणाम: एक लिखित निदान (diagnosis) जो आपको बताता है कि वास्तव में क्या गलत हुआ।

डेटा: रोबोट की विफलताओं और जीत का एक विशाल पुस्तकालय
इसे बनाने के लिए, टीम ने केवल परफेक्ट रोबोट वीडियो एकत्र नहीं किए। उन्होंने एक विशाल लाइब्रेरी (Eval-Actions Benchmark) बनाई जिसमें रोबोटों द्वारा कार्य करने के 13,000 से अधिक एपिसोड शामिल हैं।

  • इसमें 150+ विभिन्न कार्य शामिल हैं (जैसे कटोरे रखना, मेज साफ करना, या दवाएं व्यवस्थित करना)।
  • महत्वपूर्ण रूप से, इसमें विफलताएं और अव्यवस्थित सफलताएं भी शामिल हैं। वे चाहते थे कि इसमें वे रोबट भी दिखें जो संघर्ष कर रहे थे, टकरा रहे थे, या झटकेदार तरीके से चल रहे थे, न कि केवल एकदम सटीक वाले।
  • इसमें लगभग 52 घंटे के वीडियो और रोबोट मूवमेंट डेटा हैं।

टूल: "ऑटोइवल" (रोबोट जज)
अंत में, उन्होंने एक AI टूल बनाया जिसे AutoEval कहा जाता है जो एक स्वचालित जज के रूप में कार्य करता है। आप इसमें रोबोट का वीडियो और उसका मूवमेंट डेटा डालते हैं, और यह मानव विशेषज्ञों की नकल करने की कोशिश करता है।

  • AutoEval-S: संख्यात्मक स्कोर देता है (एक्सपर्ट ग्रेडर की तरह)।
  • AutoEval-P: स्पष्टीकरण लिखता है (चेन-ऑफ-थॉट की तरह)।

परिणाम
जब उन्होंने मानव विशेषज्ञों के विरुद्ध AutoEval का परीक्षण किया:

  • यह लगभग 81% से 84% बार मानव रैंकिंग के साथ सहमत हुआ (एक कंप्यूटर के लिए यह एक बहुत उच्च स्कोर है)।
  • यह सही ढंग से पहचान सका कि रोबोट सफल हुआ या विफल हुआ, लगभग 91% बार।
  • यह ऐसे स्पष्टीकरण उत्पन्न कर सका जो मानव तर्क के साथ लगभग 70% बार मेल खाते थे।

सारांश में
यह शोध पत्र रोबोटों के मूल्यांकन के लिए एक नए तरीके को पेश करता है जो "क्या यह काम कर गया?" से आगे बढ़कर "यह कितनी अच्छी तरह से काम कर गया?" पर ध्यान केंद्रित करता है। मानव स्कोरिंग, गणितीय अंशांकन (calibration) और AI-जनित स्पष्टीकरणों के मिश्रण का उपयोग करके, उन्होंने एक ऐसा सिस्टम बनाया है जो एक अनाड़ी रोबोट और एक कुशल रोबोट के बीच अंतर कर सकता है, भले ही दोनों तकनीकी रूप से कार्य पूरा कर लें। यह डेवलपर्स को वास्तविक दुनिया में तैनात करने से पहले अपने रोबोटों को सुधारने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →