← नवीनतम पेपर
💻 computer science

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

यह शोध पत्र RoboProcessBench को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और डेटासेट है जिसे रोबोटिक हेरफेर (manipulation) में विजन-लैंग्वेज मॉडल्स की प्रक्रिया-सचेत समझ (process-aware understanding) का मूल्यांकन करने और उसे बढ़ाने के लिए डिज़ाइन किया गया है, जो इस क्षमता को 12 नैदानिक कार्य परिवारों (diagnostic task families) में स्टेटिक मॉनिटरिंग और डायनेमिक रीजनिंग आयामों में विभाजित करता है।

मूल लेखक: Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

प्रकाशित 2026-08-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को शर्ट तह करने की कोशिश करते हुए देख रहे हैं। एक मानक रोबोट कैमरा केवल कपड़े का ढेर और एक यांत्रिक हाथ देख सकता है। वह जानता है कि शर्ट क्या है, लेकिन वह वास्तव में यह नहीं समझ पाता कि रोबोट अभी क्या कर रहा है। क्या हाथ कॉलर को पकड़ रहा है? क्या वह किसी सिलवट को सीधा कर रहा है? क्या वह शर्ट को गिराने वाला है? एक रोबोट के लिए वास्तव में सहायक होने के लिए, उसे केवल आँखों के जोड़े से कहीं अधिक होने की आवश्यकता है; उसे एक "प्रक्रिया-जागरूक" (process-aware) पर्यवेक्षक होने की आवश्यकता है। उसे क्रिया की कहानी को कदम-दर-कदम, जैसे-जैसे वह आगे बढ़ती है, समझने की आवश्यकता है, न कि केवल तह की हुई शर्ट की अंतिम तस्वीर की।

यहीं विजन-लैंग्वेज मॉडल्स (VLMs) काम आते हैं। इन्हें इन सुपर-स्मार्ट AI दिमागों के रूप में सोचें जो एक तस्वीर देख सकते हैं और शब्दों में उसका वर्णन कर सकते हैं। वैज्ञानिक इन एआई (AI) का उपयोग रोबोट के लिए "जजों" के रूप में करने लगे हैं। रोबोट को केवल यह बताने के बजाय कि उसे क्या करना है, एआई रोबोट को काम करते हुए देखता है और कहता है, "अच्छा काम किया, तुम कप को पकड़े हुए हो," या "रुको, तुम बहुत तेज़ी से चल रहे हो, तुम इसे गिरा सकते हो।" लेकिन यहाँ एक पेच है: हमें वास्तव में यह नहीं पता कि ये एआई जज कहानी के मध्य भाग को देखने में कितने अच्छे हैं। वे यह बताने में बेहतरीन हो सकते हैं कि "कार्य पूरा हो गया है," लेकिन यह समझने में बेहद खराब हो सकते हैं कि रोबलेट वर्तमान में "पकड़ने" (grasping) के चरण में है या "उठाने" (lifting) के चरण में। यदि एआई यह अंतर नहीं कर सकता कि रोबोट आगे बढ़ रहा है या पीछे फिसल रहा है, तो वह सही सलाह नहीं दे सकता।

यह बिल्कुल वही है जिसे पेपर RoboProcessBench हल करता है। शोधकर्ताओं ने एक विशाल, कठिन परीक्षण बनाया ताकि यह देखा जा सके कि क्या ये एआई जज वास्तव में रोबोट के काम की "प्रक्रिया" को समझ सकते हैं। उन्होंने केवल यह नहीं पूछा, "क्या रोबोट सफल रहा?" इसके बजाय, उन्होंने रोबोट की क्रियाओं को छोटे, विशिष्ट क्षणों में विभाजित किया और उनसे उन पर 12 अलग-अलग प्रकार के प्रश्न पूछे। उन्होंने ProcessData नामक एक डेटासेट बनाया जिसमें लगभग 58,000 प्रश्न-उत्तर जोड़े थे, जो 260 विभिन्न रोबोट कार्यों को कवर करते थे, जैसे कागज मोड़ना, पेंच इकट्ठा करना, या कोस्टर रखना।

उनके परीक्षण के परिणाम एक वास्तविकता की जाँच (reality check) की तरह थे। जब उन्होंने सबसे अच्छे एआई मॉडल्स को बिना किसी विशेष प्रशिक्षण के टेस्ट लेने दिया (एक "जीरो-शॉट" प्रयास), तो एआई पूरी तरह से दिशाहीन थे। कुछ मॉडल यह पहचानने में ठीक थे कि रोबोट किसी वस्तु को छू रहा है या नहीं, लेकिन वे घटनाओं के क्रम का अनुमान लगाने या यह भविष्यवाणी करने में बेहद खराब थे कि कोई चाल सफल होगी या नहीं। यह एक छात्र को फिल्म देखने और कथानक का अनुमान लगाने के लिए कहने जैसा था, लेकिन वे इस बात को लेकर भ्रमित होते रहते थे कि कौन सा दृश्य पहले आया या क्या नायक वास्तव में जीत रहा था।

हालाँकि, यह पेपर एक आशाजनक मार्ग सुझाता है। जब शोधकर्ताओं ने दो लोकप्रिय एआई मॉडल्स (Qwen2.5-VL-7B और InternVL-3-8B) को उनके डेटा के एक छोटे हिस्से (जिसे ProcessData-SFT कहा जाता है) का उपयोग करके एक "स्टडी गाइड" दी, तो मॉडल्स में काफी सुधार हुआ। इस प्रशिक्षण के बाद, वे स्थानीय अवस्थाओं (local states) को पहचानने में बहुत अधिक सटीक हो गए, जैसे कि "क्या रोबोट हिल रहा है?" या "क्या इसने वस्तु को पकड़ा हुआ है?" वे गति (motion) और विशिष्ट रोबोट क्रियाओं की पहचान करने वाले कार्यों पर काफी बेहतर हुए।

लेकिन कहानी अभी तक पूरी तरह से जीत नहीं है। यहाँ तक कि अध्ययन करने के बाद भी, एआई को टेस्ट के सबसे कठिन हिस्सों में संघर्ष करना पड़ा: समय के क्रम में घटनाओं का सटीक क्रम समझना और एक जटिल चाल के अंतिम परिणाम की भविष्यवाणी करना। पेपर सुझाव देता है कि जबकि हम इन एआई को "अभी" और "अगले कदम" को अच्छी तरह से समझने के लिए सिखा सकते हैं, उन्हें रोबोट की क्रिया के पूर्ण "टाइमलाइन" को समझने के लिए सिखाना अभी भी एक बड़ी चुनौती है। अंततः, RoboProcessBench केवल एक परीक्षण नहीं है; यह एक उपकरण है। यह हमें दिखाता है कि हमारे एआई जज कहाँ कमजोर हैं और उन्हें स्मार्ट बनाने के लिए आवश्यक प्रशिक्षण डेटा प्रदान करता है, जिससे हमें ऐसे रोबोट बनाने में मदद मिलती है जो केवल दुनिया को देखते ही नहीं, बल्कि वास्तव में समझते भी हैं कि उसमें क्या हो रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →