ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs
यह शोधपत्र ReactHuman को प्रस्तुत करता है, जो पहला भौतिकी-आधारित (physics-grounded) बेंचमार्क है जो सिम्युलेटेड घरेलू वातावरण में तत्काल, सुरक्षा-महत्वपूर्ण प्रतिक्रियात्मक निर्णय लेने की क्षमता पर एम्बॉडीड मल्टीमॉडल एलएलएम (embodied multimodal LLMs) का मूल्यांकन करता है, जिससे यह पता चलता है कि स्केलिंग के बावजूद वर्तमान मॉडल सहज भौतिकी और सुरक्षा के मामले में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी रसोई की कल्पना करें जहाँ एक भारी पैन काउंटर से फिसल जाता है, या एक गलियारा जहाँ एक ऊँची अलमारी गिरने लगती है। एक सेकंड के कुछ ही अंश में, मानव मस्तिष्क दृश्य खतरे को समझ लेता है, यह अनुमान लगाता है कि वस्तु कहाँ गिरेगी, और शरीर को उसे पकड़ने या किनारे हटने का आदेश देता है। यह पलक झपकते ही होने वाली प्रतिक्रिया केवल एक रिफ्लेक्स नहीं है; यह इस बात की समझ, वस्तु कितनी भारी है यह जानने और वह बिल्कुल कहाँ जाएगी, इसकी गणना करने का एक जटिल मेल है। जैसे-जैसे वैज्ञानिक ऐसे रोबोट बनाने के लिए काम कर रहे हैं जो हमारे घरों में हमारे साथ रह सकें और काम कर सकें, वे एक महत्वपूर्ण प्रश्न का सामना करते हैं: क्या आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) इसी तरह की गति और सुरक्षा के साथ प्रतिक्रिया करना सीख सकता है? इन बुद्धिमान प्रणालियों के लिए वर्तमान परीक्षण अक्सर उनसे वीडियो के बारे में प्रश्न पूछते हैं या कमरा साफ करने जैसे दीर्घकालिक कार्यों की योजना बनाने के लिए कहते हैं, लेकिन ये तरीके यह परीक्षण नहीं करते कि क्या कोई मशीन खतरा प्रकट होते ही जीवन बचाने वाला निर्णय ले सकती है।
एक नया अध्ययन 'रिएक्टह्यूमन' (ReactHuman) नामक एक कठोर परीक्षण पेश करता है, जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या आर्टिफिशियल इंटेलिजेंस अचानक शारीरिक खतरों का सामना करने पर एक सक्षम मानव की तरह कार्य कर सकता है। शोधकर्ताओं ने एक सिम्युलेटेड दुनिया बनाई जहाँ एक डिजिटल रोबोट एक कमरे में खड़ा होता है और घटनाओं की एक श्रृंखला को घटित होते हुए देखता है, जैसे कि गिरता हुआ चाकू, एक खिसकती हुई शेल्फ, या उसकी ओर उछलता हुआ एक गेंद। सिस्टम आपदा होने से ठीक पहले सिमुलेशन को रोक देता है, जिससे रोबोट को कई कैमरा कोणों से घटना के कुछ सेकंड दिखाए जाते हैं। आर्टिफिशियल इंटेलिजेंस, जो रोबot के मस्तिष्क के रूप में कार्य करता है, उसे फिर यह निर्णय लेना होता है कि क्या करना है और एक विशिष्ट कमांड जारी करनी होती है: एक नई जगह पर जाना, वस्तु को पकड़ने के लिए हाथ बढ़ाना, या स्थिर रहना। उन पिछले परीक्षणों के विपरीत जहाँ एक कंप्यूटर केवल एक सूची में से सही उत्तर चुन सकता था, यह प्रणाली रोबोट को वास्तव में भौतिकी के सिमुलेशन (physics simulation) में वह क्रिया करने के लिए मजबूर करती है। यदि रोबोट गिरती हुई वस्तु को पकड़ने का निर्णय लेता है, तो सिमुलेशन यह देखने के लिए चलता है कि क्या उसका हाथ समय पर वस्तु से मिल पाता है। यदि वह बचने का निर्णय लेता है, तो सिमुलेशन यह जाँचता है कि क्या रोबोट सफलतापूर्वक रास्ते से हट गया।
शोधकर्ताओं ने सत्रह विभिन्न प्रकार की अचानक होने वाली घटनाओं को कवर करने वाले एक हज़ार से अधिक अद्वितीय दृश्य बनाए, जिनमें साधारण गिरावट से लेकर जटिल श्रृंखला प्रतिक्रियाएं शामिल थीं जहाँ एक गिरती हुई वस्तु दूसरी वस्तु से टकराती है। उन्होंने इसमें "ट्रिक" (धोखा देने वाली) वस्तुएं भी शामिल कीं जो एक चीज़ जैसी दिखती हैं लेकिन व्यवहार दूसरी तरह का करती हैं, जैसे कि एक फोम का एनविल (निहाई) जो भारी दिखता है लेकिन हल्का है, या एक स्टील का सेब जो फल जैसा दिखता है लेकिन भारी और खतरनाक है। यह सेटअप यह परीक्षण करता है कि क्या रोबोट इस बात पर निर्भर करता है कि चीजें कैसी दिखती हैं या इस पर कि वे वास्तव में कैसे चलती हैं। टीम ने इस कार्य के लिए सात उन्नत आर्टिफिशियल इंटेलिजेंस मॉडलों का मूल्यांकन किया। परिणाम निराशाजनक थे: मॉडल लगभग तीन में से एक बार सही प्रतिक्रिया देने में विफल रहे। जब सही क्रिया खतरे से दूर हटना थी, तो रोबोट अक्सर वहीं जम जाते थे या वस्तु को पकड़ने की कोशिश करते थे, जिससे असुरक्षित परिणाम निकलते थे।
शायद सबसे अधिक खुलासा करने वाली बात यह थी कि रोबोट बड़े या अधिक जटिल होने पर अपनी गलतियों से सीखना नहीं जानते थे। सबसे बड़े, सबसे शक्तिशाली मॉडल छोटे मॉडलों की तुलना में महत्वपूर्ण रूप से अधिक सुरक्षित या सटीक नहीं थे। अपने सामने के विशिष्ट दृश्य का विश्लेषण करने के बजाय, प्रत्येक मॉडल का एक निश्चित व्यक्तित्व प्रतीत होता था: कुछ हमेशा भागने को प्राथमिकता देते थे, जबकि अन्य बिना यह देखे कि सही कदम क्या है, चीजों को पकड़ने की कोशिश करते थे। रोबोटों को गति का आकलन करने में भी कठिनाई हुई। वे बता सकते थे कि कुछ चल रहा है, लेकिन वे यह नहीं बता सकते थे कि वह धीरे चल रहा है या तेज़ी से, अक्सर एक धीमी गति वाले खतरे के साथ ऐसा व्यवहार करते थे जैसे कि वह कोई खतरा ही न हो। जब रोबोटों ने सही क्रिया चुनी, तो वे अक्सर उसे सही ढंग से निष्पादित करने में विफल रहे, वस्तु की ओर हाथ बढ़ाया लेकिन वहां से एक मीटर दूर रुक गए जहाँ उन्हें पहुँचना चाहिए था।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये आर्टिफिशियल इंटेलिजेंस सिस्टम दुनिया को समझने में बेहतर हो रहे हैं, लेकिन वे अचानक शारीरिक खतरों के प्रति सुरक्षित रूप से प्रतिक्रिया करने के मामले में अभी भी बहुत पीछे हैं। अनुसंधान इस बात पर प्रकाश डालता है कि केवल मॉडलों को बड़ा बनाना सुरक्षा की समस्या को हल नहीं करता है। ऐसे रोबोट बनाने के लिए जो वास्तव में हमारे घरों में रह सकें, डेवलपर्स को उन्हें यह सिखाना होगा कि वे इस पर भरोसा करें कि वे क्षण में क्या होते देख रहे हैं, न कि इस पर कि कोई वस्तु कैसी दिखती है, और उन्हें मानवीय सहज सटीकता के साथ गति और दूरी का आकलन करना सिखाना होगा। जब तक, एक ऐसी मशीन के बीच का अंतर जो गिरती हुई वस्तु का वर्णन कर सकती है और एक ऐसी मशीन जो उसे सुरक्षित रूप से पकड़ सकती है, बहुत बड़ा बना रहेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।