← नवीनतम पेपर
💻 computer science

ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models

यह शोधपत्र ForesightSafety-VLA प्रस्तुत करता है, जो एक एकीकृत नैदानिक बेंचमार्क है जो एक व्यापक 13-श्रेणी सुरक्षा वर्गीकरण और नियंत्रित भिन्नता आयामों के माध्यम से विजन-लैंग्वेज-एक्शन मॉडलों का मूल्यांकन करता है ताकि यह प्रकट किया जा सके कि एम्बॉडीड (embodied) सुरक्षा विफलताएं केवल पोस्ट-हॉक फ़िल्टरिंग द्वारा हल होने के बजाय धारणा और नियंत्रण सक्षमता से घनिष्ठ रूप से जुड़ी हुई हैं।

मूल लेखक: Mingyang Lyu, Yinqian Sun, Yiyang Jia, Sicheng Shen, Moquan Sha, Huangrui Li, Feifei Zhao, Yi Zeng

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingyang Lyu, Yinqian Sun, Yiyang Jia, Sicheng Shen, Moquan Sha, Huangrui Li, Feifei Zhao, Yi Zeng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखा रहे हैं। आप उसे कहते हैं, "मेरे लिए एक सैंडविच बनाओ।" एक स्मार्ट रोबोट ब्रेड, मीट और चाकू उठा सकता है। लेकिन यहाँ एक पेंच है: क्या उसने इसे सुरक्षित रूप से किया?

हो सकता है कि उसने ब्रेड काटते समय दूसरे हाथ में गर्म पैन पकड़ रखा हो, जिससे जलने का खतरा हो। हो सकता है कि उसने चाकू को इतनी बेरहमी से घुमाया हो कि वह आपको चोट पहुँचा सकता था। या शायद उसने आपके शब्दों का गलत मतलब निकाला और सैंडविच के बजाय प्लेट खाने की कोशिश की।

वर्तमान रोबोट दिमाग (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल कहा जाता है) निर्देशों का पालन करने और अपने हाथों को चलाने में बहुत अच्छे हो रहे हैं। लेकिन वास्तव में किसी ने यह नहीं बनाया है कि यह देखने के लिए "ड्राइविंग टेस्ट" क्या है कि क्या वे ऐसा कर सकते हैं बिना खुद को, आपको, या फर्नीचर को नुकसान पहुँचाए।

यह पेपर ForesightSafety-VLA पेश करता है, जो रोबोट के लिए एक नया "सेफ्टी ड्राइविंग टेस्ट" है। यह कैसे काम करता है, यहाँ सरल विचारों में दिया गया है:

1. "सेफ्टी टैक्सोनॉमी" (सुरक्षा वर्गीकरण): तीन तरीके जिनसे रोबोट गलती कर सकते हैं

लेखकों ने महसूस किया कि रोबोट तीन विशिष्ट तरीकों से विफल हो सकते हैं, इसलिए उन्होंने 13 अलग-अलग "खतरे वाले क्षेत्रों" के साथ एक चेकलिस्ट बनाई:

  • Safe-Core (भौतिक शरीर): यह रोबोट के शरीर और उन वस्तुओं के बारे में है जिन्हें वह छूता है।
    • उपमा: कल्पना कीजिए कि एक रोबोट का हाथ एक मानव हाथ की तरह है। Safe-Core जाँचता है: क्या आपने अंडे को बहुत ज़ोर से दबाया? क्या आपने चालू होने पर चूल्हे को छुआ? क्या आप मेज के किनारे से टकरा गए?
  • Safe-Lang (निर्देश): यह उस बारे में है जो आप रोबोट को बताते हैं।
    • उपमा: यदि आप कहते हैं, "गर्म कॉफी फेंक दो," तो रोबोट वास्तव में ऐसा कर सकता है। या यदि आप कुछ भ्रमित करने वाला कहते जैसे "कप को मेज पर रखो... या शायद फर्श पर?", तो रोबोट भ्रमित हो सकता है और उसे गिरा सकता है। यह जाँचता है कि क्या रोबोट को खराब या चालाकी भरे शब्दों से मूर्ख बनाया जा सकता है।
  • Safe-Vis (आँखें): यह इस बारे में है कि रोबोट क्या देखता है।
    • उपमा: यदि लाइट चली जाए, या यदि कोई खतरनाक वस्तु को छिपाने के लिए उस पर स्टिकर लगा दे, तो क्या रोबोट अभी भी खतरे को देख सकता है? यह जाँचता है कि क्या रोबोट खराब रोशनी या विजुअल ट्रिक्स के कारण खतरों के प्रति "अंधा" हो जाता है।

2. टेस्ट ट्रैक: "छिपे हुए जाल" के साथ 66 परिदृश्य

शोधकर्ताओं ने केवल एक साधारण किचन नहीं बनाया। उन्होंने कंप्यूटर सिमुलेशन (जिसे RoboTwin कहा जाता है) में 66 अलग-अलग परिदृश्य बनाए।

  • सेटअप: उन्होंने सामान्य कार्यों (जैसे कप को हिलाना) को लिया और गुप्त रूप से उनमें "जाल" जोड़ दिए।
  • जाल: उन्होंने गर्म सतहें, नाजुक वस्तुएं, संकीर्ण स्थान या भ्रमित करने वाले निर्देश जोड़े।
  • ट्विस्ट: उन्होंने केवल एक बार रोबोट का परीक्षण नहीं किया। उन्होंने इसे तीन अलग-अलग "स्ट्रेसर्स" (तनाव कारकों) के तहत टेस्ट किया:
    1. कमरे को बदलना (संरचना): फर्नीचर को हटाना या जगह को तंग बनाना।
    2. शब्दों को बदलना (भाषा): रोबोट से अलग-अलग तरीकों से पूछना, या चालाकी भरे शब्दों का उपयोग करना।
    3. नज़ारे को बदलना (दृष्टि): कमरे को अंधेरा, धुंधला या विजुअल नॉइज़ वाला बनाना।

3. स्कोरकार्ड: यह सिर्फ "पास या फेल" नहीं है

अतीत में, रोबोट का परीक्षण सरल था: "क्या उसने कार्य पूरा किया? हाँ/नहीं।"
यह पेपर कहता है कि यह पर्याप्त नहीं है। एक रोबोट कार्य पूरा करके "पास" हो सकता है, लेकिन कार्य करते समय घर को लगभग जला ही डाला हो।

इसलिए, उन्होंने दो मुख्य विचारों के साथ एक नया स्कोरकार्ड बनाया:

  • चार चतुर्थांश (Four Quadrants): वे हर प्रयास को चार बॉक्सों में वर्गीकृत करते हैं:

    1. Safe Success (सुरक्षित सफलता): कार्य को सुरक्षित रूप से पूरा किया। (लक्ष्य!)
    2. Unsafe Success (असुरक्षित सफलता): कार्य पूरा किया, लेकिन दुर्घटना होते-होते बची। (यह "भाग्यशाली लेकिन खतरनाक" वाला बॉक्स है)।
    3. Safe Failure (सुरक्षित विफलता): कार्य पूरा नहीं किया, लेकिन कुछ नुकसान नहीं पहुँचाया। (अगले वाले से बेहतर है)।
    4. Unsafe Failure (असुरक्षित विफलता): कार्य पूरा नहीं किया और साथ ही गंदगी या खतरा पैदा किया। (सबसे बुरा परिणाम)।
  • "रिस्क एक्सपोज़र" मीटर:

    • कल्पना कीजिए कि एक रोबोट कार चला रहा है।
    • रोबोट A सीधे खाई के किनारे तक जाता है, रुकता है, फिर मुड़ता है। वह गिरा नहीं, लेकिन यह डरावना था।
    • रोबोट B खाई से दूर चलता है।
    • दोनों ने न गिरने के परीक्षण में "पास" किया। लेकिन ForesightSafety-VLA रोबोट A को कम अंक देता है क्योंकि उसने बहुत अधिक समय खतरे के पास बिताया। वे Cumulative Safety Cost (कितना जोखिम लिया गया) और Risk Exposure Time (रोबोट कितनी देर तक खतरे के करीब रहा) को मापते हैं।

4. उन्होंने क्या पाया (परिणाम)

उन्होंने आज के सबसे स्मार्ट रोबोट दिमागों का परीक्षण किया। यहाँ क्या हुआ:

  • कोई भी परफेक्ट नहीं है: यहाँ तक कि "सबसे अच्छे" रोबोट दिमागों ने भी गलतियाँ कीं। उन सभी में कुछ "Unsafe Successes" (उन्होंने कार्य पूरा किया लेकिन जोखिम लिया) थे।
  • स्मार्ट होना हमेशा सुरक्षित होना नहीं है (उस तरीके से जिसे आप सोचते हैं): मजबूत मॉडल आम तौर पर कमजोर मॉडलों की तुलना में सुरक्षित थे, लेकिन वे पूरी तरह से सुरक्षित नहीं थे।
  • असली खतरा: रोबोट सबसे अधिक तब संघर्ष करते थे जब भौतिक कमरा बदल जाता था (जैसे फर्नीचर को हटाना) या जब उनकी दृष्टि धुंधली हो जाती थी।
    • आश्चर्य: शब्दों को बदलना (भाषा) उनके लिए सबसे आसान चीज़ थी, जब तक कि शब्द विशेष रूप से उन्हें धोखा देने के लिए डिज़ाइन नहीं किए गए हों (एडवर्सरियल अटैक्स)।
  • "किस्मत" की समस्या: कई रोबोट "किस्मत" के सहारे सफल हुए—जैसे गर्म चूल्हे या नाजुक फूलदान के बिल्कुल बगल से निकल जाना। नए टेस्ट ने इस व्यवहार को पकड़ा और इसे जोखिम भरा माना, जबकि पुराने टेस्ट केवल यही कहते कि "अच्छा काम किया!"

निचोड़

यह पेपर तर्क देता है कि हम केवल अंत में एक "सेफ्टी फ़िल्टर" जोड़कर रोबोट को सुरक्षित नहीं बना सकते। सुरक्षा को शुरुआत से ही रोबोट के दिमाग में बनाया जाना चाहिए।

यदि कोई रोबोट वास्तविक दुनिया में सुरक्षित रहने वाला है, तो उसे खतरों को देखने, भौतिक स्थान को समझने और अपनी गतिविधियों को सावधानी से नियंत्रित करने में कुशल होना चाहिए—न कि केवल आदेशों का पालन करने में। यह नया बेंचमार्क यह पता लगाने का एक उपकरण है कि हमें उन्हें हमारे घरों में छोड़ने से पहले वे कहाँ बहुत लापरवाह हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →