← नवीनतम पेपर
💻 computer science

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

VASO एक नवीन ढांचा है जो औपचारिक सत्यापन (formal verification) के माध्यम से LLM-जनित रोबोट कौशल अनुबंधों के स्व-विकास को सक्षम बनाता है, जो फाउंडेशन मॉडल के भार (weights) को संशोधित किए बिना, काउंटरएग्ज़ाम्पल्स (counterexamples) का उपयोग करके टेम्पोरल सुरक्षा विशिष्टताओं (temporal safety specifications) के विरुद्ध पुन: प्रयोज्य कौशलों को पुनरावृत्ति से परिष्कृत करता है, जिससे न्यूनतम अनुकूलन नमूनों (optimization samples) के साथ भौतिक एजेंटों पर उच्च अनुपालन प्राप्त होता है।

मूल लेखक: Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र VASO की व्याख्या दी गई है।

बड़ी समस्या: "स्मार्ट" रोबोट जिन पर भरोसा नहीं किया जा सकता

कल्पना कीजिए कि आपने एक बहुत ही प्रतिभाशाली, रचनात्मक शेफ (AI) को रोबोटिक किचन के लिए रेसिपी (कौशल/skills) लिखने के लिए काम पर रखा है। वह शेफ कुछ ही सेकंडों में "सैंडविच बनाएं" या "बिल्ली से बचें" जैसी रेसिपी लिख सकता है।

हालाँकि, एक पेंच है: सिर्फ इसलिए कि रेसिपी अंग्रेजी में सुनने में अच्छी लग रही है, इसका मतलब यह नहीं है कि रोबोट घर को जलाकर राख नहीं कर देगा।

वर्तमान तरीके इसे ठीक करने की कोशिश करते हैं जिसमें रोबोट को रेसिपी आज़माने दिया जाता है, यह देखने के लिए कि क्या वह विफल होती है, और फिर शेफ को इसे फिर से लिखने के लिए कहा जाता है। यह सूप चखने और यह कहने जैसा है, "यह बहुत नमकीन है, फिर से कोशिश करो।" लेकिन यह आपको केवल यह बताता है कि इस एक बार सूप नमकीन था। यह इस बात का प्रमाण नहीं देता कि रेसिपी हर संभावित स्थिति (जैसे यदि चूल्हा बहुत गर्म हो जाए, या यदि बिल्ली काउंटर पर कूद जाए) के लिए सुरक्षित है।

समाधान: VASO (द "मैथमैटिकल एडिटर")

लेखक VASO पेश करते हैं, जो इन रोबोटिक रेसिपीज़ के लिए एक सख्त, गणितीय संपादक (mathematical editor) की तरह कार्य करता है। केवल सूप चखने के बजाय, VASO रेसिपी की जांच अटूट सुरक्षा नियमों (जैसे "आग को कभी न छुएं" या "यदि कोई व्यक्ति पास हो तो हमेशा रुकें") के विरुद्ध करता है।

यहाँ बताया गया है कि VASO कैसे काम करता है, चरण-दर-चरण:

1. "अनुवादक" (The Bridge)

रोबोट "कोड" बोलते हैं (बाएं मुड़ें, रुकें, गति बढ़ाएं), लेकिन सुरक्षा नियम "लॉजिक" (यदि व्यक्ति दिखाई दे, तो रुकें) में लिखे जाते हैं।

  • उपमा: कल्पना कीजिए कि रोबोट एक विदेशी है जो केवल "रोबोट भाषा" बोलता है, और सुरक्षा निरीक्षक केवल "लॉजिक" बोलता है।
  • VASO क्या करता है: यह एक अनुवादक (जिसे लेबलिंग फंक्शन कहा जाता है) बनाता है जो रोबोट की गतिविधियों को तुरंत तार्किक कथनों (logical statements) में बदल देता है। इससे सुरक्षा निरीक्षक यह समझ पाता है कि रोबोट वास्तव में क्या कर रहा है।

2. "गणितीय जाँच" (Formal Verification)

रोबोट द्वारा रेसिपी आज़माने से पहले ही, VASO एक गणितीय सिमुलेशन चलाता है।

  • उपमा: इसे एक पायलट के लिए फ्लाइट सिम्युलेटर की तरह समझें। विमान के उड़ान भरने से पहले, सिम्युलेटर लाखों परिदृश्यों को चलाकर देखता है कि कहीं उड़ान की योजना पहाड़ से तो नहीं टकरा रही है।
  • VASO क्या करता है: यह जाँचता है कि क्या रेसिपी कभी सुरक्षा नियमों को तोड़ सकती है। यदि गणित कहता है "हाँ, यह रेसिपी क्रैश हो सकती है," तो यह केवल "विफल" (Fail) नहीं कहता। यह उस सटीक क्षण को ढूंढ निकालता है जब क्रैश होता है (इसे "काउंटर-एग्जांपल" कहते हैं)।

3. "टेक्स्ट ग्रेडिएंट" (The Feedback Loop)

यही सबसे जादुई हिस्सा है। आमतौर पर, जब गणितीय जाँच विफल होती है, तो आपको पूरा कोड फिर से लिखना पड़ता है। VASO अधिक स्मार्ट है।

  • उपमा: कल्पना कीजिए कि गणितीय जाँच शेफ को एक नोट भेजती है कि: "आपकी रेसिपी कहती है 'आगे बढ़ें' भले ही वहां एक व्यक्ति मौजूद हो। उस लाइन को बदलकर 'रुकें' कर दें।"
  • VASO क्या करता है: यह गणितीय विफलता को एक टेक्स्ट निर्देश (एक "टेक्स्टुअल ग्रेडिएंट") में बदल देता है। यह AI शेफ को ठीक वही बताता है कि त्रुटि को ठीक करने के लिए उसे रेसिपी को कैसे फिर से लिखना चाहिए।
  • महत्वपूर्ण विवरण: AI शेफ का दिमाग (अंतर्निहित मॉडल) स्थिर (frozen) रहता है। हम शेफ को फिर से प्रशिक्षित नहीं कर रहे हैं; हम केवल उनके द्वारा लिखी गई विशिष्ट रेसिपी कार्ड को संपादित कर रहे हैं।

यह एक बड़ी बात क्यों है

शोध पत्र ने इसे दो वास्तविक रोबोटों पर टेस्ट किया: एक ग्राउंड रोबोट (जैसे कि एक उन्नत रूमबा) और एक ड्रोन

  • परिणाम: VASO ने 100 से भी कम प्रयासों में रोबोटों को 97.2% समय सुरक्षा नियमों का पालन करने के लिए प्रेरित किया।
  • तुलना: अन्य तरीके (जैसे केवल AI को फिर से प्रयास करने के लिए कहना, या AI के दिमाग को फिर से प्रशिक्षित करना) या तो कम सुरक्षित थे या उनमें बहुत अधिक समय और कंप्यूटिंग पावर लगी।

"स्व-विकसित" (Self-Evolving) वाला हिस्सा

शोध पत्र इसे "सेल्फ-इवॉल्विंग स्किल्स" कहता है।

  • पुराना तरीका: आप एक रोबोट को लाखों उदाहरणों पर प्रशिक्षित करते हैं, और वह क्या करना है इसकी एक सामान्य "समझ" सीख लेता है।
  • VASO का तरीका: आप रोबोट को एक विशिष्ट कौशल (जैसे "ड्राइव") देते हैं, गणित के साथ उसकी जाँच करते हैं, कमी पाते हैं, और कौशल की परिभाषा को अपडेट करते हैं। अब, वही कौशल भविष्य के हर कार्य के लिए बेहतर है। यह एक कार इंजन के ब्लूप्रिंट को अपग्रेड करने जैसा है ताकि उस ब्लूप्रिंट से बनी हर कार सुरक्षित हो, न कि केवल एक विशिष्ट कार को ठीक करना।

एक वाक्य में सारांश

VASO एक ऐसी प्रणाली है जो रोबोटिक निर्देशों में खामियों को खोजने के लिए गणितीय प्रमाण का उपयोग करती है, उन खामियों को सरल टेक्स्ट फीडबैक में बदलती है, और स्वचालित रूप से रोबोट की "स्किल रेसिपी" को फिर से लिखती है ताकि वह पूरी तरह सुरक्षित हो सके, बिना AI के दिमाग को फिर से प्रशिक्षित किए।

शोध पत्र क्या दावा नहीं करता है

  • यह दावा नहीं करता कि यह अभी चिकित्सा सर्जरी या जीवन-मरण के निर्णयों के लिए काम करता है (इसे नेविगेशन और ड्रोन पर टेस्ट किया गया था)।
  • यह दावा नहीं करता कि रोबोट "चेतन" है या सुरक्षा को "समझता" है; यह केवल गणितीय रूप से सत्यापित नियमों का पालन करता है।
  • यह दावा नहीं करता कि यह हर संभव रोबोट परिदृश्य के लिए तुरंत काम करता है; यह "अनुवादक" (लेबलिंग फंक्शन) के सही ढंग से लिखे जाने पर निर्भर करता है। यदि अनुवादक गलती करता है, तो गणितीय जाँच गलत सुरक्षा का अहसास दे सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →