← नवीनतम पेपर
🤖 AI

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph एक नवीन ढांचा है जो विजन-लैंग्वेज मॉडल्स को सीन ग्राफ-आधारित सत्यापन के साथ एकीकृत करता है ताकि रोबोटिक एक्शन अनुक्रमों को पुनरावृत्ति से परिष्कृत और मान्य किया जा सके, जो बेसलाइन विधियों की तुलना में विविध मैनिपुलेशन परिदृश्यों में कार्य पूर्णता दरों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट को एक बिखरी हुई रसोई साफ करना सिखाने की कोशिश कर रहे हैं। आप उसे एक सरल निर्देश देते हैं: "टमाटर के डिब्बे को बीन्स के डिब्बे पर रख दो और सेब को कटोरे में डाल दो।"

यदि आप एक मानक AI रोबोट से यह करने के लिए कहते हैं, तो वह तस्वीर को देख सकता है, अनुमान लगा सकता है कि क्या करना है और सेब को पकड़ने की कोशिश कर सकता है। लेकिन अगर सेब एक प्लेट के ऊपर रखा है जो वर्तमान में एक जार के ऊपर है, तो रोबोट पहले जार को पकड़ने की कोशिश कर सकता है, जिससे प्लेट टूट सकती है और सेब लुढ़क कर दूर जा सकता है। यह बिल्कुल वैसा ही है जैसे किताबों के ढेर को उठाने की कोशिश करना बिना यह जाने कि ऊपर वाली किताब ढीली है; आप पूरे ढेर को गिरा देते हैं।

VeriGraph एक नया सिस्टम है जिसे इन दुर्घटनाओं को होने से पहले ही रोकने के लिए बनाया गया है। इसे एक रोबोट को कुछ भी छूने से पहले एक मानसिक ब्लूप्रिंट (mental blueprint) और एक सख्त सुरक्षा निरीक्षक (safety inspector) देने के रूप में समझें।

यह कैसे काम करता है, यहाँ इसके सरल चरण दिए गए हैं:

1. "मानसिक ब्लूप्रिंट" (सीन ग्राफ - Scene Graph)

रोबोट केवल रसोई की एक धुंधली फोटो देखने के बजाय, छवि को तथ्यों की एक व्यवस्थित सूची में बदल देता है, जैसे कि वस्तुओं का एक सोशल नेटवर्क।

  • उपमा: कल्पना कीजिए कि रोबोट केवल "एक लाल डिब्बा" नहीं देखता। वह एक कार्ड देखता है जिस पर लिखा है: "टमाटर का डिब्बा, बीन्स के डिब्बे के ऊपर है।" दूसरा कार्ड कहता है: "कटोरा, प्लेट के ऊपर है।"
  • इस सूची को सीन ग्राफ (Scene Graph) कहा जाता है। यह भ्रमित करने वाले विवरणों (जैसे मेज़पोश का रंग) को हटा देता है और केवल उन संबंधों पर ध्यान केंद्रित करता है जो महत्वपूर्ण हैं: कौन किससे छू रहा है?

2. "आर्किटेक्ट" (द प्लानर - The Planner)

एक बार जब रोबोट के पास तथ्यों की यह सूची आ जाती है, तो वह एक सुपर-स्मार्ट AI (आर्किटेक्ट) से काम करने की सूची लिखवाता है।

  • उपमा: आर्किटेक्ट कहता है, "ठीक है, टमाटर के डिब्बे को हिलाने के लिए, मुझे पहले बीन्स के डिब्बे को रास्ते से हटाना होगा।"
  • VeriGraph के बिना, आर्किटेक्ट केवल क्रम का अनुमान लगा सकता है। VeriGraph के साथ, आर्किटेक्ट को यह देखने के लिए मजबूर किया जाता है कि भौतिक रूप से क्या संभव है, इसके लिए "मानसिक ब्लूप्रिंट" को देखना पड़ता है।

3. "सुरक्षा निरीक्षक" (द वेरीफायर - The Verifier)

यही सबसे जादुई हिस्सा है। रोबोट के अपने हाथ चलाने से पहले, VeriGraph एक सख्त सुरक्षा निरीक्षक की तरह कार्य करता है।

  • उपमा: कल्पना कीजिए कि आर्किटेक्ट एक योजना लिखता है: "कटोरे को उठाओ।"
  • सुरक्षा निरीक्षक मानसिक ब्लूप्रिंट को देखता है और चिल्लाता है: "रुको! तुम अभी कटोरा नहीं उठा सकते! इसके ऊपर एक प्लेट रखी है!"
  • निरीक्षक फिर योजना को आर्किटेक्ट के पास वापस भेजता है और कहता है, "इसे ठीक करो। तुम्हें पहले प्लेट को हटाना होगा।"
  • आर्किटेक्ट योजना को फिर से लिखता है, निरीक्षक उसे फिर से जांचता है, और उसके बाद ही रोबोट को हिलने की अनुमति दी जाती है।

4. "सुधार का चक्र" (The Loop of Correction)

यदि रोबोट कुछ करने की कोशिश करता है और निरीक्षक एक गलती पकड़ लेता है, तो सिस्टम केवल हार नहीं मानता। यह वापस जाता है, योजना को ठीक करता है, और फिर से प्रयास करता है।

  • उपमा: यह एक वीडियो गेम खेलने जैसा है जहाँ आप मर नहीं सकते। यदि आप किसी खाई से कूदने की कोशिश करते हैं, तो गेम रुक जाता है, आपको बताता है "यह एक बुरा विचार है," और आपको एक अलग रास्ता आज़माने देता है। आप तब तक प्रयास करते रहते हैं जब तक कि आपको सुरक्षित रास्ता न मिल जाए।

यह एक बड़ी बात क्यों है?

पिछले रोबोट प्लानर्स स्वप्नद्रष्टा (dreamers) की तरह थे: उनके पास बेहतरीन विचार थे लेकिन वे अक्सर भौतिक विज्ञान के नियमों (जैसे गुरुत्वाकर्षण या स्टैकिंग) को भूल जाते थे। वे एक भारी फूलदान के नीचे दबी हुई किताब को उठाने की कोशिश करते थे, जिससे सब गड़बड़ हो जाता था।

VeriGraph एक व्यावहारिक इंजीनियर (pragmatic engineer) की तरह है:

  1. यह दुनिया का एक स्पष्ट नक्शा बनाता है (सीन ग्राफ)।
  2. यह हर कदम की उस नक्शे के साथ जाँच करता है।
  3. यह बिना किसी इंसान के चिल्लाए अपनी गलतियों को स्वचालित रूप से ठीक करता है।

परिणाम

परीक्षणों में, यह सिस्टम पिछले तरीकों की तुलना में निर्देशों का पालन करने में 58% बेहतर था। चाहे रोबोट को पहेली के टुकड़े (Tangrams) व्यवस्थित करने, ब्लॉक रखने, या रसोई को व्यवस्थित करने के लिए कहा गया हो, VeriGraph ने शायद ही कभी वे "भौतिकी-तोड़ने वाली" गलतियाँ कीं जो अन्य रोबोट करते थे।

संक्षेप में: VeriGraph रोबोट को एक "चेकलिस्ट" और एक "सुरक्षा जाल" देता है, यह सुनिश्चित करता है कि वे कुछ भी हिलाने से पहले समझते हैं कि चीजें आपस में कैसे जुड़ी हुई हैं। यह एक अनाड़ी अंदाजे लगाने वाले को एक सावधान, भरोसेमंद सहायक में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →