← नवीनतम पेपर
💻 computer science

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

यह शोध पत्र VoLo को प्रस्तुत करता है, जो एक भौतिक ऑर्केस्ट्रेशन फ्रेमवर्क है जिसमें एक VLM-आधारित एजेंट है जो रोबस्ट ओपन-वोकैबुलरी लॉन्ग-होरिज़न मैनिपुलेशन प्राप्त करने के लिए इंटरप्टिबल रोबोट टूल्स को गतिशील रूप से निर्देशित करता है, जिसे नए RoboVoLo बेंचमार्क और वास्तविक दुनिया के प्रयोगों द्वारा मान्य किया गया है।

मूल लेखक: Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रसोई की मेज साफ करना सिखाने की कोशिश कर रहे हैं। निर्देश केवल "कप उठाओ" जैसा नहीं है। यह एक जटिल वाक्य है: "मेज पर रखी हर वस्तु को कटोरे में डाल दो, सिवाय लाल ब्लॉक और टूना कैन के।"

यह अधिकांश रोबोटों के लिए एक बुरा सपना है। वे गलत चीज़ पकड़ सकते हैं, चीज़ गिरा सकते हैं, या फिसलते हुए कैन को उठाने की कोशिश में फंस सकते हैं। उनमें अक्सर रुकने, सोचने और अपनी गलतियों को वास्तविक समय (real-time) में सुधारने की क्षमता नहीं होती है।

VoLo नामक शोध पत्र इस समस्या को हल करने का एक नया तरीका पेश करता है, जिसे फिजिकल ऑर्केस्ट्रेशन (Physical Orchestration) कहा जाता है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "फ्रोजन वर्ल्ड" बनाम "मूविंग वर्ल्ड"

अधिकांश AI एजेंट (जैसे चैटबॉट्स) एक "फ्रोजन वर्ल्ड" (स्थिर दुनिया) में रहते हैं। वे एक शब्द टाइप करने से पहले जितना चाहें उतना सोच सकते हैं। जब वे सोच रहे होते हैं, तो दुनिया नहीं बदलती।

लेकिन एक वास्तविक रोबोट एक मूविंग वर्ल्ड (गतिशील दुनिया) में रहता है। यदि कोई रोबोट एक भारी प्लेट पकड़े हुए 10 सेकंड तक सोचने के लिए रुक जाता है, तो प्लेट फिसल सकती है, या प्लेट गिर सकती है। रोबोट को निर्णय लेना होगा जब दुनिया अभी भी घूम रही हो।

2. समाधान: "कंडक्टर" (VoLoAgent)

लेखकों ने VoLoAgent नामक एक प्रणाली बनाई है। इस एजेंट को एक अकेले रोबोट के मस्तिष्क के रूप में नहीं, बल्कि एक सिम्फनी कंडक्टर (संगीत निर्देशक) के रूप में समझें।

  • कंडक्टर (The VLM): यह एक स्मार्ट "मस्तिष्क" (एक विजन-लैंग्वेज मॉडल) है जो जटिल निर्देशों को समझता है। यह खुद सामान नहीं उठाता। इसके बजाय, यह संगीत की स्कोर शीट रखता है और संगीतकारों को बताता कि क्या बजाना है।
  • संगीतकार (The Tools): कंडक्टर के पास अलग-अलग "संगीतकार" (टूल्स) हैं जिन्हें वह बुला सकता है:
    • डांसर (VLA): एक रोबोट पॉलिसी जो सुचारू, निरंतर गति (जैसे नृत्य) करने में माहिर है।
    • आंखें (Perception Models): विशेष उपकरण जो यह पहचानने में माहिर हैं कि कोई वस्तु वास्तव में क्या है या वह कहाँ है (जैसे चूहे को देखते हुए बाज की नज़र)।
    • हाथ (Action Primitives): सरल, विश्वसनीय कमांड जैसे "इसे पकड़ो" या "उसे नीचे रखो।"

3. यह कैसे काम करता है: "इंटरप्टिबल" डांस (बीच में रोका जा सकने वाला नृत्य)

पुराने सिस्टमों में, एक बार जब रोबोट चलना शुरू कर देता था, तो उसे बिना रुके पूरा नृत्य समाप्त करना होता था। यदि उसने गलत वस्तु उठा ली, तो वह बस चलते रहेगा और विफल हो जाएगा।

VoLoAgent अलग है। यह "डांसर" (रोबोट की गति) को एक इंटरप्टिबल टूल (बीच में रोका जा सकने वाला उपकरण) के रूप में मानता है।

  • कंडक्टर हमेशा सुन रहा होता है। जब रोबोट चल रहा होता है, तो कंडक्टर वीडियो फीड देख रहा होता है।
  • "स्टॉप" बटन: यदि कंडक्टर देखता है कि रोबोट गलत वस्तु (जैसे नींबू के बजाय टूना कैन) की ओर बढ़ रहा है, तो वह तुरंत "पॉज" बटन दबा देता है।
  • द स्विच (बदलाव): कंडक्टर फिर कहता है, "नाचना बंद करो! चलो 'आंखों' का उपयोग करके नींबू को ढूंढते हैं, फिर 'हाथों' का उपयोग करने के लिए स्विच करते हैं, और फिर नृत्य पूरा करने के लिए 'डांसर' को वापस बुलाते हैं।"

यह एक निरंतर लूप में होता है: योजना बनाना (Plan) → कार्य करना (Act) → निगरानी करना (Monitor) → सुधारना (Fix)।

4. परीक्षण: "रोबोवोलो" (RoboVoLo) बेंचमार्क

इसे सिद्ध करने के लिए, टीम ने RoboVoLo नामक एक विशाल परीक्षण बनाया। कल्पना कीजिए कि यह एक वीडियो गेम लेवल है जिसमें 126 अलग-अलग चुनौतियाँ हैं जिनमें शामिल हैं:

  • कॉमन सेंस (सामान्य ज्ञान): यह जानना कि "टूना कैन" भारी और फिसलन भरा होता है।
  • मेमोरी (स्मृति): यह याद रखना कि आपने पहले ही नीला ब्लॉक हटा दिया है, इसलिए उसे दोबारा न हिलाएं।
  • जटिल भाषा: "बाएं से दूसरी वस्तु" या "लाल वाले को छोड़कर" जैसे निर्देशों को समझना।
  • विश्व ज्ञान (World Knowledge): यह जानना कि "नोबल गैसें" एक बिन में और "धातुएं" दूसरे बिन में जाती हैं।

5. परिणाम: कंडक्टर की जीत

जब उन्होंने इस सिस्टम का अन्य रोबोटों के साथ परीक्षण किया:

  • स्टैंडअलोन रोबोट (सोलोइस्ट): इन रोबोटों ने सब कुछ खुद करने की कोशिश की। वे अक्सर विफल रहे क्योंकि वे जटिल निर्देशों से भ्रमित हो गए या अपनी गलतियों को ठीक नहीं कर सके।
  • VoLoAgent (कंडक्टर): टूल्स के बीच स्विच करने और गलतियों को सुधारने के कारण, VoLoAgent 42% बार सफल हुआ, जबकि अगला सबसे अच्छा सिस्टम केवल 12% बार सफल हुआ।

मुख्य निष्कर्ष:
यह शोध पत्र दिखाता है कि रोबोटों को स्मार्ट बनाने का रहस्य केवल "डांसर" (रोबोटिक हाथ) को बेहतर बनाना नहीं है। यह एक स्मार्ट "कंडक्टर" होना है जो जानता है कि कब टूल्स बदलने हैं, कब रुकना है, और आपदा बनने से पहले गलतियों को कैसे सुधारना है।

उन्होंने इसे एक वास्तविक रोबोट पर भी टेस्ट किया (केवल कंप्यूटर सिमुलेशन नहीं), और यह मानक रोबोट की तुलना में तीन गुना बेहतर काम कर रहा था, जिससे सिद्ध होता है कि यह "कंडक्टर" दृष्टिकोण वास्तविक, अव्यवस्थित दुनिया में भी काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →