OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
यह शोध पत्र OneTwoVLA को प्रस्तुत करता है, जो एक एकीकृत विजन-लैंग्वेज-एक्शन मॉडल है जो स्पष्ट तर्क (explicit reasoning) और प्रत्यक्ष क्रिया पीढ़ी (direct action generation) के बीच अनुकूल रूप से स्विच करता है, जिसे लंबी अवधि की योजना (long-horizon planning), त्रुटि सुधार (error recovery) और जटिल दक्ष हेरफेर (complex dexterous manipulation) कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए एक स्केलेबल डेटा सिंथेसिस पाइपलाइन द्वारा उन्नत किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल व्यंजन बनाना सिखा रहे हैं, जैसे कि हॉटपॉट या कॉकटेल।
अतीत में, हमने रोबोट को सिखाने के लिए एक "दो-सिर वाला" (Two-Headed) दृष्टिकोण अपनाया था:
- मस्तिष्क (सिस्टम टू - System Two): एक सुपर-स्मार्ट AI जो रेसिपी पढ़ता है और चरणों की योजना बनाता है। वह सोचता है, "पहले, प्याज काटें। फिर, पानी उबालें।"
- हाथ (सिस्टम वन - System One): एक रोबोटिक हाथ जो बस आदेशों का पालन करता है। उसे यह नहीं पता कि वह क्या कर रहा है; वह बस तब चलता है जब उसे बताया जाता है।
समस्या: यह सेटअप बहुत बोझिल है। मस्तिष्क कह सकता है, "नीला कप उठाओ," लेकिन हाथों को पता भी नहीं होगा कि कौन सा कप नीला है, या यदि कप गिर जाता है तो मस्तिष्क बहुत धीमा हो सकता है। वे दो ऐसे लोगों की तरह हैं जो कार चलाने की कोशिश कर रहे हैं जहाँ एक नक्शा देख रहा है और दूसरा स्टीयरिंग व्हील पकड़े हुए है, लेकिन वे वास्तविक समय (real-time) में एक-दूसरे से बात नहीं कर सकते।
पेश है OneTwoVLA: "काम करते हुए सोचने वाला" रोबोट
यह पेपर OneTwoVLA को पेश करता है, जो एक एकल रोबोट मॉडल है जो मस्तिष्क और हाथों को एक एकीकृत मन (unified mind) में मिला देता है। इसे दो अलग-अलग लोगों के रूप में नहीं, बल्कि एक ही व्यक्ति के रूप में सोचें जो तुरंत "ऑटोपायलट" और "गहन सोच" के बीच स्विच कर सकता है।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. अनुकूलन योग्य स्विच (एक "ट्रैफिक लाइट" प्रणाली)
अधिकांश रोबोट या तो हमेशा सोचते रहते हैं (जिससे वे धीमे हो जाते हैं) या कभी नहीं सोचते (जिससे वे अनाड़ी बन जाते हैं)। OneTwoVLA स्मार्ट है कि उसे कब रुकना है और सोचना है।
- ड्राइविंग मोड (कार्य करना): जब रोबोट कोई नियमित काम कर रहा होता है, जैसे कि गिलास में जूस डालना, तो वह "ड्राइविंग मोड" में रहता है। वह तेजी से और सहजता से चलता है, ठीक वैसे ही जैसे आप बिना हर कदम के बारे में सोचे एक परिचित गलियारे में चलते हैं।
- सोचने का मोड (तर्क करना): लेकिन जैसे ही कुछ पेचीदा होता है—जैसे कि जूस का गिलास फिसलन भरा हो, या रोबोट को यह तय करने की आवश्यकता हो कि कौन सा जूस डालना है—यह तुरंत "सोचने के मोड" में स्विच हो जाता है। यह एक पल के लिए रुकता है, खुद से कहता है, "रुको, गिलास झुका हुआ है। मुझे अपनी पकड़ को एडजस्ट करने की जरूरत है," या "इंसान ने लेमन वोडका मांगा है, ऑरेंज नहीं। मुझे बोतल बदलनी होगी।"
यह एक कुशल शेफ की तरह है जो सब्जियां अपने आप काटता है (कार्य करना) लेकिन जब स्वाद सही नहीं होता, तो वह सॉस को चखने और मसाले को एडजस्ट करने के लिए रुक जाता है (तर्क करना)।
2. "ट्रेनिंग कैंप" (सिंथेटिक डेटा)
इस रोबोट को इतना स्मार्ट बनाने के लिए, शोधकर्ताओं ने केवल रोबोट के काम करने के वीडियो नहीं दिखाए। उन्होंने एक आभासी प्रशिक्षण शिविर (virtual training camp) बनाया।
कल्पना कीजिए कि आप एक रोबोट को रसोई में 10,000 अलग-अलग वस्तुओं को पहचानना सिखाना चाहते हैं। एक वास्तविक रोबोट को यह करते हुए फिल्माना वर्षों का समय लेगा और बहुत महंगा होगा। इसके बजाय, शोधकर्ताओं ने AI का उपयोग करके मेजों पर यादृच्छिक वस्तुओं (जैसे कि एक "आभासी रसोई") के साथ नकली लेकिन वास्तविक दिखने वाली छवियां बनाईं। फिर उन्होंने एक अन्य AI का उपयोग इन नकली दृश्यों के लिए "विचार" लिखने के लिए किया, जिससे रोबोट को उन चीजों के बारे में तर्क करना सिखाया गया जिन्हें उसने वास्तव में कभी छुआ भी नहीं है।
- वास्तविक रोबोट डेटा: रोबोट भौतिक रूप से हिलने-डुलने का अनुभव सीखता है।
- सिंथेटिक डेटा: रोबोट दुनिया का तर्क (logic) सीखता है (जैसे, "यदि मुझे ठंडा पेय चाहिए, तो मुझे फ्रिज में देखना चाहिए")।
इन दोनों को मिलाकर, रोबोट एक "जनरलिस्ट" बन जाता है—वह उन कार्यों को संभाल सकता है जो उसने पहले कभी नहीं देखे हैं, जैसे कि एक अव्यवस्थित कमरे में विशिष्ट उपकरण खोजना या किसी इंसान की अस्पष्ट मांग को समझना ("मुझे प्यास लगी है, मेरे लिए कुछ स्वस्थ बनाओ")।
3. वास्तविक दुनिया की महाशक्तियाँ
पेपर दिखाता है कि OneTwoVLA चार विशिष्ट चीजों में बहुत बेहतर है:
- दीर्घकालिक योजना (Long-Term Planning): यह पांच चरणों वाला कॉकटेल बना सकता है बिना यह भूले कि पहला चरण क्या था। यह अपने दिमाग में एक "मानसिक चेकलिस्ट" रखता है।
- गलतियों से उबरना (Recovering from Mistakes): यदि यह चम्मच गिरा देता है, तो यह बस चलते रहना जारी नहीं रखता। यह रुकता है, महसूस करता है, "ओह नहीं, मैंने इसे गिरा दिया," और इसे फिर से उठाने का तरीका खोज लेता है।
- इंसानों से बात करना (Talking to Humans): यदि आप कहते हैं, "रुको, मुझे ऑरेंज जूस नहीं चाहिए," तो रोबोट तुरंत समझ जाता है, अपना वर्तमान कार्य रोकता है, और पूछता है, "ठीक है, आपको कौन सा फ्लेवर चाहिए?" बजाय इसके कि वह गलत चीज डालना जारी रखे।
- छिपी हुई वस्तुओं को खोजना (Finding Hidden Objects): यदि आप "वह चीज़ जिससे बोतलें खोली जाती हैं" मांगते हैं और वहां मेज पर कई वस्तुएं हैं, तो यह आकार और उद्देश्य के आधार पर यह पता लगा सकता है कि बोतल ओपनर कौन सा है, भले ही इसने पहले कभी वह विशिष्ट बोतल ओपनर न देखा हो।
निष्कर्ष
OneTwoVLA एक बड़ी सफलता है क्योंकि यह "सोचने" और "करने" को अलग-अलग काम के रूप में मानना बंद कर देता है। यह एक ऐसा रोबोट बनाता है जो तेजी से चलने के लिए पर्याप्त फुर्तीला है लेकिन जब चीजें जटिल हो जाती हैं, तो सोचने के लिए पर्याप्त बुद्धिमान भी है। यह एक ऐसे रोबोट के बीच का अंतर है जो केवल एक स्क्रिप्ट का अंधाधुंध पालन करता है और एक ऐसे रोबोट के बीच का अंतर है जो वास्तव में समझता है कि वह क्या कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।