← नवीनतम पेपर
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

यह शोध पत्र OneTwoVLA को प्रस्तुत करता है, जो एक एकीकृत विजन-लैंग्वेज-एक्शन मॉडल है जो स्पष्ट तर्क (explicit reasoning) और प्रत्यक्ष क्रिया पीढ़ी (direct action generation) के बीच अनुकूल रूप से स्विच करता है, जिसे लंबी अवधि की योजना (long-horizon planning), त्रुटि सुधार (error recovery) और जटिल दक्ष हेरफेर (complex dexterous manipulation) कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए एक स्केलेबल डेटा सिंथेसिस पाइपलाइन द्वारा उन्नत किया गया है।

मूल लेखक: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल व्यंजन बनाना सिखा रहे हैं, जैसे कि हॉटपॉट या कॉकटेल।

अतीत में, हमने रोबोट को सिखाने के लिए एक "दो-सिर वाला" (Two-Headed) दृष्टिकोण अपनाया था:

  1. मस्तिष्क (सिस्टम टू - System Two): एक सुपर-स्मार्ट AI जो रेसिपी पढ़ता है और चरणों की योजना बनाता है। वह सोचता है, "पहले, प्याज काटें। फिर, पानी उबालें।"
  2. हाथ (सिस्टम वन - System One): एक रोबोटिक हाथ जो बस आदेशों का पालन करता है। उसे यह नहीं पता कि वह क्या कर रहा है; वह बस तब चलता है जब उसे बताया जाता है।

समस्या: यह सेटअप बहुत बोझिल है। मस्तिष्क कह सकता है, "नीला कप उठाओ," लेकिन हाथों को पता भी नहीं होगा कि कौन सा कप नीला है, या यदि कप गिर जाता है तो मस्तिष्क बहुत धीमा हो सकता है। वे दो ऐसे लोगों की तरह हैं जो कार चलाने की कोशिश कर रहे हैं जहाँ एक नक्शा देख रहा है और दूसरा स्टीयरिंग व्हील पकड़े हुए है, लेकिन वे वास्तविक समय (real-time) में एक-दूसरे से बात नहीं कर सकते।

पेश है OneTwoVLA: "काम करते हुए सोचने वाला" रोबोट

यह पेपर OneTwoVLA को पेश करता है, जो एक एकल रोबोट मॉडल है जो मस्तिष्क और हाथों को एक एकीकृत मन (unified mind) में मिला देता है। इसे दो अलग-अलग लोगों के रूप में नहीं, बल्कि एक ही व्यक्ति के रूप में सोचें जो तुरंत "ऑटोपायलट" और "गहन सोच" के बीच स्विच कर सकता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. अनुकूलन योग्य स्विच (एक "ट्रैफिक लाइट" प्रणाली)

अधिकांश रोबोट या तो हमेशा सोचते रहते हैं (जिससे वे धीमे हो जाते हैं) या कभी नहीं सोचते (जिससे वे अनाड़ी बन जाते हैं)। OneTwoVLA स्मार्ट है कि उसे कब रुकना है और सोचना है।

  • ड्राइविंग मोड (कार्य करना): जब रोबोट कोई नियमित काम कर रहा होता है, जैसे कि गिलास में जूस डालना, तो वह "ड्राइविंग मोड" में रहता है। वह तेजी से और सहजता से चलता है, ठीक वैसे ही जैसे आप बिना हर कदम के बारे में सोचे एक परिचित गलियारे में चलते हैं।
  • सोचने का मोड (तर्क करना): लेकिन जैसे ही कुछ पेचीदा होता है—जैसे कि जूस का गिलास फिसलन भरा हो, या रोबोट को यह तय करने की आवश्यकता हो कि कौन सा जूस डालना है—यह तुरंत "सोचने के मोड" में स्विच हो जाता है। यह एक पल के लिए रुकता है, खुद से कहता है, "रुको, गिलास झुका हुआ है। मुझे अपनी पकड़ को एडजस्ट करने की जरूरत है," या "इंसान ने लेमन वोडका मांगा है, ऑरेंज नहीं। मुझे बोतल बदलनी होगी।"

यह एक कुशल शेफ की तरह है जो सब्जियां अपने आप काटता है (कार्य करना) लेकिन जब स्वाद सही नहीं होता, तो वह सॉस को चखने और मसाले को एडजस्ट करने के लिए रुक जाता है (तर्क करना)।

2. "ट्रेनिंग कैंप" (सिंथेटिक डेटा)

इस रोबोट को इतना स्मार्ट बनाने के लिए, शोधकर्ताओं ने केवल रोबोट के काम करने के वीडियो नहीं दिखाए। उन्होंने एक आभासी प्रशिक्षण शिविर (virtual training camp) बनाया।

कल्पना कीजिए कि आप एक रोबोट को रसोई में 10,000 अलग-अलग वस्तुओं को पहचानना सिखाना चाहते हैं। एक वास्तविक रोबोट को यह करते हुए फिल्माना वर्षों का समय लेगा और बहुत महंगा होगा। इसके बजाय, शोधकर्ताओं ने AI का उपयोग करके मेजों पर यादृच्छिक वस्तुओं (जैसे कि एक "आभासी रसोई") के साथ नकली लेकिन वास्तविक दिखने वाली छवियां बनाईं। फिर उन्होंने एक अन्य AI का उपयोग इन नकली दृश्यों के लिए "विचार" लिखने के लिए किया, जिससे रोबोट को उन चीजों के बारे में तर्क करना सिखाया गया जिन्हें उसने वास्तव में कभी छुआ भी नहीं है।

  • वास्तविक रोबोट डेटा: रोबोट भौतिक रूप से हिलने-डुलने का अनुभव सीखता है।
  • सिंथेटिक डेटा: रोबोट दुनिया का तर्क (logic) सीखता है (जैसे, "यदि मुझे ठंडा पेय चाहिए, तो मुझे फ्रिज में देखना चाहिए")।

इन दोनों को मिलाकर, रोबोट एक "जनरलिस्ट" बन जाता है—वह उन कार्यों को संभाल सकता है जो उसने पहले कभी नहीं देखे हैं, जैसे कि एक अव्यवस्थित कमरे में विशिष्ट उपकरण खोजना या किसी इंसान की अस्पष्ट मांग को समझना ("मुझे प्यास लगी है, मेरे लिए कुछ स्वस्थ बनाओ")।

3. वास्तविक दुनिया की महाशक्तियाँ

पेपर दिखाता है कि OneTwoVLA चार विशिष्ट चीजों में बहुत बेहतर है:

  • दीर्घकालिक योजना (Long-Term Planning): यह पांच चरणों वाला कॉकटेल बना सकता है बिना यह भूले कि पहला चरण क्या था। यह अपने दिमाग में एक "मानसिक चेकलिस्ट" रखता है।
  • गलतियों से उबरना (Recovering from Mistakes): यदि यह चम्मच गिरा देता है, तो यह बस चलते रहना जारी नहीं रखता। यह रुकता है, महसूस करता है, "ओह नहीं, मैंने इसे गिरा दिया," और इसे फिर से उठाने का तरीका खोज लेता है।
  • इंसानों से बात करना (Talking to Humans): यदि आप कहते हैं, "रुको, मुझे ऑरेंज जूस नहीं चाहिए," तो रोबोट तुरंत समझ जाता है, अपना वर्तमान कार्य रोकता है, और पूछता है, "ठीक है, आपको कौन सा फ्लेवर चाहिए?" बजाय इसके कि वह गलत चीज डालना जारी रखे।
  • छिपी हुई वस्तुओं को खोजना (Finding Hidden Objects): यदि आप "वह चीज़ जिससे बोतलें खोली जाती हैं" मांगते हैं और वहां मेज पर कई वस्तुएं हैं, तो यह आकार और उद्देश्य के आधार पर यह पता लगा सकता है कि बोतल ओपनर कौन सा है, भले ही इसने पहले कभी वह विशिष्ट बोतल ओपनर न देखा हो।

निष्कर्ष

OneTwoVLA एक बड़ी सफलता है क्योंकि यह "सोचने" और "करने" को अलग-अलग काम के रूप में मानना बंद कर देता है। यह एक ऐसा रोबोट बनाता है जो तेजी से चलने के लिए पर्याप्त फुर्तीला है लेकिन जब चीजें जटिल हो जाती हैं, तो सोचने के लिए पर्याप्त बुद्धिमान भी है। यह एक ऐसे रोबोट के बीच का अंतर है जो केवल एक स्क्रिप्ट का अंधाधुंध पालन करता है और एक ऐसे रोबोट के बीच का अंतर है जो वास्तव में समझता है कि वह क्या कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →