← नवीनतम पेपर
🤖 AI

VIA: Visual Interface Agent for Robot Control

यह शोध पत्र VIA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रोबोट को ब्राउज़र-आधारित 3D इंटरफ़ेस के माध्यम से नियंत्रित करने के लिए टास्क-विशिष्ट फाइन-ट्यूनिंग के बिना ऑफ-द-शेल्फ फाउंडेशन मॉडल्स का विजुअल इंटरफेस एजेंट के रूप में लाभ उठाता है, यह प्रदर्शित करते हुए कि फ्रंटियर एजेंट्स रोबोट नियंत्रण को एक इंटरैक्टिव सॉफ्टवेयर ऑपरेशन के रूप में मानकर जटिल मैनिपुलेशन कार्यों में उच्च ज़ीरो-शॉट सफलता दर प्राप्त कर सकते हैं।

मूल लेखक: Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट रोबोट दोस्त है जो कोडिंग करने, वीडियो गेम खेलने और पहेलियाँ सुलझाने में माहिर है, लेकिन उसने अपने जीवन में कभी किसी भौतिक वस्तु को छुआ तक नहीं है। अब, कल्पना कीजिए कि आप इस रोबोट को एक कटोरा उठाने, दराज खोलने या ब्लॉक्स को एक के ऊपर एक रखने के लिए सिखाना चाहते हैं।

आमतौर पर, वैज्ञानिक रोबोट को सिखाने के लिए उसे लाखों घंटों के वीडियो खिलाते हैं जिनमें एक रोबोटिक हाथ हिलता हुआ दिखाई देता है, और फिर वे रोबोट के "दिमाग" (इसके weights) को तब तक ट्यून करते हैं जब तक कि वह उन मूव्स को सीख न ले। लेकिन यह पेपर, VIA (Visual Interface Agent), एक बहुत ही शानदार और सरल तरीका सुझाता है: रोबोट को रोबोट की तरह सिखाना छोड़ दें। इसके बजाय, बस इसे एक कंप्यूटर माउस का उपयोग करने दें।

मुख्य विचार: वीडियो गेम के रूप में रोबोट

लेखकों ने, जो स्टैनफोर्ड की एक टीम है, महसूस किया कि आज के सबसे उन्नत AI मॉडल पहले से ही सॉफ्टवेयर को नियंत्रित करने में विशेषज्ञ हैं। वे एक कंप्यूटर स्क्रीन देख सकते हैं, बटन क्लिक कर सकते हैं, टेक्स्ट टाइप कर सकते हैं, और यह पता लगा सकते हैं कि बग को कैसे ठीक किया जाए या वेबसाइट कैसे बनाई जाए।

इसलिए, उन्होंने पूछा: क्या होगा अगर हम एक वास्तविक रोबोटिक हाथ के साथ बिल्कुल एक सॉफ्टवेयर की तरह व्यवहार करें?

उन्होंने एक विशेष 3D इंटरफ़ेस बनाया जो एक वीडियो गेम या 3D डिज़ाइन प्रोग्राम (जैसे Blender) की तरह दिखता है। इस दुनिया में, एक नीला "टारगेट ग्रिपर" (target gripper) अंतरिक्ष में तैर रहा है। AI एजेंट सीधे रोबोट के मोटर्स से बात नहीं करता है। इसके बजाय, वह इस 3D दुनिया के स्क्रीनशॉट देखता है और उस नीले टारगेट ग्रिपर को इधर-उधर घुमाने के लिए सरल उपकरणों के एक सेट का उपयोग करता है, ठीक वैसे ही जैसे एक इंसान माउस कर्सर को हिलाता है।

यहाँ जादुई लूप (Magic Loop) है:

  1. देखना (Look): AI 3D दृश्य का स्क्रीनशॉट लेता है (जिसमें रोबोट पर लगे कैमरों के दृश्य शामिल होते हैं)।
  2. सोचना (Think): वह तय करता है, "मुझे उस लाल क्यूब को पकड़ना है।"
  3. कार्य करना (Act): वह नीले टारगेट ग्रिपर को लाल क्यूब के पास टेलीपोर्ट करने, उसे सही दिशा में घुमाने और "Execute" पर क्लिक करने के लिए एक टूल का उपयोग करता है।
  4. देखना (Watch): असली रोबोट का हाथ नीले टारगेट के अनुरूप हिलता है।
  5. दोहराना (Repeat): AI एक और स्क्रीनशॉट लेता है, देखता है कि क्या यह काम कर गया, और अगले कदम की योजना बनाता है।

उन्होंने क्या पाया (अच्छी खबर)

टीम ने इसका परीक्षण दो शक्तिशाली AI एजेंटों (Claude Code और Codex) के साथ छह अलग-अलग कार्यों पर किया, जैसे ब्लॉक्स को स्टैक करना, दराज खोलना और स्टोव चालू करना। उन्होंने AI को कोई विशेष रोबोट ट्रेनिंग नहीं दी। उन्होंने बस उसे इंटरफ़ेस और एक सरल लक्ष्य दिया।

  • यह आश्चर्यजनक रूप से सफल रहा: सबसे मजबूत मॉडल (CC-Fable) के साथ, AI दराज खोलने और नॉब घुमाने वाले कार्यों में 96.7% बार सफल रहा। सात ब्लॉक्स को इंद्रधनुष के रूप में व्यवस्थित करने के लंबे, कठिन कार्य पर, इसे 100% सफलता मिली।
  • जीरो-शॉट (Zero-shot) वास्तविक है: AI ने पहले कभी इस विशिष्ट इंटरफ़ेस को नहीं देखा था। उसने इसे शुरुआत से ही समझ लिया, केवल स्क्रीन को देखकर और टूल के विवरण को पढ़कर।
  • बड़े दिमाग = बेहतर रोबोट: जैसे-जैसे उन्होंने अधिक शक्तिशाली और स्मार्ट AI मॉडल का उपयोग किया, रोबोट कार्यों में बेहतर होता गया। इससे पता चलता है कि जैसे-जैसे AI कंप्यूटर चलाने में स्मार्ट होता जाता है, वह स्वचालित रूप से रोबोट को नियंत्रित करने में भी स्मार्ट होता जाता है।

वे स्पष्ट रूप से क्या कहते हैं कि यह क्या नहीं है

यह जानना महत्वपूर्ण है कि यह पेपर क्या नहीं कर रहा है, क्योंकि यह क्षेत्र के कुछ सामान्य विचारों को खारिज करता है:

  • कोई "फाइन-ट्यूनिंग" (Fine-Tuning) नहीं: उन्होंने AI मॉडल्स को रोबोट डेटा पर दोबारा प्रशिक्षित (retrain) नहीं किया। उन्होंने AI के दिमाग को भौतिकी (physics) समझने के लिए ट्यून नहीं किया। उन्होंने मॉडल्स का उपयोग ठीक वैसे ही किया जैसे वे बेचे जाते हैं।
  • कोई "कोड-एज़-पॉलिसीज़" (Code-as-Policies) नहीं: उन्होंने AI को जटिल कोड लिखने के लिए नहीं कहा जो विशिष्ट रोबोट फंक्शन्स को कॉल करे (जैसे grasp_object("red_cube"))। पेपर का तर्क है कि पूर्व-लिखित कोड लाइब्रेरीज़ पर निर्भर रहना एक बाधा (bottleneck) है। इसके बजाय, AI बस सरल, विजुअल टूल्स का उपयोग करके एक वर्चुअल ग्रिपर को हिलाता है।
  • कोई "प्रिविलेज्ड" (Privileged) जानकारी नहीं: AI को रोबोट के सटीक निर्देशांक (coordinates) या आंतरिक स्थिति के साथ कोई गुप्त 'चीट शीट' नहीं मिलती है। वह केवल वही देखता है जो एक इंसान देखता है: स्क्रीनशॉट और कैमरा फीड।

पेच (वास्तविकता की जाँच)

हालाँकि परिणाम रोमांचक हैं, लेकिन पेपर बहुत सावधानी से कहता है कि यह हर स्थिति के लिए एक "हल की गई" (solved) समस्या नहीं है।

  • यह एक सिमुलेशन है: ये सभी परीक्षण एक कंप्यूटर सिमुलेशन (RoboSuite) में हुए, न कि अभी एक वास्तविक रसोई में वास्तविक रोबट पर। लेखक सुझाव देते हैं कि यह एक आशाजनक मार्ग है, लेकिन इसे वास्तविक हार्डवेयर पर परीक्षण करने की आवश्यकता है।
  • यह धीमा और महंगा है: क्योंकि AI को स्क्रीनशॉट लेने, सोचने और स्टेप-बाय-स्टेप योजना बनाने की आवश्यकता होती है, इसलिए यह तेज़ नहीं है। यह फर्नीचर असेंबल करने जैसे धीमे, सावधानी वाले कार्यों के लिए अच्छा है, लेकिन यदि आप इसे उड़ती हुई गेंद को पकड़ने के लिए कहेंगे तो यह शायद विफल हो जाएगा।
  • इसे बड़े दिमागों की आवश्यकता है: वर्तमान में इस सिस्टम के लिए उपलब्ध सबसे शक्तिशाली, महंगे AI मॉडल्स की आवश्यकता होती है। छोटे, सस्ते मॉडल शायद स्क्रीनशॉट देखकर 3D स्पेस को समझने के लिए पर्याप्त स्मार्ट नहीं होंगे।

निचोड़ (Bottom Line)

यह पेपर सुझाव देता है कि हमें शायद शुरू से एक नए प्रकार का "रोबोट ब्रेन" बनाने की आवश्यकता नहीं है। इसके बजाय, हमें बस अपने मौजूदा, सुपर-स्मार्ट कंप्यूटर चलाने वाले AI को भौतिक दुनिया में एक खिड़की देने की आवश्यकता हो सकती है। यदि आप एक कोडिंग एजेंट को 3D इंटरफ़ेस और माउस दे सकते हैं, तो वह वास्तव में एक छिपा हुआ रोबोट कंट्रोलर हो सकता है, जो बिना किसी रोबोट-विशिष्ट सबक को सीखे, ब्लॉक्स का इंद्रधनुष बनाने या दराज खोलने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →