← नवीनतम पेपर
🤖 AI

RobotArena \infty: Scalable Robot Benchmarking via Real-to-Sim Translation

यह शोधपत्र RobotArena \infty को प्रस्तुत करता है, जो एक स्केलेबल बेंचमार्किंग फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन नीतियों के मूल्यांकन के लिए वास्तविक दुनिया के रोबोटिक प्रदर्शनों को सिम्युलेटेड वातावरण में परिवर्तित करता है, जिससे स्वचालित स्कोरिंग और क्राउड-सोर्स्ड मानव प्राथमिकताओं के माध्यम से पारंपरिक वास्तविक दुनिया के परीक्षण की श्रम, सुरक्षा और पुनरुत्पादकता संबंधी सीमाओं को दूर किया जा सके।

मूल लेखक: Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

प्रकाशित 2026-03-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना, सफाई करना या चीजें बनाना सिखाने की कोशिश कर रहे हैं। अतीत में, यह देखने के लिए कि क्या कोई रोबोट वास्तव में इन कार्यों में कुशल था, आपको एक वास्तविक रसोई, एक वास्तविक लिविंग रूम, या एक वास्तविक फैक्ट्री फ्लोर बनाना पड़ता था, दृश्यों को व्यवस्थित करने के लिए लोगों की एक टीम रखनी पड़ती थी, रोबोट को प्रयास करते हुए देखना पड़ता था, और फिर अगले परीक्षण के लिए सब कुछ मैन्युअल रूप से रीसेट करना पड़ता था।

यह एक नए वीडियो गेम को उसके भौतिक कार्डबोर्ड संस्करण के रूप में बनाने, पात्रों की भूमिका निभाने के लिए अभिनेताओं को रखने और फिर हर बार जब खिलाड़ी गलती करता है तो पूरे सेट को फिर से बनाने की कोशिश करने जैसा है। यह महंगा है, धीमा है, और इसे हजारों बार करना असंभव है।

RobotArena ∞ इस समस्या का समाधान है। इसे एक विशाल, जादुई वीडियो गेम इंजन के रूप में समझें जो वास्तविक जीवन के रोबोट वीडियो को तुरंत एक डिजिटल सिमुलेशन में बदल सकता है, जिससे शोधकर्ताओं के लिए उन कार्यों का परीक्षण करना संभव हो गया जो पहले असंभव था।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "जादुई कैमरा" (Real-to-Sim Translation)

आमतौर पर, जब शोधकर्ता कंप्यूटर में रोबोट का परीक्षण करना चाहते हैं, तो उन्हें मैन्युअल रूप से 3D दुनिया बनानी पड़ती है, हर कप और चम्मच को रखना पड़ता है, और भौतिकी (physics) को प्रोग्राम करना पड़ता है। इसमें हफ्तों लग जाते हैं।

RobotArena ∞ AI "जादुई कैमरों" की एक टीम का उपयोग करता है।

  • इनपुट (Input): आप इसे वास्तविक दुनिया में एक रोबोट द्वारा कार्य करने का एक साधारण वीडियो देते हैं (जैसे "टमाटर को बर्तन में डालें")।
  • जादू (The Magic): सिस्टम स्वचालित रूप से वीडियो का विश्लेषण करता है। यह पता लगाता है कि कैमरा कहाँ था, वस्तुएं 3D में कैसी दिखती हैं, वे कितनी भारी हैं, और यहाँ तक कि रोबोट का हाथ कैसे हिलता है।
  • आउटपुट (Output): सेकंडों में, यह कंप्यूटर के भीतर उस वास्तविक दुनिया के दृश्य का एक सटीक डिजिटल ट्विन (Digital Twin) बनाता है। यह एक कमरे की फोटो लेने और उसे तुरंत एक खेलने योग्य वीडियो गेम लेवल में बदलने जैसा है जहाँ भौतिकी बिल्कुल वास्तविक चीज़ की तरह काम करती है।

2. "तनाव परीक्षण" (The "Stress Test" - Perturbations)

एक बार जब डिजिटल दुनिया बन जाती है, तो शोधकर्ता केवल रोबोट को सामान्य रूप से खेलने नहीं देते। वे यह देखना चाहते हैं कि क्या रोबोट वास्तव में स्मार्ट है या उसने केवल विशिष्ट दृश्य को याद कर लिया है।

कल्पित कीजिए कि आप एक छात्र को कागज के एक विशिष्ट टुकड़े पर गणित का सवाल हल करना सिखाते हैं। यदि आप फ़ॉन्ट, कागज का रंग बदल देते हैं, या संख्याओं को थोड़ा सा खिसका देते हैं, तो क्या वे अभी भी हल कर पाएंगे?

  • RobotArena ∞ यह काम स्वचालित रूप से करता है। यह बैकग्राउंड का वॉलपेपर बदल देता है, वस्तुओं के रंगों को बदल देता है, या कपों को अलग-अलग जगहों पर खिसका देता है।
  • यह रोबोट को तुरंत हजारों "क्या होगा अगर" (what-if) वाले परिदृश्यों का सामना करने के लिए मजबूर करता है। यदि रोबोट बैकग्राउंड बदलने पर विफल हो जाता है, तो यह साबित करता है कि रोबोट केवल बैकग्राउंड को याद करके "चीटिंग" कर रहा था, न कि वास्तव में कार्य को समझ रहा था।

3. "क्राउड-सोर्स्ड जज" (The "Crowd-Sourced Judges" - Human Feedback)

आपको कैसे पता चलेगा कि रोबोट ने अच्छा काम किया या नहीं?

  • रोबोट जज: सिस्टम एक सुपर-स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग करता है जो वीडियो को देखता है और एक स्कोर देता है, जैसे कि एक रेफरी।
  • मानव जज: यही असली सफलता का मंत्र है। सिस्टम दो अलग-अलग रोबोटों के एक ही कार्य को करने के वीडियो लेता है और उन्हें ऑनलाइन आम लोगों को दिखाता है (रोबोटों के लिए "टिंडर" की तरह)।
    • लोगों को बस क्लिक करना होता है: "कौन सा बेहतर लग रहा था?" या "क्या उन्होंने गांठ बांधी?"
    • इन साधारण "A बनाम B" वोटों से हजारों की संख्या में डेटा एकत्र करके, सिस्टम एक ग्लोबल लीडरबोर्ड (जैसे शतरंज में एलो रेटिंग) बनाता है जो हमें ठीक से बताता है कि कौन सा रोबोट सबसे अच्छा है, बिना किसी रोबोटिक्स विशेषज्ञ को हर सेकंड देखे।

हमने क्या खोजा?

जब उन्होंने दुनिया के सबसे अच्छे रोबोट दिमागों (जिन्हें VLAs कहा जाता है) पर यह विशाल परीक्षण चलाया, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:

  • वे अभी तक "जनरलिस्ट" (Generalists) नहीं हैं: अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने केवल एक विशिष्ट परीक्षा के लिए पढ़ाई की है। यदि आप परीक्षा को थोड़ा बदल देते हैं (जैसे वस्तुओं को खिसकाना), तो वे विफल हो जाते हैं। उन्होंने कार्य की अवधारणा को नहीं सीखा है; उन्होंने बस उस विशिष्ट वीडियो को याद कर लिया जिस पर उन्हें प्रशिक्षित किया गया था।
  • "स्पेशियल पैराडॉक्स" (The Spatial Paradox): कुछ रोबोट जिन्हें उनकी कलाइयों (wrists) पर कैमरे लगाकर प्रशिक्षित किया गया था (हाथ के दृष्टिकोण से देखना), वे 3D स्थान को समझने में उन रोबोटों की तुलना में बहुत बेहतर थे जिन्हें स्पष्ट रूप से 3D ज्यामिति सिखाई गई थी। यह पता चला कि दुनिया को अलग-अलग कोणों से देखना, रोबोट को गणित के नियम थोपने की तुलना में स्वाभाविक रूप से बेहतर स्थानिक कौशल (spatial skills) सिखाता है।
  • "ओवरफिटिंग" (The "Overfitting" Problem) की समस्या: कई रोबोट बैकग्राउंड बदलने पर विफल हो गए। वे वस्तु के बजाय बैकग्राउंड पर निर्भर थे।

यह क्यों महत्वपूर्ण है?

RobotArena ∞ से पहले, रोबोटों का परीक्षण करना एक कार की गति को मापने के लिए हर दिन एक अलग, ऊबड़-खाबड़ सड़क पर चलाने जैसा था। आप उनकी निष्पक्ष तुलना नहीं कर सकते थे।

अब, हमारे पास एक मानकीकृत, अनंत रेसट्रैक है जिसे तुरंत बदला जा सकता है। हम हजारों रोबोटों का परीक्षण कर सकते हैं, हजारों अलग-अलग स्थितियों में, विजेता तय करने के लिए भीड़ के ज्ञान का उपयोग करते हुए। यह हमें उस दिन की ओर तेजी से बढ़ने में मदद करता है जब रोबोट वास्तव में "जनरलिस्ट" बन सकें—ऐसे सहायक जो किसी भी घर में जा सकें, किसी भी कार्य को समझ सकें और इसे सुरक्षित रूप से कर सकें, चाहे कमरा कितना भी अस्त-व्यस्त क्यों न हो।

संक्षेप में: RobotArena ∞ रोबोटों के परीक्षण की धीमी, महंगी और खतरनाक प्रक्रिया को एक तेज़, सस्ते और स्केलेबल वीडियो गेम में बदल देता है, जिससे हमें वास्तविक दुनिया के लिए स्मार्ट मशीनें बनाने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →