← नवीनतम पेपर
💻 computer science

RHO: Your Coding Agent is Secretly a Roboticist

यह शोध पत्र रोबोटिक्स हार्नेस ऑप्टिमाइज़ेशन (RHO) को पेश करता है, जो एक नवीन प्रशिक्षण प्रतिमान (training paradigm) है जहाँ टूल-सक्षम कोडिंग एजेंट पर्यावरणीय फीडबैक का उपयोग करके व्याख्या योग्य, मल्टी-फाइल न्यूरोसिम्बोलिक पॉलिसी रिपॉजिटरी की खोज करते हैं, जिससे वास्तविक समय के रोबोटिक्स कार्यों में मौजूदा मल्टी-टर्न एजेंटिक सिस्टमों की तुलना में अत्याधुनिक प्रदर्शन और बेहतर दक्षता प्राप्त होती है।

मूल लेखक: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कप उठाने और उसे मेज पर रखने के बारे में सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: "ऑन-द-फ्लाई" प्रोग्रामर
पहले, इसे करने का सबसे अच्छा तरीका एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) को एक घबराए हुए प्रोग्रामर की तरह इस्तेमाल करना था। हर बार जब रोबोट कप गिरा देता या मेज को मिस कर देता, तो AI रुक जाता, सोचता, गलती को सुधारने के लिए नया कोड लिखता, और फिर से कोशिश करता। यह एक शेफ की तरह है जो सूप चखता है, महसूस करता है कि इसमें नमक की कमी है, फिर खाना बनाना रोक देता है, एक नया रेसिपी लिखता है, और फिर से शुरू करता है। यह काम तो करता है, लेकिन यह धीमा, अव्यवस्थित है और रोबोट वास्तविक दुनिया में उपयोगी होने के लिए पर्याप्त तेज़ नहीं हो पाता क्योंकि वह लगातार अपने ही निर्देशों को फिर से लिखने के लिए रुकता रहता है।

नया तरीका: RHO (द "प्री-गेम" कोच)
यह पेपर RHO (रोबोटिक्स हार्नेस ऑप्टिमाइजेशन) पेश करता है। रोबोट के चलते समय AI को कोड लिखने देने के बजाय, RHO ट्रेनिंग के दौरान एक सख्त, चिंतनशील कोच की तरह काम करता है।

RHO कैसे काम करता है, इसे एक सरल उपमा (analogy) से समझते हैं:

1. द "रिपॉजिटरी" (सिर्फ एक नोट नहीं, बल्कि पूरा टूलबॉक्स)

अधिकांश AI सिस्टम रोबोट को ठीक करने के लिए एक एकल वाक्य या एक छोटे फंक्शन को बदलने की कोशिश करते हैं (जैसे रेसिपी में एक सामग्री बदलना)। RHO अलग है। यह रोबोट के मस्तिष्क को एक पूरी लाइब्रेरी ऑफ फाइल्स (एक "रिपॉजिटरी") के रूप में मानता है।

  • उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क केवल निर्देशों वाला एक स्टिकी नोट नहीं है; यह एक पूर्ण वर्कशॉप है जिसमें एक मैनुअल, औजारों का एक सेट, एक सुरक्षा चेकलिस्ट और एक नेविगेशन मैप है। RHO केवल स्टिकी नोट को संपादित नहीं करता; यह पूरे वर्कशॉप को पुनर्गठित करता है, औजारों को बदल देता है और मैनुअल को एक साथ फिर से लिख देता है।

2. द "टूल-इनेबल्ड एजेंट" (एक प्रशिक्षु जो वास्तव में निर्माण कर सकता है)

RHO एक विशेष AI एजेंट का उपयोग करता है जो केवल टेक्स्ट जेनरेट करने वाला नहीं है। यह एक कोडिंग एजेंट है जिसके पास हाथ भी हैं।

  • उपमा: केवल रोबोट को ठीक करने के बारे में बात करने के बजाय, इस एजेंट को रोबोट की कोड फाइल्स खोलने, टेस्ट चलाने, रोबोट के "वीडियो फीड" को देखने कि क्या गलत हुआ, एरर लॉग्स की जांच करने और फिर वास्तव में कोड को फिर से लिखने की अनुमति दी जाती है। यह एक ऐसे प्रशिक्षु (apprentice) की तरह है जो मैनुअल पढ़ सकता है, रिंच उठा सकता है, इंजन को ठीक कर सकता है और फिर एक ही बार में कार की टेस्ट-ड्राइव ले सकता है।

3. द "इवोल्यूशनरी सर्च" (सर्वाइवल ऑफ द फिटेस्ट)

RHO केवल एक सुधार का प्रयास नहीं करता। यह एक इवोल्यूशनरी प्रोसेस चलाता है।

  • उपमा: एक टूर्नामेंट की कल्पना करें। AI रोबोट के "मस्तिष्क" के 100 अलग-अलग संस्करण (अलग-अलग कोड रिपॉजिटरी) बनाता है। वह उन सभी को एक सिमुलेशन में कार्य करने के लिए भेजता है।
    • कुछ बुरी तरह विफल हो जाते हैं।
    • कुछ ठीक-ठाक करते हैं।
    • कुछ बहुत अच्छा करते हैं।
    • AI "विजेताओं" को लेता है, उनकी सबसे अच्छी विशेषताओं को आपस में मिलाता है, और 100 रोबोटों की एक नई पीढ़ी बनाता है। वह इसे सैकड़ों बार दोहराता है।
    • महत्वपूर्ण बात यह है कि यह एक "पारेटो फ्रंटियर" (Pareto Frontier) बनाए रखता है। इसका मतलब यह नहीं है कि यह उस रोबोट को रखता है जो हर चीज़ में सर्वश्रेष्ठ है। यह उस रोबोट को रखता है जो इस विशिष्ट कार्य के लिए सर्वश्रेष्ठ है, भले ही वह दूसरे कार्य में खराब हो। यह सुनिश्चित करता है कि अंतिम रोबोट एक विशेषज्ञ हो, न कि एक सामान्यवादी जो विशिष्ट कार्यों में विफल हो जाता है।

4. परिणाम: एक "रेडी-टू-डिप्लॉय" रोबोट

ट्रेनिंग के अंत तक, RHO एक एकल, पूर्ण "रिपॉजिटरी" (कोड फाइल्स का एक पूरा सेट) तैयार करता है।

  • जादू: जब यह रोबोट वास्तविक दुनिया में तैनात किया जाता है, तो इसे अब AI के सोचने की आवश्यकता नहीं होती। इसे कोड लिखने के लिए रुकने की आवश्यकता नहीं होती। यह बस पहले से लिखे गए, अत्यधिक अनुकूलित (optimized) कोड को चलाता है।
  • उपमा: यह उस छात्र के बीच के अंतर जैसा है जिसे टेस्ट के दौरान हर गणितीय सूत्र को खोजने की आवश्यकता होती है बनाम उस छात्र के बीच जिसने सूत्रों को याद कर लिया है और हजारों समस्याओं का अभ्यास किया है। RHO रोब manera वह छात्र है जिसने "होमवर्क" (ट्रेनिंग) के दौरान कठिन काम कर लिया है और अब बिना किसी देरी के टेस्ट (डिप्लॉयमेंट) में उत्कृष्ट प्रदर्शन करने के लिए तैयार है।

उन्होंने वास्तव में क्या हासिल किया?

पेपर का दावा है कि यह विधि वर्तमान स्टेट-ऑफ-द-आर्ट से काफी बेहतर है:

  • गति और विश्वसनीयता: मानक रोबोट बेंचमार्क (जैसे ब्लॉक स्टैक करना या वस्तुओं को हिलाना) पर, RHO ने एक एकल, तेज़ निष्पादन का उपयोग करके 70% सफलता दर प्राप्त की। पिछला सबसे अच्छा तरीका (जिसके लिए AI को लगातार कोड लिखने के लिए रुकने और फिर से लिखने की आवश्यकता थी) केवल 68% प्राप्त कर सका और बहुत धीमा था।
  • अराजकता को संभालना: जब शोधकर्ताओं ने नियम बदल दिए (जैसे वस्तुओं को अलग-अलग जगहों पर ले जाना या कार्य विवरण बदलना), तो अन्य AI मॉडल (जैसे OpenVLA) पूरी तरह से विफल हो गए (0% सफलता)। RHO अभी भी 45% समय सफल रहा।
  • दक्षता: एक अधिक जटिल वास्तविक दुनिया के सिमुलेशन में, RHO ने रोबोट द्वारा "सोचने" में बिताए गए समय को 20% कम कर दिया और आवश्यक टूल्स की संख्या को 27% कम कर दिया, जबकि इसकी सफलता दर को दोगुना कर दिया।

निचोड़ (The Bottom Line)

RHO भारी काम को डिप्लॉयमेंट (जब रोबोट काम कर रहा होता है) से हटाकर ट्रेनिंग (जब रोबोट सीख रहा होता है) में स्थानांतरित करके खेल बदल देता है। यह एक स्मार्ट, टूल-वेल्डिंग AI का उपयोग करता है जो एक पूर्ण, मल्टी-फाइल कोड लाइब्रेरी विकसित करता है जो मजबूत, व्याख्या योग्य (इंसान कोड पढ़ सकते हैं) है, और बिना किसी सुपरकंप्यूटर के निर्देशों को फिर से लिखने की आवश्यकता के तुरंत चलने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →