← नवीनतम पेपर
💻 computer science

Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation

यह शोध पत्र एक्ट-ऑब्जर्व-रीराइट (AOR) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टीमॉडल लैंग्वेज मॉडल्स को विजुअल फीडबैक और विफलता विश्लेषण के आधार पर निष्पादन योग्य पायथन कंट्रोलर कोड को संश्लेषित और पुनर्गठित करके रोबोट मैनिपुलेशन पॉलिसी को पुनरावृत्ति से बेहतर बनाने में सक्षम बनाता है, जिससे बिना किसी प्रदर्शन (demonstrations), रिवॉर्ड इंजीनियरिंग या ग्रेडिएंट अपडेट के कार्यों में उच्च सफलता दर प्राप्त होती है।

मूल लेखक: Vaishak Kumar

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vaishak Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ब्लॉक्स का टॉवर बनाना सिखा रहे हैं। पुराने दिनों में, आपके पास दो मुख्य विकल्प थे:

  1. "ड्रिल सार्जेंट" विधि: आप रोबोट को एक इंसान द्वारा इसे 10,000 बार पूरी तरह से करने का वीडियो दिखाते हैं। रोबोट रटकर उन गतिविधियों को याद कर लेता है। यदि आप रोशनी या मेज बदल देते हैं, तो रोबोट भ्रमित हो जाता है और असफल हो जाता है।
  2. "प्रयास और त्रुटि" (Trial and Error) विधि: आप रोबोट को कोशिश करने, असफल होने और फिर से प्रयास करने देते हैं, लेकिन आपको हर गलती के बाद उसके "दिमाग" (इसके न्यूरल नेटवर्क) को मैन्युअल रूप से ट्यून करना पड़ता है। इसमें बहुत समय लगता है और इसके लिए एक सुपरकंप्यूटर की आवश्यकता होती है।

यह पेपर एक तीसरा तरीका पेश करता है: "स्व-शिक्षित प्रोग्रामर" (Self-Taught Programmer)।

लेखक इसे एक्ट-ऑब्जर्व-रीराइट (Act–Observe–Rewrite - AOR) कहते हैं। यह कैसे काम करता है, इसे एक सरल कहानी और उपमाओं के साथ समझाया गया है।

कहानी: रोबोट और "घोस्ट राइटर"

कल्पना कीजिए कि एक रोबोटिक हाथ (एक्टर/Actor) एक लाल क्यूब को उठाने और उसे मेज पर रखने की कोशिश कर रहा है।

  1. एक्ट (Act): रोबोट कार्य करने की कोशिश करता है। वह अपने हाथ को हिलाता है, क्यूब को पकड़ता है, और उसे रख देता है।
  2. ऑब्जर्व (Observe): रोबोट असफल हो जाता है। शायद उसने क्यूब को मिस कर दिया, या उसे गिरा दिया। लेकिन केवल "मैं असफल हुआ" कहने के बजाय, एक विशेष AI सहायक (मल्टीमॉडल LLM) विफलता के वीडियो को देखता है। यह रोबलेट के कोड (वे निर्देश जो रोबोट को हिलने-डुलने के लिए बताते हैं) और गलती के वीडियो को अगल-बगल देखता है।
  3. रीराइट (Rewrite): AI सहायक केवल यह नहीं कहता, "अधिक प्रयास करो।" यह रोबोट के दिमाग के लिए एक "घोस्ट राइटर" की तरह कार्य करता है। यह रोबोट के सोर्स कोड को खोलता है, उस सटीक लाइन को ढूंढता है जो त्रुटि का कारण बन रही है, और उसे फिर से लिखता (Rewrites) है।

फिर, रोबोट इस नए कोड को संकलित (Compile) करता है और फिर से प्रयास करता है। किसी इंसान ने कोड को छुआ नहीं। किसी विशाल प्रशिक्षण डेटा का उपयोग नहीं किया गया। रोबोट ने हर विफलता के बाद अपने ही बेहतर संस्करण को वास्तव में लिखा।

जादुई उपमा: "कोड बनाम डायल"

यह समझने के लिए कि यह क्यों विशेष है, कल्पना कीजिए कि एक रेडियो है।

  • पुरानी विधियाँ (पैरामीटर ट्यूनिंग): कल्पना कीजिए कि रोबोट एक रेडियो है जिसमें एक डायल है। यदि सिग्नल खराब है, तो आप बस डायल को थोड़ा बाएं या दाएं घुमाते हैं। आप केवल अनुमान लगा रहे हैं। यदि रेडियो इसलिए खराब है क्योंकि एंटीना गलत जगह पर है, तो डायल घुमाने से कोई मदद नहीं मिलेगी।
  • इस पेपर की विधि (कोड रीराइटिंग): कल्पना कीजिए कि रोबोट एक रेडियो है, लेकिन AI सहायक एक इंजीनियर है। यदि सिग्नल खराब है, तो इंजीनियर केवल डायल नहीं घुमाता। वे रेडियो को खोलते हैं, सर्किट बोर्ड को देखते हैं, और महसूस करते हैं, "आह, एंटीना उल्टा लगा है!" वे मूल कारण को ठीक करने के लिए एक नया तार जोड़ते हैं (कोड को फिर से लिखते हैं)।

यह एक बड़ी बात क्यों है?
अधिकांश रोबोट सीखने के तरीके केवल "डायल घुमाते" हैं। वे नंबरों को ट्यून करते हैं। लेकिन यह पेपर दिखाता है कि यदि आप AI को वास्तविक निर्देशों को फिर से लिखने की अनुमति देते हैं, तो यह उन गहरी, संरचनात्मक समस्याओं को ठीक कर सकता है जिन्हें नंबर हल नहीं कर सकते।

तीन चुनौतियाँ जिन्हें उन्होंने हल किया

शोधकर्ताओं ने इन तीन कार्यों पर इसका परीक्षण किया, और "घोस्ट राइटर" ने उन्हें बहुत मानवीय तरीकों से हल किया:

  1. "गलत मानचित्र" की समस्या (लिफ्ट टास्क):

    • गलती: रोबोट क्यूब के ऊपर 8 इंच ऊपर मंडराता रहा। उसे लगा कि क्यूब हवा में तैर रहा है।
    • पुराना तरीका: आपको अनुमान लगाना पड़ता, "शायद कैमरा बहुत संवेदनशील है?"
    • AOR तरीका: AI ने कोड और वीडियो को देखा। उसने कहा, "कैमरा एक अलग समन्वय प्रणाली (जैसे एक नक्शा जहाँ उत्तर नीचे की ओर है) का उपयोग करता है। कोड नक्शे को उल्टा पढ़ रहा है।" उसने छवि को पलटने के लिए गणित को फिर से लिखा। सफलता।
  2. "रंग अंधापन" की समस्या (पिक एंड प्लेस कैन):

    • गलती: रोबोट एक "चांदी के रंग" के सोडा कैन की तलाश कर रहा था, लेकिन कैमरे के दृश्य में, कैन लाल दिख रहा था। रोबोट उसे ढूंढ नहीं पाया।
    • AOR तरीका: AI ने देखा कि रोबोट खाली जगह को घूर रहा है। उसने कोड देखा: search for silver (चांदी के लिए खोजें)। उसे एहसास हुआ, "रुको, रोशनी इसे लाल दिखा रही है!" उसने कोड को बदलकर search for red (लाल के लिए खोजें) कर दिया। सफलता।
  3. "भद्दे हाथ" की समस्या (स्टैक टास्क):

    • गलती: रोबोट पहला क्यूब तो उठा सकता था, लेकिन जब उसने दूसरा क्यूब रखने की कोशिश की, तो उसकी उंगलियां नीचे वाले क्यूब से टकरा गईं और उसे गिरा दिया।
    • AOR तरीका: AI ने वीडियो में टक्कर देखी। उसने दृष्टिकोण पथ (Approach Path) को अधिक सावधानीपूर्वक बनाने के लिए फिर से लिखा। इसने रोबोट को 91% सफलता तक पहुँचाया।
    • सीमा: रोबोट अंततः फंस गया। वह जानता था कि वह क्यों विफल हो रहा है (वह ब्लॉक से टकरा रहा है), लेकिन वह यह नहीं समझ सका कि टकराने से बचने के लिए अपनी उंगलियों को अलग तरह से कैसे हिलाया जाए। वह एक दीवार से टकरा गया। यह दर्शाता है कि सिस्टम अभी भी पूर्ण नहीं है, लेकिन यह अपनी सीमाओं के बारे में ईमानदार है।

"नो-गो" ज़ोन (जो इसे अद्वितीय बनाता है)

आमतौर पर, रोबोट को सीखने के लिए आपको चाहिए होता है:

  • मानव द्वारा किए जाने वाले कार्यों के हजारों वीडियो।
  • रोबोट को अच्छे मूव्स के लिए पुरस्कृत करने के लिए जटिल गणित।
  • मस्तिष्क को प्रशिक्षित करने के लिए सुपरकंप्यूटर।

AOR को इनमें से किसी की भी आवश्यकता नहीं है।

  • कोई वीडियो नहीं: यह अपनी गलतियों से सीखता है।
  • कोई पुरस्कार (Rewards) नहीं: इसे स्कोर की आवश्यकता नहीं है; इसे बस यह देखने की आवश्यकता है कि कोड काम नहीं कर रहा है।
  • कोई ट्रेनिंग नहीं: यह बैकग्राउंड में "सीखता" नहीं है; यह प्रत्येक प्रयास के बीच अपने स्वयं के सॉफ़्टवेयर को वास्तव में फिर से लिखता है।

निचोड़

यह पेपर रोबोट बनाने का एक नया तरीका प्रस्तावित करता है: रोबोट को स्मार्ट बनाने के लिए प्रशिक्षित न करें; उसे एक स्मार्ट संपादक दें जो अपने मैनुअल को फिर से लिख सके।

यह एक रोबोट को "Ctrl+Z" (Undo) बटन देने जैसा है, लेकिन केवल मूव को अनडू करने के बजाय, यह निर्देशों को फिर से लिखता है ताकि वह गलती दोबारा न हो। यह रोबोट लर्निंग को एक "ब्लैक बॉक्स" (जहाँ हमें नहीं पता कि यह क्यों काम करता है) से एक पारदर्शी प्रक्रिया में बदल देता है जहाँ हम कोड को पढ़ सकते हैं और कह सकते हैं, "आह, यह इसलिए विफल हुआ, और यहाँ इसका समाधान है।"

हालाँकि यह अभी भी पूर्ण नहीं है (यह कभी-कभी बहुत कठिन भौतिक समस्याओं पर अटक जाता है), यह साबित करता है कि रोबोट केवल खुद को असफल होते हुए देखकर और उसके बारे में सोचकर अपने कोड को ठीक करना सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →