← नवीनतम पेपर
🤖 AI

Efficient Skill Grounding via Code Refactoring with Small Language Models

यह शोध पत्र RECENT को प्रस्तुत करता है, जो एक रिफैक्टरिंग-केंद्रित ढांचा (framework) है जो छोटे भाषा मॉडलों को पूर्ण पुनर्जनन (full regeneration) के बजाय स्थानीयकृत कोड संशोधनों के माध्यम से सिमेंटिक इंटेंट (semantic intent) को निष्पादन बाइंडिंग्स (execution bindings) से अलग करके, एम्बोडीड एजेंटों में मजबूत, लॉन्ग-होरिज़ॉन स्किल ग्राउंडिंग सक्षम बनाता है।

मूल लेखक: Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "एक ही आकार सबके लिए नहीं" वाला रोबोट

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जो एक बेहतरीन लाज़ानिया बना सकता है। आप उनकी रेसिपी को एक बहुत ही विशिष्ट तरीके से लिखते हैं: "बाएं हाथ पर स्थित लाल चाकू का उपयोग करें, टमाटरों को नीचे की ओर गति के साथ काटें, और उन्हें नीले कटोरे में डालें।"

अब, कल्पना कीजिए कि आप इस रेसिपी को एक अलग रसोई में भेजना चाहते हैं।

  • रसोई A में दाईं ओर एक नीला चाकू है और एक चौकोर कटोरा है।
  • रसोई B में कोई चाकू नहीं है, केवल एक फूड प्रोसेसर है।

यदि आप मूल रेसिपी को नई रसोई में सौंप देते हैं, तो वह विफल हो जाती है। रोबोट (शेफ) उस "लाल चाकू" को पकड़ने की कोशिश करता है जो मौजूद ही नहीं है, या उस उपकरण के साथ काटने की कोशिश करता है जो उसके पास है ही नहीं।

रोबोटिक्स की दुनिया में, इसे एम्बॉडिमेंट गैप (Embodiment Gap) कहा जाता है। एक रोबोट का "शरीर" (उसके हाथ, ग्रिपर, सेंसर) उस रोबोट से अलग होता है जिसके लिए वह कौशल (skill) मूल रूप से डिज़ाइन किया गया था। आमतौर पर, इसे ठीक करने के लिए, इंजीनियरों को या तो:

  1. हर बार पूरी रेसिपी को शून्य से फिर से लिखना पड़ता है (धीमा और महंगा)।
  2. एक बहुत ही स्मार्ट, महंगे AI (एक "लार्ज लैंग्वेज मॉडल" या LLM) का उपयोग करना पड़ता है ताकि वह चलते-फिरते बदलावों को समझ सके (जिसके लिए विशाल कंप्यूटर और इंटरनेट एक्सेस की आवश्यकता होती है, जो कि एक फैक्ट्री फ्लोर पर मौजूद रोबोट के पास नहीं हो सकता)।

समाधान: RECENT (एक "एडिटर" दृष्टिकोण)

लेखकों ने एक नया सिस्टम बनाया है जिसे RECENT कहा जाता है। एक सुपर-स्मार्ट AI से पूरी किताब को हर बार फिर से लिखने के लिए कहने के बजाय, RECENT एक स्मार्ट एडिटर की तरह काम करता है जो केवल उन विशिष्ट शब्दों को बदलता है जो नई रसोई में फिट नहीं बैठते।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "मास्टर रेसिपी बुक" (ऑफलाइन स्किल रिपॉजिटरी)

इससे पहले कि रोबोट कभी काम पर जाए, सिस्टम कौशलों (जैसे "कप उठाना" या "सब्जी काटना") की एक लाइब्रेरी बनाता है। ये कौशल कंप्यूटर कोड के रूप में लिखे जाते हैं।

  • जादुई ट्रिक: कोड को दो भागों में विभाजित किया गया है:
    • "क्यों" (Semantics): वह तर्क कि क्या होना चाहिए (जैसे, "वस्तु को पकड़ें और उसे मेज पर ले जाएं")। यह हमेशा के लिए समान रहता है।
    • "कैसे" (Execution): इसे कैसे करने के लिए विशिष्ट निर्देश (जैसे, "Use the panda_gripper API")। यही वह हिस्सा है जो बदलता है।

इसे एक रिक्त स्थान भरने वाली कहानी (fill-in-the-blank story) की तरह समझें। कथानक (plot) स्थिर है, लेकिन पात्रों के नाम और सेटिंग को बाद में भरने के लिए खाली छोड़ दिया गया है।

2. "स्मार्ट एडिटर" (स्मॉल लैंग्वेज मॉडल - sLM)

जब रोबोट को कोई कार्य करना होता है, तो वह किसी विशाल, महंगे सुपरकंप्यूटर को कॉल नहीं करता है। इसके बजाय, वह एक स्मॉल लैंग्वेज मॉडल (sLM) का उपयोग करता है। यह एक त्वरित, कुशल संपादक की तरह है जो लैपटॉप या यहाँ तक कि टैबलेट पर भी फिट हो सकता है।

एडिटर "मास्टर रेसिपी" और "नई रसोई" (नया रोबोट) को देखता है।

  • परिदृश्य: नए रोबोट में क्लॉ (claw) के बजाय वैक्यूम ग्रिपर है।
  • पुराना तरीका: AI "कप उठाने के तरीके" की पूरी कहानी को फिर से लिखने की कोशिश करेगा, जिससे भ्रम पैदा हो सकता है या गलत चरणों की कल्पना (hallucination) हो सकती है।
  • RECENT का तरीका: एडिटर देखता है कि "कैसे" वाले भाग में claw_grab() लिखा है। वह जानता है कि एक वैक्यूम रोबोट के लिए, यह vacuum_attach() होना चाहिए (एक संदर्भ गाइड या ऑन्टोलॉजी के माध्यम से)। वह बस उन दो शब्दों को बदल देता है और बाकी की कहानी को बिल्कुल वैसा ही छोड़ देता है जैसा वह था।

इसे कोड रिफैक्टरिंग (Code Refactoring) कहा जाता है। यह एक स्प्रेडशीट फॉर्मूला में एक सिंगल लाइन बदलने जैसा है, न कि पूरे स्प्रेडशीट को फिर से बनाने जैसा।

3. "लाइव फिक्स" (इन-सिटू अडैप्टेशन)

कभी-कभी, रोबोट काम करते समय किसी सरप्राइज का सामना करता है। शायद वस्तु फिसलन भरी है, या रोशनी बहुत कम है।

  • पुराना तरीका: रोबोट रुक जाता है, घबरा जाता है, और पूरे प्लान को फिर से लिखने के लिए सुपरकंप्यूटर से पूछता है। इसमें बहुत समय लगता है और रोबोट के काम करने में बाधा आती है।
  • RECENT का तरीका: रोबोट के कोड में छोटे "सुरक्षा चेक" (यूनिट टेस्ट) बने हुए हैं। यदि कोई चेक विफल होता है (जैसे, "क्या वस्तु वास्तव में वहां है?"), तो रोबोट एक सेकंड के सौवें हिस्से के लिए रुकता है। छोटा एडिटर कोड की अगली कुछ लाइनों को देखता है और फिसलन को संभालने के लिए उन्हें तुरंत पैच (ठीक) कर देता है, और फिर रोबोट बिना पूरी तरह रुके चलता रहता है।

यह क्यों मायने रखता है (परिणाम)

पेपर में इस सिस्टम का परीक्षण रोबोटों द्वारा लंबे, जटिल कार्यों (जैसे कमरे में वस्तुओं को इधर-उधर ले जाना) को करने के लिए दो मुख्य परिदृश्यों में किया गया:

  1. अलग हाथ (Arms): पांडा (Panda) रोबोट आर्म से UR5 या सॉयर (Sawyer) आर्म में बदलना।
  2. अलग ग्रिपर (Grippers): क्लॉ हैंड से वैक्यूम सक्शन कप में बदलना।

परिणाम:

  • गति और दक्षता: RECENT अविश्वसनीय रूप से तेज़ था। इसने कोड को ठीक करने के लिए अन्य तरीकों की तुलना में 99% कम कंप्यूटिंग पावर (टोकन) का उपयोग किया।
  • सफलता दर: यह कार्यों में लगभग 73% से 82% बार सफल रहा, जो अन्य छोटे-मॉडल विधियों की तुलना में बहुत अधिक है और विशाल, महंगे सुपरकंप्यूटरों (LLMs) के लगभग बराबर है।
  • कोई रुकावट नहीं: रोबोट को अक्सर रुकने और प्रतीक्षा करने की आवश्यकता नहीं पड़ी। क्योंकि यह केवल छोटे, स्थानीय सुधार कर रहा था, इसलिए यह पूरे प्रोग्राम को फिर से शुरू करने के बजाय चलता रहा।

निचोड़ (The Bottom Line)

कल्पना कीजिए कि आप कार चला रहे हैं।

  • पुराना तरीका: हर बार जब आप एक सेडान से ट्रक पर स्विच करते हैं, तो आपको पूरे इंजन को फिर से बनाने के लिए मैकेनिक को काम पर रखना पड़ता है क्योंकि पुर्जे अलग होते हैं।
  • RECENT का तरीका: आपके पास एक टूलकिट है जो जानता है कि किस बोल्ट को बदलना है और किस तार को फिर से रूट करना है। आप बदलाव 5 मिनट में कर लेते हैं, और ट्रक बिल्कुल वैसे ही चलता है जैसे सेडान चलता था।

यह पेपर दिखाता है कि हमें रोबोटों को अलग-अलग शरीरों में काम करने के लिए विशाल, महंगे AI की आवश्यकता नहीं है। हमें बस एक स्मार्ट, कुशल तरीके की आवश्यकता है जो स्थानीय स्तर पर निर्देशों को संपादित (edit) कर सके, जिससे मुख्य तर्क सुरक्षित और सुसंगत रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →