← नवीनतम पेपर
💻 computer science

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

यह शोध पत्र CRAFT का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो जटिल मल्टी-रोबोट समन्वय कार्यों को उप-कार्यों में स्वायत्त रूप से विभाजित करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) का और रिवॉर्ड फंक्शन्स को परिष्कृत करने के लिए विजन लैंग्वेज मॉडल्स (VLMs) का लाभ उठाता है, जिससे मैन्युअल रिवॉर्ड डिजाइन के बिना समन्वय व्यवहारों की प्रभावी सीख और वास्तविक दुनिया में स्थानांतरण सक्षम होता है।

मूल लेखक: Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कुत्तों की एक टीम को एक जटिल नृत्य (डांस) सिखाने की कोशिश कर रहे हैं, जैसे कि एक संकीर्ण गेट से बिना एक-दूसरे से टकराए गुजरना, या बिना सूप गिराए एक भारी बर्तन को मिलकर उठाना।

यदि आप उन्हें बस कमरे में फेंक देते हैं और कहते हैं, "करो!" तो वे भ्रमित हो जाएंगे, एक-दूसरे से टकराएंगे और कभी सीख नहीं पाएंगे। यह वही समस्या है जिसका सामना यूसी बर्कले (UC Berkeley) के शोधकर्ताओं ने रोबोट्स के साथ किया। वे चाहते थे कि रोबोट मिलकर काम करें, लेकिन मानक कंप्यूटर प्रशिक्षण विधियाँ विफल हो रही थीं क्योंकि कार्य बहुत लंबे, बहुत जटिल थे, और रोबोट योजना बनाने के लिए एक-दूसरे से "बात" नहीं कर पा रहे थे।

यहाँ आता है CRAFT।

CRAFT को एक सुपर-स्मार्ट, AI-संचालित कोच के रूप में समझें जो केवल रोबोट्स को देखता ही नहीं है; बल्कि यह उन्हें सीखने का तरीका भी सक्रिय रूप से सिखाता है। यह "कोच" कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. कोच बड़े काम को छोटे अभ्यासों में तोड़ता है (Curriculum Generation)

एक फुटबॉल कोच की कल्पना करें। वे एक नई टीम को तुरंत यह नहीं कहते, "जाओ वर्ल्ड कप जीतो!" इसके बजाय, वे इसे छोटे हिस्सों में तोड़ते हैं: "आज, हम पासिंग का अभ्यास करेंगे। कल, हम शूटिंग का अभ्यास करेंगे। अगले सप्ताह, हम डिफेंस करने का अभ्यास करेंगे।"

CRAFT एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है—जो एक प्रकार का AI है जो भाषा और तर्क को समझने में बहुत अच्छा है—ताकि वह इस कोच की भूमिका निभा सके। एक बड़े, डरावने कार्य (जैसे "दो रोबोट्स को एक गेट पार करना है") को दिए जाने पर, कोच इसे छोटे, आसान चरणों की एक सूची में तोड़ देता है:

  • चरण 1: बस गेट से टकराए बिना चलना सीखें।
  • चरण 2: गेट के पास से गुजरना सीखें।
  • चरण 3: समन्वय (coordinate) करना सीखें ताकि एक के गुजरने तक दूसरा प्रतीक्षा करे।

2. कोच खेल के नियम लिखता है (Reward Generation)

रोबोट प्रशिक्षण में, रोबोट अच्छा करने पर "पॉइंट्स" (इनाम) प्राप्त करके और बुरा करने पर पॉइंट्स खोकर सीखते हैं। आमतौर पर, इंसानों को ये नियम लिखने पड़ते हैं, जो कठिन है।

CRAFT का कोच प्रत्येक छोटे अभ्यास के लिए स्कोरिंग नियम लिखने के लिए AI का उपयोग करता है।

  • उदाहरण: "गेट के पास से गुजरने" वाले ड्रिल के लिए, AI एक नियम लिखता है जो कहता है, "आपको गेट के करीब आने के लिए पॉइंट्स मिलेंगे, लेकिन यदि आप उससे टकराते हैं तो आपके पॉइंट्स कट जाएंगे।"
  • AI इस नियम को कंप्यूटर कोड में लिखता है जिसे रोबट वास्तव में समझ सकते हैं।

3. कोच देखता है और आलोचना करता है (Policy Evaluation)

एक बार जब रोबोट अभ्यास करते हैं, तो एक विज़न-लैंग्वेज मॉडल (VLM)—एक ऐसा AI जो वीडियो देख सकता है और समझ सकता है कि क्या हो रहा है—रोबोट्स को देखता है। यह एक रेफरी की तरह काम करता है।

  • क्या वे सफल हुए? यदि हाँ, तो कोच कहता है, "बहुत बढ़िया! चलिए अगले अभ्यास पर चलते हैं।"
  • क्या वे विफल रहे? यदि वे टकरा गए या फंस गए, तो रेफरी केवल "असफल" नहीं कहता। वह वीडियो और स्कोर के इतिहास को देखता है ताकि यह पता लगाया जा सके कि क्यों ऐसा हुआ। शायद रोबोट संतुलन बनाने की कोशिश में बहुत अधिक व्यस्त थे और आगे बढ़ना भूल गए।

4. कोच नियमों में सुधार करता है (Reward Refinement)

यही जादुई हिस्सा है। यदि रोबोट विफल होते हैं, तो कोच हार नहीं मानता।

  • "रेफरी AI" सलाह देता है: "रोबोट संतुलन बनाने के लिए बहुत अधिक अंक प्राप्त कर रहे हैं और आगे बढ़ने के लिए पर्याप्त नहीं। आगे बढ़ने वाले नियम को अधिक मजबूत होने की आवश्यकता है।"
  • "कोच AI" इस सलाह को लेता है और समस्या को ठीक करने के लिए स्कोरिंग नियमों को फिर से लिखता है।
  • रोबोट नए नियमों के साथ फिर से प्रयास करते हैं। वे इस लूप (कोशिश करें -> देखें -> नियमों को ठीक करें -> फिर से कोशिश करें) को तब तक दोहराते रहते हैं जब तक कि वे उस विशिष्ट छोटे अभ्यास में महारत हासिल नहीं कर लेते।

परिणाम: सिमुलेशन से वास्तविकता तक

शोधकर्ताओं ने इसे दो मुख्य चुनौतियों पर परखा:

  1. क्वाड्रुपेड नेविगेशन (Quadruped Navigation): दो चार पैरों वाले रोबोट (कुत्तों की तरह) बिना टकराए एक संकीर्ण गेट से गुजरने का अभ्यास कर रहे हैं।
  2. बाइमैनुअल मैनिपुलेशन (Bimanual Manipulation): दो रोबोटिक हाथ मिलकर एक भारी बर्तन को सीधा रखते हुए उठाने का अभ्यास कर रहे हैं।

क्या हुआ?

  • इस कोच के बिना, अन्य विधियाँ विफल हो गईं या अजीब, अप्राकृतिक हरकतें सीखीं (जैसे कि पॉइंट्स पाने के लिए अपने जोड़ों को असंभव तरीकों से मोड़ना)।
  • CRAFT के साथ, रोबोटों ने सुचारू रूप से समन्वय करना सीखा। उन्होंने पहले बुनियादी बातें सीखीं, फिर कठिन चीजों की ओर बढ़े।
  • वास्तविक दुनिया का परीक्षण: सबसे अच्छी बात? शोधकर्ताओं ने कंप्यूटर सिमुलेशन में प्रशिक्षित रोबोट्स को वास्तविक भौतिक रोबोट्स (Unitree Go1 और Go2) पर रखा। बिना किसी अतिरिक्त ट्यूनिंग के, रोबोट वास्तविक दुनिया में गेट से सफलतापूर्वक गुजरे, जिससे साबित हुआ कि प्रशिक्षण काम कर गया।

सारांश में

CRAFT रोबोट्स के लिए एक धैर्यवान, बुद्धिमान ट्यूटर की तरह है। रोबोट्स के खुद से जटिल टीम वर्क सीखने की उम्मीद करने के बजाय, यह:

  1. बड़े कार्य को छोटे चरणों में सरल बनाता है।
  2. प्रत्येक चरण के लिए कस्टम नियम बनाता है।
  3. रोबोट्स को देखता है और गलतियाँ होने पर नियमों को ठीक करता है।
  4. उन्हें सरल अभ्यासों से जटिल समन्वय तक मार्गदर्शन देता है, जिससे अंततः उन्हें ऐसे वास्तविक दुनिया के कार्य करने में सक्षम बनाता है जिन्हें वे किसी अन्य तरीके से नहीं सीख सकते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →