← नवीनतम पेपर
🤖 AI

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

यह शोध पत्र ओपन-सेट सुधारात्मक सहायता (Open-Set Corrective Assistance) के नवीन कार्य के लिए विविध सिंथेटिक इंटरैक्टिव डेटा पर फाइन-ट्यून किए गए एक मल्टीमॉडल फाउंडेशन मॉडल की सामान्यीकरण क्षमताओं की जांच करता है, जो यह प्रदर्शित करता है कि प्रभावी ओपन-सेट सहायक बुद्धिमत्ता के लिए ऐसे डेटासेट की आवश्यकता होती है जिनमें मल्टीमॉडल ग्राउंडिंग, दोष अनुमान (defect inference), और विविध परिदृश्यों का एक्सपोजर शामिल हो।

मूल लेखक: Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक "सौ-शेफ" (sous-chef) बनने के लिए प्रशिक्षित कर रहे हैं, जो "ओवरकुक्ड" (Overcooked) नामक एक काल्पनिक, अराजक वर्चुअल किचन में काम करता है। आपका लक्ष्य केवल रोबोट को सही ढंग से खाना बनाना सिखाना नहीं है; बल्कि आपका लक्ष्य यह है कि रोबोट आपको खाना बनाते हुए देखे, आपकी गलतियों को पहचाने और उन्हें ठीक करने के लिए आपको धीरे से बताए।

यह पेपर इस बारे में है कि एक रोबोट को एक सहायक सौ-शेफ बनने के लिए कैसे प्रशिक्षित किया जाए, तब भी जब वह ऐसी गलती का सामना करे जो उसने पहले कभी नहीं देखी हो।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:

1. बड़ी समस्या: "क्लोज्ड-सेट" (Closed-Set) का जाल

आज के अधिकांश AI रोबोट उन छात्रों की तरह हैं जो केवल एक विशिष्ट बहुविकल्पीय परीक्षा (multiple-choice test) के लिए पढ़ाई करते हैं। यदि परीक्षा में पूछा जाता है, "क्या आप प्याज काटना भूल गए?" तो रोबोट को उत्तर पता होता है। लेकिन यदि परीक्षा में पूछा जाता है, "आप स्टेक (steak) को सिंक में क्यों धो रहे हैं?" तो रोबोट घबरा जाता है क्योंकि यह सवाल उसके स्टडी गाइड में नहीं था।

वास्तविक दुनिया में, इंसान अजीब और अप्रत्याशित गलतियाँ करते हैं। हमें एक ऐसे रोबोट की आवश्यकता है जो ओपन-सेट (Open-Set) सहायता संभाल सके—यानी, वह किसी भी गलती को समझ सके, भले ही वह बिल्कुल नई क्यों न हो।

2. समाधान: "सिंथेटिक किचन" (The Synthetic Kitchen)

चूंकि वास्तविक किचन में हजारों असली इंसानों को गलतियाँ करने के लिए काम पर रखना बहुत महंगा और धीमा होगा, इसलिए शोधकर्ताओं ने एक वीडियो गेम सिमुलेशन (Overcooked) बनाया।

  • अभिनेता (The Actors): उन्होंने "सिंथेटिक यूजर्स" (इंसानों की तरह व्यवहार करने वाले कंप्यूटर प्रोग्राम) बनाए।
  • ग्लिच (The Glitches): उन्होंने इन अभिनेताओं को विशिष्ट "दिमागी ग्लिच" (दोष) के साथ प्रोग्राम किया। उदाहरण के लिए, एक अभिनेता सोचता है कि सूप को 3 के बजाय 5 टमाटरों की आवश्यकता है; दूसरा सोचता है कि वह कटिंग बोर्ड पर स्टेक पका सकता है।
  • डेटा (The Data): उन्होंने गेमप्ले के हजारों घंटे उत्पन्न किए जहाँ ये ग्लिच वाले अभिनेता विफल होते हैं, और फिर उन्होंने हर एक विफलता के लिए "सही" सलाह लिखने के लिए एक सुपर-स्मार्ट AI (GPT-4) का उपयोग किया।

इसे एक विशाल "हाउ-टू" (कैसे करें) गाइड की लाइब्रेरी के रूप में सोचें, जो गेम के अंदर हर उस तरीके के लिए बनाई गई है जिससे कोई इंसान खाना बनाने में गलती कर सकता है।

3. प्रशिक्षण: तीन प्रकार के सबक

रोबोट को स्मार्ट बनाने के लिए, उन्होंने इसे केवल गलतियाँ नहीं दिखाईं। उन्होंने इसे तीन प्रकार के प्रशिक्षण डेटा दिए:

  • "आंखों" का प्रशिक्षण (Grounding): इससे पहले कि रोबोट सलाह दे सके, उसे यह समझना होगा कि वह क्या देख रहा है। उन्होंने इसे ऐसे सवालों के जवाब देने के लिए प्रशिक्षित किया जैसे, "क्या सूप उबल रहा है?" या "चाकू कहाँ है?" यह रोबोट को किचन का नक्शा पढ़ना सिखाने जैसा है।
  • "कोच" का प्रशिक्षण: उन्होंने रोबोट को यह समझाने के लिए एक टेक्स्ट मैसेज लिखना सिखाया कि गलती क्यों हुई (जैसे, "आपने स्टेक को ग्रिल पर बहुत जल्दी रख दिया")।
  • "फिक्स-इट" (ठीक करने का) प्रशिक्षण: उन्होंने रोबोट को अगला सही कदम शारीरिक रूप से प्रदर्शित करना सिखाया (जैसे, "टमाटर उठाएं और बाईं ओर बढ़ें")।

4. बड़ा टेस्ट: "अननोन" (Unknown) परिदृश्य

असली जादू तब हुआ जब उन्होंने रोबोट का परीक्षण उन चीजों पर किया जो उसने प्रशिक्षण के दौरान कभी नहीं देखी थीं।

  • टेस्ट A: नई गलतियाँ। उन्होंने रोबled को एक ऐसा "ग्लिच" दिया जिसका उसने पहले कभी सामना नहीं किया था (जैसे, एक खिलाड़ी जो बर्तन धोने से मना कर देता है)।
    • परिणाम: उनके विविध सिंथेटिक डेटा पर प्रशिक्षित होने के कारण, रोबोट एक मानक AI (GPT-4o) की तुलना में सुधार का अनुमान लगाने में बहुत बेहतर था, जिसने इस विशिष्ट "कुकिंग लॉजिक" पर प्रशिक्षण नहीं लिया था।
  • टेस्ट B: नई रेसिपी। उन्होंने रोबोट को एक पूरी तरह से नई रेसिपी दी (जैसे, "सूप" के बजाय "स्टेक स्टू" बनाना)।
    • परिणाम: रोबोट को स्टेक और सूप के बारे में जो कुछ भी पता था, उसे मिलाकर नए चरणों का पता लगाना पड़ा। बड़ा, स्मार्ट रोबोट (8 बिलियन पैरामीटर्स वाला) इसमें बहुत अच्छा था, जिससे पता चला कि वह अपने ज्ञान को "मिक्स एंड मैच" कर सकता है।

5. मुख्य निष्कर्ष: "कंपोजिशनैलिटी" (Compositionality) ही सर्वोपरि है

पेपर ने पाया कि एक अच्छा सहायक बनने के लिए, AI को केवल नियमों की सूची से अधिक की आवश्यकता है। उसे कंपोजिशनैलिटी (Compositionality) की आवश्यकता है।

उपमा:
मान लीजिए कि आप किसी को गाड़ी चलाना सिखा रहे हैं।

  • खराब प्रशिक्षण: आप उन्हें 100 वीडियो दिखाते हैं जिनमें एक कार लाल बत्ती से टकरा रही है। वे रेड लाइट पर रुकना सीख जाते हैं। लेकिन यदि वे एक टूटी हुई हरी बत्ती देखते हैं, तो वे दुर्घटनाग्रस्त हो जाते हैं।
  • अच्छा प्रशिक्षण (यह पेपर): आप उन्हें सिखाते हैं कि "लाइट" क्या है, "रुकना" क्या होता है, और "ट्रैफिक नियम" क्या हैं। फिर, जब वे एक टूटी हुई हरी बत्ती देखते हैं, तो वे तर्क (reason) कर सकते हैं: "लाइट टूटी हुई है, लेकिन नियम यह है कि चौराहों पर रुकना है, इसलिए मुझे रुकना चाहिए।"

शोधकर्ताओं ने पाया कि AI को एक साथ कई प्रकार के डेटा (विजुअल प्रश्न, कोचिंग, और फिजिकल फिक्स) पर प्रशिक्षित करने से, रोबोट ने केवल विशिष्ट चरणों को नहीं, बल्कि खाना बनाने के सिद्धांतों (concepts) को सीखा। इसने इसे नई, अजीब स्थितियों में सामान्यीकरण (generalize) करने में सक्षम बनाया।

सारांश

यह पेपर साबित करता है कि यदि आप चाहते हैं कि वास्तविक दुनिया में एक रोबोट एक सहायक बने, तो आप केवल वास्तविक दुनिया का डेटा (जो दुर्लभ और अव्यवस्थित है) उसे नहीं दे सकते। इसके बजाय, आपको एक विविध, सिंथेटिक ट्रेनिंग ग्राउंड बनाना चाहिए जहाँ रोबोट कल्पना योग्य हर तरह की गलती को पहचानने और ठीक करने का अभ्यास कर सके।

ऐसा करके, रोबोट कार्य के सिद्धांतों को सीखता है, जिससे वह तब भी एक सहायक कोच बना रहता है जब इंसान कुछ पूरी तरह से अप्रत्याशित करता है। यह एक रोबोट जो स्क्रिप्ट रटता है और एक ऐसे रोबोट के बीच का अंतर है जो वास्तव में खेल को समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →