← नवीनतम पेपर
🤖 AI

Beyond Partner Diversity: An Influence-Based Team Steering Framework for Zero-Shot Human-Machine Teaming

यह शोध पत्र इन्फ्लुएंस-बेस्ड टीम स्टीयरिंग (IBTS) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो पार्टनर डाइवर्सिटी (साझेदार विविधता) को इन्फ्लुएंस शेपिंग (प्रभाव आकार देने) के साथ जोड़कर ज़ीरो-शॉट ह्यूमन-मशीन टीमिंग को बढ़ाता है ताकि एजेंटों को मजबूत समन्वय पैटर्न खोजने और उनकी ओर निर्देशित करने में सक्षम बनाया जा सके, जो सिम्युलेटेड और वास्तविक दुनिया के ह्यूमन-एआई ओवरकुक्ड-एआई (Overcooked-AI) अध्ययनों में उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Wei Sheng, Rohan Paleja

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Sheng, Rohan Paleja

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके पेपर का विवरण दिया गया है।

बड़ी समस्या: रोबोट को अजनबियों के साथ नाचना सिखाना

कल्पना कीजिए कि आप एक रोबोट को व्यस्त रसोई में खाना बनाना सिखा रहे हैं। रोबोट निर्देशों का पालन करने में बहुत अच्छा है, लेकिन उसने पहले कभी आपके साथ काम नहीं किया है। अतीत में, शोधकर्ताओं ने रोबोट को अलग-अलग लोगों के खाना बनाने के हजारों वीडियो दिखाकर इसे हल करने की कोशिश की। उन्हें उम्मीद थी कि पर्याप्त विविधता देखकर, रोबोट यह सीख जाएगा कि किसी भी नए साथी के साथ कैसे तालमेल बिठाना है।

पेपर इसे "पार्टनर डायवर्सिटी" (Partner Diversity) कहता है। यह 100 अलग-अलग लोगों के साथ अभ्यास करके नृत्य सीखने जैसा है। आप बुनियादी बातों में अच्छे हो सकते हैं, लेकिन यदि आप किसी ऐसे व्यक्ति से मिलते हैं जो अजीब या अप्रत्याशित तरीके से नाचता है, तो भी आप एक-दूसरे से टकरा सकते हैं।

लेखक तर्क देते हैं कि केवल विभिन्न अभ्यास साथियों का होना ही काफी नहीं है। जब रसोई बड़ी हो जाती है (तीसरे व्यक्ति को जोड़ना) या निर्देश कठिन हो जाते हैं (स्पार्स रिवॉर्ड्स), तो रोबोट को केवल अभ्यास से अधिक की आवश्यकता होती है; उसे अपने साथियों को प्रभावित करने और टीम को एक अच्छी लय की ओर मोड़ने (steer) की समझ होनी चाहिए।

समाधान: IBTS (द "टीम कंडक्टर")

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे इन्फ्लुएंस-बेस्ड टीम स्टीयरिंग (IBTS) कहा जाता है। IBTS को रोबोट के लिए तीन चरणों वाले प्रशिक्षण शिविर के रूप में समझें:

चरण 1: टीमों का एक "सुपर-पूल" बनाना

रोबोट को केवल यादृच्छिक रूप से अभ्यास करने देने के बजाय, शोधकर्ता एक विशेष तकनीक का उपयोग करते हैं जिसे इन्फ्लुएंस शेपिंग (Influence Shaping) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक कोच केवल "गोल करो!" चिल्लाता नहीं है (जो तुरंत करना कठिन है)। इसके बजाय, कोच तब एक छोटा "हाई-फाइव" (एक इनाम) देता है जब कोई खिलाड़ी ऐसा कदम उठाता है जो भविष्य की सफलता के लिए अपने साथी को तैयार करता है।
  • यह क्या करता है: यह रोबोट को केवल अपने अगले कदम के बारे में सोचने के बजाय यह सोचने के लिए प्रोत्साहित करता है कि, "यदि मैं यहाँ चलता हूँ, तो क्या मेरा साथी भविष्य में कुछ मददगार कर पाएगा?" यह ऐसी टीमों का पुस्तकालय बनाता है जो केवल स्कोर करने में नहीं, बल्कि गेंद पास करने में भी अच्छी हैं।

चरण 2: "पैटर्न डिटेक्टिव" (पैटर्न का पता लगाने वाला)

एक बार जब रोबोट ने इस विविध टीम पूल के साथ अभ्यास कर लिया, तो उसे यह पहचानना सीखना होगा कि वह वर्तमान में किस तरह की टीम के साथ काम कर रहा है।

  • उपमा: कल्पना कीजिए कि रोबोट एक जासूस है। वह खेल के पहले कुछ सेकंड देखता है और पूछता है, "क्या यह टीम उस 'पासिंग टीम' जैसी दिखती है जिसके साथ मैंने अभ्यास किया था? या यह 'रशिंग टीम' है?"
  • यह क्या करता है: रोबोट एक मानसिक मानचित्र (एक प्रेडिक्टर) बनाता है जो हाल के कार्यों के इतिहास को देखता है और अनुमान लगाता है कि अभी किस "शैली" का समन्वय हो रहा है।

चरण 3: "स्टीयरिंग व्हील" (स्टीयरिंग व्हील)

यह अंतिम चरण है जहाँ रोबोट टीम को सफलता की ओर ले जाना सीखता है।

  • उपमा: कल्पना कीजिए कि आप जीपीएस के साथ कार चला रहे हैं। जीपीएस केवल यह नहीं कहता कि "तेज़ चलो।" यह कहता है, "आप वर्तमान में एक 'स्लो टीम' की तरह गाड़ी चला रहे हैं, लेकिन यदि आप यह विशिष्ट मोड़ लेते हैं, तो आप एक 'फास्ट टीम' की तरह गाड़ी चलाने लगेंगे, जिससे हम मंजिल तक तेज़ी से पहुँच जाएँगे।"
  • यह क्या करता है: रोबोट अपने "पैटर्न डिटेक्टिव" कौशल का उपयोग यह देखने के लिए करता है कि क्या वर्तमान टीम का प्रवाह कमजोर है। यदि ऐसा है, तो वह पूरे समूह को चरण 1 में सीखे गए एक मजबूत, अधिक कुशल पैटर्न की ओर मोड़ने के लिए अपने कार्यों को धीरे से निर्देशित करता है।

उन्होंने इसका परीक्षण कैसे किया: "ओवरकुक्ड" किचन

इसका परीक्षण करने के लिए, शोधकर्ताओं ने Overcooked-AI नामक एक लोकप्रिय वीडियो गेम का उपयोग किया।

  • सेटअप: इंसानों और AI एजेंटों को मिलकर प्याज काटने, सूप पकाने और उसे परोसने का काम करना होता है।
  • चुनौती: उन्होंने इसे दो परिदृश्यों में परखा:
    1. दो-व्यक्ति टीम: एक इंसान, एक रोबोट।
    2. तीन-व्यक्ति टीम: दो इंसान, एक रोबोट। (यह बहुत कठिन है क्योंकि इंसानों को एक-दूसरे के साथ और रोबोट के साथ भी तालमेल बिठाना पड़ता है)।
  • परिणाम:
    • सिम्युलेटेड टेस्ट: उन्होंने नकली साथियों (जिनमें अलग-अलग व्यक्तित्व जैसे "सहमत," "बहिर्मुखी," या "चिंतित" की नकल करने वाले AI शामिल थे) के खिलाफ रोबत का परीक्षण किया। IBTS लगभग हर बार जीता, विशेष रूप से कठिन तीन-व्यक्ति परिदृश्यों में जहाँ पुराने तरीके विफल हो गए थे।
    • वास्तविक मानव परीक्षण: वे 30 वास्तविक लोगों को गेम खेलने के लिए लाए। IBTS के साथ प्रशिक्षित रोबोट ने लगातार मानव टीमों को पुराने तरीकों से प्रशिक्षित रोबोटों की तुलना में अधिक अंक दिलाने में मदद की।

मुख्य निष्कर्ष

यह पेपर दावा करता है कि रोबोट को मनुष्यों (विशेष रूप से समूहों में) के साथ अच्छी तरह से काम करने के लिए, हम उन्हें केवल अलग-अलग लोगों की भीड़ में नहीं फेंक सकते और उम्मीद नहीं कर सकते कि वे सीख जाएंगे। हमें उन्हें सिखाना होगा कि कैसे अपने साथियों को प्रभावित किया जाए ताकि अच्छी आदतें बनाई जा सकें, और फिर उन्हें वास्तविक समय में उन अच्छी आदतों की ओर टीम को पहचानने और मोड़ने (steer) के लिए सिखाना होगा।

लेखक निष्कर्ष निकालते हैं कि हालांकि उनकी विधि अच्छी तरह काम करती है, लेकिन यह पूर्ण नहीं है। कभी-कभी, इस प्रशिक्षण के बावजूद, रोबोट अभी भी एक मानव-निर्मित रणनीति की सहजता (intuition) से मेल खाने में संघर्ष करता है, और मनुष्य अपने मानव साथियों पर रोबोट साथियों की तुलना में अधिक भरोसा करते हैं, भले ही रोबोट अधिक अंक प्राप्त कर रहा हो। लेकिन, यह उन रोबोटों की दिशा में एक महत्वपूर्ण कदम है जो वास्तव में एक समूह में मनुष्यों के साथ "जैम" (तालमेल बिठाना) कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →