← नवीनतम पेपर
🤖 AI

Partner-Aware Hierarchical Skill Discovery for Robust Human-AI Collaboration

यह शोध पत्र पार्टनर-अवेयर स्किल डिस्कवरी (PASD) को प्रस्तुत करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो पार्टनर के व्यवहार पर आधारित कौशल सीखने के लिए कंट्रास्टिव इंट्रिंसिक रिवार्ड्स का उपयोग करता है, जिससे शॉर्टकट लर्निंग की समस्या दूर होती है और विविध एवं नवीन पार्टनर्स के बीच सुदृढ़, अनुकूलन योग्य मानव-एआई सहयोग सक्षम होता है।

मूल लेखक: Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए साथी के साथ मिलकर एक जटिल भोजन बनाने की कोशिश कर रहे हैं। आपने पहले कभी उनके साथ काम नहीं किया है। वे तेज़, धीमे, लापरवाह या व्यवस्थित हो सकते हैं। यदि आप केवल अपनी खाना पकाने की शैली पर ध्यान केंद्रित करते हैं और उन पर ध्यान नहीं देते हैं, तो आप संभवतः एक-दूसरे से टकराएंगे, सामग्री गिरा देंगे, या एक ही सूप के बजाय दो अलग-अलग सूप बना लेंगे।

यह शोध पत्र AI "कुकिंग पार्टनर्स" (या किसी भी सहयोगी रोबोट) को प्रशिक्षित करने का एक नया तरीका पेश करता है ताकि वे किसी भी इंसान के साथ, चाहे उनका व्यवहार कैसा भी हो, सुचारू रूप से काम कर सकें। इस पद्धति का नाम PASD (पार्टनर-अवेयर स्किल डिस्कवरी) है।

यहाँ इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: "स्वार्थी" शेफ (The "Self-Centered" Chef)

वर्तमान में अधिकांश AI प्रशिक्षण विधियाँ एक ऐसे शेफ की तरह हैं जिसे केवल अपने चाकू चलाने के कौशल की चिंता होती है। वे सब्जियां काटने में जितना तेज़ हो सकते हैं, उतना तेज़ होने के लिए सीखते हैं क्योंकि इससे उन्हें "रिवॉर्ड" (पुरस्कार) मिलता है।

  • दोष: यदि साथी धीमा है, तो तेज़ शेफ और भी तेज़ी से काटता जाता है, यह नज़रअंदाज़ करते हुए कि साथी उसका साथ नहीं दे पा रहा है। AI "शॉर्टकट" सीखता है—यह वातावरण में अजीब पैटर्न ढूंढ लेता है जो इसे अच्छा दिखाते हैं लेकिन वास्तव में टीम की मदद नहीं करते। यह एक ऐसे डांसर की तरह है जो पागलों की तरह घूमता है क्योंकि उसे लगता है कि यह कूल दिखता है, भले ही उसका साथी स्थिर खड़ा हो।
  • परिणाम: जब आप इस AI को एक वास्तविक इंसान के साथ जोड़ते हैं जिसकी शैली अलग है, तो AI भ्रमित हो जाता है और तालमेल बिठाने में विफल रहता है।

2. समाधान: "दर्पण" शेफ (The "Mirror" Chef - PASD)

लेखकों ने PASD बनाया है, जो AI को अपने साथी का "दर्पण" बनना सिखाता है। केवल "कैसे काटें" सीखने के बजाय, AI सीखता है "जब मेरा साथी X कर रहा हो, तब कैसे काटें।"

इसे एक डांस सीखने की तरह समझें।

  • पुराना तरीका: AI 100 अलग-अलग डांस मूव्स (कौशल) की एक सूची सीखता है और अकेले ही उन्हें पूरी तरह से करने की कोशिश करता है।
  • PASD तरीका: AI अपने साथी को देखना सीखता है। यदि साथी एक धीमा, सुंदर मूव करता है, तो AI जानता है कि उसे "स्लो डांस" वाला कौशल चुनना चाहिए। यदि साथी एक तेज़, ऊर्जावान जंप करता है, तो AI "फास्ट डांस" वाला कौशल चुनता है।

3. यह कैसे सीखता है: "ग्रुप फोटो" वाला तरीका (The "Group Photo" Trick)

AI को कैसे पता चलता है कि कौन सा कौशल किस साथी से मेल खाता है? शोध पत्र एक चतुर तकनीक का उपयोग करता है जिसे कॉन्ट्रास्टिव लर्निंग (Contrastive Learning) कहा जाता है।

कल्पना कीजिए कि आप अलग-अलग गतिविधियाँ कर रहे दोस्तों के समूह की तस्वीरें ले रहे हैं:

  • सेटअप: आप एक ही "स्लो डांस" कौशल की 10 तस्वीरें लेते हैं, लेकिन हर बार आप AI को एक अलग साथी के साथ जोड़ते हैं (कोई लंबा है, कोई छोटा है, कोई तेज़ है, कोई धीमा है)।
  • लक्ष्य: AI को बताया जाता है, "भले ही ये साथी अलग दिखते हों, लेकिन 'स्लो डांस' के परिणाम वाली फोटो में सब एक जैसा दिखना चाहिए।"
  • कंट्रास्ट (अंतर): फिर, आप AI को "फास्ट जंप" कौशल की तस्वीरें दिखाते हैं। AI सीखता है: "ये तस्वीरें 'स्लो डांस' की तस्वीरों से बिल्कुल अलग दिखती हैं।"

ऐसा करके, AI यादृच्छिक शोर (जैसे साथी की लंबाई) को अनदेखा करना और साथी के हिलने-डुलने के पैटर्न पर ध्यान केंद्रित करना सीख जाता है। यह सीखता है कि, "आह, यह विशिष्ट साथी शैली हमेशा इस विशिष्ट टीम परिणाम की ओर ले जाती है।"

4. "इंट्रिन्सिक रिवॉर्ड": एक गुप्त स्कोर (The "Intrinsic Reward")

वीडियो गेम में, आपको दुश्मनों को मारने या सिक्के इकट्ठा करने के लिए अंक मिलते हैं (एक्सट्रिन्सिक रिवॉर्ड)। लेकिन यहाँ, AI को पैटर्न पहचानने के लिए ही एक गुप्त, आंतरिक स्कोर (इंट्रिन्सिक रिवॉर्ड) मिलता है।

  • यदि AI एक साथी को देखता है और सही अनुमान लगाता है, "ओह, यह साथी क्लॉकवाइज (घड़ी की दिशा में) घूमना पसंद करता है, इसलिए मुझे 'क्लॉकवाइज स्किल' का उपयोग करना चाहिए," तो उसे बोनस पॉइंट मिलता है।
  • यदि वह गलत अनुमान लगाता है और "काउंटर-क्लॉकवाइज स्किल" का उपयोग करता है, तो उसे पेनल्टी मिलती है।
  • यह बोनस पॉइंट AI को अंदाजे लगाने के बजाय साथी के व्यवहार पर बारीकी से ध्यान देने के लिए प्रोत्साहित करता है।

5. परिणाम: सफलतापूर्वक मिलकर खाना बनाना

शोधकर्ताओं ने इसका परीक्षण Overcooked-AI नामक एक गेम में किया, जहाँ दो एजेंट एक छोटे से किचन में मिलकर सूप बनाते हैं।

  • टेस्ट: उन्होंने AI को कई अलग-अलग "पार्टनर्स" के साथ जोड़ा (कुछ अन्य AI थे, कुछ वास्तविक मानव डेटा पर प्रशिक्षित कंप्यूटर मॉडल थे, और कुछ वास्तविक इंसान थे)।
  • परिणाम:
    • पुराने तरीके (जैसे FCP या DIAYN) अक्सर भ्रमित हो जाते थे या दीवारों से टकरा जाते थे क्योंकि वे अच्छी तरह से अनुकूलित नहीं हो पाते थे।
    • PASD जीत गया। इसने लगातार अधिक अंक प्राप्त किए।
    • जब वास्तविक इंसानों ने PASD AI के साथ खेला, तो उन्होंने अन्य AI के मुकाबले अधिक सूप बनाया और कम दुर्घटनाएँ हुईं।

निष्कर्ष (The Takeaway)

यह पेपर यह दावा नहीं करता कि AI अब कल ही आपके लिए रात का खाना बना सकता है। यह केवल यह साबित करता है कि यदि आप AI को यह सिखाते हैं कि वह किसके साथ काम कर रहा है उसके आधार पर कौशल सीखना (केवल यह कि वह क्या कर रहा है, इसके बजाय), तो वह एक बहुत बेहतर टीममेट बन जाता है। यह एक "अकेला भेड़िया" बनने के बजाय एक सच्चा साथी बन जाता है जो किसी की भी शैली के अनुसार खुद को ढाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →