← नवीनतम पेपर
🤖 machine learning

A Linear Matching Bandit Approach to Online Multi-Human Multi-Robot Teaming

यह शोध पत्र LinMatch प्रस्तुत करता है, जो मल्टी-ह्यूमन मल्टी-रोबोट टीमिंग के लिए एक ऑनलाइन लर्निंग एल्गोरिदम है, जो असाइनमेंट समस्या को लीनियर मैचिंग बैंडिट के रूप में स्वरूपित करता है, हंगेरियन एल्गोरिदम के माध्यम से मैक्सिमम वेटेड मैचिंग को हल करके Θ~(dMKT)\tilde{\Theta}(d\sqrt{MKT}) के स्ट्रिक्टली ऑप्टिमल रिग्रेट बाउंड्स प्राप्त करता है, और हाउसिंग एलोकेशन और रिकमेंडेशन सिस्टम जैसे व्यापक अनुप्रयोगों तक विस्तारित होता है।

मूल लेखक: Yaohui Guo, X. Jessie Yang, Cong Shi

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaohui Guo, X. Jessie Yang, Cong Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: रोबोट और इंसानों के लिए "ब्लाइंड डेट"

कल्पना कीजिए कि आप एक व्यस्त कार्यक्रम चला रहे हैं जहाँ आपके पास रोबोटों का एक निश्चित समूह है (मान लीजिए 20 रोबोट) और इंसानों का एक समूह है (मान लीजिए 10 इंसान) जो शिफ्ट में आते हैं। हर घंटे, 10 इंसानों का एक नया समूह आता है, और आपको कार्य को पूरा करने के लिए प्रत्येक इंसान को एक रोबोट के साथ जोड़ना होता है।

लक्ष्य सरल है: सभी जोड़ों की कुल खुशी (इनाम/रिवॉर्ड) को अधिकतम करना।

चुनौती: आप रोबोटों को बहुत अच्छी तरह से नहीं जानते।

  • आप इंसानों को जानते हैं: आप उनके कौशल, उनके व्यक्तित्व और वे किन चीजों में अच्छे हैं (उनके "फीचर्स") को जानते हैं।
  • आप रोबोटों को नहीं जानते: वे जटिल मशीनें हैं जिनमें छिपी हुई क्षमताएं हैं। आप नहीं जानते कि रोबोट #5 भारी बक्से उठाने में माहिर है या रोबोट #12 नाजुक असेंबली में बेहतर है। आप केवल उन्हें आपस में जोड़कर और यह देखकर पता लगाते हैं कि वे एक साथ कितनी अच्छी तरह काम करते हैं।

यह एक क्लासिक "करते-करते सीखना" (learning while doing) वाली समस्या है। यदि आप गलत अनुमान लगाते हैं, तो टीम विफल हो जाती है। यदि आप सही अनुमान लगाते हैं, तो वे सफल होते हैं। लेकिन आप केवल रैंडम अनुमान नहीं लगा सकते; आपको खराब जोड़ियों पर बहुत अधिक समय बर्बाद किए बिना रोबोटों के बारे में तेजी से सीखने के लिए एक स्मार्ट रणनीति की आवश्यकता है।

समस्या: बहुत सारे विकल्प, बहुत कम समय

यदि आप हर संभव रोबोट-इंसान संयोजन को एक-एक करके सीखने की कोशिश करेंगे, तो आप हमेशा के लिए फंस जाएंगे। 20 रोबोट और 10 इंसानों के साथ, उन्हें जोड़ने के संभावित तरीकों की संख्या अत्यधिक है (जैसे रेगिस्तान में रेत का एक विशिष्ट कण ढूंढना)। इसे "कॉम्बिनेटोरियल एक्सप्लोजन" (combinatorial explosion) कहा जाता है।

इसके अलावा, रोबोट "ब्लैक बॉक्स" हैं। आप उनके कोड को देखकर यह नहीं जान सकते कि वे कैसे काम करते; आपको उनका परीक्षण करना ही होगा।

समाधान: "LinMatch" (एक आशावादी मैचमेकर)

लेखकों ने LinMatch नामक एक नया एल्गोरिदम प्रस्तावित किया है। इसे एक सुपर-स्मार्ट मैचमेकर के रूप में सोचें जो "अनिश्चितता के सामने आशावाद" (Optimism in the Face of Uncertainty) नामक एक विशेष ट्रिक का उपयोग करता है।

LinMatch इस प्रकार काम करता है, चरण-दर-चरण:

  1. "अनुमान लगाने का खेल" (कॉन्फिडेंस इंटरवल):
    चूंकि रोबोट रहस्यमय हैं, इसलिए LinMatch को उनकी वास्तविक क्षमताओं का पता नहीं है। इसके बजाय, यह प्रत्येक रोबोट के लिए "संभावनाओं की एक सीमा" बनाता है।
  • उपमा: कल्पना करें कि रोबोट #5 एक रहस्यमय बॉक्स है। LinMatch कहता है, "मैं 95% आश्वस्त हूँ कि रोबोट #5 'औसत' और 'सुपरस्टार' के बीच कहीं है।" यह उस चीज़ के आसपास जो LinMatch सोचता है कि रोबोट कर सकता है, एक सुरक्षा जाल (कॉन्फिडेंस इंटरवल) खींचता है।
  1. "सर्वश्रेष्ठ स्थिति" (आशावाद):
    जब मिलान करने का समय आता है, तो LinMatch किसी रोबोट को उसके औसत अनुमान के आधार पर नहीं चुनता। यह उस रोबोट के सबसे अच्छे संस्करण के आधार पर चुनता है जो अभी भी उसके सुरक्षा जाल के भीतर फिट बैठता है।
  • उपमा: यदि रोबोट #5 का सुरक्षा जाल कहता है कि वह एक 'सुपरस्टार' हो सकता है, तो LinMatch योजना बनाने के लिए उसे एक सुपरस्टार की तरह मानता है। यह मान लेता है कि जब तक अन्यथा सिद्ध न हो जाए, तब तक सबसे अच्छा सच है। यह सिस्टम को उन रोबोटों को आज़माने के लिए प्रोत्साहित करता जिनके बारे में वह अभी तक ज्यादा नहीं जानता है, क्योंकि वे अद्भुत हो सकते हैं
  1. "हंगेरियन एल्गोरिदम" (कुशल समाधानकर्ता):
    एक बार जब LinMatch के पास प्रत्येक संभावित जोड़ी के लिए ये "सर्वश्रेष्ठ-मामले" वाले स्कोर आ जाते हैं, तो उसे एक विशाल पहेली सुलझानी होती है: "मैं इन 10 इंसानों को 20 रोबोटों के साथ कैसे जोड़ूँ ताकि उच्चतम कुल स्कोर प्राप्त हो सके?"
  • जादुई ट्रिक: लेखकों ने खोजा कि इस जटिल पहेली को एक सरल गणितीय समस्या (लीनियर प्रोग्राम) में बदला जा सकता है। वे एक प्रसिद्ध, कुशल गणितीय उपकरण का उपयोग करते हैं जिसे हंगेरियन एल्गोरिदम (एक गणितज्ञ के नाम पर, देश के नाम पर नहीं) कहा जाता है, ताकि इसे तुरंत हल किया जा सके। यह एक GPS होने जैसा है जो लाखों सड़कों वाले शहर में सबसे तेज़ रास्ता तुरंत ढूंढ लेता है, बजाय इसके कि हर सड़क को एक-एक करके आज़माया जाए।
  1. सीखना और अपडेट करना:
    रोबोटों और इंसानों के एक साथ काम करने के बाद, LinMatch को फीडबैक मिलता है (क्या वे सफल रहे? वे कितने तेज़ थे?)। यह रोबोटों के आसपास के "सुरक्षा जाल" को छोटा करने के लिए इस नए डेटा का उपयोग करता है।
  • परिणाम: वे जितना अधिक साथ काम करते हैं, अनुमान लगाने की आवश्यकता उतनी ही कम होती जाती है। सुरक्षा जाल और भी सख्त होते जाते हैं, और मिलान (मैचेस) और भी स्मार्ट होते जाते हैं।

यह पेपर एक बड़ी बात क्यों है

लेखकों ने केवल एक टूल नहीं बनाया; उन्होंने साबित किया है कि यह इस विशिष्ट काम के लिए सबसे अच्छा संभव टूल है।

  • स्पीड रिकॉर्ड: उन्होंने गणितीय रूप से सिद्ध किया कि उनका एल्गोरिदम भौतिक रूप से संभव जितनी तेजी से सीख सकता है, उतनी तेजी से सीखता है। कोई अन्य एल्गोरिदम LinMatch की तुलना में रोबोटों के बारे में महत्वपूर्ण रूप से तेजी से नहीं सीख सकता।
  • फॉर्मूला: उन्होंने दिखाया कि एल्गोरिदम द्वारा की जाने वाली "गलतियाँ" (रिग्रेट) समय के साथ बहुत धीरे-धीरे बढ़ती हैं। यह एक "सबलीनियर" (sublinear) विकास है, जिसका अर्थ है कि सिस्टम बेहतर और बेहतर होता जाता है, और सीखने की लागत समय के साथ नगण्य हो जाती है।
  • रोबोट्स से परे: हालांकि उन्होंने रोबोटों और इंसानों का उदाहरण दिया, लेकिन यह गणित किसी भी ऐसी स्थिति में काम करता है जहाँ आपको दो समूहों को जोड़ना होता है जहाँ एक पक्ष अज्ञात हो।
    • पेपर में उल्लेखित उदाहरण: आवास आवंटन (housing allocation), अनुशंसा प्रणाली (recommendation systems - उपयोगकर्ताओं को उत्पादों से मिलाना), और कार्य असाइनमेंट।

सारांश

LinMatch को एक ऐसे मैचमेकर के रूप में सोचें जो एक रहस्यमय साथी के "सर्वश्रेष्ठ संभावित संस्करण" पर दांव लगाने के लिए साहसी है, जो पूरे समूह को तुरंत व्यवस्थित करने के लिए एक सुपर-फास्ट कैलकुलेटर का उपयोग करता है, और अनुमान लगाना बंद करने और जानना शुरू करने के लिए हर बातचीत से सीखता है। पेपर यह सिद्ध करता है कि यह दृष्टिकोण न केवल अच्छा है, बल्कि इस प्रकार की मिलान समस्या को हल करने का गणितीय रूप से सबसे तेज़ तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →