← नवीनतम पेपर
💬 NLP

You Only Align Once: Propagating Cooperative Behaviors in Multi-Agent Systems through Seed Agents

यह शोध पत्र प्रदर्शित करता है कि एक रणनीतिक रूप से स्थापित "सीड एजेंट" (seed agent), जिसे प्राकृतिक भाषा संवाद के माध्यम से सहयोगात्मक व्यवहारों को प्रसारित करने के लिए प्रशिक्षित किया गया है, अप्रशिक्षित बहु-एजेंट टीमों में सहयोग की दरों को महत्वपूर्ण रूप से बढ़ा सकता है और इन सहयोगात्मक क्षमताओं को पूरी तरह से भिन्न वातावरणों में ज़ीरो-शॉट (zero-shot) सफलतापूर्वक स्थानांतरित कर सकता है।

मूल लेखक: Nicole Hsing, Asuka Yuxi Zheng, Yi Zhao, Haoqin Tu, Jen-Tse Huang

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicole Hsing, Asuka Yuxi Zheng, Yi Zhao, Haoqin Tu, Jen-Tse Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास लोगों (या रोबोटों) का एक बड़ा समूह है जो मिलकर किसी समस्या को हल करने की कोशिश कर रहे हैं, जैसे कि यह तय करना कि संसाधनों को साझा किया जाए या उन्हें अपने पास ही रखा जाए। कई मामलों में, हर कोई स्वार्थी रूप से कार्य करता है क्योंकि यह व्यक्तिगत रूप से सबसे समझदारी भरा कदम लगता है, भले ही यह लंबे समय में समूह को नुकसान पहुँचाता हो। यह एक क्लासिक "ट्रैजेडी ऑफ द कॉमन्स" (साझा संसाधनों की त्रासदी) या "प्रिजनर्स डिलेमा" (कैदी की दुविधा) है।

यह शोध पत्र एक सरल लेकिन शक्तिशाली प्रश्न पूछता है: यदि आप हर एक व्यक्ति को अच्छा बनने के लिए प्रशिक्षित नहीं कर सकते, तो क्या आप उनमें से कुछ को दूसरों को भी अच्छा बनने के लिए समझाने में बहुत कुशल बनाने के लिए प्रशिक्षित कर सकते हैं?

लेखक कहते हैं कि हाँ, यह संभव है। वे इस घटना को "अलाइनमेंट प्रोपेगेशन" (Alignment Propagation - सामंजस्य प्रसार) कहते हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं का उपयोग करके विवरण दिया गया है:

1. सेटअप: "रेड-ब्लैक" गेम

इसे एक टीम गेम के रूप में सोचें जो 10 राउंड तक खेला जाता है। पांच-पांच लोगों की दो टीमों को हर राउंड में यह तय करना होता है कि वे सहयोग (Cooperate) करेंगे (काला रंग) या धोखा देंगे (Defect) (लाल रंग)।

  • यदि दोनों टीमें सहयोग करती हैं, तो सभी को थोड़ा लाभ होता है।
  • यदि एक टीम धोखा देती है और दूसरी सहयोग करती है, तो धोखा देने वाला बड़ा लाभ कमाता है, और सहयोग करने वाला भारी नुकसान उठाता है।
  • यदि दोनों टीमें धोखा देती हैं, तो सभी को नुकसान होता है।

जटिल बात यह है कि खेल जैसे-जैसे आगे बढ़ता है, यह अधिक तीव्र होता जाता है (जैसे तूफान बिगड़ता जाता है) और धोखाधड़ी करने का प्रलोभन भी मजबूत होता जाता है। आमतौर पर, बिना किसी मदद के, ये AI एजेंट एक-दूसरे के खिलाफ हो जाते हैं और आपस में धोखा देना शुरू कर देते हैं, जिससे सभी के लिए बुरा परिणाम निकलता है।

2. समाधान: "सीड एजेंट" (बीज एजेंट)

शोधकर्ताओं ने सिस्टम के सभी 100 एजेंटों को फिर से प्रशिक्षित करने की कोशिश नहीं की। इसके बजाय, उन्होंने एक विशिष्ट AI मॉडल (एक "सीड एजेंट") को लिया और उसे एक विशेष "कोचिंग" सत्र दिया। उन्होंने इसे न केवल यह सिखाया कि क्या करना है, बल्कि यह भी सिखाया कि अपने साथियों से कैसे बात करनी है।

इस सीड एजेंट को एक कुशल मध्यस्थ या एक टीम कप्तान की तरह समझें जिसे बातचीत (negotiation) में प्रशिक्षित किया गया है। वे जानते हैं कि कैसे कहना है, "देखो, अगर हम अभी धोखाधड़ी करते हैं, तो हम इस राउंड में जीत सकते हैं, लेकिन हम पूरे खेल में हार जाएंगे। आइए एकजुट रहें।"

3. जादू: एक बीज पूरे कमरे को बदल देता है

जब उन्होंने इन प्रशिक्षित "सीड एजेंटों" में से केवल एक को चार अप्रशिक्षित, स्वार्थी एजेंटों के साथ एक कमरे में रखा, तो कुछ अद्भुत हुआ:

  • पहले: टीम केवल लगभग 25% बार सहयोग करती थी।
  • बाद में: टीम 62% बार सहयोग करती थी।

प्रशिक्षित एजेंट ने केवल खुद "सहयोग" के लिए वोट नहीं दिया; उसने अपने शब्दों का उपयोग अन्य चार एजेंटों को अपना मन बदलने के लिए प्रेरित करने के लिए किया। यह एक शोर भरे कमरे में एक शांत आवाज की तरह था जिसने बाकी सभी को चिल्लाना बंद करने और सुनने के लिए प्रेरित किया।

4. "जीरो-शॉट" ट्रांसफर: तैरना सीखना, फिर सर्फिंग करना

सबसे आश्चर्यजनक हिस्सा यहाँ है। सीड एजेंट को केवल "रेड-ब्लैक" गेम (टीम वोटिंग गेम) पर प्रशिक्षित किया गया था। उसने अगला परीक्षण वातावरण कभी नहीं देखा था।

फिर वे उसी प्रशिक्षित एजेंट को एक पूरी तरह से अलग दुनिया में ले गए जिसे "शुगरस्केप" (Sugarscape) कहा जाता है।

  • नई दुनिया: एक ग्रिड की कल्पना करें जहाँ 100 एजेंट भोजन (चीनी और मसाला) की तलाश में घूम रहे हैं। उन्हें जीवित रहने के लिए अपने पड़ोसियों के साथ व्यापार करना पड़ता है। यदि वे व्यापार नहीं करते हैं, तो वे भूख से मर जाते हैं।
  • परिणाम: इस प्रशिक्षित सीड एजेंट ने अपने पड़ोसियों को सफलतापूर्वक व्यापार करने में मदद की।
    • अप्रशिक्षित एजेंटों की सफलता दर व्यापार करने में 21% थी।
    • प्रशिक्षित सीड एजेंट ने समूह को 91% सफलता दर प्राप्त करने में मदद की।

यह ऐसा है जैसे आपने किसी व्यक्ति को बोर्ड गेम में शांति संधि कैसे की जाती है, यह सिखाया, और फिर उसे एक ऐसी उत्तरजीविता (survival) स्थिति में डाल दिया जहाँ वह बिना भूखे मरे तुरंत व्यापार करना जान गया। प्रेरणा की कला का कौशल पूरी तरह से स्थानांतरित हो गया।

5. यह क्यों काम करता है: यह "क्या" के बारे में नहीं, बल्कि "कैसे" के बारे में है

शोधकर्ताओं ने पाया कि केवल AI को "अच्छा बनो" (एक प्रॉम्प्ट) कहना अच्छी तरह से काम नहीं करता है। AI को अच्छा होने की प्रक्रिया पर प्रशिक्षित करने की आवश्यकता है।

  • प्रॉम्प्टिंग (Prompting) किसी को स्क्रिप्ट देने जैसा है: "कहें 'आइए सहयोग करें'।"
  • ट्रेनिंग (SFT) उन्हें प्रेरणा की कला सिखाने जैसा है: आपत्ति को कैसे सुनें, समस्या को कैसे नए रूप में प्रस्तुत करें, और विश्वास कैसे बनाएं।

प्रशिक्षित एजेंटों ने कहना सीखा जैसे, "मुझे पता है कि आप धोखा दिए जाने के बारे में चिंतित हैं, लेकिन यदि हम दोनों डटे रहते हैं, तो हम दोनों जीतेंगे। यदि आप अब धोखा देते हैं, तो आप हम दोनों को नुकसान पहुँचाएंगे।" इस तरह का तर्क ही अन्य एजेंटों के व्यवहार को बदल देता है।

6. मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि हमें दुनिया के हर एक AI को ठीक करने की आवश्यकता नहीं है ताकि वे मिलकर काम कर सकें। हमें बस सिस्टम में कुछ रणनीतिक "अच्छे बीजों" (प्रशिक्षित एजेंटों) को रखने की आवश्यकता है।

  • ब्रॉडकास्ट सेटिंग में (जैसे एक टीम मीटिंग जहाँ हर कोई सबको सुन सकता है), आपको पूरी टीम को सहयोग करने के लिए केवल लगभग 20% प्रशिक्षित लोगों की आवश्यकता है।
  • निजी सेटिंग में (जहाँ एजेंट केवल आमने-सामने बात करते हैं), आपको उच्च प्रतिशत (लगभग 50%) की आवश्यकता होती है क्योंकि "अच्छी खबर" धीरे फैलती है।

संक्षेप में: आपको फैक्ट्री में हर रोबोट का कोड फिर से लिखने की आवश्यकता नहीं है। यदि आप उनमें से कुछ को उत्कृष्ट संचारक और टीम प्लेयर बनने के लिए प्रशिक्षित करते हैं, तो वे स्वाभाविक रूप से समूह के बाकी हिस्सों को सहकारी व्यवहार से "संक्रमित" कर सकते हैं, जिससे एक अराजक भीड़ एक सामंजस्यपूर्ण टीम में बदल सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →