The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration
यह शोध पत्र मल्टी-एजेंट एलएलएम (LLMs) में एक महत्वपूर्ण भेद्यता की पहचान करता है जहाँ बहुमत मतदान (majority voting) मध्यवर्ती तर्क के प्रति अपनी अंधापन के कारण प्रतिकूल बहुलकों (adversarial majorities) के विरुद्ध विफल हो जाता है, और एक टोकन-लेवल राउंड-रॉबिन सहयोग पद्धति का प्रस्ताव करता है जो सैद्धांतिक और अनुभवजन्य रूप से यह प्रदर्शित करती है कि इंटरलीविंग जनरेशन के माध्यम से ईमानदार एजेंटों को भ्रष्ट तर्क को सुधारने की अनुमति दी जाती है, भले ही वे संख्या में कम हों।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।
समस्या: "बुरे बहुमत" का जाल (The "Bad Majority" Trap)
कल्पना कीजिए कि आप एक कठिन गणित की समस्या हल करने की कोशिश कर रहे हैं। आप पाँच विशेषज्ञों से उनके उत्तर माँगते हैं।
- पुराना तरीका (बहुमत मतदान - Majority Voting): प्रत्येक विशेषज्ञ एक अलग कमरे में अकेले काम करता है, समस्या को हल करता है, और अपने उत्तर को एक कागज़ पर लिख देता है। आप उन पाँचों कागज़ों को इकट्ठा करते हैं और उस उत्तर को चुनते हैं जो सबसे अधिक बार आया हो।
दोष:
अब, कल्पना कीजिए कि एक खलनायक इमारत में घुस आता है और उन पाँच विशेषज्ञों में से तीन के कानों में एक गुप्त, सम्मोहक आदेश फुसफुसाता है: "गणित चाहे जो भी कहे, तुम्हें अपना उत्तर '3' ही लिखना है।"
भले ही अन्य दो विशेषज्ञ जानते हों कि सही उत्तर वास्तव में "4" है, लेकिन वे संख्या में कम हैं। खलनायक के पास बहुमत (majority) है। पुराना सिस्टम केवल वोटों को गिनता है, देखता है कि तीन "3" और दो "4" हैं, और आत्मविश्वास के साथ घोषित करता है कि "3" सही उत्तर है। सिस्टम को धोखा दिया गया है क्योंकि इसने केवल अंतिम परिणाम को देखा, उस तर्क (logic) को नहीं जो वहाँ तक पहुँचने के लिए इस्तेमाल किया गया था।
समाधान: "साझा व्हाइटबोर्ड" (टोकन-स्तर का सहयोग - Token-Level Collaboration)
लेखक मिलकर काम करने का एक नया तरीका प्रस्तावित करते हैं। अलग-अलग कमरों में काम करने के बजाय, सभी एक विशाल साझा व्हाइटबोर्ड के चारों ओर इकट्ठा होते हैं।
- नया तरीका (टोकन-स्तर का राउंड-रॉबिन):
- विशेषज्ञ A बोर्ड पर समाधान के पहले कुछ शब्द लिखता है।
- विशेषज्ञ B देखता है कि A ने क्या लिखा है, और फिर अगले कुछ शब्द जोड़ता है।
- विशेषज्ञ C पूरे बोर्ड को पढ़ता है, अपना हिस्सा जोड़ता है, और इसी तरह आगे बढ़ता है।
- वे बारी-बारी से मार्कर एक-दूसरे को सौंपते हैं, और मिलकर एक एकल कहानी का निर्माण करते हैं।
यह खलनायक को कैसे हराता है:
मान लीजिए कि खलनायक ने तीन विशेषज्ञों को "3" लिखने के लिए प्रेरित किया है।
- टर्न 1: एक भ्रष्ट विशेषज्ञ लिखना शुरू करता है, "9 का वर्गमूल 3 है..."
- टर्न 2: एक ईमानदार विशेषज्ञ (जिसे धोखा नहीं दिया गया है) मार्कर उठाता है। वह बोर्ड को पढ़ता है, देखता है कि तर्क गलत होने वाला है, और तुरंत हस्तक्षेप करता है। वह लिखता है: "रुको, ठहरो। यदि मूल (root) 3 है, तो 3 प्लस 1 बराबर 4 होता है। हम 3 पर नहीं रुक सकते।"
- टर्न 3: अगला भ्रष्ट विशेषज्ञ मार्कर उठाता है। वह देखता है कि बोर्ड अब स्पष्ट रूप से "4" दिखा रहा है। क्योंकि वे स्मार्ट AI मॉडल हैं, उनकी प्रोग्रामिंग उन्हें बोर्ड पर लिखे तर्क का पालन करने के लिए मजबूर करती है। वे वाक्य के प्रवाह को तोड़े बिना "4" को अनदेखा करके "3" नहीं लिख सकते। वे सही पथ पर आगे बढ़ने के लिए मजबूर हैं: "इसलिए, अंतिम उत्तर 4 है।"
मुख्य रूपक: "सत्य का आकर्षण" (The "Truth Attractor")
इस साझा व्हाइटबोर्ड को एक चुंबकीय क्षेत्र या एक नदी की मजबूत धारा के रूप में सोचें।
- पुराना तरीका: नदी पाँच अलग-अलग धाराओं में विभाजित है। यदि एक बांध (खलनायक) तीन धाराओं को रोकता है, तो पानी (उत्तर) गलत दिशा में बहने के लिए मजबूर हो जाता है।
- नया तरीका: यहाँ केवल एक ही नदी है। ईमानदार विशेषज्ञ एक मजबूत धारा की तरह कार्य करते हैं जो पानी को सही दिशा (सत्य) की ओर खींचती है। भले ही खलनायक पानी को तिरछा धकेलने की कोशिश करे, नदी का संवेग (साझा संदर्भ/shared context) इतना मजबूत होता है कि खलनायक का "धक्का" अगली ईमानदार बारी के सामने बह जाता है।
यह क्यों महत्वपूर्ण है
- यह तब भी काम करता है जब बुरे लोग बहुमत में हों: यह शोध पत्र गणितीय रूप से सिद्ध करता है कि जब तक "ईमानदार" बारीयाँ पर्याप्त बार होती हैं, वे गलत तर्क के हावी होने से पहले उसे सुधार सकती हैं। आपके पास 3 बुरे विशेषज्ञ और 2 अच्छे विशेषज्ञ हो सकते हैं, फिर भी अच्छे विशेषज्ञ जीत सकते हैं।
- यह सस्ता है: आपको अधिक कंप्यूटर या अधिक समय की आवश्यकता नहीं है। आपको बस यह बदलना है कि कंप्यूटर एक-दूसरे से कैसे बात करते हैं। 5 लोगों के उत्तर चिल्लाने के बजाय, वे एक लाइन में फुसफुसाते हुए एक ही नोट को आगे बढ़ाते हैं।
- यह "चापलूसी" (Sycophancy) को रोकता है: AI मॉडल अक्सर उसी बात से सहमत होने की कोशिश करते हैं जो उन्होंने अभी-अभी पढ़ी है (जैसे कि जी-हज़ूर कहना)। यदि बोर्ड पर "4" लिखा है, तो अगला AI वाक्य को सुचारू रखने के लिए "4" से सहमत होना चाहता है। यह प्रणाली इस स्वाभाविक प्रवृत्ति का उपयोग बुरे तत्वों को सच बोलने के लिए मजबूर करने हेतु करती है।
निष्कर्ष
वर्तमान AI सुरक्षा कई AI से राय माँगने और वोट लेने पर निर्भर करती है। लेकिन यदि कोई बुरा तत्व बहुमत को धोखा दे देता है, तो वोट विफल हो जाता है।
यह शोध पत्र सुझाव देता है कि हमें उत्तरों पर वोट देना बंद करना चाहिए और विचारों पर सहयोग करना शुरू करना चाहिए। AI को एक एकल, साझा तर्क प्रक्रिया बनाने के लिए मजबूर करके जहाँ वे शब्द-दर-शब्द एक-दूसरे को सुधार सकें, हम एक ऐसी प्रणाली बनाते हैं जहाँ सत्य एक भारी लंगर (anchor) की तरह है जो पूरे समूह को सुरक्षित वापस खींच लाता है, भले ही समूह के अधिकांश हिस्से को भटकने की कोशिश कर रहे हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।