← नवीनतम पेपर
🤖 AI

Robust Multi-Agent LLMs under Byzantine Faults

यह शोध पत्र सेल्फ-एंकोर्ड कंसेंसस (SAC) को प्रस्तुत करता है, जो एक पूर्णतः विकेंद्रीकृत इटरेटिव फ़िल्टर-एंड-रिफ़ाइन प्रोटोकॉल है जो लार्ज लैंग्वेज मॉडल मल्टी-एजेंट सिस्टम को असुरक्षित लीडर-आधारित समन्वय या स्व-रिपोर्टेड कॉन्फिडेंस पर निर्भर रहे बिना, विविध संचार टोपोलॉजी में बायज़ेंटाइन दोषों का मजबूती से प्रतिरोध करने और विश्वसनीय प्रदर्शन बनाए रखने में सक्षम बनाता है।

मूल लेखक: Haejoon Lee, Vincent-Daniel Yun, Hyeonho Oh, Dimitra Panagou, Sai Praneeth Karimireddy

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haejoon Lee, Vincent-Daniel Yun, Hyeonho Oh, Dimitra Panagou, Sai Praneeth Karimireddy

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह मिलकर एक कठिन पहेली को सुलझाने की कोशिश कर रहा है। वे सभी बुद्धिमान हैं, लेकिन कुछ थके हुए हैं, कुछ भ्रमित हैं, और दुर्भाग्य से, एक या दो "शरारती तत्व" जानबूझकर समूह को गलत उत्तर की ओर ले जाने की कोशिश कर रहे हैं। यह वही समस्या है जिसे यह शोध पत्र (paper) हल करता है: AI एजेंटों (डिजिटल "दोस्तों") की एक टीम कैसे मिलकर सही उत्तर खोज सकती है जब उनमें से कुछ अविश्वसनीय या दुर्भावनापूर्ण हों?

यहाँ रोजमर्रा के उदाहरणों का उपयोग करके इस शोध पत्र की कहानी का एक सरल विवरण दिया गया है।

समस्या: "आत्मविश्वास" का जाल (The "Confidence" Trap)

अतीत में, शोधकर्ताओं ने हर AI एजेंट से यह पूछकर इसे हल करने की कोशिश की थी कि, "मैं अपने उत्तर के बारे में कितना आश्वस्त हूँ?"

  • दोष: कल्पना कीजिए कि आपके मित्र समूह में एक शरारती व्यक्ति है जो पहेली के बारे में गलत है, लेकिन वह जोर से चिल्लाता है, "मुझे अपने उत्तर पर 100% भरोसा है!" अन्य मित्र, उस ऊंचे आत्मविश्वास पर भरोसा करते हुए, अपना मन बदल सकते हैं और गलत रास्ते पर चल सकते हैं।
  • शोध पत्र का निष्कर्ष: लेखक दिखाते हैं कि एजेंट द्वारा स्वयं रिपोर्ट किए गए आत्मविश्वास पर भरोसा करना एक बहुत बड़ी सुरक्षा खामी है। एक दुर्भावनापूर्ण एजेंट पूरे समूह को धोखा देने के लिए अपने आत्मविश्वास के बारे में आसानी से झूठ बोल सकता है।

समाधान: "सेल्फ-एंकोर्ड कंसेंसस" (SAC)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे सेल्फ-एंकोर्ड कंसेंसस (SAC) कहा जाता है। "तुम कितने आश्वस्त हो?" पूछने के बजाय, सिस्टम पूछता है, "मैं इस बात को लेकर कितना आश्वस्त हूँ कि तुम्हारा उत्तर सही है?"

इसे एक पीयर रिव्यू पार्टी (Peer Review Party) की तरह समझें:

  1. प्रसार (The Broadcast): हर कोई पहेली का अपना उत्तर लिखता है और उसे अपने पड़ोसियों के साथ साझा करता है।
  2. स्थानीय न्यायाधीश (The Local Judge): लेखक के आत्मविश्वास पर भरोसा करने के बजाय, प्रत्येक एजेंट अपने पड़ोसियों के लिए एक न्यायाधीश के रूप में कार्य करता है। वह पड़ोसी के उत्तर को देखता है और अपने आंतरिक तर्क से पूछता है: "क्या यह समझ में आता है? क्या यह सही है?" वह अपने स्वयं के निर्णय के आधार पर पड़ोसी को एक स्कोर देता है।
  3. फ़िल्टर (The "Bottom F" Rule): यह सबसे महत्वपूर्ण हिस्सा है। यदि किसी एजेंट के पास 5 पड़ोसी हैं, और वह जानता है कि वहां अधिकतम 3 शरारती तत्व हो सकते हैं (एक अवधारणा जिसे "बाइजेंटाइन" सीमा कहा जाता है), तो वह बस 3 सबसे कम स्कोर वाले उत्तरों को अनदेखा कर देता है। इससे कोई फर्क नहीं पड़ता कि शरारती तत्व ने चिल्लाकर कहा था "मैं 100% सुनिश्चित हूँ!"—यदि स्थानीय न्यायाधीश को लगता है कि उत्तर खराब है, तो उसे बाहर कर दिया जाता है।
  4. परिष्करण (The Refine): एजेंट फिर अपने स्वयं के उत्तर और अपने पड़ोसियों के शेष "अच्छे" उत्तरों को लेकर एक नया, बेहतर उत्तर बनाता है।

सुरक्षा जाल: "रोबस्ट" नेटवर्क (The "Robust" Network)

इस सिस्टम के काम करने के लिए, दोस्तों को एक विशिष्ट तरीके से जुड़ा होना चाहिए। यह पेपर (F+1)(F+1)-robustness की एक गणितीय अवधारणा का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप लोगों के एक समूह के साथ एक कमरे में हैं। यदि आप यह सुनिश्चित करना चाहते हैं कि आप झूठ बोलने वालों से घिरे नहीं हैं, तो आपको यह सुनिश्चित करने की आवश्यकता है कि भले ही आप सबसे खराब 3 लोगों के साथ अपने संबंध काट दें, फिर भी आपके पास बात करने के लिए कम से कम एक ईमानदार व्यक्ति बचा रहे।
  • यह पेपर सिद्ध करता है कि यदि नेटवर्क को इस विशिष्ट "सुरक्षा मार्जिन" के साथ डिज़ाइन किया गया है, तो ईमानदार एजेंट हमेशा कम से कम एक अच्छा उत्तर खोजने में सक्षम होंगे जिसे वे पकड़ सकें, जिससे शरारती तत्वों को पूरे समूह को नीचे गिराने से रोका जा सके।

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने दो प्रकार की पहेलियों पर इसका परीक्षण किया: गणित की समस्याएं (जैसे समीकरणों को हल करना) और सामान्य ज्ञान के प्रश्न (जैसे "टमाटर एक फल है या सब्जी?")।

  • पुराना तरीका (CP-WBFT): जब एक शरारती तत्व ने अपने आत्मविश्वास के बारे में झूठ बोला, तो पूरा समूह ढह गया। बुद्धिमान एजेंट भ्रमित हो गए और गलत उत्तर देने लगे। समूह का प्रदर्शन वास्तव में अकेले काम करने की तुलना में बदतर हो गया।
  • नया तरीका (SAC): शरारती तत्वों को सफलतापूर्वक फ़िल्टर कर दिया गया।
    • मजबूत एजेंट: सबसे बुद्धिमान एजेंट बुद्धिमान बने रहे। उन्हें शोर से प्रभावित नहीं किया गया।
    • कमजोर एजेंट: कम आश्वस्त एजेंट वास्तव में बेहतर हुए क्योंकि उन्होंने अपने पड़ोसियों के फ़िल्टर किए गए, उच्च-गुणवत्ता वाले उत्तरों से सीखा।
    • परिणाम: समूह ने सही उत्तर बहुत अधिक बार प्राप्त किया, भले ही शरारती तत्व मौजूद थे।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र एक ऐसा तरीका पेश करता है जहाँ AI एजेंट एक-दूसरे की "डींग मारने" (स्व-रिपोर्ट किए गए आत्मविश्वास) पर भरोसा नहीं करते हैं। इसके बजाय, वे अपने पड़ोसियों के काम का न्याय करने की अपनी क्षमता पर भरोसा करते हैं। सबसे खराब उत्तरों को फ़िल्टर करके और नेटवर्क को एक विशिष्ट, मजबूत तरीके से जोड़कर, समूह सही राह पर रह सकता है और समस्याओं को सही ढंग से हल कर सकता है, भले ही कुछ सदस्य उन्हें बाधित करने की कोशिश कर रहे हों।

संक्षेप में: इस पर ध्यान न दें कि कौन सबसे ज़ोर से चिल्ला रहा है; बल्कि इस पर ध्यान दें कि किसके पास सबसे अच्छा प्रमाण है, और सुनिश्चित करें कि आपके पास बुरे लोगों को अनदेखा करने के लिए पर्याप्त अच्छे दोस्त हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →