← नवीनतम पेपर
🤖 AI

Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification

यह शोध पत्र एक अनुकूलन योग्य सहकारी हमला ढांचा (adaptive cooperative attack framework) प्रस्तावित करके और वाक्य-स्तरीय विश्वसनीयता विश्लेषण और सुधार (Sentence-Level Trustworthiness Analysis and Rectification - STAR) रक्षा तंत्र को पेश करके, समन्वित दुर्भावनापूर्ण व्यवहारओं के प्रति LLM-आधारित मल्टी-एजेंट सिस्टम की संवेदनशीलता को संबोधित करता है, जो भ्रामक जानकारी की प्रभावी ढंग से पहचान करने और उसे सुधारने के माध्यम से कार्य सफलता दर को महत्वपूर्ण रूप से बहाल करता है।

मूल लेखक: Yaoyang Luo, Zhi Zheng, Ziwei Zhao, Tong Xu, Zhao Jielun, Wenjun Xue, Yong Chen, Enhong Chen

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaoyang Luo, Zhi Zheng, Ziwei Zhao, Tong Xu, Zhao Jielun, Wenjun Xue, Yong Chen, Enhong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि स्मार्ट रोबोटों (या "एजेंटों") की एक टीम एक पहेली को हल करने के लिए मिलकर काम कर रही है, जैसे कि किसी कठिन प्रश्न का उत्तर देना। वे एक-दूसरे से बात करते हैं, विचार साझा करते हैं और अंतिम उत्तर पर मतदान करते हैं। आमतौर पर, वे बहुत अच्छा काम करते हैं। लेकिन क्या होगा अगर कुछ रोबोट वास्तव में जासूस हों?

यह शोध पत्र दो चीजों के बारे में है:

  1. जासूसों द्वारा टीम को धोखा देने का एक नया, अधिक चालाकी भरा तरीका।
  2. जासूसों को पकड़ने और उनके झूठ को ठीक करने के लिए एक नया "सत्य डिटेक्टर" (Truth Detector)।

यहाँ सरल शब्दों में विवरण दिया गया है:

1. समस्या: जासूसों का मिलकर काम करना

अतीत में, शोधकर्ताओं ने सोचा था कि जासूस अकेले काम करते हैं। कल्पना कीजिए कि दोस्तों के एक समूह में एक जासूस एक झूठ फुसफुसा रहा है: "एफिल टॉवर रोम में है।" अन्य दोस्त इसे अनदेखा कर सकते हैं क्योंकि यह बेतुका लगता है।

लेकिन इस शोध पत्र ने कुछ अधिक डरावनी चीज़ खोजी है: सहकारी हमले (Cooperative Attacks)।
कल्पना कीजिए कि जासूस एक गुप्त चैट ग्रुप में हैं।

  • जासूस A कहता है: "एफिल टॉवर रोम में है।"
  • जासूस B (जो एक जासूस भी है) जवाब देता है: "हाँ, मैं सहमत हूँ! रोम इसके लिए प्रसिद्ध है।"
  • जासूस C जोड़ता है: "वास्तव में, मैंने एक किताब पढ़ी है जिसमें कहा गया है कि यह रोम में ही है।"

अब, ईमानदार दोस्त केवल एक झूठ नहीं सुन रहे हैं; वे सहमति के एक समूह स्वर (Chorus of Agreement) को सुन रहे हैं। जासूस अपने झूठ को ठोस तथ्य दिखाने के लिए वास्तविक समय में अपनी कहानियों को बदलते हैं। शोध पत्र ने पाया कि जब जासूस इस तरह मिलकर काम करते हैं, तो वे अकेले काम करने की तुलना में टीम की समस्या सुलझाने की क्षमता को बहुत तेज़ी से तोड़ देते हैं।

2. समाधान: "सेंटेंस-लेवल ट्रुथ स्कैनर" (STAR)

लेखकों ने STAR (Sentence-Level Trustworthiness Analysis and Rectification) नामक एक रक्षा प्रणाली बनाई है। इसे एक अत्यंत बुद्धिमान संपादक के रूप में समझें जो पूरे पैराग्राफ को नहीं, बल्कि टीम द्वारा लिखे गए प्रत्येक वाक्य को पढ़ता है।

STAR कैसे काम करता है, यहाँ चरण-दर-चरण बताया गया है:

  • चरण 1: सूक्ष्मदर्शी (वाक्य-स्तर का विघटन - Sentence-Level Decomposition)
    पूरे पैराग्राफ को देखकर यह कहने के बजाय कि, "यह संदिग्ध लग रहा है," STAR टेक्स्ट को व्यक्तिगत वाक्यों में तोड़ देता है।

    • उपमा: कल्पना कीजिए कि एक शिक्षक छात्र के निबंध को ग्रेड दे रहा है। पूरे निबंध के लिए केवल "C" देने के बजाय, शिक्षक ठीक उन वाक्यों को हाइलाइट करता है जो गलत हैं।
  • चरण 2: तथ्य-जांच (सत्यापन - Verification)
    प्रत्येक वाक्य के लिए, STAR एक शक्तिशाली AI से पूछता है: "क्या यह सच है? आप कितने निश्चित हैं?"

    • यदि वाक्य सत्य है, तो उसे हरा टिक मिलता है।
    • यदि वाक्य झूठ है, तो उसे लाल झंडा और एक कॉन्फिडेंस स्कोर मिलता है (जैसे, "मुझे 90% यकीन है कि यह झूठ है")।
  • चरण 3: "एडिट" बटन (लक्षित सुधार - Targeted Rectification)
    यही सबसे चतुर हिस्सा है। यदि कोई जासूस कहता है, "सिडनी ऑस्ट्रेलिया की राजधानी है क्योंकि यह समृद्ध है," तो STAR पूरे वाक्य को नहीं हटाता है। यह केवल झूठ को ठीक करता है।

    • मूल झूठ: "सिडनी राजधानी है... क्योंकि यह समृद्ध है।"
    • STAR का सुधार: "सिडनी आर्थिक केंद्र है... लेकिन यह राजधानी नहीं है।"
    • उपमा: यह एक स्पेल-चेकर की तरह है जो केवल एक शब्द को नहीं हटाता; बल्कि गलत शब्द को सही शब्द से बदल देता है जबकि बाकी वाक्य को बरकरार रखता है। यह झूठ को फैलने से रोकता है लेकिन उपयोगी जानकारी को बनाए रखता है।
  • चरण 4: वोट (मजबूत निर्णय एकत्रीकरण - Robust Decision Aggregation)
    अंत में, जब टीम उत्तर पर मतदान करती है, तो STAR कहता है, "हम जानते हैं कि झूठे कौन हैं। आइए उनके वोटों को न गिनें।" यह अंतिम निर्णय से संदिग्ध एजेंटों को हटा देता है, जिससे यह सुनिश्चित होता है कि ईमानदार एजेंट ही परिणाम तय करें।

3. परिणाम क्या दर्शाते हैं

शोधकर्ताओं ने विभिन्न प्रकार के प्रश्नों (जैसे सामान्य ज्ञान, तर्क पहेलियाँ और सामान्य समझ) पर विभिन्न AI मॉडल का उपयोग करके इसका परीक्षण किया।

  • हमला (The Attack): जब जासूसों ने मिलकर काम किया (Cooperative Attack), तो टीम की सफलता दर काफी गिर गई। टीम भ्रमित हो गई और बहुत अधिक गलत उत्तर देने लगी।
  • रक्षा (The Defense): जब उन्होंने STAR को चालू किया:
    • इसने झूठ को बहुत अच्छी तरह से पकड़ा (जासूसों को पहचानने में 70% से अधिक सटीकता)।
    • इसने टीम के प्रदर्शन को ठीक कर दिया, जिससे उनकी सफलता दर औसतन 36% तक बढ़ गई।
    • इसने अन्य मौजूदा सुरक्षा विधियों की तुलना में बेहतर प्रदर्शन किया।

4. लागत

शोध पत्र ने यह भी देखा कि इसमें कितनी "कंप्यूटिंग पावर" (या पैसा) खर्च होता है।

  • कुछ अन्य सुरक्षा विधियाँ बहुत महंगी हैं (जैसे टीम की निगरानी के लिए अतिरिक्त रोबोटों की एक बड़ी सेना को भुगतान करना)।
  • STAR कुछ न करने की तुलना में थोड़ा महंगा है, लेकिन यह अन्य भारी-भरकम सुरक्षा प्रणालियों की तुलना में बहुत सस्ता और अधिक कुशल है। यह "पैसे की पूरी वसूली" (Bang for your buck) वाला समाधान है।

सारांश

यह शोध पत्र हमें चेतावनी देता है कि यदि AI टीम में बुरे तत्व अपने झूठ का समन्वय करते हैं, तो वे आसानी से पूरे समूह को धोखा दे सकते हैं। लेकिन, लेखकों ने STAR बनाया है, जो एक सूक्ष्म संपादक की तरह कार्य करता है। यह हर वाक्य को पढ़ता है, विशिष्ट झूठ को ठीक करता है, अंतिम वोट के दौरान झूठ बोलने वालों को अनदेखा करता है, और ईमानदार टीम को सही उत्तर वापस पाने में मदद करता है।

नोट: शोध पत्र स्पष्ट रूप से बताता है कि ये प्रयोग एक नियंत्रित वातावरण में सुरक्षा जोखिमों का अध्ययन करने के लिए किए गए थे। उन्होंने इनका परीक्षण वास्तविक दुनिया के सार्वजनिक सिस्टम या नैदानिक (clinical) उपयोगों पर नहीं किया है, और वे वकालत करते हैं कि "सहकारी हमले" (Cooperative Attack) के तरीके का उपयोग केवल बेहतर रक्षा बनाने के लिए अनुसंधान के रूप में किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →