← أحدث الأبحاث
🤖 AI

Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification

تتناول هذه الورقة البحثية ضعف أنظمة الوكلاء المتعددين القائمة على النماذج اللغوية الكبيرة تجاه السلوكيات الخبيثة المنسقة من خلال اقتراح إطار عمل هجوم تعاوني تكيفي وتقديم آلية دفاع "تحليل وتصحيح الموثوقية على مستوى الجملة" (STAR)، والتي تحدد وتصحح المعلومات المضللة بفعالية لاستعادة معدلات نجاح المهام بشكل كبير.

المؤلفون الأصليون: Yaoyang Luo, Zhi Zheng, Ziwei Zhao, Tong Xu, Zhao Jielun, Wenjun Xue, Yong Chen, Enhong Chen

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yaoyang Luo, Zhi Zheng, Ziwei Zhao, Tong Xu, Zhao Jielun, Wenjun Xue, Yong Chen, Enhong Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل فريقًا من الروبوتات الذكية (أو "الوكلاء") يعملون معًا لحل لغز، مثل الإجابة على سؤال صعب. إنهم يتحدثون مع بعضهم البعض، ويشاركون الأفكار، ويصوتون على الإجابة النهائية. عادةً ما يعملون بشكل رائع. ولكن ماذا لو كان بعض هؤلاء الروبوتات في الواقع جواسيس؟

هذه الورقة البحثية تتحدث عن شيئين:

  1. طريقة جديدة وأكثر دهاءً للجواسيس لخداع الفريق.
  2. "كاشف حقيقة" جديد للإيقاع بالجواسيس وإصلاح أكاذيبهم.

إليك تفصيل ذلك بكلمات بسيطة:

1. المشكلة: الجواسيس يعملون معًا

في الماضي، اعتقد الباحثون أن الجواسيس يعملون بمفردهم. تخيل جاسوسًا واحدًا في مجموعة من الأصدقاء يهمس بكذبة: "برج إيفل موجود في روما". قد يتجاهله الأصدقاء الآخرون لأن الكلام يبدو سخيفًا.

لكن هذه الورقة اكتشفت شيئًا أكثر رعبًا: الهجمات التعاونية (Cooperative Attacks).
تخيل أن الجواسيس في مجموعة دردشة سرية.

  • الجاسوس (أ): يقول: "برج إيفل موجود في روما."
  • الجاسوس (ب) (وهو جاسوس أيضًا) يرد: "نعم، أنا أتفق! روما مشهورة بهذا الشيء."
  • الجاسوس (ج) يضيف: "في الواقع، قرأت كتابًا يقول إنه في روما أيضًا."

الآن، الأصدقاء الصادقون لا يسمعون كذبة واحدة فقط؛ بل يسمعون جوقة من التأييد. يقوم الجواسيس بتعديل قصصهم في الوقت الفعلي لجعل الكذبة تبدو وكأنها حقيقة راسخة. وجدت الورقة أنه عندما يعمل الجواسيس معًا بهذه الطريقة، فإنهم يكسرون قدرة الفريق على حل المشكلات بشكل أسرع بكثير مما لو عملوا بمفردهم.

2. الحل: "ماسح الحقيقة على مستوى الجملة" (STAR)

بنى المؤلفون نظام دفاع يسمى STAR (تحليل وتصحيح الموثوقية على مستوى الجملة). فكر فيه كأنه محرر ذكي للغاية يقرأ كل جملة يكتبها الفريق، وليس الفقرة بأكملها فقط.

إليك كيف يعمل STAR، خطوة بخوة:

  • الخطوة 1: المجهر (التفكيك على مستوى الجملة)
    بدلاً من النظر إلى فقرة كاملة والقول: "هذا يبدو مريبًا"، يقوم STAR بتفكيك النص إلى جمل فردية.

  • مثال توضيحي: تخيل معلمًا يصحح مقال طالب. بدلًا من إعطاء درجة "C" للمقال بأكمله، يقوم المعلم بتحديد الجمل الخاطئة بدقة.

  • الخطوة 2: التحقق من الحقائق (Verification)
    لكل جملة، يسأل STAR ذكاءً اصطناعيًا قويًا: "هل هذا صحيح؟ ما مدى تأكدك؟"

  • إذا كانت الجملة صحيحة، تحصل على علامة صح خضراء.

  • إذا كانت الجملة كذبة، تحصل على علامة حمراء ودرجة ثقة (مثل: "أنا متأكد بنسبة 90% أن هذه كذبة").

  • الخطوة 3: زر "التعديل" (التصحيح المستهدف)
    هذا هو الجزء الذكي. إذا قال جاسوس: "سيدني هي عاصمة أستراليا لأنها غنية"، فإن STAR لا يحذف الجملة بأكملها فحسب. بل يصلح الكذبة فقط.

  • الكذبة الأصلية: "سيدني هي العاصمة... لأنها غنية."

  • إصلاح STAR: "سيدني هي المركز الاقتصادي... لكنها ليست العاصمة."

  • مثال توضيحي: الأمر يشبه برنامج التدقيق الإملائي الذي لا يحذف الكلمة فحسب، بل يستبدل الكلمة الخاطئة بالكلمة الصحيحة مع الحفاظ على بقية الجملة سليمة. هذا يمنع انتشار الكذبة ولكنه يحافظ على المعلومات المفيدة.

  • الخطوة 4: التصويت (تجميع القرارات القوي)
    أخيرًا، عندما يصوت الفريق على الإجابة، يقول STAR: "نحن نعرف من هم الكاذبون. دعونا لا نحسب أصواتهم." إنه يستبعد الوكلاء المشبوهين من القرار النهائي، مما يضمن أن الوكلاء الصادقين هم من يقررون النتيجة.

3. ماذا تظهر النتائج؟

اختبر الباحثون ذلك على أنواع مختلفة من الأسئلة (مثل المعرفة العامة، والألغاز المنطقية، والمنطق العام) باستخدام نماذج ذكاء اصطناعي مختلفة.

  • الهجوم: عندما عمل الجواسيس معًا (الهجوم التعاوني)، انخفض معدل نجاح الفريق بشكل كبير. أصيب الفريق بالارتباك وقدموا إجابات خاطئة في كثير من الأحيان.
  • الدفاع: عندما قاموا بتشغيل STAR:
    • كشف الأكاذيب بشكل جيد جدًا (دقة تزيد عن 70% في كشف الجواسيس).
    • أصلح أداء الفريق، مما رفع معدل نجاحهم بنسبة 36% في المتوسط.
    • عمل بشكل أفضل من طرق الأمن الأخرى الموجودة.

4. التكلفة

نظرت الورقة أيضًا في مقدار "قوة الحوسبة" (أو المال) التي يكلفها هذا الأمر.

  • بعض طرق الأمن الأخرى مكلفة للغاية (مثل دفع ثمن جيش ضخم من الروبوتات الإضافية لمراقبة الفريق).
  • STAR مكلف قليلاً مقارنة بعدم فعل أي شيء، لكنه أرخص بكثير وأكثر كفاءة من أنظمة الأمن الثقيلة الأخرى. إنه حل يوفر "أقصى استفادة مقابل السعر".

ملخص

تحذر الورقة من أنه إذا قام أشخاص سيئون بتنسيق أكاذيبهم داخل فريق ذكاء اصطناٍ، فيمكنهم بسهولة خداع المجموعة بأكملها. ولكن، ابتكر المؤلفون STAR، وهو أداة تعمل كمحرر دقيق. إنه يقرأ كل جملة، ويصلح الأكاذيب المحددة، ويتجاهل الكاذبين أثناء التصويت النهائي، ويساعد الفريق الصادق على استعادة الإجابة الصحيحة.

ملاحظة: تنص الورقة صراحةً على أن هذه التجارب أجريت في بيئة محكومة لدراسة المخاطر الأمنية. لم يختبروا هذا على أنظمة عامة حقيقية أو استخدامات طبية، وهم يدعون أن طريقة "الهجوم التعاوني" يجب أن تُستخدم فقط لأغراض البحث لبناء دفاعات أفضل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →