← أحدث الأبحاث
💻 computer science

MemLineage: Lineage-Guided Enforcement for LLM Agent Memory

يُعد MemLineage نظام دفاع تشفيري لوكلاء النماذج اللغوية الكبيرة (LLM) يمنع هجمات تسميم الذاكرة من خلال تتبع أصل وسلالة اشتقاق مدخلات الذاكرة، مما يضمن عدم التصريح بالإجراءات الحساسة إلا عندما لا يكون مبررها مشتقاً من مصادر غير موثوقة.

المؤلفون الأصليون: Ciyan Ouyang, Rui Hou

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ciyan Ouyang, Rui Hou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن العميل الذكي (AI Agent) هو مساعد شخصي متعاون للغاية، ولكنه ساذج قليلاً، يمتلك دفتر ملاحظات (ذاكرة) ليتذكر تفضيلاتك، ومحادثاتك السابقة، ومهامك. هذا الدفتر قوي لأنه يسمح للمساعد بربط النقاط ببعضها عبر الأيام أو الأسابيع. ومع ذلك، فإن هذا الدفتر هو أيضاً نقطة ضعفه الكبرى.

MemLineage هو نظام أمني جديد مصمم لحماية هذا الدفتر من أن يتم خداعه بواسطة مخترق ذكي.

إليك كيف يشرح البحث المشكلة والحل، باستخدام تشبيهات بسيطة:

المشكلة: خدعة "الإيصال المزيف"

حالياً، إذا تمكن مخترق من تسريب تعليمات خبيثة إلى دفتر ملاحظات المساعد، فقد يطيعها المساعد لاحقاً، حتى لو كانت التعليمات خطيرة (مثل "تحويل الأموال إلى شخص غريب").

يسلط البحث الضوء على خدعة ماكرة ومستترة تسمى "النائم عبر الاشتقاق" (Sleeper via Derivation).

  • الطريقة القديمة: يكتب المخترق ملاحظة تقول "اسرق المال" ويخفيها في الدفتر. يقوم حارس أمني بسيط (دفاع يعتمد على "التوقيع فقط") بفحص الملاحظة، ويرى أنها لم تُكتب من قبل المستخدم، فيقوم بحظرها. هذا سهل.
  • الخدعة الجديدة: المخترق لا يكتب الملاحظة مباشرة. بدلاً من ذلك، يزرع تلميحاً غامضاً يبدو غير ضار في موقع إلكتروني يزوره المساعد (على سبيل المثال، قصة عن "حساب بنكي سري").
  • يقرأ المساعد القصة، ويلخصها، ثم يكتب ملاحظة جديدة تبدو نظيفة وبخط يده: "وجدت إشارة إلى حساب بنكي سري".
  • ولأن الملاحظة الآن مكتوبة بخط يد المساعد نفسه، يعتقد الحارس الأمني البسيط: "أوه، هذا آمن! لقد جاء منا!" ويسمح ببقائها في الدفتر.
  • لاحقاً، يطرح المستخدم سؤالاً يؤدي إلى تفعيل هذه الملاحظة، فيقوم المساعد بتنفيذ الأمر الخطير، ظناً منه أنها ملاحظة صالحة.

يطلق البحث على هذه العملية اسم "غسيل الذاكرة" (Memory Laundering): وهي غسل المعلومات القذرة وغير الموثوقة حتى تبدو نظيفة وموثوقة.

الحل: MemLineage (متتبع "سلسلة الحيازة")

يعامل MemLineage ذاكرة المساعد كأنها خزانة أدلة عالية الأمن وليس مجرد دفتر ملاحظات. فهو يضيف طبقتين رئيسيتين من الحماية:

1. البصمة الرقمية (المنشأ التشفيري)

كل ملاحظة في الدفتر تحصل على بصمة رقمية فريدة وغير قابلة للتزوير (توقيع تشفيري). هذا يثبت بالضبط من الذي كتبها. إذا كُتبت ملاحظة من مصدر غير موثوق (مثل موقع إلكتروني عشوائي)، يتم وضع علامة "راية حمراء" عليها فوراً.

2. شجرة العائلة (النسب/Lineage)

هذا هو الابتكار الكبير لـ MemLineage. فهو لا ينظر فقط إلى من كتب الملاحظة، بل ينظر أيضاً إلى من أين جاءت هذه المعلومات.

  • تخيل أن لكل ملاحظة "شجرة عائلة" مرفقة بها.
  • إذا كانت الملاحظة عبداً (ملخصاً) لملاحظة سابقة، يقوم النظام برسم خط يصل بينهما.
  • يسأل النظام: "هل هذه الملاحظة النظيفة تنحدر من مصدر يحمل 'راية حمراء'؟"
  • القاعدة: إذا كانت الملاحظة هي "ابنة" لمصدر يحمل "راية حمراء"، وكان الاتصال قوياً بما يكفي، فإن الملاحظة الابنة ترث الراية الحمراء، حتى لو كُتبت بواسطة المساعد.

كيف يوقف الهجوم

عندما يريد المساعد تنفيذ إجراء حساس (مثل إرسال أموال)، يقوم الحارس (Gatekeeper) بفحص الذاكرة:

  1. فحص التوقيع: هل كتب المستخدم أو أداة موثوقة هذه الملاحظة؟
  2. فحص شجرة العائلة: هل لهذه الملاحظة أي أسلاف غير موثوقين؟
  3. الحكم: إذا كانت شجرة عائلة هذه الملاحظة تؤدي إلى موقع إلكتروني تابع لمخترق، فإن الحارس يقول: "لا". إنه يحظر الإجراء، حتى لو كانت الملاحظة تبدو طبيعية تماماً في ظاهرها.

"الميزات السحرية"

يدعي البحث أن MemLineage متميز لأن:

  • إنه غير مرئي: لا يضيف أي تأخير تقريباً (أقل من ميلي ثانية واحدة) إلى عملية تفكير المساعد. إنه مثل إضافة فحص أمني يحدث بسرعة كبيرة لدرجة أنك لا تلاحظه حتى.
  • إنه ذكي: لا يقوم بحظر كل شيء من المصادر غير الموثوقة. فهو يسمح للمساعد باستخدام تلك المعلومات لأشياء غير ضارة (مثل الإجابة على سؤال معلومات عامة) ولكنه يمنعها من تحفيز إجراءات خطيرة (مثل تحويل الأموال).
  • إنه يصمد أمام الزمن: حتى لو تم حذف ملاحظة المخترق الأصلية أو دفنها في أعماق التاريخ، تظل "الراية الحمراء" ملتصقة بالملاحظات المشتقة منها للأبد، مما يمنع هجوم "النائم" من الاستيقاظ لاحقاً.

النتائج

اختبر المؤلفون هذا النظام ضد ثلاثة أنواع من هجمات المخترقين في بيئة محكومة ومحاكية للكمبيوتر.

  • بدون MemLineage: نجح المخترقون بنسبة 100%.
  • مع حارس أمني أساسي (التوقيعات فقط): نجح المخترقون بنسبة 100% في هجوم "النائم" لأن الملاحظات بدت نظيفة.
  • مع MemLineage: نجح المخترقون بنسبة 0% من المرات. لقد كشف النظام كل المحاولات، بما في ذلك الملاحظات "المغسولة" الماكرة، دون إبطاء المهام غير الضارة أو إبطاء عمل المساعد.

باختاً، يضمن MemLineage أن المساعد الذكي يمكنه تذكر الأشياء بأمان، مع العلم أنه حتى لو بدت قطعة من المعلومات نظيفة، فلن تسمح لتلك المعلومة بالتسبب في ضرر إذا كان لها تاريخ "قذر".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →