← أحدث الأبحاث
💻 computer science

ACRFence: Preventing Semantic Rollback Attacks in Agent Checkpoint-Restore

تقدم هذه الورقة ACRFence، وهو إجراء وقائي غير مرتبط بإطار عمل محدد يمنع هجمات التراجع الدلالي (semantic rollback attacks) في وكلاء النماذج اللغوية الكبيرة (LLM agents)—حيث تتسبب الطلبات المعاد تصنيعها بعد استعادة نقاط التحقق في آثار جانبية غير قابلة للإلغاء مثل عمليات الدفع المكررة—وذلك عن طريق تسجيل تأثيرات الأدوات وفرض دلالات إعادة التشغيل أو التفرع (replay-or-fork semantics).

المؤلفون الأصليون: Yusheng Zheng, Yiwei Yang, Wei Zhang, Andi Quinn

نُشر 2026-03-24
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yusheng Zheng, Yiwei Yang, Wei Zhang, Andi Quinn

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان ACRFence باستخدام لغة بسيطة وتشبيهات إبداعية.

الفكرة الكبرى: زر "التراجع السحري" الذي يكسر الواقع

تخيل أنك تلعب لعبة فيديو حيث يمكنك حفظ تقدمك و"إعادة" الزمن إذا ارتكبت خطأً. هذه ميزة رائعة لاستكشاف مسارات مختلفة أو إصلاح الأخطاء.

الآن، تخيل أن شخصيتك في لعبة الفيديو هي وكيل ذكاء اصطناعي (روبوت ذكي) يمكنه التفاعل مع العالم الحقيقي: يمكنه تحويل الأموال، أو طلب البيتزا، أو حذف الملفات. قام مطورو هؤلاء الوكلاء بإضافة زر "إعادة" (Rewind) حتى يتمكن الروبوت من العودة والمحاولة مرة أخرى إذا تعطل.

المشكلة: زر "الإعادة" يعمل بشكل مثالي لذاكرة الروبوت، لكنه لا يعمل بالنسبة للعالم الحقيقي.

إذا قام الروبوت بتحويل 500 دولار إلى بنك، ثم تعطل الروبوت وضغط على زر "إعادة"، فإن الروبوت ينسى أنه أرسل المال. لكن البنك لا ينسى. البنك لا يزال يمتلك المال.

عندما يستيقظ الروبوت بعد عملية الإعادة، يحاول إرسال المال مرة أخرى. ولكن نظرًا لأنه ذكاء اصطناعي، فإنه لا يرسل نفس الرسالة تمامًا. إنه يرسل رسالة مختلفة قليلاً (مثل استخدام رقم مرجعي مختلف). يرى البنك هذا على أنه عملية جديدة ومشروعة ويرسل 500 دولار أخرى.

النتيجة: يرسل البنك 1,000 دولار إجمالًا، لكن الروبوت يعتقد أنه أرسل 500 دولار فقط. وهذا ما يسمى بـ هجوم التراجع الدلالي (Semantic Rollback Attack).


طريقتان يحدث بهما هذا الهجوم

تحدد الورقة البحثية طريقتين محددتين يمكن للمهاجمين من خلالهما استغلال زر "الإعادة السحرية" هذا:

1. هجوم "إعادة التشغيل" (صاحب المتجر الجشع)

  • السيناريو: تخيل أنك تشتري قهوة. تدفع 5 دولارات. يقوم صاحب المتجر (الذكاء الاصطناعي) بإرسال الدفع إلى البنك.
  • الخدعة: صاحب المتجر هو في الواقع شرير. بمجرد تأكيد البنك للدفع، يقوم الشرير بتفعيل "عطل" في نظام الذكاء الاصطناعي.
  • الاستغلال: يقوم النظام تلقائيًا بعملية "إعادة" (Rewind). يستيقظ الذكاء الاصطناعي وهو يفكر: "أوه، لم أدفع بعد!" ويحاول الدفع مرة أخرى. ولأنه ذكاء اصطناعي، فإنه ينشئ رقم إيصال جديد هذه المرة. يقبل البنك هذا كدفعة ثانية.
  • النتيجة: يحصل الشرير على قهوة بقيمة 10 دولارات مقابل سعر واحدة. يمكنه فعل ذلك مرارًا وتكرارًا عبر تعطيل النظام في كل مرة للحصول على أموال مجانية.

2. هجوم "إحياء السلطة" (المفتاح الشبح)

  • السيناريو: يمنح مديرٌ ما "مفتاحًا للاستخدام لمرة واحدة" للذكاء الاصطناعي لحذف ملف معين. يستخدم الذكاء الاصطناعي المفتاح، ويتم حذف الملف، ومن المفترض أن يُحرق (يُستهلك) المفتاح.
  • الخدعة: يقوم موظف ضار بالضغط على "إعادة" (Rewind) في نظام الذكاء الاصطناعي.
  • الاستغلال: يعود الذكاء الاصطناعي بالزمن إلى اللحظة التي تلت الحصول على المفتاح مباشرة، ولكن قبل استخدامه. الآن يحمل الذكاء الاصطناعي "المفتاح للاستخدام لمرة واحدة" مرة أخرى، لكن ليس لديه ذاكرة بأنه استخدمه.
  • النتيجة: يطلب الموظف من الذكاء الاصطناعي حذف ملف آخر باستخدام نفس المفتاح. إذا لم يتحقق الخادم مما إذا كان المفتاح قد استُخدم بالفعل، فسيقوم الذكاء الاصطناعي بحذف الملف الخطأ. لقد استخدم الموظف فعليًا تذكرة "للاستخدام لمرة واحدة" للدخول إلى صالة كبار الشخصيات مرتين.

لماذا لا يمكننا مجرد إصلاح ذلك؟

قد تتساءل، "لماذا لا يقول البنك ببساطة: 'مهلًا، لقد رأيت هذا الطلب بالفعل'؟"

المشكلة هي أن الذكاء الاصطناعي غير حتمي (Nondeterministic). حتى لو أخبرته بأن يكون دقيقًا بنسبة 100%، فإن الطريقة التي يفكر بها ويكتب بها تتغير قليلاً في كل مرة (بسبب اختلافات رياضية ضئيلة في دماغه).

  • الطريقة القديمة: "هل أرسلت نفس الرسالة تمامًا؟" (لا، رقم التعريف مختلف).
  • رؤية البنك: "يبدو أنه طلب جديد. سأقوم بمعالجته."

الأمن التقليدي يفترض أنه إذا أعدت محاولة تنفيذ أمر ما، فسيكون متطابقًا. لكن النماذج اللغوية الكبيرة (LLMs) مبدعة؛ فهي تعيد كتابة طلباتها في كل مرة تبدأ فيها من جديد.


الحل: ACRFence (حارس البوابة الدلالي)

تقترح المؤلفة حلاً يسمى ACRFence. فكر فيه كحارس بوابة ذكي للغاية يقف عند الباب بين الذكاء الاصطناعي والعالم الخارجي (البنك، السحابة، إلخ).

كيف يعمل:

  1. سجل الأحداث (Logbook): في كل مرة يحاول فيها الذكاء الاصطناعي القيام بشيء غير قابل للتراجع (مثل إرسال أموال)، يقوم ACRFence بتدوين ذلك في سجل خاص. إنه يسجل ما أراد الذكاء الاصطناعي فعله (مثل "إرسال 500 دولار إلى بوب")، وليس فقط التفاصيل التقنية.
  2. فحص الإعادة (Rewind Check): عندما يتعطل الذكاء الاصطناعي ويعيد التشغيل، يحاول إرسال الطلب مرة أخرى.
  3. قرار "حارس البوابة": يستخدم ACRFence ذكاءً اصطناعيًا صغيرًا وسريعًا لمقارنة الطلب الجديد مع مدخل السجل القديم.
    • هل هو نفس القصد؟ (على سبيل المثال: "إرسال 500 دولار إلى بوب" مرة أخرى).
      • إذا كانت الإجابة نعم: يقول الحارس: "توقف! لقد فعلنا هذا بالفعل". يعطي الذكاء الاصطناعي الإجابة من السجل دون إرسال الطلب فعليًا إلى البنك. (هجوم إعادة التشغيل - Replay)
    • هل هو قصد جديد؟ (على سبيل المثال: "إرسال 500 دولار إلى أليس").
      • إذا كانت الإجابة نعم: يقول الحارس: "حسنًا، هذه خطة جديدة. أنت بحاجة إلى الحصول على موافقة جديدة للقيام بذلك". ويجبر النظام على إنشاء "فرع" جديد من الواقع. (هجوم التفرع - Fork)
    • هل هو مفتاح مسروق؟ (على سبيل المثال: محاولة استخدام "مفتاح لمرة واحدة" مرة أخرى).
      • إذا كانت الإجابة نعم: يقوم الحارس بحظر الأمر فورًا.

لماذا يهم هذا الأمر؟

هذه الورقة البحثية هي بمثابة جرس إنذار. بينما نبني المزيد من وكلاء الذكاء الاصطناعي الذين يمكنهم إنفاق الأموال، وإدارة البيانات، والتحكم في البنية التحتية، لا يمكننا الاعتماد على قواعد الأمن القديمة.

  • القاعدة القديمة: "إذا بدا الرسالة متشابهة، فهي آمنة."
  • الواقع الجديد: "الرسالة قد تبدو مختلفة، لكن القصد قد يكون هجوماً مكرراً."

ACRFence هو أول أداة مصممة لفهم المعنى وراء أفعال الذكاء الاصطناعي، مما يضمن أنه عندما يضغط الذكاء الاصطناعي على "إعادة"، فإنه لا يكسر العالم الحقيقي عن طريق الخطأ.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →