← أحدث الأبحاث
💬 NLP

Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection

تقدم الورقة البحثية إطار عمل SAVOR، وهو إطار عمل مبتكر يتيح حقن الأوامر غير المباشر أحادي الخطوة القائم على الميتا-معرفة (metacognitive) ضد وكلاء النماذج اللغوية الكبيرة (LLM agents)، وذلك عبر استخلاص استراتيجيات هجوم قابلة لإعادة الاستخدام من التأمل غير المتصل (offline reflection) في مسارات متنوعة، مما يحقق معدلات نجاح فائقة في سيناريوهات الاستعلام الواحد دون الحاجة إلى تغذية راجعة من الهدف.

المؤلفون الأصليون: Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

نُشر 2026-08-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً يعمل كخادم منزلي كيفية الطبخ. أنت تعطيه وصفة، لكن على الروبوت أيضاً قراءة الأخبار، والتحقق من حالة الطقس، والاستماع إلى التقارير الإذاعية أثناء عمله. هكذا تعمل وكلاء الذكاء الاصطناعي الحديثة: فهي تستخدم "أدوات" للتفاعل مع العالم الحقيقي، مثل تصفح الويب أو فحص قواعد البيانات. ولكن هنا تكمن الخدعة: إذا قام مخترق ماكر بإخفاء ملاحظة سرية داخل أحد تلك المقالات الإخبارية أو التقارير الإذاعية، فقد يرتبك الروبوت. وبدلاً من إنهاء الوصفة، قد يقرر فجأة حذف ملفاتك أو إرسال أموال إلى شخص غريب. تُسمى هذه الحيلة "حقن الأوامر غير المباشر" (Indirect Prompt Injection). الأمر يشبه ساحراً يضع تعليمات مزيفة في جيب أحد المتفرجين؛ يقرأها الروبوت، ويظن أنها جزء من العرض، فيتبع الأوامر الخاطئة.

لفترة طويلة، كان على المخترقين الذين يحاولون خداع هذه الروبوتات ممارسة لعبة "التخمين والتحقق". كانوا يجربون حيلة، ويرون ما إذا كان الروبوت قد وقع في الفخ، ثم يعدلون حيلتهم بناءً على رد فعل الروبوت. لكن في العالم الحقيقي، غالباً ما يحصل المخترق على فرصة واحدة فقط لتسلل ملاحظة إلى مسار الروبوت. لا يمكنهم الانتظار ليروا كيف استجاب الروبوت؛ بل يجب عليهم إصابة الهدف من المرة الأولى. السؤال الكبير الذي طرحه الباحثون هو: هل يمكن للمخترق أن يتعلم من الإخفاقات والنجاحات السابقة لابتكار "حيلة ماهرة" تعمل على روبوت جديد تماماً لم يقابله من قبل، باستخدام محاولة واحدة فقط؟

هنا يأتي دور SAVOR، وهي طريقة جديدة تعمل كشيف ماهر يتعلم من مكتبة من كوارث ونجاحات الطبخ. بدلاً من محاولة خداع روبوت معين في الوقت الفعلي، يقضي SAVOR وقتاً "خارج الخط" (offline)، في دراسة آلاف المحاولات الماضية حيث حاول مخترقون اختطاف روبوتات مختلفة. إنه ينظر إلى ما نجح، والأهم من ذلك، ما الذي لم ينجح. يسأل نفسه: "لماذا فشلت تلك الحيلة؟" و"لماذا نجحت هذه؟". ومن خلال التأمل في هذه النتائج، يقوم SAVOR باستخلاص التفاصيل الفوضوية للحيل المحددة وتحويلها إلى بضع قواعد ذهبية، أو "استراتيجيات". إنه يشبه طالباً يتوقف عن حفظ مسائل رياضية محددة، وبدلاً من ذلك يتعلم المنطق الأساسي للجبر.

بمجرد أن يبني SAVOR هذه "مكتبة الاستراتيجيات"، فإنه يقوم بتجميدها. وعندما يواجه روبوتاً جديداً وغير مرئي، فإنه لا يحتاج إلى طلب المساعدة أو المحاولة مرة أخرى. ببساطة، يسحب أفضل استراتيجية من مكتبته المجمدة، ويصيغ ملاحظة خبيثة واحدة ومثالية، ويسللها في المسار. تُظهر الورقة البحثية أن هذا النهج فعال للغاية. ففي الاختبارات، نجح SAVOR في خداതി الروبوتات في كثير من الأحيان أكثر من الطرق السابقة، حتى عندما كانت الروبوتات تمتلك دفاعات قوية أو كانت مختلفة تماماً عن الروبوتات التي تدرب عليها SAVOR. لم يقتصر نجاحه على الاختبارات المحاكية فحسب؛ بل نجح أيضاً في بيئة أكثر واقعية حيث كان على الروبوت القيام بأفعال حقيقية، مما أثبت أن هذه الحيل "ذات المحاولة الواحدة" يمكن أن تغير سلوك الروبوت حقاً. وجد الباحثون أن SAVOR يمكنه التعلم من مجموعة واحدة من الأدوات والنجاح في مهاجمة مجموعة أدوات مختلفة تماماً، مما يعني نقل "بديهة المخترق" لديه إلى مواقف جديدة دون الحاجة إلى فرصة ثانية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →