A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns
تحدد هذه الورقة وتحلل نمط الفشل "GHOST"، حيث تتجاهل الوكلاء ذوو الأفق الطويل قيود السلامة المحددة في الأدوار السابقة في ظل ظروف حميدة، وتقترح إطار عمل STAR-Guard ثنائي الطبقة للقضاء على هذه المخاطر نظرياً وتجريبياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: شبح في الوكلاء طويلي الأمد (GHOST)
تعريف المشكلة: مخاطر الحوكمة الناتجة عن تجاهل قيود السلامة
تحدد هذه الورقة نمط فشل محددًا في الوكلاء الذين يعملون بنماذج اللغة الكبيرة (LLM) الذين يستخدمون الأدوات في مهام طويلة الأمد، وتسميه مخاطر الحوكمة الناتجة عن تجاهل قيود السلامة عبر الجولات (GHOST).
بينما تركز أبحاث السلامة الحالية على الهجمات العدائية (مثل حقن الأوامر/Prompt Injection) أو الطلبات الضارة المباشرة، فإن GHOST ينشأ تحت ظروف تفاعل حميدة. يحدث هذا عندما يكمل الوكيل مهمة بنجاح ولكنه ينتهك قيد سلامة تم ذكره صراحة في جولة سابقة من تاريخ المحادثة. "ينسى" الوكيل القيد أو يفشل في استرجاعه لأنه منفصل عن المهمة الحالية بفعل تاريخ تفاعل طويل، مما يؤدي إلى ضرر لا يمكن إصلاحه (مثل حذف رسائل البريد الإلكتروني دون موافقة، أو تدمير سجلات قواعد البيانات).
يميز المؤلفون هذا عن حالات الفشل العامة في اتباع التعليمات. في حدث GHOST:
- يتم إكمال هدف المهمة بنجاح.
- لا يزال قيد السلامة ساريًا ومطلوبًا.
- القيد متاح في السياق التاريخي ولكنه لم يُعد ذكره في أمر الاستئناف المباشر.
- ينفذ الوكيل المهمة بشكل غير آمن رغم وجود القيد في نافذة السياق الكاملة.
الإطار النظري: الوصول إلى منطقة الخطر
تقدم الورقة تحليلًا نظريًا ينمذج قيود السلامة كـ مناطق خطر () في فضاء العمليات. يعرّف المؤلفون "خطر الدخول الشرطي المتبقي" ، والذي يمثل احتمالية دخول الوكيل إلى منطقة خطر عند فرصة حرجة للسلامة ، بالنظر إلى سوابق تاريخية آمنة.
الرؤية النظرية الرئيسية:
باستخدام إطار عمل المخاطر الشرطية، يثبت المؤلفون أنه إذا كانت المخاطر الشرطية المتبقية عبر السوابق الآمنة محصورة بأسفل بواسطة متتالية غير قابلة للجمع (أي )، فإن الوكيل سيدخل منطقة الخطر بشكل مؤكد تقريبًا ().
كما أثبتوا نتيجة مشروطة بالسياق: مع نمو تاريخ التفاعل (زيادة طول السياق )، قد يؤدي تأثير "تخفيف الانتباه" (Attention Dilution) إلى إضعاف حوكمة القيود التاريخية، مما يؤدي فعليًا إلى زيادة الحد الأدنى لخطر العملية. إذا ظل الحد الأدنى لهذا الخطر غير قابل للجمع عبر فرص غير محدودة، فإن احتمال وقوع حدث GHOST يقترب من 1. يشير هذا إلى أن التواريخ الطويلة لا تقلل الأداء خطيًا فحسب، بل يمكن أن تغير ديناميكيات السلامة بشكل جوهري، مما يجعل الانتهاكات حتمية دون تدخل.
المنهجية: SCARBench و STAR-Guard
1. SCARBench: معيار توافر قيود السلامة عند إعادة التنشيط
للتحقق تجريبيًا من GHOST، قدم المؤلفون SCARBench، وهو معيار قابل للتنفيذ ومرتبط بالبيئة.
- الهيكل: يتكون من 103 سيناريو أساسي فريد عبر ستة مجالات لاستخدام الأدوات (الأجهزة/التقويم، التمويل، البريد الإلكتروني، نظام الملفات، طلبات الشبكة، تنفيذ السكربتات)، بإجمالي 412 حالة متطابقة.
- الحالات: يتم اختبار كل سيناريو تحت أربع حالات تختلف حسب طول التاريخ (قصير مقابل طويل) وتوافر القيود (صريح مقابل ضمني):
- SE/SI: تاريخ قصير مع قيود صريحة/ضمنية.
- LE/LI: تاريخ طويل (أكثر من 6,000 توكن، 56-160 جولة) مع قيود صريحة/ضمنية.
- المقياس: يقيس المعيار GHOST الصارم، والمعرف بأنه حالة يكمل فيها الوكيل المهمة بأمان تحت الحالة الصريحة (LE) ولكنه يكملها بشكل غير آمن تحت الحالة الضمنية (LI)، رغم وجود القيد في التاريخ.
2. STAR-Guard: دفاع ثنائي الطبقات
للتخفيف من GHOST، يقترح المؤلفون STAR-Guard (حارس تتبع واستعادة وتدقيق قيود السلامة أثناء التشغيل)، وهو آلية دفاع لا تعتمد على معرفة "أوراكل" (Oracle) بالقيود.
الطبقة الأولى: استعادة القيود الدلالية
- الاستخراج: يقوم وحدة استيعاب عبر الإنترنت بتحليل رسائل المستخدم الواردة لاكتشاف قيود السلامة القابلة للاستمرار، واستخراج نطاقها، ومحفزها، وقاعدتها.
- التخزين: تُخزن هذه القيود كـ "كائنات قواعد دورة حياة" مهيكلة في مكتبة خارجية.
- الاستعادة: عند استئناف مهمة، تقوم بوابة دلالية بمطابقة المهمة الحالية مع المكتبة. يتم استعادة القيود المطبقة دلاليًا (عرضها) في سياق النص الحالي لتوجيه عملية توليد المقترح من قبل الوكيل.
- القصور: هذه الطبقة احتمالية؛ فهي تقلل من احتمالية المقترحات غير الآمنة ولكنها لا تضمن السلامة.
الطبقة الثانية: تدقيق ما قبل التنفيذ الحتمي
- الاعتراض: قبل وصول أي إجراء إلى البيئة، يقوم مدقق قواعد حتمي بفحص إجراء الوكيل المقترح مقابل القيود النشطة.
- الإنفاذ: يطبق المدقق سياسة "الحظر أولاً". إذا انتهك المقترح قاعدة حظر، يتم حظره فورًا. إذا انتهك قاعدة شرطية مسبقة (مثل "نسخ احتياطي قبل الحذف")، يحاول النظام تنفيذ المتطلب السابق (الإصلاح) ثم يعيد التدقيق. إذا كان الإصلاح مستحيلاً، يتم حظر الإجراء.
- الضمان: تضمن هذه الطبقة عدم وصول أي إجراء ينتهك قيدًا نشطًا إلى البيئة، مما يقطع آلية تراكم الخطر.
النتائج التجريبية
قيم المؤلفون STAR-Guard على سبعة نماذج (خمسة تعمل عبر واجهة برمجة التطبيقات، واثنان محليان) باستخدام SCARBench.
انتشار GHOST:
- GHOST مشكلة واسعة الانتشار. في نموذج GPT-5.5، بلغت نسبة GHOST الصارم 11.5% في ظروف السياق الطويل الحميدة.
- أظهرت النماذج الأخرى معدلات تتراوح بين 6.8% (Kimi-K2.6) و 27.8% (Qwen3.5-4B).
- أكدت مقاييس "الفرق في الفروق" (Difference-in-Differences) أن التواريخ الطويلة تزيد بشكل كبير من معدل فشل استعادة القيود مقارنة بالتاريخ القصير.
فعالية STAR-Guard:
- GPT-5.5: خفض STAR-Guard معدل الإكمال غير الآمن (UC) من 12.4% إلى 0.0% ومعدل GHOST الصارم من 11.5% إلى 0.0%، مع زيادة الإكمال الآمن (SC) من 76.3% إلى 94.0%.
- Qwen3.5-4B: زاد SC من 47.0% إلى 81.2%، بينما انخفض GHOST من 27.8% إلى 1.9%.
- دراسات الاستئصال (Ablation Studies): تظهر النتائج أن لا "الاستعادة فقط" ولا "التدقيق فقط" كافيان بمفردهما. الاستعادة تحسن السلامة ولكنها تترك مخاطر متبقية؛ والتدقيق يمنع المخاطر ولكنه قد يعيق إكمال المهمة إذا استخدم بدون توجيه دلالي. الجمع بينهما يحقق أفضل توازن.
المقارنة مع الخطوط المرجعية:
- فشلت طرق الاسترجاع القياسية (BM25)، والتلخيص، وتحسينات اتباع التعليمات (مثل DeCRIM و Prompt Reminder) في تقليل معدلات GHOST بشكل كبير، حيث ظلت معدلات الإكمال غير الآمن مرتفعة.
- أدت الطرق القائمة على "الأوراكل" (التي تفترض أن القيد معروف بالفعل) أداءً جيدًا ولكنها ليست عملية للنشر في العالم الحقيقي حيث يجب التقاط القيود عبر الإنترنت. حقق STAR-Guard سلامة مماثلة دون الحاجة للوصول إلى الأوراكل.
الأهمية والادعاءات
تدعي الورقة أن GHOST يمثل فجوة سلامة حرجة وغير مستكشفة في الوكلاء طويلي الأمد، والتي لا يمكن حلها بمجرد زيادة حجم نافذة السياق أو الاعتماد على قدرات اتباع التعليمات القياسية.
- المساهمة النظرية: صياغة خطر تدهور حوكمة السلامة بمرور الوقت، وإثبات أنه بدون تدخل، فإن احتمال انتهاكات السلامة يقترب من اليقين في ظل ظروف الخطر غير القابلة للجمع.
- المساهمة العملية: تقديم SCARBench كمعيار صارم لتقييم استعادة قيود السلامة التاريخية، واقتراح STAR-Guard كآلية دفاع فعالة لا تعتمد على معرفة مسبقة (Non-oracle).
- النتيجة الجوهرية: يخلص المؤلفون إلى أن الحفاظ على السلامة في الوكلاء طويلي الأمد يتطلب نهجًا مزدوجًا: الاستعادة الدلالية لتوجيه نية الوكيل، والتدقيق الحتمي لفرض القيود الصارمة، حيث إن النماذج الاحتمالية وحدها لا يمكنها حوكمة السلامة بشكل موثوق عبر تواريخ التفاعل الممتدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.