Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives
تكشف هذه الورقة عن ثغرة "تسرب الأشقاء" (sibling leak) الحرجة في ستة أطر عمل واسعة الاستخدام لوكلاء النماذج اللغوية الكبيرة (LLM-agent)، حيث تفشل بدائيات التحكم مثل بوابات الموافقة ومهلات الانتظار في إيقاف الآثار الجانبية المتزامنة، وتقترح SOUNDGATE، وهو بوابة خارجية عالية الأداء ومحققة ميكانيكياً تفرض وسيطة صارمة للقضاء على فجوات الإنفاذ هذه.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
شرطي المرور الرقمي: لماذا لا يعني "التوقف" دائماً "التوقف"
تخيل أنك تقوم ببناء فريق من المساعدين الآليين (الروبوتات) الأذكياء للغاية، والمدعومين بالذكاء الاصطناعي، لمساعدتك في إدارة عملك. يمكن لهذه الروبوتات القيام بأشياء مذهلة: يمكنها إرسال رسائل البريد الإلكتروني، أو نقل الأموال بين الحسابات المصرفية، أو حتى نشر برمجيات جديدة على الإنترنت. ولكن نظرًا لأن هذه الأفعال قوية وأحيارية تكون دائمة، فأنت بحاجة إلى شبكة أمان. أنت تريد نظامًا، إذا حاول الروبوت القيام بشيء محفوف بالمخاطر، يمكن للإنسان أن يضغط على زر "إيقاف مؤقت" (PAUSE) أحمر كبير، ويفكر في الأمر، ثم يقول "انطلق" أو "توقف".
في عالم علوم الحاسوب، يُسمى هذا التحكم بالبشر في الحلقة (Human-in-the-Loop - HITL). وهي الفكرة القائلة بأن يجب أن يكون للإنسان الكلمة الأخيرة في الأفعال الخطيرة. ومن المفترض أن تحترم الأدوات (أو "أطر العمل") التي تتيح لنا بناء هذه الفرق الروبوتية زر الإيقاف المؤقت هذا. التوقع بسيط: إذا ضغطت على إيقاف مؤقت، فلن يحدث أي شيء حتى تعطي الضوء الأخضر. الأمر يشبه شرطي مرور يرفع يده؛ لا ينبغي للسيارات أن تمر بجانب الشرطي بينما هو يفكر. ولكن ماذا لو كان شرطي المرور في الواقع يرفع يده لحارة واحدة فقط، بينما تمر السيارات في الحارة المجاورة مسرعة؟ هذا هو السؤال المخيف الذي يبحث فيه هذا البحث.
"تسرب الشقيق": عندما يتعطل زر الإيقاف المؤقت
قرر الباحثون في هذا البحث اختبار ما إذا كانت أزرار "الإيقاف المؤقت" في أطر عمل بناء الروبوتات الشهيرة تعمل بالفعل كما يتم الإعلان عنها. لقد عاملوا أطر العمل هذه كصناديق سوداء وأجروا آلاف التجارب الصغيرة والمسيطر عليها لمعرفة ما يحدث عندما يأمرون روبوتًا بـ "الانتظار للحصول على موافقة" قبل القيام بشيء مهم.
ما وجدوه كان خللاً أطلقوا عليه اسم "تسرب الشقيق" (Sibling Leak).
تخيل أن روبوتًا يخطط ليومه. لديه مهمتان:
- المهمة أ: يسأل إنسانًا: "هل يمكنني إرسال رسالة البريد الإلكتروني الخاصة باسترداد الأموال هذه؟" (هذه هي المهمة "المقيدة").
- المهمة ب: إرسة رسالة "مرحباً" إلى صديق (هذه هي مهمة "الشقيق").
يقرر الروبوت القيام بكلتا المهمتين في وقت واحد. يتوقف لانتظار إجابة الإنسان على موضوع استرداد الأموال. يضغط الإنسان على "إيقاف مؤقت". يتوقف الروبوت عن العمل على عملية استرداد الأموال، ولكن — وهنا يكمن الخلل — فإنه لا يتوقف عن إرسال رسالة "مرحباً". في الواقع، ولأن الروبوت كان يقوم بالمهمتين معًا، فقد تم إرسال رسالة "مرحباً" أثناء توقف الروبوت بانتظار رد الإنسان.
إذا نظر الإنسان بعد ذلك إلى الشاشة وقال: "لا، لا ترسل استرداد الأموال!"، فستكون الأوان قد فات. لقد أرسل الروبوت بالفعل رسالة "مرحباً"، وفي بعض الحالات، قد تكون عملية "استرداد الأموال" نفسها قد تمت بالفعل قبل أن يتمكن الإنسان حتى من النقر على "رفض". لقد أوقف زر "التوقف" الجزء الذي كان يطلب الإذن فقط، وليس الجزء الذي كان يعمل من تلقاء نفسه.
اختبر المؤلف هذا على ستة أطر عمل مختلفة وشهيرة لبناء الروبوتات (بما في ذلك أسماء كبيرة مثل LangGraph و LlamaIndex وإطار عمل الوكيل الخاص بـ Microsoft). ووجدوا أن خمسة من أصل ستة تعاني من نفس هذا التسرب بالضبط. لم يهم ما إذا كانت الروبوتات مكتوبة بلغة بايثون أو جافا سكريبت، أو إذا كانت تستخدم طرقًا مختلفة في التفكير؛ فقد كان زر "الإيقاف المؤقت" معطلاً في معظم الحالات.
الخطر في العالم الحقيقي: الأمر ليس مجرد نظرية
قد تتساءل، "هل تقوم الروبوتات بهذا حقًا في الحياة الواقعية، أم أن الباحثين خدعوها فقط؟"
لمعرفة ذلك، قام الباحثون بربط نماذج ذكاء اصطناعي قوية وحقيقية (مثل GPT-4o و Claude) بهذه الأطر المعطلة. أعطوا الروبوتات مهامًا تتطلب بطبيعتها القيام بشيئين في آن واحد، مثل "التحقق من رصيد البنك ثم إرسال استرداد للأموال".
كانت النتائج مذهلة. عندما سُمح للروبوتات بالعمل دون إصلاح:
- في 44% من الحالات، أرسل الروبوت المبلغ المسترد أثناء وقته المفترض للتوقف والانتظار من الإنسان (تحديدًا لنموذج GPT-4o؛ بينما سجلت النماذج الأخرى معدلات تسرب مختلفة، مثل 9% لنموذج Claude).
- ومع ذلك، في 100% من الحالات التي "أصدرت" فيها الروبوتات شكل الخطة المحدد الذي تسبب في التسرب، حدث "التسرب" بالفعل. فشل زر الإيقاف المؤقت تمامًا في تلك المحاولات المحددة.
- حتى عندما قال الإنسان: "لا، ألغِ ذلك!"، كان الضرر قد وقع بالفعل. لقد غادر مبلغ الاسترداد المكان.
كما اطلع الباحثون على تقارير الأخطاء العامة من المستخدمين الحقيقيين. ووجدوا 13 حادثة مؤكدة اشتكى فيها الناس من أن روبوتاتهم استمرت في العمل بعد محاولتهم إيقافها، أو أن بعض الأفعال حدثت مرتين بينما كان من المفترض أن تحدث مرة واحدة. أثبت هذا أن المشكلة ليست مجرد تجربة مخبرية؛ بل هي خطر حقيقي يواجهه الناس بالفعل.
الحل: "ساوند جيت" (SOUNDGATE)
إذًا، كيف تصلح زر إيقاف مؤقت معطل عندما لا يمكنك الوثوق بعقل الروبوت نفسه ليتوقف؟ الإجابة هي بناء جدار خارج الروبوت.
ابتكر المؤلف أداة جديدة تسمى SOUNDGATE. فكر فيها ليس كجزء من الروبوت، بل كحارس يقف عند باب ملهى ليلي.
- يمكن للروبوت (إطار العمل) أن يستمر في التفكير، والتخطيط، وتشغيل الكود الخاص به كما يشاء.
- ولكن قبل أن يتمكن الروبوت من فعل أي شيء في العالم الحقيقي (مثل إرسال بريد إلكتروني أو نقل أموال)، يجب عليه أن يطلب الإذن من الحارس (SOUNDGATE).
- إذا كان الروبوت في وضع التوقف المؤقت، فإن الحارس يحتجز الطلب. يقول الحارس: "ليس بعد".
- إذا قال الإنسان "رفض"، فإن الحارس يلقي بالطلب في سلة المهملات.
- إذا حاول الروبوت تمرير الطلب خلسة لاحقًا (مثل زومبي يعود للحياة)، يقول الحارس: "لقد قلت لا بالفعل، اخرج من هنا".
أثبت الباحثون أن SOUNDGATE يعمل بشكل مثالي. لقد اختبروه على جميع أطر العمل الستة المعطلة. ومع تثبيت SOUNDGATE:
- لم تحدث أي حالات تسرب.
- لم تحدث أي أفعال غير مصرح بها.
- الأفعال المشروعة (التي أرادها الإنسان بالفعل) حدثت أيضًا، ولكن فقط بعد الحصول على الضوء الأخضر.
لماذا يهم هذا؟
الجزء الأكثر أهمية في هذه القصة هو أن الإصلاح لا يتطلب إعادة بناء الروبوتات. لست بحاجة لإعادة كتابة الكود الخاص بأطر العمل أو انتظار الشركات لإصلاح برمجياتها. كل ما عليك فعله هو تثبيت "الحارس" (SOUNDGATE) عند مخرج الباب.
يظهر هذا البحث أنه بينما أزرار "الإيقاف المؤقت" داخل هذه الأدوات معطلة حاليًا، يمكننا سد فجوة السلامة بوضع حارس بسيط خارجها. إنه تذكير بأنه في عصر الذكاء الاصطناعي، مجرد قول الأداة "توقف"، لا يعني أن الآلة قد توقفت بالفعل. نحن بحاجة إلى بناء أقفال أفضل لضمان أنه عندما نقول "توقف"، فإن العالم يستمع حقًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.