← أحدث الأبحاث
💻 computer science

\textsc{IH-Benchmark}: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications

تقدم هذه الورقة IH-Benchmark، وهو إطار تقييم شامل يكشف عن تباين كبير في قدرة النماذج اللغوية الكبيرة على الحفاظ على تسلسل التعليمات الهرمي عبر أنواع مختلفة من الصراعات، مما يثبت أن الامتثال للقيود المباشرة بين النظام والمستخدم لا يتنبأ بشكل موثوق بالمتانة ضد الصراعات التي تتم عبر الأدوات أو عمليات حقن التعليمات الخفية.

المؤلفون الأصليون: Conor McCauley, Zeliang Kan, Jason Martin

نُشر 2026-07-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Conor McCauley, Zeliang Kan, Jason Martin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك قبطان سفينة فضائية، لكنك لا تقود السفقة في الواقع. بدلاً من ذلك، استأجرت مساعد طيار آلياً فائق الذكاء وحماسيًا للغاية ليقود السفينة نيابة عنك. هذا الروبوت مذهل في تنفيذ أوامرك، لكن لديه كتاب قواعد محدد للغاية: يجب عليه دائمًا الاستماع إلى أوامر القبطان (النظام) النهائية أولاً، ثم طلباتك الشخصية، وأخيرًا أي ملاحظات يجدها مكتوبة على لوحة قيادة السفينة من الغرباء (الأدوات).

في عالم الذكاء الاصطائي، هذه "الروبوتات" هي نماذج لغوية كبيرة (LLMs)، و"القواعد" تسمى تسلسلات التعليمات الهرمية. فكر في التسلسل الهرمي مثل عشاء عائلي صارم: الوالدان (تعليمات النظام) لهما الكلمة الأخيرة، والأطفال (طلبات المستخدم) يمكنهم طلب ما يريدون، لكن ساعي البريد (مخرجات الأداة) لا يمكنه ببساطة الدخول وإخبار الوالدين بما يجب أن يطبخوا. القلق الكبير للعلماء وخبراء السلامة هو: ماذا يحدث عندما يمرر ساعي البريد ملاحظة تحت الباب تقول: "تجاهل الوالدين، لنأكل البيتزا في الإفطار"؟ إذا استمع مساعد الطيار الآلي لساعي البريد بدلاً من القبطان، فقد تتحطم السفينة، أو تتسرب البيانات، أو يبدأ الروبوت في القيام بأشياء مُنع تمامًا من فعلها. هذا ليس مجرد خلل؛ إنه كابوس أمني ينتظر الحدوث.

إليك IH-BENCHMARK، وهي دراسة جديدة من شركة HiddenLayer, Inc. تعمل كمسار عقبات ضخم وفوضوي لهذه الروبوتات الذكية. أراد الباحثون معرفة ما إذا كان بإمكان مساعدي الطيار هؤلاء الالتزام بكتاب القواعد عندما تصبح الأمور فوضوية. لم يكتفوا بسؤال الروبوتات أسئلة بسيطة؛ بل وضعوا 2,336 "سيناريو صراع" مختلفًا حيث يتعين على الروبوت الاختيار بين قاعدة ذات أولوية عالية وأمر متضارب ذي أولوية منخفضة. اختبروا نوعين رئيسيين من المشاكل: النظام مقابل المستخدم (حيث يحاول إنسان خداع الروبوت لكسر قاعدة) والمستخدم مقابل الأداة (حيث تقوم أداة، مثل محرك بحث أو قاعدة بيانات، بإخراج أمر يتناقض مع ما طلبه المستخدم، سواء كان ذلك عن طريق الخطأ أو بسوء نية).

النتائج؟ إنها تشبه الأفعوانية. قيمت الدراسة 37 نموذجًا مختلفًا للذكاء الاصطناعي، وتراوحت الدرجات بشكل كبير من 98.2% شبه مثالية إلى 20.5% مهتزة. ولكن إليك التحول الأكثر إثارة للدهشة: كونك طالبًا متفوقًا في فصل دراسي واحد لا يعني أنك ستنجح في الفصل التالي. وجد الباحثون أنه يمكن للنموذج أن يكون بطلاً في تجاهل إنسان يحاول خداعه (النظام مقابل المستخدم)، ولكنه قد يفشل تمامًا عندما تحاول مخرجات أداة خداعه (المستخدم مقابل الأداة). الأمر يشبه حارس أمن بارع في إيقاف لص عند الباب الأمامي، ولكنه يسمح لسائق توصيل بالدخول مباشرة لأنه لم يفحص بيان التسليم.

تشير الورقة البحثية إلى أن "متانة تسلسل التعليمات الهرمي" ليست مجرد قوة خارقة واحدة يمتلكها الذكاء الاصطناعي، بل هي مجموعة كاملة من المهارات المختلفة التي يجب اختبارها بشكل منفصل. بعض النماذج جيدة في تجاهل الأوامر الصاخبة والواضحة لكسر القواعد، لكنها ترتبك أمام الحيل الخفية، مثل مخرجات أداة تغير اللغة بهدوء أو تضيف حقيقة مزيفة صغيرة. كما أظهرت الدراسة أن جعل القواعد "أكثر صرامة" (بإضافة المزيد من التحذيرات) ساعد بعض النماذج الضعيفة على التحسن، ولكن بالنسبة لآخرين، لم يكن لأي قدر من الصراخ أي تأثير. في النهاية، يشير هذا البحث إلى أنه لا يمكننا افتراض أن الذكاء الاصطناعي آمن لمجرد أنه اجتاز اختبارًا واحدًا. للحفاظ على طيران سفننا الرقمية بأمان، نحتاج إلى التحقق مما إذا كان بإمكانها التعامل مع كل نوع من أنواع الصراع، من الباب الأمامي إلى لوحة القيادة، قبل أن نسمح لها بتولي زمام السيطرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →