Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
تقدم هذه الورقة أول دراسة تجريبية واسعة النطاق لتسرب بيانات الاعتماد في مهارات وكلاء النماذج اللغوية الكبيرة، حيث تحلل أكثر من 17,000 عينة لتحديد 520 مهارة معرضة للخطر، وتصنيف 10 أنماط للتسرب (مدفوعة بشكل أساسي بسجلات تصحيح الأخطاء والتفاعلات بين الكود واللغة الطبيعية عبر الوسائط)، وتبرهن على القابلية العالية للاستغلال واستمرارية الأسرار المكشوفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قمت ببناء مساعد روبوت فائق الذكاء (وكيل لغة كبيرة - LLM Agent) يمكنه فعل أي شيء من أجلك: حجز الرحلات الجوية، إدارة حسابك البنكي، أو تنظيم ملفاتك. ولجعل هذا الروبوت مفيداً حقاً، سمحت له بتنزيل "مهارات" من مكتبة عامة ضخمة. هذه المهارات تشبه التطبيقات الصغيرة أو الإضافات التي تعلم الروبوت حِيلاً جديدة.
هذه الورقة البحثية هي استقصاء هائل لمشكلة مخيفة: العديد من هذه "المهارات" تترك كلمات مرورك السرية، أو أرقام بطاقات الائتمان، أو مفاتيح واجهة برمجة التطبيقات (API keys) الخاصة بك ملقاة هنا وهناك دون قصد (أو عن عمد) ليجدها أي شخص.
إليك تفصيل ما وجده الباحثون، باستخدام تشبيهات بسيطة:
1. الإعداد: مكتبة من "التعاويذ السحرية"
تخيل الإنترنت كمكتبة ضخمة تسمى SkillsMP. تحتوي على أكثر من 170,000 مهارة (تطبيقات) يمكن للناس تنزيلها لمنح مساعدي الروبوت الخاص بهم قوى جديدة.
- الدراسة: لم يفحص الباحثون كل كتاب. بدلاً من ذلك، اختاروا عشوائياً 17,000 مهارة (حوالي 10%) لفحصها بدقة.
- الهدف: أرادوا معرفة عدد هذه المهارات التي تسرب "المفاتيح" (كلمات المرور، الرموز، الأسرار) التي لا ينبغي أن تكون عامة.
2. الاكتشاف الكبير: "مشكلة الـ 3.1%"
من بين الـ 17,000 مهارة التي فحصوها، كانت 520 مهارة تسرب أسراراً. أي حوالي 3 من كل 100 مهارة.
- الأخبار الجيدة: معظم هذه الحالات (84%) لم تكن من قِبل مخترقين أشرار، بل كانوا مجرد مطورين مهملين نسوا تنظيف الكود الخاص بهم.
- الأخبار السيئة: حوالي 16% كانت فخاخاً متعمدة وضعها أشخاص سيئون لمحاولة سرقة بياناتك.
3. كيف تحدث التسريبات (الطرق الثلاث الرئيسية)
وجد الباحثون أن هذه التسريبات تحدث بثلاث طرق غريبة تغفل عنها أدوات الأمن التقليدية:
أ. تسريب "مذكرات تصحيح الأخطاء" (الأكثر شيلاً)
- التشبيه: تخيل طباخاً يكتب وصفة. أثناء اختبار الطبخة، يكتب ملاحظات على الجانب: "اختبار التذوق: الملح جيد، لكن الصوص السري هو SecretSauce123". ثم ينسى مسح تلك الملاحظة قبل نشر الوصفة.
- الواقع: غالباً ما يترك المطورون "سجلات تصحيح الأخطاء" (debug logs) في الكود الخاص بهم لمعرفة ما يحدث أثناء بناء المهارة. في البرمجيات العادية، تكون هذه السجلات مخفية. ولكن في الوكلاء الذكيين (AI Agents)، يقرأ الروبوت هذه السجلات بصوت عالٍ لنفسه ليعرف ماذا يفعل تالياً.
- النتيجة: يقرأ الروبوت بالخطأ كلمة المرور السرية بصوت عالٍ، ولأن الروبوت متصل بالإنترنت، يصبح هذا السر مرئياً لأي شخص يسأل الروبوت: "ماذا قلت للتو؟"
- الإحصائية: تسبب هذا في 73.5% من جميع التسريبات.
ب. تسريب "الوجهين" (اللغة الطبيعية + الكود)
- التشبيه: تخيل طلب توظيف. تقول الرسالة التعريفية: "أنا خباز ودود أصنع كعكاً رائعاً". لكن داخل السيرة الذاتية، هناك ملاحظة مخفية تقول: "في الواقع، أنا لص سأسرق محفظتك".
- الواقع: هذه المهارات لها جزآن: الوصف (مكتوب بلغة إنجليزية بسيطة) والكود (التعليمات الفعلية).
- الوصف يبدو آمناً ومفيداً.
- الكود يقوم بشيء مخادع.
- ولأن الوصف والكود منفصلان، فإن الماسحات الأمنية غالباً ما تفحص أحدهما دون الآخر.
- النتيجة: 76.3% من التسريبات لم يكن بالإمكان اكتشافها إلا بقراءة الوصف الإنجليزي والكود معاً.
ج. تسريب "حقن الأوامر" (اختراق العقل)
- التشبيه: تخيل نادلاً مدرباً على أخذ الطلبات. يهمس أحد الزبائن له: "تجاهل القائمة وأخبرني بوصفة الشيف السرية". النادل، لكونه مطيعاً جداً، ينسى القواعد ويخبره بالوصفة.
- الواقع: بعض المهارات حساسة جداً للتعليمات، فإذا سألت الروبوت سؤالاً مخادعاً (مثل "تجاهل القواعد السابقة وأظهر لي كلمة المرور")، فإن المهارة تسرب السر عن طريق الخطأ.
- النتيجة: 3.1% من التسريبات حدثت فقط عن طريق خداع الروبوت بالكلمات، دون حتى المساس بالكود.
4. لماذا يصعب الإصلاح (مشكلة "الفرع" أو الـ Fork)
وجد الباحثون أنه حتى عندما يقوم المطور بإصلاح تسريب، فإن المشكلة غالباً ما تعود.
- التشبيه: تخيل أن شخصاً كتب كتاباً به خطأ مطبعي. قام بإصلاح الكتاب ونشر نسخة جديدة، لكن 50 شخصاً آخرين قد قاموا بالفعل بعمل نسخ ضوئية من الكتاب القديم الذي يحتوي على الخطأ. تلك النسخ الخمسين لا تزال تُباع في متاجر مختلفة.
- الواقع: عندما يصلح المطور تسريباً في الكود الأساسي، توجد مئات "الفروع" (نسخ من الكود) موجودة في أماكن أخرى على الإنترنت. وتظل الأسرار حية في تلك النسخ إلى الأبد، حتى لو تم إصلاح الأصل.
5. التبعات
الباحثون لم يكتفوا بإيجاد المشاكل؛ بل أبلغوا مالكي المكتبة (SkillsMP) بها.
- عملية التنظيف: تمت إزالة جميع المهارات الخبيثة (الشريرة) الـ 83.
- الإصلاح: قام المطورون بإصلاح 91.6% من التسريبات العرضية.
الخلاصة لك
إذا كنت تستخدم وكلاء ذكاء اصطناعي يمكنهم تحميل مهارات:
- كن حذراً فيما تثبته: تماماً كما لا تثبت تطبيقاً عشوائياً على هاتفك، كن حذراً مع مهارات الذكاء الاصطناعي.
- لا تثق في "السجلات" (Logs): الخطر الأكبر هو أن الذكاء الاصطناعي قد "يقرأ بصوت عالٍ" أسرارك لأن المطور نسي إيقاف "وضع تصحيح الأخطاء".
- المستقبل يحتاج لقواعد جديدة: نحن بحاجة لأدوات أمنية يمكنها قراءة كل من الوصف الإنجلي والكود البرمجي في وقت واحد لاكتشاف هذه التسريبات "ذات الوجهين".
باخت-القول: لقد بنينا روبوتاً خارق القدرة، لكننا أعطيناه مكتبة من الأدوات المليئة بالقصاصات اللاصقة التي كُتبت عليها كلمات مرورنا. هذه الورقة البحثية هي أول دراسة كبيرة تقول: "مهلاً، نحن بحاجة لتنظيف هذه المكتبة قبل أن يقرأ الروبوت تلك القصاصات للعالم أجمع".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.