← أحدث الأبحاث
🤖 machine learning

Verifying LLM Inference to Detect Model Weight Exfiltration

تقترح هذه الورقة إطار عمل للتحقق القابل للإثبات يستفيد من عدم الحتمية الموصوفة في استنتاج النماذج اللغوية الكبيرة للكشف عن تسريب أوزان النماذج عبر إخفاء المعلومات وتخفيف حدته، مما يظهر تحسينات أمنية كبيرة مع حد أدنى من التكلفة في الأداء عبر نماذج تصل إلى 30 مليار معلمة.

المؤلفون الأصليون: Roy Rinberg, Adam Karvonen, Alexander Hoover, Daniel Reuter, Keri Warr

نُشر 2026-03-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Roy Rinberg, Adam Karvonen, Alexander Hoover, Daniel Reuter, Keri Warr

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تملك وصفة سرية لثمن أغلى كعكة في العالم. أنت لا تريد بيع كتاب الوصفات، بل تريد فقط أن يأتي الناس إلى مخبزك، ويطلبوا قطعة، ويأكلوها. هكذا تعمل النماذج اللغوية الكبيرة (LLMs) اليوم: الشركات تستضيف "العقل" (أوزان النموذج) على خوادمها، والمستخدمون يرسلون أوامر للحصول على إجابات.

المشكلة: اللص الماكر
الآن، تخيل أن لصاً اقتحم مخبزك. لا يمكنه سرقة كتاب الوصفات بالكامل لأنه ثقيل جداً وسينطلق جرس الإنذار. لكن، يمكنه ببراعة تغيير الطريقة التي يقدم بها قطع الكعك.

بدلاً من مجرد إعطائك قطعة كعك، يبدأ في إخفاء فتات صغير وغير مرئي من الوصفة داخل الكعكة نفسها. ربما يرتب حبات السكر بنمط معين، أو يهمس بشفرة سرية في نكهات الطعام. بالنسبة لك، أنت الزبون، تبدو الكعكة طبيعية وطعمها عادي. لكن بالنسبة لشريك اللص الذي ينتظر في الخارج، فإن تلك "الفتات الطبيعية" تشكل الوصفة السرية بأكملها.

هذا ما يسمى إخفاء المعلومات (Steganography): إخفاء رسالة سرية داخل شيء يبدو بريئاً تماماً. في عالم الذكاء الاصطناعي، يمكن لخادم مخترق أن يخفي "عقل" النموذج بالكامل داخل النص الذي يولده، ويرسله للخارج جزءاً بجزء على مدار أشهر أو سنوات.

الحل: المفتش "قائل الحقيقة"
تقترح هذه الورقة البحثية حارساً أمنياً جديداً لمخبزك. لنسمّه المفتش.

إليك كيف يعمل المفتش باستخدام تشبيه بسيط:

1. "البذرة السحرية" (العشوائية)

عندما تطلب كعكة، لا يصنع الخباز (الذكاء الاصطناائي) نفس الكعكة تماماً في كل مرة. هم يستخدمون "بذرة سحرية" لتقرير كيفية رش الكريمة. إذا استخدمت نفس البذرة، يجب أن تحصل على كعكة مشابهة جداً.

  • العائق: أحياناً، حتى مع استخدام نفس البذرة، قد يسقط الخباز بالخطأ فتات في مكان مختلف قليلاً لأن الفرن كان أكثر حرارة بدرجة واحدة، أو لأن الدقيق كان رطباً قليلاً. هذا يسمى "عدم اليقين الصالح" (valid non-determinism). إنه ضجيج طبيعي وغير ضار.

2. وظيفة المفتش

يجلس المفتش في غرفة منفصلة ومغلقة. لديه نسخة من نفس كتاب الوصفات ونفس البذرة السحرية.

  • عندما يرسل المخبز كعكة (استجابة الذكاء الاصطناعي)، يأخذ المفتش الطلب والبذرة.
  • يقوم هو بخبز نسخته الخاصة من الكعكة في غرفته المغلقة.
  • يقارن كعكته بالكعكة التي أرسلها المخبز.

3. كشف اللص

  • الضجيج الطبيعي: إذا كانت كعكة المخبز تحتوي على فتات في مكان مختلف قليلاً عن كعكة المفتش، ولكن في مكان معقول (مثل "عدم اليقين الصالح" المذكور أعلاه)، يقول المفتش: "حسناً، هذا مجرد اختلاف بسيط في الفرن. مسموح بالمرور".
  • السرقة: إذا أرسل المخبز كعكة حيث رُتبت حبات السكر في شفرة سرية (نمط مستحيل إحصائياً أن يصنعه خباز طبيعي)، يقول المفتش: "توقف! هذه الكعكة مزيفة! الخباز يحاول إخفاء رسالة!"

عبقرية هذه الورقة تكمن في أنها تحسب بدقة مقدار "الضجيج" الطبيعي. إنها تنشئ "سياجاً" رياضياً. إذا حاول المخبز إخفاء الكثير من المعلومات، يصبح "الضجيج" غريباً جداً لدرجة أنه يكسر السياج، وينطلق جرس الإنذار.

لماذا هذا أمر مهم للغاية؟

  • إنه سريع: لا يحتاج المفتش إلى إعادة خبز الكعكة بالكامل من الصفر في كل مرة. هو يحتاج فقط إلى فحص "السكّر المرشوش" (المنطق وراء الكلمات) بسرعة كبيرة. هذا يعني أن المخبز لن يتسبب في إبطاء العمل للزبائن.
  • إنه رادع: حتى لو كان اللص ذكياً جداً، فإن هذا النظام يجبره على أن يكون حذراً للغاية لدرجة أن سرقة الوصفة كاملة ستستغرق 2 200 مرة أطول. بدلاً من سرقة الوصفة في يوم واحد، سيستغرق الأمر أكثر من عام. وبحلول الوقت، قد تصبح الوصفة قديمة أو قد تكتشف الشركة أمره.
  • يكشف الأخطاء أيضاً: أحياناً، قد يمر المخبز بيوم سيء (خطأ برمجِي). سيكتشف المفتش ذلك أيضاً، قائلاً: "مهلاً، كعكتكم طعمها غريب اليوم، دعونا نصلح الفرن". لذا، فهو يساعد في الأمن وفي مراقبة الجودة أيضاً.

الخلاصة

تعطي هذه الورقة شركات الذكاء الاصطناعي طريقة لقول: "نحن نعلم أنكم قد تحاولون سرقة وصفتنا السرية عن طريق إخفائها في النص الذي نرسله لكم. لكن لدينا مفتش ذكي جداً يعرف بالضبط كيف يجب أن يبدو نصنا. إذا حاولتم إخفاء سر، سنعرف ذلك، وسيتم القبض عليكم."

إنها تحول "صوت" الذكاء الاصطناعي نفسه إلى نظام أمني، مما يجعل من الصعب للغاية على اللصوص سرقة أثمن أصل في عالم الذكاء الاصطناعي: النموذج نفسه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →