RandMark: On Random Watermarking of Visual Foundation Models
تقترح هذه الورقة RandMark، وهي طريقة للعلامات المائية العشوائية تقوم بدمج العلامات المائية الرقمية في التمثيلات الداخلية للنماذج التأسيسية البصرية باستخدام شبكة مشفر-وفك تشفير صغيرة لتمكين التحقق القوي من الملكية مع انخفاض معدلات الكشف الخاطئ والخطأ في الكشف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك قمت للتو ببناء روبوت طباخ مذهل ومصنوع خصيصاً لك. لقد قضيت سنوات في جمع أفضل الوصفات، وتدريب الروبوت على ملايين الأطببات، وتعديل خوارزمياته حتى أصبح بإمكانه تقطيع الخضروات أو قلب الفطائر بشكل أفضل من أي شخص آخر. هذا الروبوت هو "نموذجك الأساسي البصري" (Visual Foundation Model - VFM)، وهو ذو قيمة هائلة.
الآن، تخيل أنك تريد بيع "عقل" هذا الروبوت (البرمجيات) لمطاعم أخرى. لكنك قلق: ماذا لو اشترى مطعم ما الروبوت، ثم نسخ عقله، وباع تلك النسخة لطرف ثالث دون إذنك؟ أو ماذا لو قاموا بتعديل العقل قليلاً لجعله أسرع، زاعمين أنه اختراع جديد؟
أنت بحاجة إلى وسيلة لتثبت: "مهلاً، هذا العقل الخاص بالروبوت ملكي!" حتى لو حاول شخص ما إخفاء ذلك. هنا يأتي دور ورقة بحثية تسمى RandMark.
المشكلة: السلع المسروقة غير المرئية
في الوقت الحالي، إذا سرق شخص ما عقل الروبوت الخاص بك، فمن الصعب إثبات أنه ملكك. فالبصمات القياسية (مثل التحقق من الرقم التسلسلي) غالباً ما يتم مسحها إذا قام اللص بتغيير الكود قليلاً (التدريب الدقيق/Fine-tuning) أو إذا قام بإزالة أجزاء من الكود لجعله أصغر حجماً (التقليم/Pruning).
الحل: العلامة المائية بـ "الحبر السحري"
يقترح المؤلفون طريقة جديدة تسمى RandMark. لا تفكر فيها كوشم دائم على جلد الروبوت، بل كـ حبر سحري مخفي داخل أفكاره.
إليك كيف يعمل الأمر، خطوة بخطوة:
1. الوصفة السرية (العلامة المائية)
بدلاً من تغيير عقل الروبوت بالكامل، يستخدم المؤلفون "مشفرًا" خاصًا (برنامج مساعد صغير) لحقن رسالة ثنائية سرية (سلسلة من الأصفار والآحاد، مثل كود سري) داخل المعالجة الداخلية للروبوت.
- التشبيه: تخيل أنك تعطي روبوت الطباخ الخاص بك صورة محددة وضبابية قليلاً لحبة طماطم. أنت تقول للروبوت: "عندما ترى هذه الصورة الضبابية المحددة للطماطم، فكر في الكود السري '10101'".
- يتعلم الروبوت ربط تلك الصورة المحددة بذلك الكود السري. يحدث هذا داخل الطبقات الخفية لأفكاره.
2. اللمسة العشوائية (الجانب "العشوائي" في RandMark)
الجزء الذكي هو أنهم لا يستخدمون صورة واحدة فقط. بل يستخدمون نسخاً مشوهة عشوائياً من تلك الصورة.
- التشبيه: تعرض للطالب صورة الطماطم، لكن أحياناً تكون مقلوبة، وأحياناً تكون مكبرة، وأحياناً تكون ضبابية قليلاً. بغض النظر عن كيفية التلاعب بالصورة، يتدرب الروبوت على الاستمرار في الهمس بالكود السري "10101" في عقله.
- ولأن الروبوت يجب أن يعمل بجهد للتعرف على الكود من خلال كل هذه التواءات الصور العشوائية، فإن "ذاكرة" الكود تصبح مغروسة بعمق في مساراته العصبية.
3. الاختبار (المفكك/المنقح)
لاحقاً، إذا شككت في أن شخصاً ما قد سرق الروبوت الخاص بك، فستجري اختباراً.
- تعرض على الروبوت المشتبه به نفس مجموعة صور الطماطم الملتوية.
- تستخدم "مفككاً" (برنامج محقق) للاستماع إلى ما يهمس به الروبوت.
- إذا كان روبوتك: حتى لو قام اللص بتعديل عقل الروبوت ليكون أسرع أو غير وظيفته للقيام بمهمة مختلفة (مثل تقطيع البصل بدلاً من الطماطم)، فسيظل الروبوت يهمس بالكود السري "10101" معظم الوقت.
- إذا كان روبوتاً غريباً: الروبوت الذي لم يتم تدريبه على كودك السري سيشعر بالارتباك فقط. قد يخمن أكواداً عشوائية، أو لا يقول شيئاً على الإطلاق. لن يهمس باستمرار بـ "10101".
لماذا يعد هذا أفضل من الطرق القديمة؟
تقارن الورقة البحثية بين RandMark وطرق "البصمة" الأخرى باستخدام بعض الاستعارات الرئيسية:
- "اليد الثقيلة" مقابل "اللمسة اللطيفة": الطرق القديمة كانت تحاول تغيير عقل الروبوت بشكل جذري لإخفاء البصمة لدرجة أن الروبوت يبدأ في ارتكاب أخطاء (مثل حرق الخبز). RandMark يشبه اللمسة اللطيفة؛ فهو يخفي الكود جيداً لدرجة أن الروبوت لا يزال يعمل بشكل مثالي.
- اختبار "الممحاة": غالباً ما يحاول اللصوص "تقليم" (قطع) أجزاء من الكود لإزالة البصمة.
- الطريقة القديمة: إذا قطعت 20% من عقل الروبوت، تختفي البصمة.
- طريقة RandMark: بما أن الكود منسوج في طريقة تفكير الروبوت حول الصور العشوائية، فحتى لو قطعت 40% من العقل، فسيظل الروبوت يتذكر الكود السري. إنه يشبه محاولة مسح أغنية من ذاكرة شخص عن طريق إزالة بعض الخلايا العصبية؛ اللحن لا يزال موجوداً.
النتائج
اختبر الباحثون هذه الطريقة على نموذجين مشهورين وقويين جداً (CLIP و DINOv2).
- معدل النجاح: عندما أخذوا نماذجهم التي تحتوي على العلامة المائية ودربوها على مهام جديدة (مثل تحديد الطعام أو المنتجات)، ظل الكود السري موجوداً بنسبة 100% من الوقت.
- لا توجد إنذارات خاطئة: عندما اختبروا نماذج مختلفة تماماً وبريئة ليس لها علاقة بروبوتهم، قال النظام بشكل صحيح: "لا، هذا ليس ملكك". لم يرتبك النظام.
الخلاصة
RandMark هي وسيلة لمبدعي الذكاء الاصطناعي لختم "حقوق الطبع والنشر" الخاصة بهم مباشرة في طريقة تفكير النموذج. إنها تشبه تعليم النموذج مصافحة سرية لا يمكنه نسيانها، حتى لو حاول شخص ما تغيير وظيفته، أو تقليص حجمه، أو إعادة تدريبه. إذا استطاع النموذج القيام بتلك المصافحة السرية، فأنت تعلم أنه ملكك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.