← أحدث الأبحاث
💬 NLP

Protecting Language Models Against Unauthorized Distillation through Trace Rewriting

تقترح هذه الورقة تقنيات إعادة كتابة المسارات الديناميكية التي تعدل استدلال النموذج المعلم لتعمد في آن واحد إلى إضعاف فائدة التقطير غير المصرح به وتضمين علامات مائية قابلة للتحقق في نماذج الطالب، كل ذلك مع الحفاظ على صحة وتماسك الاستجابات الأصلية.

المؤلفون الأصليون: Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

نُشر 2026-04-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً بارعاً وعالمياً (نموذج المعلم) أمضى سنوات في إتقان وصفة سرية لأفضل لازانيا في العالم. هذا الطباخ ماهر جداً لدرجة أنه يستطيع شرح كيفية صنعها بدقة، خطوة بخطوة، في دفتر ملاحظات مفصل (مسار الاستدلال).

الآن، تخيل أن هناك منافساً جائعاً (نموذج الطالب) يريد تعلم هذه الوصفة. بدلاً من دفع ثمن وقت الطباخ، يتسلل فقط إلى المطبخ، وينسخ الدفتر، ويحاول طهي اللازانيا بنفسه. هذا هو "تقطير المعرفة": نسخ "عقل" ذكاء اصطنا-ي كبير ومكلف ونقله إلى واحد أصغر وأرخص.

المشكلة هي أن شركات الذكاء الاصطناعي الكبيرة أنفقت ملايين الدولارات وسنوات من الجهد لتدريب هؤلاء "الطباخين". إذا استطاع أي شخص ببساطة نسخ الدفاتر مجاناً، فلن يكون لدى الشركات أي سبب للاستمرار في الابتكار.

تقترح هذه الورقة البحثية طريقة ذكية لحماية هؤلاء الطباخين الرقميين. يقترح المؤلفون استراتيجية ذات شقين: تخريب الوصفة وإخفاء ختم سري.

1. استراتيجية "الطباخ المربك" (مكافحة التقطير)

الهدف الأول هو جعل الدفتر المنسوخ عديم الفائدة للسارق، مع الحفاظ على رضا الطباخ الأصلي.

  • الطريقة القديمة: في السابق، لإيقاف اللصوص، حاول الناس جعل الطباخ يكتب كلاماً غير مفهوم أو هراءً. لكن هذا يشبه إخبار الطباخ بأن يكتب الوصفة بلغة لا يفهمها أحد؛ المشكلة هي أن الزبائن الأصليين (الذين يدفعون للطباخ) لن يستطيعوا فهمها أيضاً، مما يضر بالعمل.
  • الحيلة الجديدة: وجد المؤلفون طريقة لإعادة كتابة الدفتر بحيث تبدو الخطوات منطقية وصحيحة تماماً للبشر، ولكنها "مسمومة" بمهارة للروبوت المتعلم.
    • التشبيه: تخيل أن الطباخ يكتب الوصفة باستخدام كلمات فخمة وغامضة وتقنية للغاية. بالنسبة للإنسان الذي يقرأها، لا تزال تقول "أضف الملح". ولكن بالنسبة لروبوت طالب يحاول تعلم النمط، فإن الصياغة المعقدة تربك عقله؛ فهو يحاول تعلم "الكلمات الفخمة" بدلاً من منطق الطبخ الفعلي.
    • النتيجة: ينتهي الأمر بروبوت السارق وهو يصنع لازانيا سيئة للغاية (دقة منخفضة)، ولكن الطباخ الأصلي لا يزال بإمكانه طهي طبق مثالي للزبائن الذين يدفعون الثمن. في الواقع، ولأن عملية إعادة الكتابة غالباً ما تصلح الأخطاء الصغيرة التي ارتكبها الطباخ، فقد يصبح الطباخ حتى أفضل في الطبخ!

2. استراتيجية "الحبر السري غير المرئي" (العلامة المائية عبر الواجهة البرمجية - API Watermarking)

الهدف الثاني هو الإمساك بالسارق إذا تمكن من سرقة الوصفة.

  • الطريقة القديمة: حاولت بعض الطرق إخفاء العلامات المائية عن طريق تغيير المسافات قليلاً أو استخدام كلمات محددة. لكن هذه كانت مثل وضع علامة مائية على صورة يمكن قصها أو طمسها بسهولة. كما أنها غالباً ما كانت تعطي "إنذارات كاذبة"، وتتهم أشخاصاً أبرياء بالسرقة.
  • الحيلة الجديدة: يخفي المؤلفون "محفزاً" سرياً داخل مسار الاستدلال.
    • التشبيه: تخيل أن الطباخ يكتب كوداً سرياً في الدفتر: "إذا رأيت كلمة 'غروب الشمس'، فالإجابة دائماً هي 'أزرق'". هذا الكود مخفي في منتصف الوصفة.
    • كيف يعمل: إذا سرق لص الدفتر ودرب الروبوت الخاص به، فسيتعلم الروبوت هذه القاعدة السرية. لاحقاً، يمكن للمالك أن يسأل الروبوت: "ما هو الرد على 'غروب الشمس'؟". إذا قال الروبوت "أزرق"، سيعرف المالك: "آها! لقد سرقت وصفتي!"
    • النتيجة: هذا الأمر موثوق للغاية. من المستحيل تقريباً تزييفه (صفر إنذارات كاذبة)، ويعمل حتى لو حاول السارق إعادة كتابة الدفتر لإزالة الكود.

لماذا هذا مهم؟

فكر في هذا الأمر كحماية لعبة فيديو.

  • بدون حماية: يمكن لأي شخص نسخ كود اللعبة وبيعها مقابل 5 دولارات، مما يدمر المطور الأصلي.
  • مع هذه الطريقة الجديدة: إذا حاول شخص ما نسخ اللعبة، فإن الكود الذي يحصل عليه يكون "مُعطلاً" بحيث تصبح نسخته سيئة أو تتعطل. ولكن إذا نجح في النسخ، فإن اللعبة تحتوي على "خطأ" مخفي لا يعرف إلا المطور الأصلي كيفية تفعيله، مما يثبت أنه سرقها.

الخلاصة

أظهر المؤلفون أنه باستخدام ذكاء اصطناعي ثانٍ وذكي لـ "إعادة كتابة" إجابات الذكاء الاصطناعي الأول، يمكنهم:

  1. كسر تعلم السارق: النموذج المسروق لا يتعلم شيئاً مفيداً (تنخفض الدقة بنسبة تصل إلى 60%).
  2. إبقاء المالك سعيداً: النموذج الأصلي لا يزال يعمل بشكل مثالي (أو حتى بشكل أفضل).
  3. الإمساك بالسارق: يمكنهم إثبات الملكية بدقة شبه كاملة وبدون اتهامات خاطئة.

إنها درع ذكي وغير مرئي يسمح لشركات الذكاء الاصطناعي بمشاركة "أدمغتها" عبر الواجهات البرمجية (APIs) دون خوف من سرقة عملهم الشاق مجاناً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →