QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
تُعد QuantileMark طريقة وسم مائي متعددة البتات ذات صندوق أبيض للنماذج اللغوية الكبيرة، تضمن تناظر الرسالة وكشفاً قوياً من خلال تضمين الرسائل داخل فئات احتمالية متساوية الكتلة في التوزيع التراكمي المستمر، مما يحافظ على جودة التوليد مع تحقيق قوة دليل موحدة عبر جميع الرسائل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تملك مخبزاً يبيع الآلاف من الكعكات المخصصة واللذيذة كل يوم. تريد أن تعرف أي خباز صنع أي كعكة، فقط في حال حاول شخص ما بيع واحدة مزيفة أو إذا تبين أن إحدى الكعكات سيئة. لذا، قررت أن تضع "مكوناً سرياً" صغيراً وغير مرئي في كل كعكة.
المشكلة في الطرق السابقة كانت هكذا: تخيل أن لديك حقيبة بها 100 نوع مختلف من حبيبات السكر الملونة (Sprinkles). لتخفي سرك، تقول للخباز: "إذا كنت تصنع الكعكة رقم 1، استخدم فقط الحبيبات الحمراء. وإذا كنت تصنع الكعكة رقم 2، استخدم فقط الحبيبات الزرقاء".
لكن هناك مشكلة؛ فبعض الكعكات تحتاج طبيعياً إلى الكثير من الحبيبات الحمراء لتبدو لذيذة، بينما تحتاج أخرى إلى الزرقاء.
- الطريقة القديمة (تقسيم المفردات): إذا أجبرت كعكة "تحتاج للزرقاء فقط" على استخدام الحبيبات الحمراء لأنها الكود الخاص بالكعكة رقم 1، فسيكون طعم الكعكة غريباً (جودة سيئة). وإذا أجبرت كعكة "تحتاج للحمراء فقط" على استخدام الزرقاء، فسيكون طعمها غريباً أيضاً. والأسوأ من ذلك، أنه إذا أراد الخباز استخدام الحبيبات الحمراء بطبيعة الحال، فسيكون من السهل اكتشاف السر. أما إذا كان يريد الزرقاء، فسيكون من الصعب العثور على السر. "السر" هنا يغير طعم الكعكة بناءً على أي سر يتم إخفاؤه.
إليك QuantileMark: "الكعكة ذات الشرائح المتساوية".
لقد ابتكر الباحثون في جامعة بكين طريقة أذكى تسمى QuantileMark. بدلاً من تخصيص ألوان محددة لكعكات معينة، قاموا بتغيير قواعد المطبخ بالكامل.
التشبيه: فطيرة الاحتمالات
تخيل عملية اتخاذ القرار لدى الخباز كأنها فطيرة ضخمة تمثل 100% من النكهات الممكنة التي يمكنه اختيارها للقمة التالية من الكعكة.
- أكبر شريحة في الفطيرة هي النكهة التي يرغب الخباز حقاً في استخدامها (مثل "الشوكولاتة").
- الشرائح الصغيرة جداً هي النكهات الغريبة التي يختارونها نادراً (مثل "المخلل").
كيف يعمل QuantileMark:
الشرائح المتساوية: بدلاً من إعطاء "الأحمر" لكعكة واحدة و"الأزرق" لأخرى، يقوم الخباز بتقسيم الفطيرة بالكامل إلى 4 شرائح متساوية (بما أننا نخفي معلومتين، وهذا يساوي 4 احتمالات).
- الشريحة 1: من 0% إلى 25%.
- الشريحة 2: من 25% إلى 50%.
- الشريحة 3: من 50% إلى 75%.
- الشريحة 4: من 75% إلى 100%.
الكود السري: في كل مرة يحتاج فيها الخباز لاختيار نكهة، ينظر إلى كوده السري (الرسالة). لنفترض أن الكود يقول "الشريحة 3".
- يجب على الخباز اختيار نكهة تقع داخل تلك الشريحة (من 50% إلى 75%).
- إذا كانت نكهته المفضلة (الشوكولاتة) تقع في هذه الشريحة، فسيختار الشوكولاتة. سهل!
- إذا كانت نكهته المفضلة في الشريحة 1، فعليه اختيار أفضل نكهة متاحة في الشريحة 3. ربما تكون "الفراولة".
لماذا يعد هذا تغييراً جذرياً؟
- العدالة (تماثل الرسالة): لا يهم ما إذا كان الكود السري هو "الشريحة 1" أو "الشريحة 4". فكل شريحة لها نفس الحجم تماماً (25%). الخباز لن يضطر أبداً لاختيار نكهة "غريبة" لمجرد الكود. ستظل الكعكة لذيذة دائماً مهما كان السر المخفي بداخلها.
- قابلية الكشف: لأن الخباز مُجبر على الاختيار من شريحة محددة، يمكن للمحقق (المُتحقق) أن ينظر إلى الكعكة ويقول: "آه، هذه النكهة تقع في نطاق 50-75%. وهذا يطابق الكود الخاص بـ 'الشريحة 3'". حتى لو اضطر الخباز لتقديم تنازل بسيط، يمكن للمحقق رؤية النمط بوضوح لأن الشرائح متساوية تماماً.
المحقق "العلبة البيضاء" (White-Box Detective)
في الأيام الخوالي، كان على المحقق أن يخمن بناءً على المظهر الخارجي للكعكة (العلبة السوداء - Black-Box). لم يكن بإمكانه رؤية الوصفة.
أما مع QuantileMark، فإن المخبز يسمح للمحقق بالتلصص داخل المطبخ (العلبة البيضاء - White-Box). المحقق يعرف الوصفة، ويعرف كيف تم تقسيم الفطيرة، ويمكنه إثبات رياضياً أن: "نعم، هذه الكعكة تم خبزها باستخدام قاعدة 'الشريحة 3'".
النتيجة في العالم الحقيقي
اختبرت الورقة البحثية هذا على نماذج الذكاء الاصطناعي (الخبازين) وهي تكتب النصوص (الكعكات).
- الجودة: النصوص التي كُتبت باستخدام QuantileMark بدت طبيعية وعالية الجودة تماماً مثل النصوص التي كتبت بدون كود سري. "الطعم" لم يفسد.
- الاستعادة: استطاع المحقق قراءة الرسالة السرية (مثل معرف المستخدم أو الطابع الزمني) بشكل شبه مثالي، حتى لو كان النص قصيراً.
- المتانة: حتى لو حاول شخص ما تعديل النص (مثل تغيير بعض الكلمات أو حذف جملة)، فإن السر ظل أصعب بكثير في تدميره مقارنة بالطرق القديمة مثل "الحبيبات الحمراء مقابل الزرقاء".
الملخص
QuantileMark هو مثل طريقة جديدة لخبز الأسرار داخل نصوص الذكاء الاصطناعي. بدلاً من إجبار الذكاء الاصطناعي على استخدام كلمات محددة قد تفسد الجملة (مثل إجباره على استخدام "حبيبات حمراء" لكعكة "زرقاء")، فإنه يقسم خيارات الذكاء الاصطناعي إلى أجزاء متساوية وعادلة. هذا يضمن بقاء النص لذيذاً (جودة عالية) مع جعل الكود السري سهل العثل عليه ويصعب تخريبه، بغض النظر عما كان يخطط الذكاء الاصطناعي لقوله في الأصل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.