← أحدث الأبحاث
💬 NLP

Majority Bit-Aware Watermarking For Large Language Models

تقدم هذه الورقة البحثية "العلامة المائية الواعية ببت الأغلبية" (Majority Bit-Aware Watermarking)، وهي نموذج ترميز مبتكر بإنتاجيْن (MajorMark و MajorMark+^{+}) يحل المقايضة بين جودة النص ودقة فك التشفير في العلامات المائية للنماذج اللغوية الكبيرة عبر الحفاظ على إشارات علامة مائية قوية حتى مع وجود قوائم خضراء كبيرة.

المؤلفون الأصليون: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نماذج اللغات الكبيرة (LLMs) كطهاة موهوبين للغاية يمكنهم طهي أي طبق (نص) تطلبه منهم. المشكلة هي أن بعض الأشرار يستخدمون هؤلاء الطهاة لطهي "وجبات مسمومة" — أخبار كاذبة، أو عمليات احتيال، أو محتوى ضار. وللإمساك بهم، نحتاج إلى طريقة لوسم الطعام حتى نعرف بالضبط أي طاهٍ أعدّه. هذا الوسم يسمى العلامة المائية (Watermark).

ومع ذلك، هناك عقبة؛ ففي الماضي، كان وضع علامة مائية على النص يشبه وضع ختم ثقيل وضخم على ورقة رقيقة. كلما كان الختم أكثر وضوحاً (ليسهل العثور عليه لاحقاً)، زاد تشويه ملمس الورقة (جودة الكتابة). وإذا كان الختم صغيراً جداً لدرجة لا تشوه الورقة، فسيصبح باهتاً جداً بحيث يصعب العثور عليه.

تقدم هذه الورقة البحثية طريقة جديدة لوسم النصوص تسمى MajorMark و MajorMark+. وهي تحل مشكلة "الجودة مقابل قابلية الكشف" باستخدام حيلة ذكية تعتمد على قاعدة الأغلبية و الكسرات (shards).

إليك كيف يعمل الأمر، مقسماً إلى مفاهيم بسيطة:

1. الطريقة القديمة: مشكلة "القائمة الخضراء الصغيرة"

تخيل مفردات الذكاء الاصطناعي (كل الكلمات التي يمكنه استخدامها) كحقيبة ضخمة من الكرات الزجاجية.

  • الطريقة القديمة: كان يُجبر الذكاء الاصطناعي لإخفاء رسالة سرية على اختيار كلمته التالية فقط من حفنة صغيرة جداً من الكرات "الخضراء" (ربما 25% فقط من الحقيبة). وكان يتجاهل الباقي.
  • المقايضة: إذا كانت القائمة الخضراء صغيرة جداً، يُجبر الذكاء الاصطناعي على اختيار كلمات غريبة وغير طبيعية لتناسب القاعدة، مما يجعل القصة تبدو آلية (روبوتية). وإذا كانت القائمة الخضراء كبيرة (للحفاظ على طبيعة القصة)، تصبح الرسالة السرية باهتة جداً لدرجة يستحيل معها العثور عليها لاحقاً.

2. الفكرة الجديدة: استراتيجية "بت الأغلبية" (Majority Bit)

أدرك المؤلفون أننا لسنا بحاجة لتقييد الذكاء الاصطناعي بقائمة ضئيلة. بدلاً من ذلك، استخدموا نظام تصويت.

تخيل أن الرسالة السرية هي سلسلة طويلة من الأصفار والآحاد (مثل 110111).

  • الحيلة: ينظر النظام إلى الرسالة ويسأل: "أي رقم يظهر بشكل متكرر أكثر؟" في 110111 الرقم 1 هو "بت الأغلبية" (Majority Bit).
  • القائمة الخضراء: بدلاً من اختيار قائمة ضئيلة، يُسمح للذكاء الاصطناعي بالاختيار من أي كلمة تقابل الرقم "1" في الرسالة. وبما أن الـ "1" هو الأغلبية، فإن هذه القائمة الخضراء ستكون ضخمة (على الأقل 50% من جميع الكلمات!).
  • النتيجة: نظرًا لأن لدى الذكاء الاصطناعي الكثير من الكلمات الطبيعية للاختيار من بينها، تبدو النصوص مثالية. ولكن بما أن الذكاء الاصطناعي لا يزال "يُدفع" قليلاً نحو كلمات الـ "1"، فإن الرسالة السرية تظل موجودة، لكنها مخفية في النمط الإحصائي للكلمات التي تم اختيارها.

3. MajorMark: "محقق التجمعات" (Cluster Detective)

يستخدم MajorMark استراتيجية الأغلبية هذه.

  • الترميز (Encoding): يكتب الذكاء الاصطناعي النص، مع توجيهه قليلاً نحو الكلمات التي تتوافق مع "بت الأغلبية" للرسالة السرية.
  • فك التشفير (Decoding): لقراءة الرسالة مرة أخرى، ينظر المحقق (المفكك) إلى النص ويعد كم مرة ظهرت الكلمات من "مجموعات" مختلفة (الكسرات/shards).
  • التشبيه: تخيل أن الكلمات مصنفة في حاويتين. إذا كانت الرسالة السرية هي "1"، فإن الحاوية الخاصة بـ "1" ستحتوي على كرات أكثر قليلاً من حاوية "0". يستخدم المفكك أداة تجميع بسيطة (مثل فرز الكرات حسب اللون) ليرى أي حاوية هي الأثقل. إذا كانت إحدى الحاويتين أثقل بوضوح، فإنه يعرف أن الرسالة السرية كانت "1".

4. MajorMark+: الترقية عبر "الكتل" (Block-by-Block)

ماذا لو كانت الرسالة السرية طويلة جداً؟ قد لا يكون "بت الأغلبية" واضحاً جداً، مما يضعف الإشارة.

  • الحل: يقوم MajorMark+ بتقسيم الرسالة الطويلة إلى كتل أصغر (مثل قطع حبل طويل إلى قطع قصيرة).
  • كيف يعمل: يطبق قاعدة "بت الأغلبية" على كل كتلة صغيرة بشكل مستقل.
  • الفائدة: هذا يحافظ على بقاء "القائمة الخضراء" كبيرة لكل كتلة، مما يضمن بقاء جودة النص عالية حتى للرسائل الطويلة جداً. كما أنه يستخدم طريقة "عدّ" أكثر دقة للعثور على الرسالة، مما يجعل من الصعب تفويتها.

لماذا هذا مهم (وفقاً للورقة البحثية)

اختبر المؤلفون هذه الطريقة على أفضل نماذج الذكاء الاصطناعي ووجدوا ما يلي:

  1. جودة أفضل: يبدو النص الذي يحمل العلامة المائية طبيعياً أكثر بكثير (انخفاض في الـ Perplexity) مقارنة بالطرق السابقة لأن الذكاء الاصطناعي لا يُجبر على الاختيار من قائمة ضيقة ومقيدة.
  2. قدرة كشف أفضل: رغم أن النص يبدو طبيعياً، إلا أن الرسالة السرية في الواقع أسهل في العثور عليها وفك تشفيرها بدقة مقارنة بالطرق القديمة.
  3. المتانة (Robustness): حتى لو حاول شخص ما تعديل النص (مثل قص ولصق أجزاء منه أو إعادة صياغة الجمل)، فإن العلامة المائية عادة ما تظل صامدة لأن "الثقل" الإحصائي لبتات الأغلبية يظل قابلاً للكشف.

باخت ملخص: تقترح الورقة طريقة جديدة لوسم نص الذكاء الاصطناعي تمنع الذكاء الاصطناعي من الاضطرار للاختيار بين أن يبدو بشرياً وبين أن يكون قابلاً للتتبع. من خلال استخدام نظام "تصويت الأغلبية" لاختيار الكلمات التي ستحصل على دفعة بسيطة، فإنهم يسمحون للذكاء الاصطناعي بالكتابة بشكل طبيعي مع الاستمرار في تضمين رسالة سرية قوية وقابلة للاستعادة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →