Can we Watermark Low-Entropy LLM Outputs?
تتقصى هذه الورقة مدى جدوى العلامات المائية القوية وغير القابلة للكشف بشكل مثبت لمخرجات النماذج اللغوية الكبيرة ذات الإنتروبيا المنخفضة، مقترحةً مخططات جديدة تعمل بإنتروبيا ثابتة لكل رمز وتظل صامدة أمام عمليات الاستبدال والحذف العشوائية في ظل فرضيات تشفيرية محددة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك شيف ماهر (الذكاء الاصطناعي) يمكنه طهي وجبات لذيذة تشبه طعام البشر (النصوص) لأي شخص. لقد ظهرت مشكلة جديدة: كيف تثبت أن وجبة معينة قد طُهيت في مطبخك أنت وليس مجرد نسخة من كتاب وصفات أو من صنع شيف آخر؟
الحل المقترح في هذه الورقة البحثية يشبه وضع مكون سري وغير مرئي في كل طبق. وهذا ما يسمى العلامة المائية (Watermarking).
إليك تفصيل الفكرة الكبيرة للورقة، والمشكلة التي حلتها، ووصفة مبتكرة جديدة، مشروحة ببساكة.
١. المشكلة: معضلة "القائمة المملة"
التعذيبات السابقة لوضع العلامات المائية على نصوص الذكاء الاصطناعي كان بها عيب رئيسي. كانت تعمل بشكل رائع عندما يكون الذكاء الاصطناعي "يفكر بعمق" ويختار من قائمة كلمات ضخمة ومتنوعة (الاعتلاج العالي - High Entropy). لكنها فشلت فشلاً ذريعاً عندما يكون الذكاء الاصطناعي في وضع "الطيار الآلي" أو يكرر عبارات شائعة (الاعتلاج المنخفض - Low Entropy).
التشبيه:
تخيل أنك تحاول إخفاء رمز سري في جملة عن طريق تغيير الحرف الأول من كل كلمة.
- الاعتلاج العالي (جيد): الجملة هي "الكلب السريع البني يقفز". يمكنك بسهولة تغيير الحروف لأن هناك الكثير من الكلمات المختلفة.
- الاعتلاج المنخفض (سيئ): الجملة هي "الـ الـ الـ الـ الـ". إذا حاولت تغيير الحروف لإخفاء رمز ما، فستفسد الجملة. ستبدو غريبة، وسيعرف الناس أنك تلاعبت بها. أو إذا لم تغيرها، فسيختفي الرمز.
تطلبت الطرق القديمة أن يكون الذكاء الاصطناعي "مبدعاً" (اعتلاج عالٍ) لإخفاء الرمز. لكن في الواقع، غالباً ما يكتب الذكاء الاصطناعي نصوصاً مملة، مكررة، أو متوقعة جداً. لم تستطع الطرق القديمة وضع علامة مائية على تلك النصوص.
٢. الهدف: غير قابل للكشف وغير قابل للكسر
أراد المؤلفون علامة مائية تكون:
- غير قابلة للكشف: حتى لو نظرت عن كثب، لا يمكنك معرفة أن النص يحتوي على علامة مائية. طعمه يبقى كما هو تماماً.
- قوية (متينة): حتى لو حاول شخص سيء "إصلاح" النص عن طريق تغيير الكلمات، أو حذف الجمل، أو استبدال المرادفات، يجب أن يظل الرمز السري قابلاً للاكتشاف.
٣. الحل: خدعة "التجزئة" (Hashing)
ابتكر المؤلفون طريقة ذكية لإخفاء الرمز حتى في النصوص "المملة". لم يحاولوا تغيير الكلمات مباشرة، بل استخدموا فلترًا سرياً.
التشبيه: فلتر اللون السري
تخيل أن الذكاء الاصطناعي يولد تدفقاً من الكرات الملونة (الكلمات).
- الطريقة القديمة: محاولة طلاء الكرات باللون الأحمر أو الأزرق لكتابة رسالة. إذا كانت جميع الكرات من نفس اللون (اعتلاج منخفض)، فلا يمكنك طلاؤها دون جعلها تبدو مزيفة.
- الطريقة الجديدة: لديك فلتر لون سري (دالة تجزئة - Hash function).
- تنظر إلى الكرة التي يريد الذكاء الاصطناعي اختيارها.
- تمررها عبر الفلتر السري الخاص بك.
- إذا قال الفلتر "أحمر"، تختار كرة تبدو حمراء. إذا قال "أزرق"، تختار كرة زرقاء.
- السحر: بما أن الفلتر عشوائي وسري، فإن الذكاء الاصطناعي سيختار في النهاية نفس الكرة التي كان سيختارها على أي حال. توزيع الألوان لا يتغير. النص يبدو طبيعياً بنسبة 100%.
ولكن، لأنك تستخدم نفس الفلتر لفقرة كاملة، فإن تسلسل نتائج "الأحمر/الأزرق" يشكل رمزاً مخفياً (العلامة المائية) لا يمكن قراءته إلا بواسطتك.
٤. لماذا يعد هذا أمراً هاماً؟
تحل هذه الورقة مشكلتين رئيسيتين:
- إنها تعمل على النصوص المملة: حتى لو كان الذكاء الاصطناعي يقول فقط "الـ الـ الـ"، يمكن للفلتر السري لسه إخفاء الرمز لأن الفلتر ينظر إلى احتمالية الكلمات، وليس مجرد تغيير الكلمات نفسها. إنه يحتاج فقط إلى قدر ضئيل من العشوائية (الاعتلاج) ليعمل، وهو ما تمتلكه حتى النصوص المملة.
- إنها تصمد أمام التعديل: إذا حاول شخص حذف كلمة أو استبدال "سعيد" بـ "مبتهج"، فإن الفلتر السري ذكي بما يكفي لسه العثور على النمط في الكلمات المتبقية. الأمر يشبه لغزاً حيث يمكنك فقدان بعض القطع، ولكن الصورة تظل واضحة.
٥. تحذير "هجوم الإيموجي"
تحذر الورقة أيضاً من خدعة معينة قد يستخدمها الأشخاص السيئون. تخيل أن شخصاً يجبر الذكاء الاصطناعي على وضع إيموجي بعد كل كلمة: "الـ 🍎 الـ 🍎 الـ 🍎".
- هذا يخلق نمطاً بـ صفر عشوائية.
- يوضح المؤلفون أنه بينما يمكن لطريقتهم التعامل مع النصوص العادية، إلا أنه إذا أجبر شخص ما الذكاء الاصطناعي على نمط متكرر وصارم (مثل هجوم الإيموجي)، يصبح من الصعب جداً إخفاء الرمز.
- الإصلاح: يقترحون أنه طالما أن "الأمر" (Prompt) طبيعي (مثل طلب كتابة قصة من الذكاء الاصطناعي، وليس روبوتاً يكرر الإيموجي)، فإن النظام يعمل بشكل مثالي.
الملخص
فكر في هذه الورقة كأنها اختراع للحبر الشبح للكتابة بالذكاء الاصطناعي.
- سابقاً: كان بإمكانك الكتابة بالحبر الشبح فقط على ورق مليء بالفعل بخربشات ملونة وعشوائية. إذا كان الورق فارغاً أو مكرراً، فلن يلتصق الحبر.
- الآن: يمكنك الكتابة بالحبر الشبح على أي نوع من الورق، حتى الأنواع المملة والمكررة. الحبر غير مرئي للعين المجردة، وحتى إذا حاول شخص مسح أجزاء من الصفحة أو استبدال الكلمات حول بعضها، فإن الرسالة السرية تظل مخفية ولكنها قابلة للاكتشاف من قبل الشخص الذي يحمل "النظارات السحرية" (المفتاح السري).
يسمح لنا هذا بإثبات أن الذكاء الاصطناعي هو من كتب النص، حتى عندما يقوم الذكاء الاصطناعي بمجرد أداء وظيفته في كتابة جمل بسيطة وطبيعية، دون جعل النص يبدو غريباً أو آلياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.