← أحدث الأبحاث
🤖 AI

Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark

تقدم هذه الورقة البحثية مخططاً جديداً لعلامة مائية ثنائية الحدين متعددة البتات للنماذج اللغوية الكبيرة (LLM) تقوم بتشفير كل بت من الحمولة عند كل موضع للرمز باستخدام مشفر ذي حالة لتحديد أولوية البتات غير المشفرة بشكل ديناميكي، مما يحقق دقة ومتانة فائقتين مقارنة بالنماذج المرجعية الحالية مع اقتراح مقياس أكثر عملية لتسجيل الثقة لكل بت من أجل التقييم.

المؤلفون الأصليون: Thibaud Gloaguen, Robin Staab, Mark Vero, Martin Vechev

نُشر 2026-05-13
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Thibaud Gloaguen, Robin Staab, Mark Vero, Martin Vechev

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "كل بت، في كل مكان، وفي آن واحد" (Every Bit, Everywhere, All at Once)، باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبيرة: إخفاء رسالة سرية داخل كتاب

تخيل أنك مؤلف (ذكاء اصطيني) تكتب كتاباً. تريد أن تثبت أنك أنت من كتب صفحة معينة، أو ربما تريد إخفاء ملاحظة سرية داخل النص، مثل معرف المستخدم (User ID) أو طابع زمني.

لفترة طويلة، حاول الباحثون القيام بذلك عن طريق إخفاء بت واحد (single bit) من المعلومات (مثل "نعم" أو "لا") في كل جملة. هذا يشبه وضع علامة "X" صغيرة على كل صفحة للقول: "هذه الصفحة حقيقية". هذا يعمل للكشف، لكنه لا يستطيع حمل رسائل معقدة مثل "المستخدم رقم 1234 هو من كتب هذا".

لإخفاء رسالة أطول (مثل كود مكون من 32 أو 64 بت)، حاولت الطرق السابقة استخدام استراتيجية تسمى "تخصيص المواضع" (Position Allocation).

  • الطريقة القديمة: تخيل أن لديك كوداً سرياً مكوناً من 32 بت. تقول الطريقة القديمة: "بالنسبة للكلمة الأولى، سأخفي البت الأول من الكود. وبالنسبة للكلمة الثانية، سأخفي البت الثاني. وبالنسبة للكلمة الثالثة، سأخفي البت الثالث".
  • العيب: هذا يشبه محاولة حمل حقيبة ثقيلة باستخدام إصبع واحد فقط في كل مرة. إذا فاتتك كلمة واحدة، فقدت قطعة محددة من اللغز. كما أن "الإصبع" قد يتعب أحياناً، مما يؤدي إلى تشوه الرسالة. إنها طريقة غير فعالة وهشة.

الحل الجديد: نهج "التوزيع الثنائي" (The Binomial Approach)

يقترح المؤلفون طريقة جديدة تماماً لإخفاء الرسالة. فبدلاً من إخفاء قطعة واحدة من اللغز في كل مرة، هم يخفون اللغز بأكمله في كل كلمة.

التشبيه: الجوقة والمايسترو

تخيل جوقة غنائية (الذكاء الاصطناعي) تغني أغنية.

  • السر: لدى المايسترو لحن سري مكون من 32 نوتة (الرسالة) يريد من الجوقة غناءه.
  • الطريقة القديمة: يشير المايسترو إلى المغني الأول ويقول: "غنِّ النوتة الأولى". ثم يشير إلى المغني الثاني: "غنِّ النوتة الثانية". إذا نسي المغني الثاني النوتة، ستضيع النوتة الثانية للأبد.
  • الطريقة الجديدة (التشفير الثنائي - Binomial Encoding): يخبر المايسترو كل مغني في الجوقة أن يستمع إلى اللحن المكون من 32 نوتة بالكامل.
    • في كل كلمة يغنونها، يقوم أعضاء الجوقة بتعديل طبقة صوتهم ببراعة بناءً على الـ 32 نوتة كاملة في وقت واحد.
    • الأمر يشبه امتلاك كل مغني لخريطة صغيرة غير مرئية للحن بأكمله.
    • إذا استمعت إلى كلمة واحدة فقط، ستحصل على تلميح باهت للحن بأكله. وإذا استمعت إلى الأغنية كاملة، يمكنك إعادة بناء اللحن بدقة عبر أخذ "تصويت الأغلبية" من جميع التلميحات.

لماذا هذا أفضل؟
لأن المعلومات موجودة في كل مكان. حتى لو حذفت بعض الكلمات (أو إذا أخطأ الذكاء الاصطناعي)، فإن بقية النص لا يزال يحمل السر كاملاً. لست بحاجة للبحث عن "الكلمة الصحيحة" لتجد "البت الصحيح"؛ فكل كلمة تحتوي على قطعة من الصورة الكاملة.

الترقية "الحالة المستمرة": المدرب الذكي (The Stateful Upgrade)

أضاف المؤلفون طبقة ثانية من الذكاء تسمى المشفر ذو الحالة (Stateful Encoder).

  • المشكلة: أحياناً يكون الذكاء الاصطناعي بارعاً جداً في إخفاء البتات الأولى من السر، لكنه يعاني مع البتات الأخيرة.
  • الحل: "المدرب" (المشفر) يراقب الأغنية أثناء كتابتها. يدرك المدرب قائلاً: "مهلاً، لقد أحكمنا أول 20 نوتة، لكن الـ 12 نوتة الأخيرة مهتزة".
  • الإجراء: يقوم المدرب بعد ذلك بالهمس للذكاء الاصطناعي: "توقف عن القلق بشأن أول 20 نوتة. ركز كل طاقتك على جعل الـ 12 نوتة الأخيرة مثالية".
  • النتيجة: هذا التحول الديناميكي في التركيز يضمن خروج الرسالة بأكملها بوضوح، بدلاً من ترك الأجزاء الضعيفة تفسد المجموع.

طريقة جديدة لقياس النجاح

يجادل الورقة أيضاً بأننا نقيس هذه العلامات المائية بشكل خاطئ.

  • المقياس القديم: "إذا كنا نعرف أن هذا النص يحتوي على علامة مائية، فما مدى جودة قراءتنا للسر؟"
    • التشبيه: "إذا أخبرتك أن هذا كود سري، هل يمكنك فكه؟" هذا يتجاهل حقيقة أن معظم النصوص في العالم الحقيقي ليست أكواداً سرية.
  • المقياس الجديد (الثقة لكل بت - Per-Bit Confidence): "إذا نظرنا إلى نص عشوائي، هل يمكننا معرفة ما إذا كان هناك سر موجود؟ وإذا كان الأمر كذلك، ما مدى تأكدنا من كل بت محدد؟"
    • التشبيه: بدلاً من مجرد التخمين، يعطيك النظام "درجة ثقة" لكل بت. يقول لك: "أنا متأكد بنسبة 99% أن البت الأول هو 1، لكنني متأكد بنسبة 50% فقط من البت الأخير". هذا يمنع الإنذارات الكاذبة.

النتائج

اختبر المؤلفون طريقتهم مقابل 8 طرق رائدة أخرى باستخدام رسائل مكونة من 16، 32، و64 بت.

  1. دقة أفضل: فكت طريقتهم الرسائل السرية بدقة أكبر بكثير من الطرق الأخرى، خاصة بالنسبة للرسائل الطويلة.
  2. متانة أكثر: حتى عندما تم تغيير النص قليلاً (مثل حذف كلمات أو استبدال المرادفات)، صمدت طريقتهم بشكل أفضل من المنافسين.
  3. الجودة: لا يزال النص يبدو طبيعياً ولم يفقد الكثير من جودته (لم يبدُ كأنه نص آلي يحاول بجهد مبالغ فيه).

الملخص

تقدم هذه الورقة طريقة جديدة لوضع العلامات المائية على نصوص الذكاء الاصطناعي. بدلاً من إخفاء قطعة سرية صغيرة في كل كلمة، هي تخفي الرسالة السرية بأكملها داخل كل كلمة. تستخدم "مدرباً ذكياً" للتركيز على نقاط الضعف أثناء عملية التوليد، وتطرح طريقة جديدة لقياس النجاح تأخذ في الاعتبار الضجيج في العالم الحقيقي. النتيجة هي نظام أقوى، وأكثر دقة، وأفضل في إخفاء الأسرار الطويلة والمعقدة في وضح النهار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →