← أحدث الأبحاث
💬 NLP

XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts

تقدم الورقة البحثية XMark، وهي طريقة علامة مائية متعددة البتات مبتكرة للنصوص المولدة بواسطة النماذج اللغوية الكبيرة (LLM)، تتغلب على القيود الحالية من خلال تحقيق دقة فك تشفير عالية حتى مع عدد محدود من الرموز (tokens) مع الحفاظ على جودة النص عبر توزيع "لوجيت" (logit) أقل تشوهاً.

المؤلفون الأصليون: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

نُشر 2026-04-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك اشتريت للتو مزهرية جميلة مرسومة يدويًا من فنان مشهور. أنت تحبها، لكنك قلق من أن يسرقها شخص ما، ويعيد طلاءها قليلاً، ثم يدعي أنها ملكه. أنت بحاجة إلى طريقة لتثبت أنها ملكك دون تشويه جمال المزهرية أو جعل الطلاء يبدو غريبًا.

هذه هي بالضبط المشكلة التي تواجه النصوص المولدة بواسطة الذكاء الاصطناي. يمكن لنماذج اللغات الكبيرة (LLMs) مثل ChatGPT كتابة قصص ورسائل إلكترونية ومقالات مذهلة. ولكن يمكن للأطراف السيئة استخدامها لنشر أخبار كاذبة أو عمليات احتيال. نحن بحاجة إلى طريقة لـ "ختم" النص لإثبات أنه جاء من ذكاء اصطناعي، لكن لا يمكننا ببساطة وضع ملصق ضخم يقول "صُنع بواسطة الذكاء الاصطناعي" لأن ذلك يفسد تجربة القراءة.

إليك XMARK، وهي طريقة ذكية وجديدة لإخفاء بصمة رقمية سرية داخل نص الذكاء الاصطناعي. إليك كيف تعمل، مشروحة ببساية:

المشكلة في الطرق القديمة

فكر في طرق العلامات المائية السابقة مثل MPAC كأنها لعبة "أخفِ الإبرة".

  • كيف كانت تعمل: كانت تختار مجموعة صغيرة ومحددة جدًا من الكلمات (مثل "الـ"، "و"، "هو") وتجعل الذكاء الاصطناعي أكثر عرضة لاختيارها إذا كانت هناك رسالة سرية مخفية.
  • العيب: لإخفاء رسالة طويلة (مثل معرف المستخدم)، كان عليهم اختيار مجموعات صغيرة جدًا من الكلمات. هذا جعل الذك- الاصطناعي يبدو آليًا وغير طبيعي (جودة سيئة). وأيضًا، إذا كان لديك فقرة قصيرة فقط للفحص، فلن تكون هناك "إبر" كافية للعثور عليها، لذا غالبًا ما يفشل فك التشفير.

حل XMARK: "القائمة الدائمة" (The Evergreen List)

يغير XMARK قواعد اللعبة عبر قلب السيناريو. بدلاً من إخفاء الإبرة، فإنه يسلط الضال على كومة القش.

1. المشفّر (الفنان): "استبعاد الواحد" (Leave-One-Out)

تخيل أن لدى الذكاء الاصطناعي حقيبة ضخمة تحتوي على 50,000 كرة ملونة (كلمات).

  • الطريقة القديمة: لإخفاء سر، كان الفنان يختار لونًا واحدًا محددًا فقط (مثل الأحمر) ويجعله أكثر شيوعًا.
  • طريقة XMARK: يقول الفنان: "سأخفي سرًا بجعل كل الألوان باستثناء الأحمر أكثر شيوعًا".
    • يُسمى هذا "استبعاد شظية واحدة" (Leave-one-Shard-out - LOSO).
    • لماذا هي أفضل؟ بما أن جميع الكرات تقريبًا أصبحت "جيدة" للاختيار، فإن النص لا يزال يبدو طبيعيًا وسلسًا. الذكاء الاصطناعي لا يُجبر على اختيار كلمات غريبة.

2. "القائمة الدائمة" (المصفاة الفائقة)

لجعل السر أقوى، لا يستخدم XMARK حقيبة واحدة من الكرات فحسب، بل يستخدم حقائب متعددة (تباديل متعددة لقائمة الكلمات)، كل منها مرتب بشكل مختلف.

  • يقوم بإنشاء "قائمة دائمة" تحتوي فقط على الكرات التي تعتبر "جيدة" في جميع الحقائب.
  • السحر: على الرغم من أن القائمة أصغر من الحقيبة بأكملها، إلا أنها لا تزال ضخمة مقارنة بالطرق القديمة. وهذا يعني أن لدى الذكاء الاصطناعي الكثير من الكلمات الطبيعية للاختيار منها، مما يحافظ على جودة النص العالية.

3. فك التشفير (المحقق): "الخريطة المقيدة" (The Constrained Map)

الآن، تخيل أنك وجدت نصًا مشبوهًا وتريد معرفة ما إذا كان يحتوي على علامة مائية. تحتاج إلى معرفة أي لون كان هو "السر".

  • التحدي: إذا كان النص قصيرًا، فقد لا ترى ما يكفي من اللون السري لتكون متأكدًا.
  • خدعة XMARK: يستخدم فك التشفير أداة خاصة تسمى مصفوفة رسم خرائط الشظايا والرموز المقيدة (cTMM).
    • فكر في هذا كمفكرة للمحقق. في الطرق القديمة، إذا رأى المحقق كرة "حمراء"، فقد يحتسبها بالخطأ عدة مرات إذا كانت تناسب فئات مختلفة، مما يربك عملية العد.
    • مفكرة XMARK لديها قاعدة صارمة: "كرة واحدة، عدّ واحد".
    • نظرًا لأن XMARK استخدم حقائب متعددة (مفاتيح هاش) لإنشاء النص، فإن كلمة واحدة في النص يمكن أن تعطي المحقق أدلة حول فئات متعددة في آن واحد.
    • النتيجة: حتى مع النصوص القصيرة جدًا، يمكن للمحقق تجميع قطع اللغز بشكل أسرع وأكثر دقة من ذي قبل.

لماذا هذا مهم؟

  • جودة أفضل: نظرًا لأن XMARK يعزز معظم الكلمات بدلاً من مجرد عدد قليل منها، فإن نص الذكاء الاصطناعي يبدو طبيعيًا، بشريًا، وسلسًا. إنه لا يبدو "متصلبًا".
  • يعمل على النصوص القصيرة: كانت الطرق القديمة تحتاج إلى مقالات طويلة لفك التشفير. يستطيع XMARK فك تشفير الرسالة السرية من تغريدة قصيرة أو بريد إلكتروني سريع.
  • صعب الإزالة: نظرًا لأن السر مخفي في غياب نمط معين عبر مجموعات مختلفة من الكلمات، فمن الصعب جدًا على أي شخص تعديل النص لإزالة العلامة المائية دون كسر بنية الجملة.

الخلاصة

XMARK يشبه الحبر السري عالي التقنية الذي لا يلطخ الورق. فهو يسمح لنا بوسم نصوص الذكاء الاصطناعي بمعرف فريد (مثل اسم المستخدم أو الطابع الزمني) بحيث يمكننا تتبع المصدر، مع الحفاظ على بقاء النص يبدو طبيعيًا تمامًا — حتى لو كان النص قصيرًا جدًا. إنه يحل المقايضة القديمة حيث كان عليك الاختيار بين "نص جيد الصوت" و"كشف موثوق". الآن، يمكنك الحصول على كليهما.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →