← أحدث الأبحاث
💬 NLP

TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection

يُعد TextSeal نظاماً متطوراً لعلامات مائية لنماذج اللغات الكبيرة (LLM) خالياً من التشوه، يضمن كشفاً قوياً للمصدر وحمايةً من التقطير من خلال توليد مفاتيح مزدوجة وتحديد المواقع في مناطق متعددة، كل ذلك مع الحفاظ على جودة المخرجات ودعم تحسينات الخدمة دون أي عبء إضافي على عملية الاستدلال.

المؤلفون الأصليون: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre
نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre Fernandez

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك خباز تصنع آلاف الأرغفة اللذيذة من الخبز يومياً. تريد أن تعرف ما إذا كان الرغيف الموجود في متجر البقالة قد صُنع على يدك، أم أن شخصاً آخر قد نسخ وصفتك وخبزه بنفسه. ولكن هناك عقبة: لا يمكنك ببساطة ختم الخبز بعبارة "صنع بواسطة الخباز توم"، لأن ذلك يفسد الطعم والملمس. أنت بحاجة إلى مكون سري غير مرئي للسان البشر، ولكنه يترك بصمة فريدة يمكن اكتشافها بواسطة ماسحك الخاص.

هذا هو بالضبط ما يحله TextSeal للنماذج اللغوية الكبيرة (الذكاء الاصطناعي). إنه "علامة مائية" تقنية عالية الجودة، غير مرئية، تثبت من الذي كتب النص دون تغيير طريقة صوته أو مظهره.

إليك كيف يعمل TextSeal، مقسماً إلى مفاهيم بسيطة:

1. المكون السري (توليد المفتاح المزدوج)

كانت العلامات المائية القديمة تشبه الختم الذي يضع دائماً نفس العلامة في نفس المكان. إذا سألت الذكاء الاصطناعي نفس السؤال مرتين، فسيقدم لك الإجابة نفسها في كل مرة. هذا أمر ممل للمستخدمين، ويمكن أن يجعل الذكاء الاصطناعي يقع في حلقات تكرارية (مثل أغنية تعمل على التكرار).

حل TextSeal: يستخدم مفتاحين سريين بدلاً من مفتاح واحد. في كل مرة يختار فيها الذكاء الاصطناعي كلمة، فإنه يقلب عملة معدنية ليقرر أي مفتاح سيستخدم.

  • التشبيه: تخيل أن لديك نوعين مختلفين من التوابل السرية. أحياناً ترش التوابل (أ)، وأحياناً أخرى ترش التوابل (ب). بالنسبة للآكل، طعم الخبز هو نفسه تماماً (لا يوجد تشويه)، ولكن بالنسبة لماسحك الضوئي، فإن نمط التوابل يخلق بصمة فريدة ومتنوعة تثبت أنه جاء منك. هذا يحافظ على إجابات الذكاء الاصطناعي طازجة ومتنوعة مع كونها قابلة للتتبع في نفس الوقت.

2. الماسح الذكي (الكشف المعتمد على الإنتروبيا)

اكتشاف العلامة المائية أمر صعب لأن الذكاء الاصطناعي أحياناً يكتب أشياء متوقعة جداً (إنتروبيا منخفضة) وأحياناً أخرى يكتب أشياء إبداعية وغير متوقعة للغاية (إنتروبيا عالية).

  • المشكلة: إذا كان الذكاء الاصطناعي متأكداً بنسبة 99% أن الكلمة التالية هي "الـ"، فإن إضافة علامة مائية هناك يشبه محاولة إخفاء همسة وسط إعصار. من الصفر سماعها. ولكن إذا كان الذكاء الاصطناعي يتوقع بين كلمات عديدة، فإن إشارة العلامة المائية تكون أقوى بكثير.
  • حل TextSeal: يستخدم "ماسحاً ذكياً" يعرف أن عليه إعطاء اهتمام إضافي للأجزاء التي لم يكن الذكاء الاصطناعي متأكداً منها (إنتروبيا عالية). إنه يتجاهل الأجزاء المملة والمتوقعة ويركز على الأجزاء الإبداعية حيث تكون إشارة العلامة المائية أقوى. هذا يجعل عملية الكشف أكثر دقة، حتى في المستندات الطويلة.

3. البحث عن الإبرة في كومة القش (الكشف الموضعي)

تخيل أن شخصاً ما أخذ فقرة من كتابتك، وخلطها في مقال مكون من 50 صفحة كتبه إنسان، وزعم أن المقال بالكامل ملكه. العلامات المائية القديمة ستنظر إلى المقال بالكامل، وتصاب بالارتباك بسبب كل الكتابة البشرية، وتقول: "لا أستطيع العثور على العلامة المائية".

حل TextSeal: هو لا ينظر فقط إلى المستند بأكمله؛ بل يمسح مناطق محددة.

  • التشبيه: بدلاً من محاولة البحث عن حبة رمل واحدة في شاطئ، يبحث TextSeal عن بقع صغيرة ومحددة من الرمل لها لون فريد. حتى لو كان نص الذكاء الاصطناعي يمثل 5% فقط من مستند ضخم، يمكن لـ TextSeal عزل هذه الـ 5%، وتجاهل الباقي، والقول: "آها! هذه الفقرة المحددة بالتأكيد من صنع الذكاء الاصطناعي". هذا يعمل حتى لو تم تقطيع نص الذكاء الاصطناعي وتوزيعه في أنحاء المستند.

4. التأثير "الإذاعي" (حماية التقطير)

هذه ربما هي الميزة الأقوى. إذا حاول منافس سرقة "عقل" الذكاء الاصطناعي الخاص بك عبر التدريب على مخرجاتك التي تحمل علامة مائية، فإن العلامة المائية لا تبقى في النص فحسب، بل يتم تعلمها.

  • التشبيه: تخيل أن توابلك السرية قوية لدرجة أنه إذا حاول منافس خبز خبز باستخدام أرغفة خبزك القديمة كمرجع، فإن خبزه الجديد سيظل يحمل أثراً باهتاً من توابلك، حتى لو لم يرَ وصفتك السرية أبداً.
  • الادعاء: توضح الورقة البحثية أنه إذا تم تدريب نموذج "طالب" على بيانات تحمل علامة TextSeal المائية، فإن نموذج الطالب هذا يصبح "مشعاً". يمكنك اختبار نموذج الطالب، وسيظل يظهر إشارة العلامة المائية، مما يثبت أنه تدرب على بياناتك. هذا يمنع المنافسين من نسخ معرفة نموذجك سراً.

لماذا يعد هذا أمراً مهماً؟

  • إنه غير مرئي: اختبرت الورقة البحثية هذا مع بشر يقرأون آلاف الأمثلة. لم يستطيعوا ملاحظة الفرق بين النصوص التي تحمل علامة مائية والنصوص التي لا تحملها. لم يجعل ذلك الذكاء الاصطناعي يبدو آلياً أو يرتكب أخطاء.
  • إنه سريع: لا يضيف تقريباً أي وقت لعملية تفكير الذكاء الاصطناعي، لذا يمكن استخدامه في التطبيقات التي تعمل بالوقت الفعلي.
  • إنه قوي: يتفوق على الطرق السابقة (مثل SynthID من Google) في اكتشاف العلامات المائية، حتى عندما يتم تخفيف العلامة المائية بشدة أو خلطها مع الكتابة البشرية.

باختاص، TextSeal هو وسيلة لتوقيع عمل الذكاء الاصطناعي الخاص بك بحبر غير مرئي وغير قابل للكسر، يصمد أمام النسخ، والخلط، وحتى "التعلم" من قبل نماذج أخرى، كل ذلك دون إفساد جودة النص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →