← أحدث الأبحاث
💻 computer science

Sequential Behavioral Watermarking for LLM Agents

تقدم هذه الورقة البحثية إطار عمل SeqWM، وهو إطار عمل للعلامات المائية السلوكية المتسلسلة يقوم بدمج إشارات الملكية في أنماط انتقال الوكيل المشروطة بالتاريخ لتمكين التحقق من المسار القوي والمستقل عن الموقع مع الحفاظ على فائدة الوكيل، متجاوزاً بذلك هشاشة الأساليب الحالية التي تعامل الإجراءات كتجارب مستقلة.

المؤلفون الأصليون: Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

نُشر 2026-05-13
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "Sequential Behavioral Watermarking for LLM Agents" (SeqWM)، مترجمة إلى لغة يومية بسيطة باستخدام تشبيهات إبداعية.

المشكلة الكبرى: العميل "الصندوق الأسود" (Black Box)

تخيل أنك وظفت مساعداً آلياً (روبوت) عالي المهارة (LLM Agent) للقيام بمهمة معقدة، مثل التخطيط لرحلة أو تصحيح أخطاء برمجية. هذا الروبوت لا يكتفي بكتابة تقرير نهائي فحسب؛ بل يتخذ سلسلة طويلة من القرارات: "سأتحقق من حالة الطقس"، ثم "سأحجز رحلة طيران"، ثم "سأتصل بسيارة أجرة".

المشكلة: إذا رأيت قائمة بهذه الأفعال، كيف ستعرف أي روبوت قام بها؟

  • هل كان روبوتك هو من فعلها؟
  • أم روبوت منافس؟
  • أم أن هناك مخترقاً سرق "عقل" روبوتك وصنع نسخة تقوم بنفس الشيء تماماً؟

في الوقت الحالي، من الصعب جداً التمييز بين ذلك. فأفكار الروبوت الداخلية (النصوص التي يولدها) غالباً ما تكون مخفية، ونحن لا نرى سوى الأفعال النهائية. إذا قام شخص ما بنسخ سلوك روبوتك، فيمكنه سرقة ملكيتك الفكرية دون أن تدري.

لماذا فشلت الطرق القديمة؟

حاول العلماء سابقاً حل هذه المشكلة بوضع "علامة مائية رقمية" على الكلمات التي يكتبها الروبوت (مثل بقعة حبر مخفية على رسالة).

  • العيب: في عالم الوكلاء (Agents)، الفعل هو المهم وليس الكلمات. إذا قرر الروبوت "الاتصال بسيارة أجرة"، فقد يقول ذلك بألف طريقة مختلفة. العلامة المائية الموضوعة على الكلمات تضيع وسط الضجيج.
  • فخ "الأرقام المستديرة": حاولت بعض الطرق الأحدث وضع علامة مائية على الأفعال عبر ربطها بترتيبها (على سبيل المثال: "الفعل الأول يجب أن يكون (أ)، والثاني (ب)").
    • التشبيه: تخيل رقصة حيث العلامة المائية هي "الخطوة 1 هي دوران، والخطوة 2 هي قفزة". إذا فات الجمهور الخطوة 1 (ربما بسبب انقطاع الفيديو)، سيفقدون العدّ. فجأة، تبدو الخطوة 2 وكأنها "الخطوة 1"، وينكسر نظام العلامة المائية بالكامل. النظام هش للغاية؛ خطوة واحدة مفقودة تفسد الدليل بأكمله.

الحل: SeqWM (علامة مائية "الرقصة السياقية")

يقترح المؤلفون SeqWM، وهي طريقة جديدة لوضع علامة مائية على الوكلاء لا تهتم برقم الخطوة المحدد، بل تنظر إلى نمط الحركة.

1. الفكرة الجوهرية: "التاريخ هو المفتاح"

بدلاً من السؤال: "ما هي الخطوة الخامسة؟"، يسأل SeqWM: "ماذا حدث في الخطوات القليلة الماضية؟"

  • التشبيه: تخيل مصافحة سرية.
    • الطريقة القديمة: "إذا كنت الشخص الخامس في الطابور، قم بحركة (High-five)". (إذا غادر شخص ما الطابور، سيتغير ترتيب الجميع، وسيصبح الشخص الخامس الآن هو الرابع، لذا ستفشل القاعدة).
    • طريقة SeqWM: "إذا قام الشخص الذي قبلك بـ (تلويحة) والشخص الذي قبله بـ (إيماءة)، فعليك القيام بـ (تصفيقة)".
    • لماذا تنجح: لا يهم إذا كنت الشخص الخامس أو الخمسين. طالما أن النمط (تلويحة -> إيماءة -> تصفيقة) موجود، فإن العلامة المائية موجودة. إذا حذف شخص ما خطوة في المنتصف، فإن النمط سيتزحزح قليلاً فقط، لكن بقية الرقصة ستظل تحتفظ بالسر.

2. شبكة الأمان "متعددة القنوات"

للتأكد من صمود العلامة المائية حتى لو تم قص أجزاء من الفيديو، يستخدم SeqWM قنوات متعددة (مثل تشغيل 8 رموز سرية في وقت واحد).

  • التشبيه: بدلاً من كتابة رسالة سرية على ورقة واحدة، تكتبها على 8 أوراق مختلفة. إذا أحرق اللص ورقة أو اثنتين، فلا يزال بإمكانك قراءة الرسالة من الأوراق الست المتبقية.
  • في SeqWM، يتم توجيه قرار الوكيل بشكل طفيف بناءً على 8 "مفاتيح سرية" مختلفة مستمدة من التاريخ القريب. حتى لو كان سلوك الوكيل غير منتظم، فإن النمط الإحصائي عبر هذه القنوات الثمانية يكشف عن العلامة المائية.

3. المحقق ذو "المفتاح العشوائي"

كيف تثبت أنها علامة مائية وليست مجرد صدفة؟

  • الطريقة القديمة: تحاول تخمين الرمز السري. إذا خمنت بشكل صحيح، ستجد العلامة المائية.
  • طريقة SeqWM: يأخذ المحقق تسلسل الأفعال ويمرره عبر "محاكي" باستخدام آلاف المفاتيح السرية الخاطئة.
    • إذا كان التسلسل يحمل علامة مائية بالمفتاح الحقيقي، فسيكون الناتج (الدرجة) مرتفعاً جداً.
    • إذا جربت المفاتيح الخاطئة، ستكون الدرجة منخفضة (مثل ضجيج الخلفية).
    • التشبيه: تخيل أنك تحاول العثور على محطة راديو معينة. أنت تمر عبر آلاف الترددات العشوائية. معظمها يبدو كتشويش. لكن تردد واحد (المفتاح الحقيقي) يعزف أغنية واضحة. إذا كانت الأغنية أعلى بكثير من التشويش، فأنت تعلم أنها حقيقية. هذه الطريقة مثبتة رياضياً بأنها عادلة، حتى لو كان سلوك الروبوت غريباً أو تم قص الفيديو.

ما أظهرته التجارب

اختبر الباحثون هذا النظام على ثلاثة أنواع مختلفة من وكلاء الذكاء الاصطناعي (واحد للأدوات، وآخر للمهام الفيزيائية، وثالث للمحاكاة الاجتماعية) باستخدام نماذج ذكاء اصطناعي مختلفة.

  1. الموثوقية: نجح SeqWM في تحديد "مالك" سلوك الوكيل في معظم الحالات (تقترب من 100%)، بينما فشلت الطرق القديمة بشكل متكرر.
  2. المتانة (القدرة على الصمود): عندما قاموا بمحاكاة "هجمات" عبر حذف 10% أو 20% أو حتى 50% من الأفعال (مثل قص أجزاء من الفيديو)، ظل SeqWM يعمل بنجاح. أما طرق "الأرقام المستديرة" القديمة فقد انهارت فور حدوث أول عملية حذف.
  3. عدم الإضرار: لم تجعل العلامة المائية الروبوت "أغبى" أو تغير قدرته على حل المشكلات. لقد قامت فقط بتوجيه الخيارات بشكل طفيف بطريقة غير مرئية للمستخدم ولكن يمكن اكتشافها من قبل الموثِّق.

الملخص

SeqWM يشبه وضع علامة مائية على حركات رقص الروبوت بدلاً من كلماته. وبدلاً من عد الخطوات (الذي ينكسر إذا فاتتك خطوة واحدة)، فإنه ينظر إلى العلاقة بين الحركات (مثلاً: "بعد الدوران، من المرجح أن تأتي القفزة"). ومن خلال استخدام مفاتيح سرية متعددة واختبار إحصائي ذكي، يمكنه إثبات من أنشأ سلوك الروبوت، حتى لو كانت أجزاء من السلوك مفقودة أو مخفية. هذا يحمي مبتكري وكلاء الذكاء الاصطناعي من سرقة أعمالهم أو نسخها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →