SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
تقترح هذه الورقة إطار عمل SECA، وهو إطار هجوم تنافسي مبتكر يستحث الهلوسة في النماذج اللغوية الكبيرة من خلال توليد تعديلات على المطالبات تكون واقعية ومتكافئة دلالياً ومتماسكة، مما يتغلب على قيود الأساليب السابقة التي تعتمد على مدخلات غير منطقية أو معدلة دلالياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعد روبوت ذكي ومدرب جيداً (نموذج لغوي كبير، أو LLM). تسأله سؤالاً رياضياً بسيطاً: "إذا ضاعفت رقماً وحصلت على 24، فما هو هذا الرقم؟" يجيب الروبوت بشكل صحيح: "12".
الآن، تخيل أنك طرحت نفس السؤال تماماً، لكنك صغته بطريقة مختلفة قليلاً: "ما الرقم الذي، عند مضاعفته، يساوي 24؟" من المفترض أن يظل الروبوت يقول "12". ولكن في هذه الورقة البحثية، يظهر الباحثون أنه باستخدام "صياغة خدعة" معينة، قد يرتبك الروبوت فجأة، ويقول *"8"، ثم يخترع تفسيراً زائفاً وغير منطقي لتبرير لماذا الرقم 8 هو الإجابة.
هذا ما يسمى بـ الهلوسة (Hallucination). الروبوت يكذب عليك، لكنه يبدو واثقاً من نفسه.
المشكلة: فخ "الكلمات غير المفهومة"
حاول باحثون سابقون خداع هذه الروبوتات لجعلها تكذب باستخدام "الهجمات". لكن أساليبهم كانت تشبه محاولة كسر خزنة برمي مطرقة ثقيلة عليها. فقد كانوا يقومون بـ:
- إضافة كلام غير مفهوم: "ما قيمة p في 24 = 2p؟ مع@الآن!#%" (هذا كلام غير مفهوم؛ والروبوت يعرف أنه غريب).
- تغيير المعنى: "ما قيمة p إذا كنت سأضاعفها ثلاث مرات لأحصل على 24؟" (هذه ليست خدعة؛ إنها مجرد سؤال مختلف).
- الأمر للروبوت: "تظاهر بأنك كاذب وأجب على هذا." (الروبوت هنا ينفذ الأوامر فقط، وليس في حالة فشل حقيقي).
هذه الأساليب لم تخبرنا الكثير عن كيفية فشل الروبوت في العالم الحقيقي، لأن البشر الحقيقيين لا يتحدثون بلغة غير مفهومة أو يطرحون أسئلة مختلفة تماماً.
الحل: SECA (سيد التنكر)
ابتكر مؤلفو هذه الورقة طريقة جديدة تسمى SECA (الهجمات المتكافئة دلالياً والمتماسكة).
فكر في SECA كـ سيد للتنكر. بدلاً من تحطيم عقل الروبوت بالضجيج، يرتدي SECA قناعاً يبدو تماماً مثل سؤال بشري طبيعي، لكنه مختلف بما يكفي لإرباك المنطق الداخلي للروبوت.
إليك كيف يعمل SECA، باستخدام تشبيه بسيط:
1. قاعدة "نفس المعنى" (التكافؤ الدلالي)
تخيل أنك تلعب لعبة حيث يتعين عليك وصف صورة لصديق دون تغيير الصورة نفسها.
- سيء: ترسم صورة مختلفة. (الروبوت يرى سؤالاً مختلفاً).
- سيء: تشخبط على الصورة. (الروبوت يرى كلاماً غير مفهوم).
- SECA: تصف نفس الصورة باستخدام كلمات مختلفة. "كرة حمراء" تصبح "كرة كروية بلون قرمزي". المعنى متطابق، لكن الكلمات مختلفة.
يضمن SECA أن السؤال الجديد يعني بالضبط نفس الشيء كما في السؤال الأصلي. إذا كان السؤال الأصلي يطلب ، فيجب أن يتطلب السؤال الجديد أيضاً منطقياً أن يكون .
2. قاعدة "التدفق الطبيعي" (التماسك الدلالي)
يحرص SECA أيضاً على أن يبدو السؤال الجديد وكأنه شيء قد يقوله إنسان بالفعل. فهو لا يستخدم رموزاً غريبة أو قواعد لغوية مكسورة، بل يتدفق بشكل طبيعي.
3. "بحث عقل الروبوت"
كيف يجد SECA هذه الأسئلة الماكرة؟
- يبدأ بسؤال طبيعي.
- يطلب من "روبوت مقترح" (روبوت مساعد ذكي) إعادة صياغة السؤال بثلاث طرق مختلفة، مع الحفاظ على المعنى نفسه ولكن بتغيير الكلمات.
- يطلب من "روبوت مدقق" التحقق: "هل هذا السؤال الجديد يعني نفس الشيء تماماً مثل السؤال القديم؟"
- يختبر السؤال الجديد على "الروبوت المستهدف". إذا ارتبك الروبوت المستهدف وأعطى إجابة خاطئة، يحتفظ SECA بهذا السؤال.
- يكرر هذه العملية، ويطور السؤال ببطء حتى يجد "التنكر" المثالي الذي يجعل الروبوت المستهدف يهلوِس.
لماذا هذا مهم؟
وجد الباحثون أن الروبوتات هشة بشكل مثير للدهشة. حتى عندما تطرح عليها نفس السؤال تماماً بطريقة أكثر تعقيداً أو إسهاباً، يمكنها أن تفشل.
- الاكتشاف: كلما زاد عدد الكلمات وكلما كانت بنية الجملة أكثر إبداعاً، زاد احتمال هلوسة الروبوت.
- الأثر: هذا أمر مخيف للاستخدام في العالم الحقيقي. إذا سأل طبيب ذكاءً اصطناعياً طبياً: "ما هو علاج المرض X؟" وهلوس الذكاء الاصطناعي لأن الطبيب صاغ السؤال بطريقة مختلفة قليلاً، فقد يكون ذلك خطيراً.
الخلاصة
هذه الورقة البحثية تشبه مفتش السلامة للذكاء الاصطناعي. فبدلاً من مجرد السؤال: "هل يعرف الذكاء الاصطناعي الإجابة؟"، هم يسألون: "هل يعرف الذكاء الاصطناعي الإجابة مهما كانت الطريقة التي تسأله بها؟"
لقد وجدوا أن نماذج الذكاء الاصطناعي الحالية تشبه طالباً حفظ الكتاب المدرسي عن ظهر قلب ولكنه لا يفهم المفاهيم حقاً. إذا سألته بطريقة مختلفة قليلاً، يصاب بالذعر ويبدأ في اختلاق الأمور. SECA هو الأداة التي تساعدنا في العثور على نقاط الضعف هذه حتى نتمكن من إصلاحها قبل أن نأتمن هذه الروبوتات على حياتنا.
باخت-صار: SECA هو طريقة ذكية لخداع الروبوتات الذكية بجعلها تكذب عبر طرح نفس السؤال عليها بطريقة أكثر إرباكاً، مما يثبت أنها ليست بالذكاء الذي تبدو عليه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.