Obfuscation Rules for Detecting and Detoxifying Korean Toxicity
تقدم هذه الورقة KOTOX، وهي أول مجموعة بيانات وإطار عمل تحويلي مفتوح كوري مصمم للكشف عن المحتوى السام المموّه وتطهيره في آن واحد من خلال تصنيف أنماط التمويه القائمة على الأسس اللغوية وتدريب النماذج على التعامل مع التعبيرات المتنكرة دون المساس بالأداء على النصوص القياسية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "قواعد التمويه للكشف عن السمية في اللغة الكورية وتطهيرها" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
المشكلة: "المصافحة السرية" للسمية
تخيل ملعباً يحاول فيه متنمر قول شيء مسيء ليتسبب في إيقاع طفل في مشكلة. لكن، هناك قاعدة صارمة في الملعب: "لا يُسمح بالكلمات المسيئة". لذا، يقوم المتنمر بتغيير كلماته قليلاً ليتسلل من أمام المعلم. فبدلاً من قول "أنت غبي"، قد يقول "أنت غـ ـبـ ـي" أو يغير طريقة الكتابة ليخفي الكلمة.
في العالم الرقمي، يسمى هذا التمويه (Obfuscation). يتعمد الناس تخريب الإملاء، أو استبدال الحروف برموز (مثل استخدام @ بدلاً من a)، أو إعادة ترتيب الكلمات لإخفاء المحتوى السام (المؤذي/المسيء) عن الفلاتر الآلية.
تشير الورقة البحثية إلى مشكلة كبيرة: معظم البرامج الحاسوبية المصممة لكشف اللغة السيئة تتدرب على نصوص "نظيفة". إنها تشبه حراس الأمن الذين يعرفون فقط كيفية رصد شخص يرتدي قبعة حمراء؛ إذا ارتدى المتنمر قبعة زرقاء مع خط أحمر، فسوف يفوته الحارس. وهذا أمر صعب للغاية في اللغة الكورية، لأن هذه اللغة مبنية مثل قطع "الليغو" (لغة إلصاقية). يمكنك بسهولة استبدال أو إضافة أو إعادة ترتيب هذه القطع دون تغيير المعنى، مما يجعل من الصعب جداً على الحواسيب رصد الإهانات المخفية.
الحل: KOTOX ( "صالة التدريب الرياضي")
قام الباحثون من جامعة يونسي بإنشاء أداة جديدة تسمى KOTOX. فكر في KOTOX كأنها صالة تدريب رياضية متخصصة لنماذج الذكاء الاصطائي.
بدلاً من عرض جمل عادية فقط على الذكاء الاصطناعي، توفر KOTOX "تمريناً مزدوجاً":
- الأصل: جملة محايدة وجملة سامة.
- التنكر: نفس الجمل، ولكن "مموهة" (مخربة) بطرق محددة.
لم يكتفِ الباحثون بالتخمين حول كيفية إخفاء الناس للكلمات السيئة، بل درسوا أمثلة حقيقية من الإنترنت وابتكروا خمس فئات محددة من "التنكرات" بناءً على كيفية عمل اللغة الكورية:
- الصوتيات (تشابه الأصوات): تغيير الحروف لتبدو متشابهة في النطق ولكن مختلفة في الشكل (مثل استبدال حرف ساكن بآخر يشبهه في الصوت). التشبيه: تغيير كلمة "cat" إلى "kat".
- الشكلانية (تشابه المظهر): استبدال الحروف برموز تشبهها في الشكل (مثل استخدام الرقم
3بدلاً من حرفEأو حرف من أبجدية أخرى). التشبيه: كتابة "H@te" بدلاً من "Hate". - النقل الصوتي (عبر اللغات): دمج حروف من لغات أخرى (مثل الإنجليزية أو الحروف الصينية) التي لها نفس النطق. التشبيه: كتابة "Gongbu" (دراسة) بدلاً من الكلمة الكورية الأصلية.
- النحوية (تلاعب بالبنية): العبث بالمسافات أو ترتيب المقاطع. التشبيه: كتابة "st up id" بدلاً من "stupid".
- البراغماتية (تشتيت الرموز التعبيرية): إضافة رموز تعبيرية (Emojis) أو رموز غريبة لتشتيت انتباه الحاسوب. التشبيه: إضافة رمز قلب
❤بجانب كلمة مسيئة لإرباك الفلتر.
كيف بنوا ذلك؟
بدأ الفريق بمجموعة بيانات موجودة من الجمل الكورية (بعضها لطيف وبعضها سيء). لقد عملوا كمحررين صارمين:
- قاموا بتنقية الأمثلة السيئة (مثل الجمل التي تحتوي على أسماء أشخاص أو قواعد لغوية مربكة).
- طبقوا "قواعد التنكر" الجديدة الخاصة بهم لإنشاء آلاف الأزواج الجديدة.
- النتيجة هي مجموعة بيانات ضخمة حيث يكون لكل جملة نسخة "نظيفة" ونسخة "مموهة".
النتائج: تدريب الذكاء الاصطناعي
اختبر الباحثون صالة التدريب الجديدة هذه (KOTOX) على عدة نماذج للذكاء الاصطناعي. وإليك ما حدث:
- قبل التدريب: كانت نماذج الذكاء الاصطناعي سيئة جداً في رصد النصوص السامة المموهة. إذا كان النص مخرباً، كانوا يعتقدون أنه آمن.
- بعد التدريب: عندما تم تدريب النماذج على KOTOX، أصبحت أفضل بكثير في شيئين:
- إزالة التمويه (Deobfuscation): استطاعت النظر إلى النص الفوضوي والمموه و"إلغاء" التغييرات لرؤية المعنى الأصلي.
- تطهير السمية (Detoxification): استطاعت أخذ النص السام المموه وإعادة كتابته في نسخة مهذبة وآمنة.
النتيجة الرئيسية: التدريب على بيانات "التنكر" هذه لم يساعد فقط في التعامل مع النصوص الفوضوية، بل جعل النماذج أفضل أيضاً في رصد النصوص السامة العادية والنظيفة. الأمر يشبه حارس الأمن الذي، بعد تدريبه على رصد الأشخاص المختبئين في الشجيرات، يصبح أفضل في رصد أي شخص يتصرف بشكل مريب، حتى لو لم يكن مختبئاً.
لماذا هذا مهم؟
هذه هي أول مجموعة بيانات من نوعها مخصصة للغة الكورية. وهي توضح أنه لإيقاف المحتوى السام، لا يمكننا فقط تعليم الذكاء الاصطناعي التعرف على "الكلمات السيئة"، بل يجب أن نعلمه التعرف على "الكلمات السيئة في تنكر". من خلال فهم الطرق المحددة التي يخفي بها المتحدثون باللغة الكورية سميتهم، يمكننا بناء فلاتر أذكى وأكثر قوة لا يمكن خداعها بحيل الإملاء البسيطة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.