A Multi-Layered Plagiarism and AI-Generated Content Detection Framework Integrating BERT-BiLSTM-Attention Encoding with Stylometric Analysis
تقترح هذه الورقة إطار عمل شاملاً ومتعدد الطبقات يدمج بين ترميز BERT-BiLSTM-Attention، والتضمينات الدلالية، وبصمات الـ n-gram، والتحليل الأسلوبي، للكشف بقوة عن التطابق التام، والانتحال بإعادة الصياغة، والنسخ الفسيفسائي، والمحتوى المُنشأ بواسطة الذكاء الاصطناعي، مع تحديد عدم اتساق التأليف داخل المستندات.
في الزوايا الهادئة من العالم الأكاديمي، تتعرض ثقة جوهرية للاختبار. فلقرون مضت، اعتمدت نزاهة البحث العلمي على فرضية بسيطة وهي أن كلمات الكاتب هي ملك له، كعقد بين المؤلف والقارئ. لكن هذا العقد يتعرض للضغط من اتجاهين في آن واحد. فمن ناحية، هناك الإغراء القديم لاستعارة أفكار شخص آخر دون ذكر المصدر، إما عن طريق نسخ الكلمات حرفياً، أو عبر إعادة ترتيب الجمل واستبدال المترادفات لإخفاء السرقة. ومن ناحية أخرى، ظهرت قوة جديدة: الذكاء الاصطناعي. هذه البرامج الحاسوبية القوية يمكنها الآن كتابة فقرات تبدو وتسمع كأنها بشرية بشكل لافت، مما يجعل من الصعب التمييز بين أين تنتهي أفكار الشخص وأين تبدأ أفكار الآلة. ولم يعد التحدي الذي يواجه المعلمين والمحررين مجرد العثور على النصوص المنسوخة؛ بل أصبح يتمثل في التمييز بين طالب يعاني في الكتابة، وآخر يرتكب سوء سلوك، وآخر يستخدم ببساطة أداة تكتب نيابة عنه.
ولمواجهة هذا التحدي، قام باحث يدعى فينيش في (Vineesh V) من كلية حكومة شيتور في كيرالا، ببناء نوع جديد من المفتش الرقمي. لا يعتمد هذا النظام على حيلة واحدة لكشف عدم الأمانة، بل يعمل مثل مصفاة متعددة الطبقات، مصممة للإمساك بأنواع مختلفة من مشاكل الكتابة في وقت واحد. إن جوهر هذه الأداة الجديدة هو طريقة متطورة لقراءة النص تفهم المعنى، وليس مجرد التهجئة. فهي تستخدم بنية تعلم عميق تدمج ثلاث تقنيات قوية: نظام يفهم سياق كل كلمة، وشبكة ذاكرة تتبع كيفية تدفق الجمل من واحدة إلى الأخرى، وآلية انتباه تتعلم الأجزاء الأكثر أهمية في الجملة. ومن خلال دمج هذه الأساليب، ينشئ النظام بصمة رقمية فريدة لكل جملة يقرأها، ملتقطاً البنية العميقة للكتابة بدلاً من مظهرها السطحي فقط.
يقوم النظام بأربع وظائف متميزة لحماية النزاهة الأكاديمية. أولاً، يبحث عن النسخ المتطابق، عبر مطابقة الجمل المتطابقة أو شبه المتطابقة مع المصادر المعروفة. ثانياً، يطارد إعادة الصياغة، حيث يتم الحفاظ على المعنى مع تغيير الكلمات. وللقيام بذلك، يقارن "المعنى الدلالي" للجمل — متسائلاً جوهرياً عما إذا كانت جملتان تقولان الشيء نفسه حتى لو استخدمتا كلمات مختلفة. ثالثاً، يكشف عن الانتحال الفسيفسائي، وهو شكل مخادع من الكتابة حيث يقوم الكاتب بتجميع عبارات صغيرة من مصادر مختلفة لإنشاء رقعة من الأفكار المستعارة. وأخيراً، وهو الأمر الأكثر إلحاحاً، يقوم بتمييز النصوص التي يبدو أنها ناتجة عن الذكاء الاصطناعي. وبخلاف الأدوات القديمة التي قد تحتاج إلى إعادة تدريب في كل مرة يظهر فيها نموذج ذكاء اصطناعي جديد، يستخدم هذا النظام مجموعة من اثني عشر دليلاً إحصائياً لرصد الكتابة الآلية. فهو يبحث في أنماط مثل مدى تباين أطوال الجمل، وعدد مرات استخدام الكاتب لكلمات انتقالية مثل "ومع ذلك" أو "علاوة على ذلك"، ومدى تنوع المفردات. وقد تعلم أن الكتابة البشرية تميل إلى أن تكون أكثر عدم قابلية للتنبؤ والتنوع، بينما غالباً ما تتبع الكتابة الآلية إيقاعاً أكثر سلاسة وانتظاماً.
ولضمان أن هذا الإطار الجديد يعمل بالفعل، لم يعتمد الباحث على النظرية فحسب، بل بنى أرضية اختبار صارمة باستخدام وثائق اصطناعية — نصوص مولدة حاسوبياً ذات أسرار معروفة. فقد أنشأ قصصاً أصلية تماماً، وأخرى منسوخة بدقة، وبعضها أعيدت صياغته، وأخرى كُتبت بوضوح بواسطة ذكاء اصطناعي. حتى أنه صنع وثائق تمزج بين كل هذه الأنواع ليرى ما إذا كان النظام يستطيع فك تشابك هذا المزيج. وكانت النتائج واضحة؛ فقد نجح النظام في تحديد النسخ المتطابقة، وأمسك بالأجزاء المعاد صياغتها، ورصد الكتابة الفسيفسائية. وعند مواجهة النص المولد بالذكاء الاصطناعي، حدد الكتابة بشكل صحيح على أنها من المحتمل أن تكون من صنع الآلة بناءً على الأنماط الإحصائية التي تدرب على التعرف عليها. والأهم من ذلك، أثبت النظام قدرته على التعامل مع الواقع الفوضوي للوثائق الحقيقية؛ فقد عالج نصوصاً قصيرة، ونصوصاً طويلة، وحتى نصوصاً مليئة برموز أو أرقام غريبة دون أن يتوقف عن العمل. كما أظهر أنه يمكنه إجراء الاختبار نفسه مرتين والحصول على النتيجة نفسها تماماً، وهي صفة حيوية لأي أداة تُستخدم في التحقيقات الأكاديمية الجادة.
إن واحدة من أكثر القدرات إثارة للاهتمام في هذا الإطار هي قدرته على ملاحظة ما إذا بدا أن وثيقة واحدة قد كُتبت بواسطة أكثر من شخص واحد. فمن خلال تحليل أسلوب الكتابة في كل جملة، يمكن للنظام تجميعها في مجموعات. وإذا بدأت الوثيقة بأسلوب بشري، ثم تحولت إلى أسلوب يشبه أسلوب الآلة، ثم عادت للتحول مرة أخرى، فإن النظام يحدد هذه التحولات. وهذا يتيح للمعلم ليس فقط معرفة أن الورقة مشبوهة، بل معرفة مكان عدم الاتساق بالضبط. وقد أظهرت الاختبارات أن النظام استطاع تحديد هذه التحولات في الأسلوب، موفراً تفصيلاً دقيقاً للجوانب الأصلية من الوثيقة، والجوانب المنسوخة، والجوانب التي قد تكون ناتجة عن كمبيوتر.
تخلص الدراسة إلى أن هذا النهج متعدد الطبقات يقدم مساراً قوياً للمضي قدماً. فمن خلال الجمع بين الفهم الدلالي العميق والتحليل الإحصائي لأسلوب الكتابة، ينشئ النظام شبكة أمان تصطاد أشكالاً مختلفة من عدم الأمانة. ولا يدعي النظام المثالية؛ إذ يشير الباحث إلى أن الاختبارات أجريت على بيانات اصطناعية وأن الأداة تعمل حالياً مع النصوص الإنجليزية فقط. ومع ذلك، تشير النتائج إلى أن هذا الإطار يمثل خطوة هامة نحو مستقبل يمكن فيه الحفاظ على النزاهة الأكاديمية حتى مع ازدياد قوة أدوات الكتابة. إنه يوفر وسيلة للنظر في قطعة من الكتابة وفهم أصولها الحقيقية، وفصل الصوت البشري عن الآلة، والجهد الصادق عن المستعار.
ملخص تقني: إطار عمل متعدد الطبقات للكشف عن الانتحال والمحتوى المُنشأ بواسطة الذكاء الاصطناعي
بيان المشكلة تتناول الورقة البحثية التهديد المتصاعد لسلامة الأكاديمية الناجم عن اتجاهين متزايدين: الانتحال النصي المستمر، والظهور السريع للذكاء الاصطناَاعي التوليدي (نماذج اللغات الكبيرة - LLMs) القادر على إنتاج نصوص تشبه النصوص البشرية. إن أنظمة الكشف التقليدية، التي تعتمد على مقاييس التداخل المعجمي (مثل TF-IDF، وبصمات النصوص)، غير كافية لمواجهة إعادة الصياغة المتطورة، والانتحال الفسيفسائي (الترقيعي)، والنصوص المُنشأة آلياً، والتي غالباً ما تظهر أصالة معجمية عالية مع الاحتفاظ ببصمات إحصائية متميزة. علاوة على ذلك، فإن الأدوات الحالية تتعامل عادةً مع كشف الانتحال وتحديد النصوص المكتوبة بالذكاء الاصطناعي كمشكلتين منفصلتين، مما يؤدي إلى عدم كفاءة تشغيلية ويترك فجوات في التغطية للمستندات التي تحتوي على تأليف مختلط.
المنهجية الحل المقترح هو إطار عمل موحد متعدد الطبقات للكشف يدمج بنيات التعلم العميق مع القياس الأسلوبي الإحصائي ضمن مسار معالجة واحد. تتكون المنهجية من خمس مراحل رئيسية:
استيعاب المستند ومعالجته مسبقاً: يستقبل النظام ملفات PDF وDOCX وTXT، ويقوم بتطبيع النصوص إلى جمل وفقرات باستخدام أدوات تقسيم النصوص (NLTK)، وإزالة كلمات التوقف.
الترميز النصي العصبي: يقوم مُرمِزان متكاملان بإنشاء تمثيلات متجهية على مستوى الجملة:
BERT-BiLSTM-Attention: بنية هجينة تستخدم نموذج bert-base-uncased (مع تجميد 10 من أصل 12 طبقة)، وطبقة BiLSTM ثنائية الاتجاه (بمخرجات ذات 512 بُعداً)، وآلية انتباه ذات ثمانية رؤوس مع تجميع الانتباه. ينتج هذا تمثيلات سياقية عميقة مُحسّنة للتشابه الدلالي.
Sentence-BERT (SBERT): نموذج خفيف الوزن all-MiniLM-L6-v2 يولد تمثيلات ذات 384 بُعداً للمقارنة الدلالية الفعالة وتجميع الأنماط الأسلوبية.
كشف الانتحال متعدد المستويات: يستخدم المحرك أربع استراتيجيات متميزة:
المطابقة التامة: يستخدم خوارزمية Ratcliff/Obershelp (عبر difflib.SequenceMatcher) مع عتبة تشابه تبلغ 0.95 لتحديد النسخ الحرفي.
كشف إعادة الصياغة: يحسب تشابه جيب التمام (Cosine Similarity) على تمثيلات SBERT. يتم وضع علامة على الأزواج التي تبلغ نسبة تشابهها الدلالي ≥0.75 والتشابه المعجمي <0.95. ويتم تصنيف الأنواع الفرعية (إعادة الصياغة العميقة، استبدال الكلمات، إعادة الهيكلة، وإعادة استخدام الأفكار) بناءً على عتبات محددة للتشابه الدلالي، والتشابه المعجمي، وتداخل الكلمات المحتويّة.
كشف الفسيفساء (الترقيع): يستخدم بصمات n-gram (بقيم n=3، 4، 5) مع تجزئة MD5. يؤدي تحقيق تشابه جاكارد (Jaccard similarity) بنسبة ≥0.55 عبر مستويات التفصيل المختلفة إلى تفعيل تصنيف الفسيفساء.
التشابه الداخلي: يحلل التماسك العالمي للمستند عبر تحديد أزواج الجمل التي يتجاوز تشابهها الداخلي 0.50.
كشف المحتوى المُنشأ بواسطة الذكاء الاصطناعي: يقوم وحدة برمجية خفيفة الوزن قائمة على القواعد بحساب اثني عشر ميزة قياس أسلوبي (مثل معامل التباين لطول الجملة، ونسبة نوع-إلى-رمز، والتدفق أو الاندفاع "burstiness"، وكثافة الكلمات الانتقالية، وتكرار عبارات الذكاء الاصطناعي، وتشابه الجمل المتتالية). يتم رسم هذه الميزات على درجة احتمالية معيارية (0.0–1.0) باستخدام عتبات مشتقة تجريبياً، مما يصنف النصوص من "من المرجح جداً أن تكون بشرية" إلى "من المرجح جداً أن تكون ذكاءً اصطناعياً" دون الحاجة إلى مصنف خاضع للإشراف مدرب على مجموعات بيانات للذكاء الاصطناعي.
تجزئة أسلوب الكتابة: يتم تطبيق تجميع DBSCAN على تمثيلات جمل SBERT (بمعايير ε=0.5، وmin_samples=2) لتحديد الأساليب الكتابية المتميزة والتحولات المفاجئة داخل المستند الواحد، مما يشير إلى عدم اتساق التأليف.
المساهمات الرئيسية تحدد الورقة خمس مساهمات أساسية:
بنية ترميز عصبية هجينة تجمع بين BERT المجمد، وBiLSTM، والانتباه متعدد الرؤوس لتحسين التمثيلات الجملية.
آلية كشف انتحال رباعية المستويات تصنف التداخل إلى نسخ تام، وإعادة صياغة (مع أنواع فرعية)، وانتحال فسيفسائي باستخدام تقنيات مكملة لمحاذاة التسلسل والتمثيل الشعاعي.
كاشف أسلوب كتابة للذكاء الاصطناعي خفيف الوزن يستخدم اثنتي عشرة ميزة قياس أسلوبي لتعيين درجات احتمالية لتأليف الذكاء الاصطناعي، متجنباً الحاجة إلى مجموعات بيانات ضخمة وموسومة لنصوص الذكاء الاصطناعي.
وحدة تجزئة أسلوب آلية تستخدم DBSCAN للكشف عن عدم اتساق التأليف والتحولات الأسلوبية داخل المستندات.
منهجية تحقق شاملة تستخدم مجموعات بيانات اصطناعية ذات حقائق أرضية معروفة لتقييم النظام عبر أبعاد الوحدة، والتكامل، والحالات الحدية، والاستمرارية.
النتائج تم التحقق من صحة الإطار باستخدام سبعة مستندات اصطناعية ذات تسميات حقائق أرضية معروفة (أصل نظيف، نسخة مكررة تماماً، إعادة صياغة، مُنشأ بالذكاء الاصطناعي، فسيفساء، مختلط، ومدخلات ضئيلة).
التحقق من المكونات: اجتازت جميع الاختبارات الوحدوية الإحدى عشرة، مما أكد الصحة الوظيفية في استيعاب المستندات، واستخراج الميزات، وتوليد الموترات.
أداء التكامل: نجح النظام في كشف جميع الشذوذات المقصودة. لم ينتج "الأصل النظيف" أي نتائج إيجابية كاذبة. أما "النسخة المكررة تماماً" فقد فعلت المطابقة التامة؛ وحالة "إعادة الصياغة" حددت بدقة التشابه الدلالي مع انخفاض في التداخل المعجمي؛ والنص "المُنشأ بالذكاء الاصطناعي" تجاوز عتبة الاحتمالية 0.40؛ والمستند "المختلط" فعل عدة فئات كشف في آن واحد.
المتانة: تعامل النظام مع الحالات الحدية (السلاسل الفارغة، الرموز الخاصة، يونيكود، النصوص الرقمية فقط، والمدخلات الطويلة جداً) دون أخطاء وقت التشغيل.
الاستمرارية: أدت عمليات التنفيذ المتكررة على مدخلات متطابقة إلى مخرجات مستقرة مع انحرافات في احتمالية الذكاء الاصطناعي أقل من 0.01، مما يؤكد السلوك الحتمي.
الأداء: أظهر النظام أوقات معالجة قابلة للتوسع، مستفيداً من المعالجة بالدفعات وتسريع وحدة معالجة الرسومات (GPU)، حيث يوفر مُرمز SBERT إنتاجية عالية بينما يوفر مُرمز BERT-BiLSTM-Attention تحليلاً سياقياً عميقاً.
الأهمية والادعاءات تدعي الورقة أن هذا الإطار يطور الحالة الراهنة من خلال توحيد استراتيجيات كشف متكاملة في مسار واحد تم التحقق منه. تكمن أهميته في:
التغطية الشاملة: القدرة على تحديد النسخ التام، وإعادة الصياغة، والانتحال الفسيفسائي، والمحتوى المُنشأ بالذكاء الاصطناعي في آن واحد، بالإضافة إلى كشف عدم اتساق التأليف داخل مستند واحد.
عملية كشف الذكاء الاصطناعي: يوفر نهج القياس الأسلوبي القائم على القواعد ميزة عملية على المصنفات الخاضعة للإشراف من خلال عدم الحاجة إلى مجموعات بيانات ضخمة وسريعة التقادم من النصوص الموسومة بالذكاء الاصطناعي، مما يجعله قابلاً للتكيف مع المشهد المتطور لنماذج اللغات الكبيرة.
الموثوقية والقابلية للتدقيق: تضع مجموعة التحقق الصارمة والسلوك الحتمي للنظام أداة قوية لتدفقات عمل النزاهة الأكاديمية حيث تكون قابلية التكرار أمراً بالغ الأهمية.
القابلية للتوسع: تسمح البنية النمطية بالتوسع المستقل للمرمِّزات، مما يتيح تكوينات نشر تعطي الأولوية إما للسرعة أو للعمق حسب السياق.
يقر المؤلف بالقيود، بما في ذلك الاعتماد على مجموعات بيانات اصطناعية بدلاً من مجموعات بيانات واقعية واسعة النطاق، واستخدام عتبات استدلالية ثابتة لكشف الذكاء الاصطناعي، والافتقار الحالي للمقارنة عبر المستندات مع قواعد بيانات خارجية، والقصر على النصوص باللغة الإنجليزية. ويُقترح العمل المستقبلي لمعالجة هذه النقاط من خلال تقييم مجموعات البيانات المرجعية، والمقارنة المعززة بالاسترجاع، والعتبات التكيفية، والتوسع متعدد اللغات.