← أحدث الأبحاث
💻 computer science

A Multi-Layered Plagiarism and AI-Generated Content Detection Framework Integrating BERT-BiLSTM-Attention Encoding with Stylometric Analysis

تقترح هذه الورقة إطار عمل شاملاً ومتعدد الطبقات يدمج بين ترميز BERT-BiLSTM-Attention، والتضمينات الدلالية، وبصمات الـ n-gram، والتحليل الأسلوبي، للكشف بقوة عن التطابق التام، والانتحال بإعادة الصياغة، والنسخ الفسيفسائي، والمحتوى المُنشأ بواسطة الذكاء الاصطناعي، مع تحديد عدم اتساق التأليف داخل المستندات.

المؤلفون الأصليون: Vineesh V

نُشر 2026-09-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Vineesh V

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في الزوايا الهادئة من العالم الأكاديمي، تتعرض ثقة جوهرية للاختبار. فلقرون مضت، اعتمدت نزاهة البحث العلمي على فرضية بسيطة وهي أن كلمات الكاتب هي ملك له، كعقد بين المؤلف والقارئ. لكن هذا العقد يتعرض للضغط من اتجاهين في آن واحد. فمن ناحية، هناك الإغراء القديم لاستعارة أفكار شخص آخر دون ذكر المصدر، إما عن طريق نسخ الكلمات حرفياً، أو عبر إعادة ترتيب الجمل واستبدال المترادفات لإخفاء السرقة. ومن ناحية أخرى، ظهرت قوة جديدة: الذكاء الاصطناعي. هذه البرامج الحاسوبية القوية يمكنها الآن كتابة فقرات تبدو وتسمع كأنها بشرية بشكل لافت، مما يجعل من الصعب التمييز بين أين تنتهي أفكار الشخص وأين تبدأ أفكار الآلة. ولم يعد التحدي الذي يواجه المعلمين والمحررين مجرد العثور على النصوص المنسوخة؛ بل أصبح يتمثل في التمييز بين طالب يعاني في الكتابة، وآخر يرتكب سوء سلوك، وآخر يستخدم ببساطة أداة تكتب نيابة عنه.

ولمواجهة هذا التحدي، قام باحث يدعى فينيش في (Vineesh V) من كلية حكومة شيتور في كيرالا، ببناء نوع جديد من المفتش الرقمي. لا يعتمد هذا النظام على حيلة واحدة لكشف عدم الأمانة، بل يعمل مثل مصفاة متعددة الطبقات، مصممة للإمساك بأنواع مختلفة من مشاكل الكتابة في وقت واحد. إن جوهر هذه الأداة الجديدة هو طريقة متطورة لقراءة النص تفهم المعنى، وليس مجرد التهجئة. فهي تستخدم بنية تعلم عميق تدمج ثلاث تقنيات قوية: نظام يفهم سياق كل كلمة، وشبكة ذاكرة تتبع كيفية تدفق الجمل من واحدة إلى الأخرى، وآلية انتباه تتعلم الأجزاء الأكثر أهمية في الجملة. ومن خلال دمج هذه الأساليب، ينشئ النظام بصمة رقمية فريدة لكل جملة يقرأها، ملتقطاً البنية العميقة للكتابة بدلاً من مظهرها السطحي فقط.

يقوم النظام بأربع وظائف متميزة لحماية النزاهة الأكاديمية. أولاً، يبحث عن النسخ المتطابق، عبر مطابقة الجمل المتطابقة أو شبه المتطابقة مع المصادر المعروفة. ثانياً، يطارد إعادة الصياغة، حيث يتم الحفاظ على المعنى مع تغيير الكلمات. وللقيام بذلك، يقارن "المعنى الدلالي" للجمل — متسائلاً جوهرياً عما إذا كانت جملتان تقولان الشيء نفسه حتى لو استخدمتا كلمات مختلفة. ثالثاً، يكشف عن الانتحال الفسيفسائي، وهو شكل مخادع من الكتابة حيث يقوم الكاتب بتجميع عبارات صغيرة من مصادر مختلفة لإنشاء رقعة من الأفكار المستعارة. وأخيراً، وهو الأمر الأكثر إلحاحاً، يقوم بتمييز النصوص التي يبدو أنها ناتجة عن الذكاء الاصطناعي. وبخلاف الأدوات القديمة التي قد تحتاج إلى إعادة تدريب في كل مرة يظهر فيها نموذج ذكاء اصطناعي جديد، يستخدم هذا النظام مجموعة من اثني عشر دليلاً إحصائياً لرصد الكتابة الآلية. فهو يبحث في أنماط مثل مدى تباين أطوال الجمل، وعدد مرات استخدام الكاتب لكلمات انتقالية مثل "ومع ذلك" أو "علاوة على ذلك"، ومدى تنوع المفردات. وقد تعلم أن الكتابة البشرية تميل إلى أن تكون أكثر عدم قابلية للتنبؤ والتنوع، بينما غالباً ما تتبع الكتابة الآلية إيقاعاً أكثر سلاسة وانتظاماً.

ولضمان أن هذا الإطار الجديد يعمل بالفعل، لم يعتمد الباحث على النظرية فحسب، بل بنى أرضية اختبار صارمة باستخدام وثائق اصطناعية — نصوص مولدة حاسوبياً ذات أسرار معروفة. فقد أنشأ قصصاً أصلية تماماً، وأخرى منسوخة بدقة، وبعضها أعيدت صياغته، وأخرى كُتبت بوضوح بواسطة ذكاء اصطناعي. حتى أنه صنع وثائق تمزج بين كل هذه الأنواع ليرى ما إذا كان النظام يستطيع فك تشابك هذا المزيج. وكانت النتائج واضحة؛ فقد نجح النظام في تحديد النسخ المتطابقة، وأمسك بالأجزاء المعاد صياغتها، ورصد الكتابة الفسيفسائية. وعند مواجهة النص المولد بالذكاء الاصطناعي، حدد الكتابة بشكل صحيح على أنها من المحتمل أن تكون من صنع الآلة بناءً على الأنماط الإحصائية التي تدرب على التعرف عليها. والأهم من ذلك، أثبت النظام قدرته على التعامل مع الواقع الفوضوي للوثائق الحقيقية؛ فقد عالج نصوصاً قصيرة، ونصوصاً طويلة، وحتى نصوصاً مليئة برموز أو أرقام غريبة دون أن يتوقف عن العمل. كما أظهر أنه يمكنه إجراء الاختبار نفسه مرتين والحصول على النتيجة نفسها تماماً، وهي صفة حيوية لأي أداة تُستخدم في التحقيقات الأكاديمية الجادة.

إن واحدة من أكثر القدرات إثارة للاهتمام في هذا الإطار هي قدرته على ملاحظة ما إذا بدا أن وثيقة واحدة قد كُتبت بواسطة أكثر من شخص واحد. فمن خلال تحليل أسلوب الكتابة في كل جملة، يمكن للنظام تجميعها في مجموعات. وإذا بدأت الوثيقة بأسلوب بشري، ثم تحولت إلى أسلوب يشبه أسلوب الآلة، ثم عادت للتحول مرة أخرى، فإن النظام يحدد هذه التحولات. وهذا يتيح للمعلم ليس فقط معرفة أن الورقة مشبوهة، بل معرفة مكان عدم الاتساق بالضبط. وقد أظهرت الاختبارات أن النظام استطاع تحديد هذه التحولات في الأسلوب، موفراً تفصيلاً دقيقاً للجوانب الأصلية من الوثيقة، والجوانب المنسوخة، والجوانب التي قد تكون ناتجة عن كمبيوتر.

تخلص الدراسة إلى أن هذا النهج متعدد الطبقات يقدم مساراً قوياً للمضي قدماً. فمن خلال الجمع بين الفهم الدلالي العميق والتحليل الإحصائي لأسلوب الكتابة، ينشئ النظام شبكة أمان تصطاد أشكالاً مختلفة من عدم الأمانة. ولا يدعي النظام المثالية؛ إذ يشير الباحث إلى أن الاختبارات أجريت على بيانات اصطناعية وأن الأداة تعمل حالياً مع النصوص الإنجليزية فقط. ومع ذلك، تشير النتائج إلى أن هذا الإطار يمثل خطوة هامة نحو مستقبل يمكن فيه الحفاظ على النزاهة الأكاديمية حتى مع ازدياد قوة أدوات الكتابة. إنه يوفر وسيلة للنظر في قطعة من الكتابة وفهم أصولها الحقيقية، وفصل الصوت البشري عن الآلة، والجهد الصادق عن المستعار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →