← أحدث الأبحاث
💬 NLP

FMI_SU_Yotkova_Kastreva at SemEval-2026 Task 13: Lightweight Detection of LLM-Generated Code via Stylometric Signals

تقدم هذه الورقة نهجاً يعتمد على وحدة المعالجة المركزية (CPU) ويكون فعالاً من الناحية الحسابية للكشف عن الكود المولد بواسطة النماذج اللغوية الكبيرة في SemEval-2026 المهمة 13 الفرع أ، والذي يجمع بين الميزات القائمة على النسب المتينة تجاه الطول، وأدوات التحليل، ومصنف "الكود مقابل النص" باستخدام شجرة قرار ضحلة وقواعد استدلالية لتحقيق استدلال شبه فوري دون الاعتماد على نماذج مدربة مسبقاً ضخمة.

المؤلفون الأصليون: Elitsa Yotkova, Violeta Kastreva, Dimitar Dimitrov, Ivan Koychev, Preslav Nakov

نُشر 2026-05-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Elitsa Yotkova, Violeta Kastreva, Dimitar Dimitrov, Ivan Koychev, Preslav Nakov

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل مكتبة رقمية ضخمة حيث تُكتب الكتب بواسطة نوعين من المؤلفين: المكتبيون البشر والكتبة الآليون. يتميز الكتبة الآليون بالسرعة الفائقة والقدرة على الكتابة بلغات عديدة، لكن لديهم عادة ترك "علامات" محددة تكشف طبيعتهم الميكانيكية.

تصف هذه الورقة كيف قام فريق من الباحثين ببناء متحرٍ خفيف الوزن وسريع للغاية لكشف الكتبة الآليين في المكتبة، وتحديداً من أجل مسابقة تسمى SemEval-2026.

إليك كيف يعمل هذا المتحري، مقسماً إلى مفاهيم بسيطة:

١. المشكلة: لماذا يصعب رصد الروبوتات؟

عادةً، لكي تجد شيئاً مزيفاً، تبحث عن أدلة كبيرة ومعقدة. ولكن في عالم الأكواد البرمجية، تكون الروبوتات مخادعة. فهي تكتب أكواداً تبدو مثالية في ظاهرها.

  • فخ "العقل الكبير": حاول الباحثون استخدام نماذج ذكاء اصطناعي ضخمة وذكية للغاية (مثل موسوعة عملاقة وعالمة بكل شيء) لرصد التزييف. نجح الأمر في الكتب التي تم التدريب عليها (والتي كانت معظمها بلغة بايثون)، ولكن عندما حاولوا قراءة كتب بلغات أخرى (مثل Go أو C# أو JavaScript)، ارتبك "العقل الكبير". كان الأمر أشبه بمتحرٍ يعرف فقط كيفية قراءة الإنجليزية وهو يحاول حل لغز في بلد أجنب، فقد فاتته الأدلة لأنه كان مركزاً أكثر من اللازم على لغة معينة.

٢. الحل: "المتحري خفيف الوزن"

بدلاً من استخدام عقل ضخم ومكلف، بنى الفريق متحرياً بسيطاً وسريعاً يبحث عن العادات اليومية الصغيرة التي لا يستطيع الروبوتات منع أنفسهم من تكرارها. هم يسمونها "الإشارات الأسلوبية".

تخيل الأمر كأنك ترصد روبوتاً من خلال طريقة إمساكه بالقلم، بدلاً من تحليل هيكل الجملة بأكمله.

الأدلة الرئيسية (العلامات)

يبحث المتحري عن ثلاثة أشياء رئيسية:

  • نسبة "الثرثرة" في التعليقات: تحب الروبوتات شرح نفسها. غالباً ما يكتبون تعليقات كثيرة (ملاحظات للقارئ) مقارنة بالكود الفعلي. يقوم المتحري بحساب نسبة "الملاحظات الثرثارة" إلى "العمل الفعلي". إذا كانت القطعة البرمجية تتكون من ٥٠٪ ملاحظات و٥٠٪ كود، فمن المرجح أنها روبوت.
  • فحص "الأفعال": في الملاحظات التي تكتبها الروبوتات، يستخدمون كلمات حركة (أفعال) محددة بطريقة تفسيرية متكررة جداً. يقوم المتحري بعدّ الكلمات الحركية التي تظهر في الملاحظات مقابل الكود.
  • مزيج "النص مقابل الكود": أحياناً، تقوم الروبوتات بلصق فقرات كاملة من المحادثات العادية (مثل رسالة دردشة) داخل الكود عن طريق الخطأ. قام الفريق بتدريب مساعد صغير لمسح الكود سطراً بسطر والسؤال: "هل هذا سطر برمجي، أم أنه مجرد جملة عادية؟" إذا كانت القطعة البرمجية تحتوي على الكثير من "الجمل العادية"، يتم وضع علامة عليها.

٣. الحيل الخاصة (القواعد الاستدلالية)

يستخدم المتحري أيضاً بعض "القواعد العامة" بناءً على ما لاحظوه في البيانات:

  • خدعة "تسمية اللغة": غالباً ما ترتبك الروبوتات في التنسيق. فهي كثيراً ما تكتب اسم اللغة (مثل "python" أو "java") كسطر مستقل مباشرة قبل بدء الكود. البشر نادراً ما يفعلون ذلك. إذا رأى المتحري سطراً يقول "python" وحده، فهذه علامة حمراء كبيرة.
  • خدعة "الخطأ في النهاية": أحياناً تتوقف الروبوتات عن الكتابة فجأة. يتحقق المتحري من نهاية القطعة البرمجية تماماً. إذا انقطع الكود في النهاية بخطأ في الصيغة (مثل جملة تنتهي في منتصف الكلمة)، فمن المرجح أنه روبوت نفدت منه الرموز أو الوقت.

٤. كيف يجمعون كل ذلك معاً

لا يعتمد النظام على عقل واحد ضخم. بدلاً من ذلك، يستخدم عملية من خطوتين:
١. الماسح الضوئي: يتحقق بسرعة من "تسمية اللغة" ومزيج "النص مقابل الكود". إذا رأى علامة واضحة للروبوت، فإنه يقول فوراً: "هذا روبوت!".
٢. الحاسبة: إذا لم يكن الماسح الضوئي متأكداً، فإنه يمرر الكود إلى حاسبة بسيطة (شجرة قرار). تقوم هذه الحاسبة بوزن "نسبة الثرثرة" و"نسبة الأفعال" لاتخاذ تخمين نهائي.

٥. النتيجة

نظام الفريق فعال للغاية.

  • لا مجهود شاق: يعمل على معالج كمبيوتر عادي (CPU) ولا يحتاج إلى كمبيوتر خارق.
  • سرعة فورية: يعطي الإجابات بشكل فوري تقريباً.
  • الأداء: في المسابقة، أنهى نظامهم "خفيف الوزن" البسيط العمل ضمن أفضل ١٥٪ من جميع المشاركات، متفوقاً على العديد من الأنظمة التي استخدمت تقنيات أكثر تعقيداً وتكلفة.

باختصار: تظهر الورقة أنك لست بحاجة إلى ذكاء اصطناعي فائق التعقيد لرصد الكود المولد بواسطة الذكاء الاصطناعي. أحياناً، يكفي أن يكون لديك متحرٍ بسيط يعد فقط عدد الملاحظات التي كتبها الكاتب ويتحقق مما إذا كان قد لصق رسالة دردشة في الكود بالخطأ للإيقاع بالروبوت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →