Benchmarking Stylometric Metrics for AI Authorship Verification: A Glass-Box Forensic Framework Across Language Models
تقترح هذه الورقة إطار عمل جنائي شفافاً من نوع "الصندوق الزجاجي" يستفيد من أربعين مقياساً أسلوبياً قابلاً للتفسير لإثبات أنه، على الرغم من التقارب اللفظي، لا تزال هناك اختلافات متميزة ومتسعة في القدرة على التنبؤ المعلوماتي، والخصائص البنيوية، والتباين الطبيعي بين النصوص البشرية وتلك المولدة بواسطة الذكاء الاصطناعي عبر مجموعات بيانات متنوعة، مما يوفر أساساً متيناً للتحقق من الهوية التأليفية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في الزوايا الهادئة للغة، يترك كل كاتب بصمة فريدة. هذه هي الفكرة الجوهرية لعلم الأسلوب (stylometry)، وهو مجال درس طويلاً كيف يكتب الناس ليس فقط من خلال ما يقولونه، بل من خلال كيفية قولهم له. لدى البشر عادات لا واعية: طول جملهم، وإيقاع علامات ترقيمهم، وتنوع الكلمات التي يختارونها، وطريقة هيكلة أفكارهم. لعقود من الزمن، استخدم اللغويون هذه الأنماط الدقيقة لتحديد مؤلفي الرسائل المجهولة أو النصوص التاريخية المتنازع عليها. واليوم، برز تحدٍ جديد؛ إذ يمكن لأنظمة الذكاء الاصطناعي القوية الآن توليد نصوص تبدو بشرية بشكل لافت، مما يمحو الخط الفاصل بين صوت الشخص ومخرجات الآلة. تثير هذه القدرة تساؤلات ملحة للمدارس والمحاكم وغرف الأخبار: عندما يظهر نص ما، كيف يمكننا معرفة ما إذا كان إنساناً هو من كتبه أم أن حاسوباً هو من ولّده؟ إن المخاطر عالية، وهي تتعلق بالنزاهة الأكاديمية، والملكية الفكرية، وانتشار المعلومات المضللة.
لقد اتخذ فريق من الباحثين في المعهد الوطني للتكنولوجيا في دلهي نهجاً جديداً تجاه هذه المشكلة. فبدلاً من الاعتماد على برامج حاسوبية معقدة وغير شفافة تخمن ببساطة ما إذا كان النص حقيقياً أم مزيفاً، قاموا ببناء إطار عمل شفاف وخطوة بخطوة لقياس الاختلافات المحددة بين الكتابة البشرية وكتابة الآلة. وقد أطلقوا عليه اسم طريقة "الصندوق الشفاف" (glass-box)، مما يعني أن كل خطوة من خطوات التحليل مرئية ومفهومة، على عكس أنظمة "الصندوق الأسود" التي تخفي منطقها. فحص الباحثون مجموعتين ضخمتين من النصوص: إحداهما تحتوي على مقالات أكاديمية منضبطة، والأخرى تحتوي على كتابات متنوعة وحقيقية من الإنترنت، بما في ذلك محتوى من أحدث نماذج الاستنتاج الأكثر تقدماً. ومن خلال قياس أربعين ميزة مختلفة للكتابة، اكتشفوا أنه بينما يتحسن الذكاء الاصطناعي في محاكاة المفردات البشرية، فإنه يصبح في الوقت نفسه أكثر جموداً وقابلية للتنبؤ في بنيته.
بدأ الباحثون باختبار أدوات القياس الأربعين الخاصة بهم على الكتابة البشرية وحدها لضمان موثوقية الأدوات. قاموا بتقسيم النصوص المكتوبة بشرياً إلى مجموعتين وتحققوا مما إذا كانت الأدوات قادرة على إيجاد أي اختلافات بينهما. وكانت النتيجة أن الأدوات لم تجد أي فرق تقريباً، مما أثبت أن الكتابة البشرية تحافظ على شكل طبيعي متسق بغض النظر عن الموضوع أو المؤلف المحدد. وقد أرسى هذا أساساً مستقراً. وعندما طبقوا هذه الأدوات نفسها لمقارنة الكتابة البشرية مقابل النص الذي تم توليده بواسطة الذكاء الاصطناعي، ظهرت أنماط واضحة. ففي السياق الأكاديمي المنضبط، ظهرت أكبر الاختلافات في التوزيع العام للكلمات ومدى قابلية النص للتنبؤ. كانت النصوص المولدة آلياً أكثر قابلية للتنبؤ إحصائياً من الكتابة البشرية، كما كان تنوع الكلمات المستخدمة مختلفاً.
ومع ذلك، أصبحت القصة أكثر تعقيداً عندما نظر الباحثون في مجموعة البيانات الأحدث والأكثر تنوعاً التي تحتوي على أحدث نماذج الاستنتاج. هذه الأنظمة مصممة للتفكير في المشكلات خطوة بخطوة قبل الإجابة. وهنا، وجد الباحثون مفارقة؛ فقد أصبح الذكاء الاصطناعي أفضل بكثير في محاكاة عدم اليقين الإحصائي للغة البشرية، مما أغلق الفجوة في مدى "المفاجأة" في الكلمات. ومع ذلك، في مجالات أخرى، اتسعت الفجوة في الواقع. أصبحت الكتابة الآلية أكثر تجانساً وتكراراً من الناحية الهيكلية. فبينما يغير البشر طبيعياً أطوال جملهم وهياكلها لخلق الإيقاع والتوكيد، أنتجت النماذج الأحدث نصوصاً ذات اتساق روبوتي. وكان هذا واضحاً بشكل خاص في نماذج الاستنتاج الأحدث، التي نزعت إلى كتابة نصوص أطول بكثير بهيكل جمل ثابت للغاية.
تعلق أحد أكثر النتيات إثارة للاهتمام بعلامات الترقيم. ففي البيئة غير المنضبطة للإنترنت، يستخدم الكتاب البشر مجموعة واسعة من علامات الترقيم، بما في ذلك الفاصلة المنقوطة وعلامات التعجب وعلامات الاستفهام، للتعبير عن الأفكات والمشاعر المعقدة. أما نماذج الذكاء الاصطناعي، فقد تجنبت هذه العلامات إلى حد كبير؛ حيث التزمت بالنقطة والفاصلة، مما خلق نبرة أكثر أماناً وحيادية. وقد عزى الباحثون ذلك إلى الطريقة التي يتم بها تدريب هذه النماذج لتكون "مفيدة وغير ضارة"، وهو ما يجردها دون قصد من التنوع العاطفي والهيكلي الموجود في الكلام البشري الطبيعي. لم تكن الآلات تكتب بشكل صحيح فحسب، بل كانت تكتب بـ "مثالية" زائدة، مفتقرة إلى "الضجيج" الطبيعي والعيوب التي تميز التعبير البشري.
كما سلطت الدراسة الضوء على اختلاف جوهري في كيفية تعامل هذه النماذج مع التباين. فالكتابة البشرية تتذبذب؛ قد يستخدم الكاتب جملة طويلة ومعقدة جداً تليها جملة قصيرة وقوية. هذا التباين هو علامة على وجود صوت حي. أما الذكاء الاصطناعي، حتى عندما يحاول أن يكون مبدعاً، يميل إلى تسطيح هذه التقلبات؛ فهو ينتج نصوصاً تظل فيها أطوال الجمل واختيارات الكلمات ضمن نطاق ضيق ومتسق. ووجد الباحثون أن هذا الافتقار إلى التباين الطبيعي كان مؤشراً أقوى على التأليف الآلي من الكلمات المختارة تحديداً. وفي الواقع، مع تقدم النماذج، تحسنت قدرتها على محاكاة المفردات البشرية، لكن عجزها عن محاكة التنوع الهيكلي البشري أصبح أكثر وضوحاً.
خلص الباحثون إلى أن الطرق القديمة للكشف عن النصوص المزيفة، والتي غالباً ما ركزت على تعداد الكلمات البسيط أو فحوصات المفردات الأساسية، لم تعد كافية؛ فالآلات تعلمت استخدام الكلمات الصحيحة. إن الحدود الجديدة للكشف تكمن في النظر إلى البنية والإيقاع في الكتابة. إن العلامات الأكثر موثوقية للآلة ليست فيما تقول، بل في كيفية قولها: أنماط الجمل المتكررة، وتجنب علامات الترقيم المعقدة، والافتقار إلى التباين الطبيعي في تدفق الأفكار. تشير الدراسة إلى أن أدوات المستقبل لتحديد النصوص الاصطناعية يجب أن تركز على هذه البصمات الهيكلية الأعمق. ومع استمرار تطور الذكاء الاصطناعي، قد يتعلم في النهاية الكتابة بمفردات تشبه البشر، ولكنه سيظل يكافح لمحاكة الفوضى المتغيرة والإيقاعية وغير الكاملة للعقل البشري أثناء العمل. المفتاح للتمييز بينهما يكمن في الإنصات إلى ذلك "الضجيج" البشري الطبيعي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.