From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection
تقدم هذه الورقة مساراً معالجياً قابلاً للتوسع والنمذجة يجمع بين التصفية القائمة على القواعد وتصنيف النماذج اللغوية الكبيرة لمعالجة 527 مليون منشور من منصة "ريديت"، حيث نجح في تقليص 124.6 مليون رمز فريد إلى 1,021 مرشحاً للمصطلحات الجديدة، والتي تأكد أن 58.7% منها هي ابتكارات لغوية حقيقية من خلال التحقق اليدوي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة تحتوي على 527 مليون كتاب (منشورات Reddit من عام 2005 إلى 2024). في مكان ما داخل هذا الجبل من النصوص، توجد بضعة آلاف من الكلمات الجديدة تماماً التي اخترعها الناس للتو. هدفك هو العثور عليها.
إذا حاولت قراءة كل كلمة في تلك المكتبة للعثور على الكلمات الجديدة، فستقضي بقية حياتك في ذلك. معظم الكلمات "الغريبة" التي ستجدها ليست اختراعات جديدة؛ بل هي مجرد أخطاء مطبعية، أو أشخاص كتبوا كلمتين معاً دون مسافة، أو كلمات من لغات أخرى.
تصف هذه الورقة فلترًا ذكيًا متعدد المراحل صُمم لغربلة هذا الجبل من النصوص وتسليمك كومة صغيرة "مشتبه بها" من الكلمات التي هي في الواقع كلمات جديدة.
إليك كيف يعمل خط الإنتاج خطوة بخً-بخطوة:
1. الغربال العملاق (التصفية القائمة على القواعد)
فكر في المرحلة الأولى كمجموعة من المناخل العملاقة. أنت تصب 124 مليون كلمة فريدة من خلالها واحدة تلو الأخرى.
- منخل "الكلمات القديمة": إذا كانت الكلمة موجودة في قاموس قبل عام 2015، يتم استبعادها. نحن نهتم فقط بالأشياء الجديدة.
- منخل "الهراء": إذا بدت الكلمة وكأنها ضغطات عشوائية على لوحة المفاتيح (مثل "asdfgh")، أو خطأ مطبعي، أو سلسلة من الحروف المتكررة، يتم التخلص منها.
- منخل "اللصق": إذا التصقت كلمتان معاً دون مسافة (مثل "datingapp")، يحاول النظام فصلهما. إذا كانتا مجرد خطأ، فيتم إلقاؤهما في المهملات.
- منخل "اللغات الأجنبية": إذا اعتقد النظام أن الكلمة باللغة الإسبانية أو التاغالوغية، فإنه يضعها جانباً (رغم أن بعض الكلمات المختلطة اللغات الماكرة قد تتسلل).
النتيجة: هذه المرحلة فعالة للغاية. فهي تتخلص من 99.99% من الكلمات. لقد قللت الـ 124 مليون مرشح إلى حوالي 175,000 كلمة جديدة محتملة.
2. لجنة القضاة (تصنيف النماذج اللغوية الكبيرة - LLM)
الآن لدينا 175,000 مشتبه به. لا يمكننا قراءتها جميعاً يدوياً بعد، لذا نطلب من لجنة مكونة من أربعة "قضاة" مختلفين من الذكاء الاصطناوي (نماذج لغوية كبيرة) النظر في كل واحدة منها.
- يُطلب من القضاة تصنيف كل كلمة إلى واحدة من أربع فئات:
- نيولوجيزم (كلمة مستحدثة): كلمة جديدة حقيقية (مثل "doomscrolling").
- كيان (Entity): اسم شخص، أو علامة تجارية، أو مكان (مثل "Elon").
- أجنبي: كلمة من لغة أخرى.
- لا شيء: مجرد خطأ مطبعي، أو اسم مستخدم، أو هراء.
- نظام التصويت: لتجنب كون أحد نماذج الذكاء الاصطناعي كسولاً أو غير دقيق، يقومون بالتصويت. إذا وافقت الأغلبية على أن الكلمة هي "نيولوجيزم"، فإنها تنتقل إلى الجولة التالية. وإذا اختلفوا، فغالباً ما يتم استبعاد الكلمة لضمان الدقة.
3. المفتش النهائي (التحقق)
حتى بعد تصويت لجنة الذكاء الاصطناعي، لا يزال هناك حوالي 10,000 مرشح لـ "النيولوجيزم". لا يزال هذا العدد كبيراً جداً ليقوم إنسان بفحصه بسرعة.
لذلك، ينظر قاضٍ أخير صارم جداً (Claude) إلى القائمة مرة أخرى. هذا القاضي محافظ للغاية؛ فهو يقول: "إذا لم أكن متأكداً بنسبة 100% أن هذه كلمة جديدة، فسأعتبرها 'لا شيء'".
- هذه الخطوة تقلل القائمة من 10,000 إلى 1,021 مرشحاً فقط.
الكشف النهائي
بعد ذلك، أخذ الباحثون هذه الكلمات الـ 1,021 النهائية وفحصوها يدوياً.
- الأخبار الجيدة: 58.7% منها (599 كلمة) كانت اختراعات جديدة حقيقية!
- الأخبار السيئة: البقية كانت إما أسماء لأشياء (كيانات)، أو كلمات أجنبية تسللت عبر الفلتر، أو مجرد أخطاء.
ما نوع الكلمات الجديدة التي وجدوها؟
وجدت الورقة أن الكلمات الجديدة تُخلق بطريقتين رئيسيتين:
- "متبعو القواعد": إضافة سوابق أو لواحق إلى كلمات موجودة (مثل إضافة "-ism" إلى "woke" لتصبح "wokeism").
- "خارقي القواعد": دمج الكلمات معاً أو تغييرها من أجل المتعة (مثل دمج "Barbie" و "Oppenheimer" لتصبح "Barbenheimer"، أو تغيير "thick" إلى "thiccest" للتوكيد).
لماذا هذا مهم؟
إن الإنجاز الرئيسي للورقة ليس مجرد العثور على الكلمات؛ بل هو الضغط (Compression). لقد أخذوا مهمة مستحيلة على البشر (قراءة 124 مليون كلمة) وضغطوها في مهمة يمكن للإنسان إنهاؤها في يوم واحد (فحص 1,021 كلمة).
ما لا تفعله الورقة:
- هي لا تتنبأ بمستقبل اللغة.
- لا تقوم بإصلاح الأخطاء المطبعية للمستخدمين.
- لا تعمل على العبارات مثل "touch grass" (فهي تجد الكلمات المفردة فقط).
- لا تلتقط الكلمات التي تغير معناها مع بقاء نفس الإملاء (مثل تحول "Karen" إلى إهانة عامية)، لأن النظام يعتقد أن "Karen" مجرد اسم قديم.
باختصار، هذه آلة استخراج ذه عالية الكفاءة. إنها تنقب في جبل هائل من التراب الرقمي، وتصفي الصخور والتراب، وتسلمك دلواً صغيراً من سبائك الذهب (الكلمات الجديدة) الجاهزة ليقوم خبير بشري بصقلها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.