← أحدث الأبحاث
💬 NLP

Entropy of Ukrainian

تقدم هذه الورقة أول دراسة لتقدير اعتلاج (إنتروبيا) اللغة الأوكرانية من خلال تكرار تجربة كلود شانون لتوقع الحروف عام 1951 مع 184 متطوعاً، مما أسفر عن حد أعلى يبلغ حوالي 1.201 بت لكل حرف، ومقارنة هذه النتيجة بنماذج اللغات الكبيرة الحالية.

المؤلفون الأصليون: Anton Lavreniuk, Mykyta Mudryi, Markiian Chaklosh

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anton Lavreniuk, Mykyta Mudryi, Markiian Chaklosh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تلعب لعبة "تخمين الحرف التالي" مع صديق لك. تعرض عليه جملة مقطوعة في منتصفها، مثل: "القط جلس على الـ..."

على صديقك أن يخمن الحرف التالي.

  • إذا خمن "م" (كلمة مـات/سجادة)، فقد أصاب. كان ذلك سهلاً.
  • إذا خمن "ز"، فهو مخطئ. عليه أن يخمن مرة أخرى.
  • إذا خمن "و" (كلمة وسادة/pillow - بالإنجليزية)، فقد أصاب.

هذه اللعبة تقيس شيئاً يسمى الإنتروبيا (Entropy). في عالم اللغة، لا تتعلق الإنتروبيا بالحرارة أو الفوضى؛ بل هي مقياس لـ المفاجأة.

  • الإنتروبيا العالية: الحرف التالي مفاجأة تامة. عليك أن تخمن عدة مرات قبل أن تصيب. تبدو اللغة فوضوية وغير متوقعة.
  • الإنتروبيا المنخفضة: الحرف التالي واضح جداً. تخمنه فوراً. تبدو اللغة متوقعة ومتكررة.

التجربة: تخمين اللغة الأوكرانية

لعقود من الزمن، لعب العلماء هذه اللعبة مع اللغة الإنجليزية. في عام 1951، سأل رجل يدعى كلود شانون الناس أن يخمنوا الحرف التالي في الجمل الإنجليزية. وجد أن الإنجليزية متوقعة تماماً؛ فأنت تحتاج في المتوسط إلى حوالي 1.2 محاولة لتصيب الحرف التالي.

لكن لم يسبق لأحد أن لعب هذه اللعبة مع اللغة الأوكرانية حتى الآن.

قرر ثلاثة باحثين من أوكرانيا (أنطون، وميكيتا، وماركيان) إجراء هذه التجربة لأول مرة. وإليكم كيف فعلوا ذلك، مترجماً بأسلوب بسيط:

1. اللاعبون (المتطوعون)

بدلاً من استئجار عمال محترفين، طلبوا من الناس العاديين على وسائل التواصل الاجتماعي (معظمهم على تيليجرام) المشاركة في اللعب.

  • الإعداد: قدموا للمتطوعين جملًا من مقالات إخبارية.
  • اللمسة المميزة: للحفاظ على حماس الناس، لم يبدأوا من بداية الجملة تماماً. عرضوا أول 70 حرفاً (وهو طول جملة قصيرة تقريباً) وسألوا: "ماذا يأتي بعد ذلك؟"
  • اللعبة: يكتب المتطوع حرفاً. إذا كان خطأ، يتحول لونه إلى الأحمر، ويحاول مرة أخرى. إذا كان صحيحاً، ينتقل إلى الحرف التالي.
  • الهدف: أرادوا معرفة عدد "التخمينات الخاطئة" التي يستغرقها الشخص قبل الوصول إلى الحرف الصحيح.

2. النتائج: ما مدى قابلية التوقع في اللغة الأوكرانية؟

بعد جمع البيانات من 184 متطوعاً قاموا بأكثر من 17,000 تخمين، قام الباحثون بتحليل الأرقام.

  • النتيجة: وجدوا أن "مستوى المفاجأة" (الإنتروبيا) في اللغة الأوكرانية يبلغ حوالي 1.201 بت لكل حرف.
  • ماذا يعني ذلك؟ هذا يعني أن اللغة الأوكرانية مشابهة جداً للغة الإنجليزية من حيث القدرة على التوقع. تماماً مثل الإنجليزية، إذا كنت تعرف الحروف السابقة، فإن الحرف التالي في الأوكرانية يكون واضحاً تماماً في الغالب.
  • الحشو (Redundancy): لأن اللغة متوقعة للغاية، فإن حوالي 76% من الحروف في الجملة الأوكرانية هي حروف "زائدة". يمكنك في الواقع إزالة جزء كبير من النص، وسيظل المتحدث الأصلي قادراً على تخمين الأجزاء المفقودة بدقة.

3. مشكلة "الغش"

كان على الباحثين أن يكونوا حذرين. بما أن هذه كانت لعبة عبر الإنترنت، فقد يكون بعض الأشخاص قد قاموا بـ:

  • البحث عن الجملة الكاملة عبر الإنترنت.
  • التخمين عشوائياً وحالفهم الحظ.
  • فقدوا الاهتمام وتوقفوا عن اللعب في منتصف الطريق.

ولحل هذه المشكلة، تصرفوا كحكام صارمين. استبعدوا نتائج الأشخاص الذين لعبوا بشكل سيء (الذين ربما لم يكونوا يحاولون حقاً) والأشخاص الذين لعبوا بشكل مثالي للغاية (الذين ربما غشوا). وحتى بعد كونهم صارمين للغاية واستبعاد الكثير من البيانات، ظلت النتيجة حول 1.20.

4. مقارنة الذكاء الاصطناي: البشر مقابل الروبوتات

طلب الباحثون أيضاً من نماذج الذكاء الاصطناعي الحديثة (نماذج اللغات الكبيرة) لعب نفس اللعبة.

  • ميزة الذكاء الاصطناعي: كانت نماذج الذكاء الاصطناعي أفضل بكثير من البشر. استطاعت بعض أفضل نماذج الذكاء الاصطناعي تخمين الحرف التالي بنتيجة تقارب 0.7.
  • العائق: يحذر الباحثون من أن الذكاء الاصطناعي قد يكون "يغش" بطريقة مختلفة. نظرًا لأن الذكاء الاصطناعي تم تدريبه على كميات هائلة من البيانات الإخبارية (مشابهة للجمل المستخدمة في اللعبة)، فقد يكون قد حفظ الجمل المحددة بدلاً من فهم اللغة حقاً. الأمر يشبه طالباً حفظ نموذج الإجابة بدلاً من تعلم الرياضيات.
  • الاستنتاج: الذكاء الاصطناعي جيد جداً، ولكن بما أنه قريب جداً من النتيجة "المثالية"، فمن الصرّف تحديد ما إذا كان يفهم الأوكرانية حقاً أم أنه مجرد "فرط ملاءمة" (overfitting) للمقالات الإخبارية المحددة المستخدمة.

الخلاصة الكبرى

هذه الورقة البحثية هي المرة الأولى التي نحصل فيها على رقم صلب حول مدى قابلية توقع اللغة الأوكرانية.

  • اللغة الأوكرانية ليست فوضوية. فهي منظمة للغاية وقابلة للتوقع، تماماً مثل الإنجليزية.
  • البشر جيدون في ذلك. يمكن للناس العاديين تخمين الحرف التالي في حوالي 1.2 محاولة.
  • الذكاء الاصطناعي أفضل، لكنه ربما يكون جيداً أكثر من اللازم. يمكن لنماذج الذكاء الاصطناعي التخمين بشكل أسرع، ولكن علينا أن نكون حذرين من الخلط بين "الحفظ" و"الذكاء".

يعترف الباحثون بأن دراستهم لم تكن مثالية (لم يكن لديهم عدد كافٍ من اللاعبين، وكانت جميع الجمل من مقالات إخبارية)، لكنها تعطينا نقطة انطلاق أفضل بكثير مما كان لدينا من قبل. كما أنهم شاركوا الكود والبيانات الخاصة بهم حتى يتمكن الآخرون من محاولة تحسين اللعبة في المستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →