← أحدث الأبحاث
💬 NLP

Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation

تُظهر هذه الدراسة أن السجل اللغوي لبيانات ما قبل التدريب يؤثر بشكل كبير على أداء النماذج اللغوية الكبيرة، كاشفةً أنه في حين تُعد النصوص الإخبارية غير مثالية، فإن دمج سجلات الرأي، والتعليمات الإرشادية، والوصف المعلوماتي يؤدي إلى تحسينات جوهرية في قدرات النموذج.

المؤلفون الأصليون: Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

نُشر 2026-05-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طفل صغير كيف يتحدث ويفهم العالم. لديك مكتبة ضخمة من الكتب، ولكن بدلاً من مجرد تسليمه كومة عشوائية، قررت فرز الكتب حسب النوع الأدبي (Genre): بعضها كتب وصفات، وبعضها تقارير إخبارية، وبعضها كلمات أغاني، وبعضها تدوينات رأي، وبعضها كتب مدرسية علمية.

هذه الورقة البحثية تطرح سؤالاً بسيطاً ولكنه عميق: هل يهم أي الكتب تستخدم لتعليم الطفل؟

يفترض معظم من يبنون الذكاء الاصطناعي (نماذج اللغات الكبيرة) أن "المزيد من البيانات هو الأفضل"، وأنه إذا قمت فقط بتصفية "الأشياء السيئة" (مثل الرسائل المزعجة أو خطاب الكراهية)، فإن الباقي سيكون جيداً بالتساوي. تقول هذه الدراسة: لا، "نكهة" النص تفرق كثيراً.

إليك تفصيل لنتائجهم باستخدام تشبيهات من الحياة اليومية:

1. تجربة "النوع الواحد"

قام الباحثون ببناء عدة نماذج ذكاء اصطنا-صغيرة. تم تغذية كل نموذج بنوع واحد فقط من النصوص (سجل لغوي واحد) طوال فترة تدريبه.

  • نموذج "الوصفات": تدرب فقط على تعليمات "كيفية القيام بـ..." (How-to).
  • نموذج "الأخبار": تدرب فقط على المقالات الإخبارية.
  • نموذج "الكلمات": تدرب فقط على كلمات الأغاني.
  • نموذج "الرأي": تدرب فقط على المراجعات والتدوينات.

المفاجأة:

  • نموذج "الأخبار" كان مخيباً للآمال. قد تعتقد أن قراءة الأخبار تجعل المرء ذكياً، لكن النموذج الذي تدرب فقط على الأخبار كان أداؤه ضعيفاً للغاية. كان الأمر أشبه بطالب يقرأ فقط العناوين اليومية لكنه لا يتعلم أبمة كيفية حل المشكلات أو فهم المفاهيم العميقة.
  • نموذج "الرأي" كان نجماً. كانت هذه أكبر صدمة. النصوص المليئة بالآراء والمراجعات والحجج (مثل مراجعات "Yelp" أو المدونات السياسية) جعلت النموذج يؤدي بشكل رائع للغاية. يبدو أن تعلم الجدال والإقناع والتعبير عن وجهة نظر هو "قوة خارقة سرية" للذكاء الاصطناعي.
  • نموذج "الكلمات" عانى. بما أن الاختبارات التي استخدموها كانت تتعلق بالمنطق والحقائق، فإن النموذج الذي تدرب فقط على الشعر والأغاني لم يعرف كيفية الإجابة على تلك الأسئلة. (يشير المؤلفون إلى أن هذا لا يعني أن الشعر عديم الفائدة، بل فقط أنه لم يساعد في هذه الاختبارات المحددة).

2. اختراق "الخلط والمطابقة"

حاول الباحثون بعد ذلك خلط أفضل الأنواع معاً. لم يقوموا بمجرد رميها في خلاط؛ بل اختاروا الفائزين بعناية.

  • الوصفة الرابحة: وجدوا أن دمج تعليمات "كيفية القيام بـ..."، والأوصاف المعلوماتية (مثل ويكيبيديا)، والآراء خلق نموذجاً كان أذكى من النموذج الذي تدرب على الإنترنت بأك-مله الفوضوي.
  • فخ "الأخبار" و"الدردشة": عندما أضافوا "الأخبار" أو "النقاش التفاعلي" (مثل محادثات المنتديات) إلى المزيج، أصبح النموذج في الواقع أغبى في هذه الاختبارات. كان الأمر أشبه بإضافة الكثير من الماء إلى الحساء؛ لقد خففت من النكهة التي كانت تعمل بشكل جيد.

3. القوى الخارقة المتخصصة

أظهرت الدراسة أيضاً أن الأنواع المختلفة تعلم الذكاء الاصطناعي "عضلات" مختلفة:

  • تعليمات "كيفية القيام بـ..." جعلت الذكاء الاصطناعي بارعاً في الاستنتاج الفيزيائي (مثلاً: "إذا أسقطت كأساً، هل سينكسر؟") ولكنه سيء في المعلومات العامة.
  • السرد/رواية القصص جعلت الذكاء الاصطناعي أفضل في فهم المواقف الاجتماعية ولكنه أسوأ في الإجابة على الأسئلة العلمية.
  • الآراء عززت قدرة الذكاء الاصطناعي على فهم المنطق السليم والتفاعلات الاجتماعية.

الخلاصة الكبرى

يخلص المؤلفون إلى أن السجل اللغوي (Register) يهم دائماً.

فكر في بيانات التدريب المسبق كأنها نظام غذائي. لا يمكنك مجرد تناول "طعام" بشكل عام؛ أنت بحاجة إلى مزيج محدد من العناصر الغذائية.

  • إذا كنت تأكل "الأخبار" فقط، فسيصبح ذكاؤك الاصطناعي مملاً وغير مبدع.
  • إذا كنت تأكل "الكلمات" فقط، فسيكون ذكاؤك الاصطناعي شاعرياً ولكنه لا يستطيع حل الرياضيات.
  • إذا خلطت بين التعليمات (كيف تعمل الأشياء)، والأوصاف (ما هي الأشياء)، والآراء (كيف يشعر الناس تجاه الأشياء)، فستحصل على ذكاء اصطناعي متكامل وعالي الأداء.

ماذا يعني هذا للمستقبل (وفقاً للورقة البحثية):
بدلاً من مجرد محاولة جمع مزيد من البيانات من الإنترنت، يجب أن نكون أكثر حذراً بشأن نوع البيانات التي نختارها. من خلال فهم "نوع" النص، يمكننا بناء نماذج ذكاء اصطناعي أفضل مع هدر أقل، بدلاً من مجرد الأمل في أن كومة أكبر من النصوص العشوائية ستؤدي في النهاية إلى نتيجة جيدة.

ملاحظة: يؤكد المؤلفون أن هذه الدراسة أجريت على نماذج صغيرة لاختبار هذه النظريات. لم يختبروا هذه النماذج في تقديم نصائح طبية أو قانونية في العالم الحقيقي، أو غيرها من التطبيقات عالية الخطورة، لذا لا نعرف كيف يمكن لهذه "الأنظمة الغذائية" المحددة أن تؤدي في تلك السيناريوهات المعقدة والواقعية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →