← أحدث الأبحاث
💬 NLP

Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled

تُظهر هذه الدراسة أنه عند التحكم في التوسع في الأبعاد باستخدام نماذج لغوية كبيرة غير مدربة، تظهر القدرة التنبؤية لمتجهات النماذج اللغوية الكبيرة المدربة لوقت القراءة البشري وبيانات التصوير بالرنين المغناطيسي الوظيفي (fMRI) تدرجاً عكسياً، مع تضاؤل القيمة المضافة للتدريب لتصل إلى الصفر عند بضعة مليارات فقط من المعلمات.

المؤلفون الأصليون: Yi-Chien Lin, Hongao Zhu, William Schuler

نُشر 2026-09-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yi-Chien Lin, Hongao Zhu, William Schuler

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

على مدى عقود، راقب العلماء الحواسيب وهي تتعلم القراءة والكتابة بسرعة تبدو شبه بيولوجية. هذه الآلات، المعروفة باسم نماذج اللغات الكبيرة، يتم تدريبها على مكتبات هائلة من النصوص البشرية حتى تتمكن من التنبؤ بالكلمة التالية في الجملة بدقة مذهلة. ولأنها تتعامل مع اللغة بشكل جيد، بدأ الباحثون يتساءلون عما إذا كانت هذه الآلات لا تحاكينا فحسب، بل تعكس حقاً الطريقة التي تعالج بها أدمغتنا اللغة. كان الأمل السائد هو أنه كلما زادت هذه النماذج حجماً وتعقيداً، ستصبح أفضل وأفضل في التنبؤ بالوقت الذي يستغرقه الإنسان لقراءة كلمة ما، أو كيف تضيء أدمغتنا عندما نستمع إلى قصة. اقترح هذا الفكرة أن بنية هذه العقول الرقمية قد تكون خريطة لبنية الفكر البشري، مما يعني أن أي فشل في مطابقة البيانات البشرية كان مجرد مسألة تتعلق بالحاجة إلى المزيد من قوة الحوسبة.

ومع ذلك، فإن دراسة جديدة من باحثين في جامعة ولاية أوهايو وجامعة كاليفورنيا في سان دييغو، تتحدى هذه الرؤية المتفائلة. فقد وجدوا أنه عندما تحكموا بدقة في حجم البيانات الهائل الذي أنتجته هذه النماذج، تغيرت العلاقة بين حجم النموذج والأداء الشبيه بالبشر بطريقة محددة: لقد اختفت الفائدة الإضافية للتدريب. فبدلاً من أن تجعل عملية التدريب النماذج الأكبر أفضل بكثير من نظيراتها غير المدربة، لم تؤدِ النماذج الأكبر حجماً أي أفضل من النسخ غير المدربة من نفس الحجم. تشير الدراسة إلى أن النجاح الظاهري لهذه الأنظمة الضخمة كان في الغالب وهماً ناتجاً عن الحجم الهائل للمعلومات التي يمكنها الوصول إليها، بدلاً من كونه فهماً حقيقياً للغة. عندما جرد الباحثون هذه الميزة، بدا أن التدريب الذي جعل هذه النماذج قوية جداً لا يقدم أي فائدة إضافية فوق نسخة غير مدربة تماماً من نفس الآلة.

لفهم كيف توصلوا إلى هذا الاستنتاج، يجب على المرء أولاً أن ينظر إلى كيفية اختبار هذه النماذج عادةً. غالباً ما يغذي الباحثون قصة في نموذج لغوي ويقارنون الحالة الداخلية للنموذج ببيانات بشرية، مثل مدة توقف الشخص عند كلمة معينة أو استجابة دماغه لجملة ما. في الدراسات السابقة، بدا أن النماذج الأكبر، التي تمتلك المزيد من المتغيرات الداخلية للعمل بها، تتنبأ بالسلوك البشري بشكل ثابت. وقد أدى ذلك إلى نظرية تسمى فرضية "الجودة-القوة": كلما كبر النموذج، زاد تشابهه مع العقل البشري. لكن الباحثين اشتبهوا في وجود خلل خفي في هذا المنطق. فعندما يكبر النموذج، فإنه لا يصبح أذكى فحسب؛ بل ينتج أيضاً عدداً أكبر بكثير من الإشارات الداخلية، أو المتجهات، للتحليل. الأمر يشبه إعطاء طالب اختباراً يحتوي على ضعف عدد الأسئلة؛ فحتى لو لم يكن الطالب يعرف شيئاً، فإن امتلاك المزيد من الأسئلة يمنحه فرصاً أكثر لتخمين الإجابة الصحيحة عن طريق الحظ. أدرك الباحثون أن الدراسات السابقة ربما كانت تقيس فائدة امتلاك المزيد من الأسئلة، بدلاً من فائدة امتلاك دماغ أفضل.

ولحل هذا اللغز، صمم الفريق سلسلة من التجارب التي فصلت تأثير الحجم عن تأثير الذكاء. جمعوا بيانات من خمس عائلات مختلفة من النماذج اللغوية، تتراوح من الصغيرة التي تحتوي على بضع مئات الملايين من المعلمات إلى الضخمة التي تحتوي على 66 مليار معلمة. واختبروا هذه النماذج مقابل بيانات بشرية حقيقية، بما في ذلك أوقات القراءة لأشخاص يقرؤون قصصاً طبيعية وفحوصات الدماغ لأشخاص يستمعون إلى تلك القصص نفسها. في تجربتهم الأولى، كرروا النتائج السابقة: مع زيادة حجم النماذج، بدا أن تنبؤاتها بالسلوك البشري تتحسن بالفعل. أكد هذا أن تأثير "الجودة-القوة" كان مرئياً على السطح.

ولكن بعد ذلك، أدخلوا ضابطاً حاسماً. أخذوا نفس النماذج ونظروا إليها قبل تدريبها على أي نص على الإطلاق. هذه النماذج غير المدربة لها نفس الحجم والبنية التي تمتلكها النماذج المدربة، لكنها في الأساس عبارة عن ضوضاء عشوائية، بلا معرفة باللغة. ومن خلال مقارنة النماذج المدربة بنظيراتها غير المدربة، استطاع الباحثون رؤية مقدار التحسن الناتج عن التعلم الفعلي ومقدار ما جاء ببساطة من امتلاك عدد أكبر من الإشارات الداخلية للعمل بها. استخدموا طريقة تشبه "الخزان"، حيث يعمل شبكة غير مدربة كبيرة كمصدر للمواد الخام التي يمكن تشكيلها بواسطة مصنف بسيط. إذا كان التدريب يجعل النموذج حقاً أكثر شبهاً بالبشر، فيجب أن يتفوق الإصدار المدرب بشكل كبير على الإصدار غير المدرب، خاصة مع نمو النماذج.

كانت النتائج مفاجئة. عندما تحكم الباحثون في حجم الإشارات الداخلية، اختفت الميزة الإضافية للتدريب. في الواقع، بالنسبة للنماذج التي تزيد عن بضعة مليارات من المعلمات، لم يكن أداء النسخ المدربة أفضل من النسخ غير المدربة. وفي عدة مجموعات بيانات، انخفضت الفائدة الإضافية للتدريب إلى الصفر. وهذا يعني أن التحسينات الهائلة التي شوهدت في الدراسات السابقة لم تكن بسبب تعلم النماذج الأكبر فهماً أعمق للغة، بل ببساطة لأنها كانت تمتلك المزيد من الأبعاد الداخلية لتناسب البيانات. وجد الباحثون أنه مع نمو النماذج لما وراء نقطة معينة، فإن مساهمة التدريب في ملاءمة النموذج للبيانات مقارنة بالأساس غير المدرب انخفضت إلى الصفر، بدلاً من أن تزداد. كلما كبر النموذج، قلّت القوة التنبؤية التي يضيفها التدريب فوق القوة التي يوفرها حجم النموذج وحده.

كما بحثت الدراسة في الطبقات المختلفة داخل النماذج، للتحقق مما إذا كانت الأقسام الوسطى من الشبكة، والتي اقترح بعض العمل السابق أنها أكثر أهمية، تسلك سلوكاً مختلفاً. ووجدوا نفس النمط: انخفضت مساهمة التدريب إلى الصفر عبر جميع الطبقات مع نمو النماذج. وحتى عندما عدلوا أساليبهم الإحصائية لمراعاة احتمال أن النماذج كانت تصل ببساطة إلى حد أقصى في قدرتها على التنبؤ بالبيانات البشرية، ظل الاتجاه ثابتاً. خلص الباحثون إلى أن نجاح هذه النماذج الكبيرة في التنبؤ بالسلوك البشري يعود إلى حد كبير إلى تأثير إحصائي حيث يسمح امتلاك المزيد من المتغيرات بتحقيق ملاءمة أفضل، بدلاً من كونه انعكاساً حقيقياً للإدراك البشري.

تشير هذه النتيجة إلى عدم توافق كبير بين الطريقة التي تُبنى بها هذه الأنظمة الاصطناعية والطريقة التي تعمل بها الأدمغة البشرية. إن عملية التدريب التي تجعل هذه النماذج جيدة جداً في توليد النصوص لا تجعلها بالضرورة نماذج أفضل للقراءة البشرية أو لنشاط الدماغ. في الواقع، تجادل الدراسة بأن النسخ غير المدربة من هذه الشبكات الضخمة، والتي تعمل كخزانات معقدة من الروابط العشوائية، قد تكون فعالة تماماً مثل النسخ المدربة والمكلفة في التنبؤ بالبيانات البشرية. يقترح الباحثون أن الدراسات المستقبللية يجب أن تستخدم هذه النماذج غير المدربة كمعيار أساسي لضمان أن أي تحسينات تُنسب إلى التدريب هي حقيقية وليست مجرد نتاج لحجم النموذج. وبينما دفع مفهوم "الأكبر هو الأفضل" المجال للأمام لسنوات، فإن هذا العمل يشير إلى أنه في مجال معالجة اللغة البشرية، هناك نقطة لا يؤدي عندها إضافة المزيد من الحجم والتدريب إلى تقريبنا من فهم العقل البشري، بل يأخذنا بدلاً من ذلك بعيداً عنه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →