← أحدث الأبحاث
🤖 machine learning

Length Generalization Bounds for Transformers

تحل هذه الورقة البحثية المشكلة المفتوحة المتعلقة بحدود تعميم الطول القابلة للحوسبة لنماذج المحولات (transformers) من خلال إثبات أن مثل هذه الحدود غير قابلة للحوسبة لنموذج CRASP (وبالتالي للمحولات العامة) باستخدام طبقتين فقط، مع وضع حدود أسية مثالية للجزء الإيجابي من نموذج CRASP والمحولات ذات الدقة الثابتة.

المؤلفون الأصليون: Andy Yang, Pascal Bergsträßer, Georg Zetzsche, David Chiang, Anthony W. Lin

نُشر 2026-03-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Andy Yang, Pascal Bergsträßer, Georg Zetzsche, David Chiang, Anthony W. Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

السؤال الكبير: هل يمكن للذكاء الاصطناعي أن "يتعلم السباحة" في المياه العميقة؟

تخيل أنك تعلم طفلاً السباحة. تبدأ به في مسبح صغير للأطفال (جمل قصيرة). يتعلم الطفو والركل بشكل مثالي. السؤال الكبير هو: إذا أخذته إلى الجزء العميق من المحيط (جمل طويلة ومعقدة)، هل سيظل يعرف كيف يسبح؟

في عالم الذكاء الاصطناعي (وتحديداً نماذج "الترانسفورمرز" - Transformers، وهي العقول الكامنة وراء نماذج مثل ChatGPT)، يُسمى هذا "تعميم الطول" (Length Generalization). هل يمكن لنموذج تدرب على قصص قصيرة أن يفهم رواية؟

لفترة طويلة، أمل الباحثون في وجود قاعدة بسيطة (أو "معادلة") يمكن أن تخبرنا بالضبط مقدار بيانات التدريب التي نحتاجها لضمان عمل الذكاء الاصطناعي على أي طول. إذا دربت النموذج على 100 كلمة، فهل سيعمل على 1,000؟ أم على مليون؟

هذه الورقة البحثية تقول: "لا. لا توجد مثل هذه المعادلة".


الاكتشاف الرئيسي: جدار "غير قابل للحوسبة"

نظر المؤلفون في نوع معين من منطق الذكاء الاصطناعي (يسمى C-RASP) والذي يعمل بمثابة مخطط لكيفية تفكير نماذج "الترانسفورمرز". وسألوا: هل هناك حد رياضي يمكننا حسابه يضمن أن الذكاء الاصطناعي لن يفشل أبداً، بغض النظر عن مدى طول المدخلات؟

الإجابة: لا. من المستحيل رياضياً حساب هذا الحد.

التشبيه: المتاهة اللانهائية
تخيل أنك تحاول العثور على مخرج محدد في متاهة.

  • الخبر الجيد: إذا كانت المتاهة صغيرة (منطق بسيط)، يمكنك بسهولة رسم خريطة وقول: "إذا مشيت 50 خطوة، ستجد المخرج بالتأكيد".
  • الخبر السيئ: أثبت المؤلفون أنه بالنسبة لنماذج "الترانسفورمرز" المعقدة، فإن المتاهة تشبه قاعة المرايا التي تزداد اتساعاً كلما نظرت إليها أكثر.
    • لكي تتأكد بنسبة 100% أن الذكاء الاصطناعي يفهم جملة ما، قد تحتاج إلى إظهار جملة أطول من عدد الذرات في الكون.
    • والأسوأ من ذلك، لا توجد خوارزمية (أي برنامج كمبيوتر) يمكنها إخبارك كم يجب أن يكون طول تلك الجملة. الأمر يشبه مطالبة آلة حاسبة بحل مسألة رياضية ليس لها حل.

لماذا يهم هذا؟
هذا يعني أنه حتى لو كان لديك ذكاء اصطناعي مثالي، فلا يوجد "رقم سحري" لعدد أمثلة التدريب التي تضمن عمله على المدخلات الطويلة. أحياناً، مهما دربت النموذج، قد يفشل ببساطة عندما تصبح القصة طويلة جداً.


الجانب المشرق: نماذج "الترانسفورمرز" البسيطة

الورقة البحثية ليست سيئة تماماً. فقد وجد المؤلفون نسخة أبسط من هذه النماذج (تسمى نماذج الترانسفورمرز ذات الدقة الثابتة - Fixed-Precision Transformers) حيث يمكننا إيجاد حد لها.

التشبيه: المسطرة مقابل شريط القياس

  • نماذج "الترانسفورمرز" القياسية تشبه شريط قياس سحري يمكنه التمدد إلى ما لا نهاية، لكنه مصنوع من مادة قد تنقطع بشكل غير متوقع. لا يمكنك التنبؤ متى سينقطع.
  • نماذج "الترانسفورمرز" ذات الدقة الثابتة تشبه مسطرة صلبة. لها حد في طول ما يمكنها قياسه، لكنك تعرف بالضبط أين يقع هذا الحد.

بالنسبة لهذه النماذج الأبسط، وجد المؤلفون الحد.

  • الحد: لتعلم قاعدة ما، تحتاج إلى رؤية أمثلة طويلة بشكل أسي (Exponentially long).
  • ماذا يعني "أسي"؟ تخيل أنك بحاجة لرؤية جملة مكونة من 10 كلمات لتعلم قاعدة ما. للمستوى التالي، قد تحتاج إلى 100 كلمة. ثم 1,000. ثم مليون.
  • العقبة: بينما يمكننا حساب هذا الحد، إلا أن الرقم يصبح ضخماً جداً بسرعة كبيرة لدرجة أنه من المستحيل عملياً تدريب الذكاء الاصطناعي على بيانات بهذا الطول. الأمر يشبه قول: "لتعلم هذا، عليك قراءة كل كتاب في المكتبة، بالإضافة إلى كل كتاب سيُكتب في المستقبل".

لماذا تعاني نماذج "الترانسفورمرز" مع النصوص الطويلة؟

تقدم الورقة تفسيراً رائعاً لسبب فشل نماذج الذكاء الاصطناعي في العالم الحقيقي غالباً في المهام الطويلة (مثل تلخيص كتاب من 100 صفحة).

مشكلة "الإبرة في كومة القش"
يشير المؤلفون إلى أن المشكلة ليست في أن الذكاء الاصطناعي "غبي". بل إن الذكاء الاصطناعي يحتاج لرؤية "إبرة" (نمط محدد) في "كومة قش" (سلسلة طويلة من النصوص) لتعلم القاعدة.

  • إذا كانت كومة القش كبيرة جداً، فقد لا يرى الذكاء الاصطناعي "الإبرة" أبداً أثناء التدريب.
  • ولأن "منطقة الأمان" للتعلم واسعة جداً (بشكل أسي)، فإن الذكاء الاصطناعي يقوم فعلياً بالتخمين في الظلام عندما يواجه مدخلات طويلة لم يسبق له رؤيتها من قبل.

"منطقة غولديلوكس" (المنطقة المثالية)
هذا يفسر لماذا يعمل الذكاء الاصطناعي بشكل رائع أحياناً في النصوص القصيرة، وبشكل جيد في النصوص المتوسطة، ويفشل في النصوص الطويلة. هذا ليس خطأً برمجياً (Bug)؛ بل هو قيد رياضي أساسي. الذكاء الاصطناعي لم يرَ أمثلة "طويلة" كافية ليتأكد من أن القواعد لا تزال سارية.


الملخص: الخلاصة

  1. لا يوجد حل سحري: لا توجد معادلة بسيطة لتخبرنا مقدار البيانات الكافية لجعل الذكاء الاصطناعي يعمل على أي طول من النصوص. بالنسبة للنماذج المعقدة، هذا الحد "غير قابل للحوسبة" رياضياً.
  2. تكلفة الأمان: بالنسبة للنماذج الأبسط والأكثر قابلية للتنبؤ، يمكننا حساب الحد، لكن ذلك يتطلب التدريب على بيانات ضخمة جداً (كبيرة بشكل أسي) لدرجة تجعل تحقيق ذلك مستحيلاً من الناحية العملية.
  3. التأثير في العالم الحقيقي: يوضح هذا سبب حساسية نماذج الذكاء الاصطناعي لكيفية تدريبها. التغييرات الصغيرة في الإعدادات (مثل سرعة التعلم أو كيفية عد الكلمات) يمكن أن تصنع الفارق بين ذكاء اصطناعي يفهم رواية، وآخر يضيع بعد الفقرة الأولى.

باختصار: لا يمكننا الوعد بأن ذكاءً اصطناعياً تدرب على قصص قصيرة سيفهم تلقائياً رواية. الرياضيات تقول إن "شبكة الأمان" إما غير موجودة أو أنها ضخمة جداً لدرجة أنها لا وجود لها في الواقع العملي. يجب أن نكون حذرين جداً عندما نطلب من الذكاء الاصطناعي التعامل مع مهام طويلة ومعقدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →