← أحدث الأبحاث
🤖 machine learning

LT2: Linear-Time Looped Transformers

تقدم هذه الورقة البحثية LT2، وهي عائلة من المحولات الحلقية ذات الزمن الخطي التي تستبدل الانتباه التربيعي بمتغيرات خطية أو متفرقة فعالة، مما يثبت أن التكرار الحلقي يتآزر مع هذه الآليات لتحقيق أداء وقابلية توسع فائقين في مهام نمذجة اللغة.

المؤلفون الأصليون: Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة عبقرياً ولكنه بطيء (نموذج الذكاء الاصطناعي) يحتاج إلى قراءة كتاب طويل جداً للإجابة على سؤال ما.

الطريقة القديمة: أمين المكتبة "الحلقي" (The Looped Librarian)
تقليدياً، لكي يصبح أمين المكتبة أكثر ذكاءً، كنا نجعله يقرأ الكتاب عدة مرات. هذا ما يسمى بـ المحول الحلقي (Looped Transformer). فبدلاً من توظيف المزيد من أمناء المكتبة (وهو أمر يكلف الكثير من المال/المعلمات)، كنا ببساطة نطلب من نفس أمين المكتبة قراءة الكتاب مرة أخرى، ثم مرة أخرى، ليصقل فهمه مع كل جولة.

  • المشكلة: كان أمين المكتبة يستخدم طريقة بطيئة جداً للتذكر فيما قرأه. في كل مرة يقلب فيها صفحة، كان عليه إعادة قراءة الكتاب بأكمله من البداية ليجد كلمة محددة. وإذا كان الكتاب طويلاً، كان ذلك يستغرق وقتاً طويلاً جداً. تطلق الورقة البحثية على هذا اسم "التعقيد التربيعي" (quadratic complexity). الأمر يشبه محاولة العثور على إبرة في كومة قش عن طريق فحص كل قطعة قش، مراراً وتكراراً، في كل مرة تخطو فيها خطوة.

الحل الجديد: LT2 (المحولات الحلقية ذات الوقت الخطي - Linear-Time Looped Transformers)
قدم المؤلفون LT2. لقد حافظوا على فكرة جعل أمين المكتبة يقرأ الكتاب عدة مرات (الحلقات)، لكنهم منحوه خدعة ذاكرة جديدة وسريعة للغاية.

استبدلوا طريقة "فحص كل شيء" البطيئة بطريقتين أسرع للتذكر:

  1. الانتباه الخطي (Linear Attention): بدلاً من إعادة قراءة الكتاب بأكمله، يحتفظ أمين المكتبة بمذكرة ملخص مستمرة. ومع قراءته لصفحة جديدة، يقوم فقط بتحديث المذكرة. هذه الطريقة سريعة بغض النظر عن طول الكتاب.
  2. الانتباه المتفرق (Sparse Attention): يكتفي أمين المكتبة بالنظر إلى الصفحات القليلة الأخيرة التي قرأها فقط، متجاهلاً بقية الكتاب في تلك اللحظة تحديداً.

التآزر السحري: لماذا تجعل "الحلقات" هذه الطرق السريعة أفضل؟
هذا هو الجزء الذكي الذي اكتشفته الورقة البحثية. عادةً، يكون لهذه الطرق السريعة نقاط ضعف.

  • الانتباه الخطي سريع ولكنه قد ينسى التفاصيل أحياناً.
  • الانتباه المتفرق سريع ولكنه لا يستطيع رؤية الأشياء البعيدة في الكتاب.

ولكن عندما تقوم بـ "الحلقات" (Looping) (أي تجعل أمين المكتبة يقرأ الكتاب عدة مرات)، تختفي نقاط الضعف هذه:

  • بالنسبة للانتباه الخطي: في كل مرة يعود فيها أمين المكتبة في حلقة جديدة، يحصل على فرصة لـ صقل ملاحظته الملخصة. الأمر يشبه قراءة مسودة، ثم قراءتها مرة أخرى لتصحيح القواعد، ثم مرة أخرى لتصحيح الحبكة. "الحلقة" تحول الملاحظة البسيطة إلى فهم عميق ومفصل.
  • بالنسبة للانتباه المتفرق: إذا كان أمين المكتبة ينظر فقط إلى آخر 10 صفحات، فلن يتمكن من رؤية البداية. ولكن إذا قام بـ 4 حلقات، فإنه يرى فعلياً 40 صفحة! "الحلقة" تمد نطاق رؤيته، مما يسمح له برؤية الكتاب بأكمله دون أن يبطئ.

أفضل ما في العالمين: النهج الهجين (The Hybrid Approach)
حاولت الورقة أيضاً دمج هذه الطرق. تخيل فريقاً من أمناء المكتبة حيث:

  • البعض يستخدم طريقة "مذكرة الملخص" السريعة.
  • والبعض الآخر يستخدم طريقة "النظر فقط في الصفحات القليلة الأخيرة".
  • وبعض الأمناء المميزين يستخدمون الطريقة القديمة والبطيئة "لفحص كل شيء" للأجزاء الأكثر أهمية فقط.

وجدوا أن الفريق الهجين هو الأفضل. فمن خلال وجود عدد صغير من الأمناء "البطيئين والدقيقين" ممزوجين مع الأمناء "السريعين"، حصلوا على سرعة الطرق السريعة ولكن بدقة الطرق البطيئة.

النتائج: أسرع، أذكى، وأرخص
اختبرت الورقة هذا النموذج على مهام متنوعة:

  • السرعة: كانت نماذجهم الجديدة قادرة على قراءة ومعالجة النصوص بشكل أسرع بكثير من النماذج الحلقية القديمة، خاصة للنصوص الطويلة. لم تتعطل أو تنفد ذاكرتها عندما أصبح الكتاب ضخماً.
  • الجودة: كانت جودتهم مساوية (أو حتى أفضل) في الإجابة على الأسئلة، وحل المسائل الرياضية، وتذكر الحقائق مقارنة بالنماذج الأبطأ القديمة.
  • الكفاءة: حققوا أداء نماذج ضخمة ومكلفة تبلغ 4 مليارات معلمة باستخدام نموذج صغير جداً يبلغ 1.4 مليار معلمة فقط، ولكنهم فعلوا ذلك بسرعة أكبر بكثير.

تجربة "أورو" (The "Ouro" Experiment)
أخيراً، أظهروا لك أنك لست بحاجة لبناء أمين مكتبة جديد من الصفر. يمكنك أخذ أمين مكتبة ذكي وبطيء (نموذج مدرب مسبقاً) و"تعليمه" خدع الذاكرة السريعة الجديدة هذه. هذا النموذج الذي تم تحويله تفوق في أدائه على النماذج الصغيرة الأخرى القياسية في الصناعة، مما يثبت أنه يمكنك ترقية الأنظمة القديمة لتصبح سريعة كالبرق دون فقدان ذكائها.

باختصار
تقول الورقة: "لقد وجدنا طريقة لجعل نماذج الذكاء الاصطناعي تقرأ الأشياء عدة مرات (لتصبح أكثر ذكاءً) دون أن تتعثر ببطء فحص كل شيء في كل مرة. من خلال استخدام خدع ذاكرة أسرع ودمجها مع الحلقات، نحصل على نماذج ذكية للغاية وسريعة للغاية في آن واحد".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →