← أحدث الأبحاث
💬 NLP

Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts

يُعد OOMB نظام تدريب عالي الكفاءة في استهلاك الذاكرة للنماذج اللغوية الكبيرة ذات السياق الطويل، حيث يستخدم إطار عمل تكراري قائم على الأجزاء (chunk-recurrent framework) مع إعادة حساب التنشيط آنياً وتحسينات تآزرية لذاكرة التخزين المؤقت لـ KV، مما يمكّن من تدريب نماذج مثل Qwen2.5-7B بسياقات تصل إلى مليون توكن على وحدة معالجة رسوميات واحدة.

المؤلفون الأصليون: Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao

نُشر 2026-03-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول قراءة كتاب مكون من 4 ملايين صفحة (أي ما يعادل حوالي 400 نسخة من رواية "الحرب والسلم" موضوعة فوق بعضها البعض). تريد تدريب ذكاء اصطناعي فائق الذكاء لفهم القصة بأكملها دفعة واحدة.

المشكلة؟ عقلك (ذاكرة وحدة معالجة الرسومات GPU الخاصة بالكمبيوتر) أصغر من أن يستوعب الكتاب بأكمله مفتوحاً في نفس الوقت. عادةً، لقراءة كتاب طويل، ستحتاج إلى مكتبة ضخمة تضم مئات المساعدين (جهاز كمبيوتر عملاق/Cluster) ليحملوا لك صفحات مختلفة.

يقدم هذا البحث نظاماً جديداً يسمى OOMB (تجاوز حاجز الذاكرة - Out Of the Memory Barrier). إنه يشبه خدعة سحرية تسمح لشخص واحد بقراءة كتاب الـ 4 ملايين صفحة هذا باستخدام مكتب صغير فقط، دون الحاجة إلى مكتبة.

إليك كيف يعمل OOMB، باستخدام تشبيهات بسيطة:

1. الطريقة القديمة: مشكلة "كومة الأوراق"

عادةً، عندما يقرأ الذكاء الاصطناعي نصاً طويلاً، فإنه يحاول الاحتفاظ بـ "ملاحظة لاصقة" لكل كلمة قرأها حتى الآن.

  • التشبيه: تخيل أنك تقرأ كتاباً وتكتب ملاحظة لاصقة لكل جملة تقرأها. إذا كان الكتاب بطول 4 ملايين صفحة، سينتهي بك الأمر بمجموعة من الملاحظات اللاصقة مرتفعة جداً لدرجة أنها تسحق مكتبك. ستنفد ذاكرة الكمبيوتر (RAM) وتتعطل قبل أن تنهي حتى الفصل الأول.

2. حل OOMB: استراتيجية "سلة إعادة التدوير"

يغير OOMB القواعد. فبدلاً من الاحتفاظ بكل ملاحظة لاصقة للأبد، فإنه يستخدم نهج "التقطيع المتكرر" (Chunk-Recurrent).

  • التشبيه: تخيل أنك تقرأ الكتاب في فصول صغيرة (قطع):
    1. تقرأ فصلاً واحداً.
    2. تكتب "خلاصة" القصة حتى تلك اللحظة (ما يسمى بـ Key-Value Cache).
    3. ترمي جميع الملاحظات اللاصقة الخاصة بهذا الفصل فوراً.
    4. إذا احتجت لتذكر تفصيل من ذلك الفصل لاحقاً لحل مسألة رياضية (عملية الـ backward pass أثناء التدريب)، فإنك تعيد قراءة ذلك الفصل تحديداً من الكتاب فوراً لإعادة إنشاء الملاحظات، بدلاً من الاحتفاظ بها على مكتبك.
  • النتيجة: مكتبك لا يمتلئ أبداً. مهما كان طول الكتاب، فأنت لا تحمل سوى الملاحظات الخاصة بفصل واحد صغير في كل مرة. هذا يحافظ على استهلاك الذاكرة ثابتاً.

3. العقبة الجديدة: "خزانة الملفات العملاقة"

من خلال رمي الملاحظات اللاصقة، حل OOMB مشكلة الذاكرة، لكنه خلق مشكلة أخرى: "الخلاصة" (KV Cache) لا تزال بحاجة إلى الحفظ لأن الذكاء الاصطناعي يحتاج لتذكر القصة بأكملها لفهم الكلمة التالية.

  • التشبيه: حتى لو رميت الملاحظات اللاصقة، فسيظل لديك كومة متزايدة من "ملخصات القصة" التي تزداد حجماً مع كل صفحة تقرأها. في النهاية، ستصبح كومة الملخصات هذه أكبر من أن يستوعبها مكتبك.

4. الأدوات السحرية الثلاثة التي يستخدمها OOMB

للتعامل مع هذه الكومة المتزايدة من الملخصات، يستخدم OOMB ثلاث حيل ذكية:

  • الحيلة (أ): نظام الملفات "المجزأ" (Paged Filing System)

    • الطريقة القديمة: عندما تضيف ملخصاً جديداً، تحاول لصقه في نهاية شريط طويل من الورق. إذا امتلأ الشريط، يتعين عليك شراء شريط جديد أكبر ونسخ كل شيء إليه. هذا أمر بطيء ويهدر المساحة.
    • طريقة OOMB: يستخدم نظام "الذاكرة المجزأة" (Paged Memory) (مثل كتاب بصفحات مرقمة). أنت فقط تضع الملخص الجديد في الصفحة التالية المتاحة. لا نسخ، لا هدر للمساحة، ولا فجوات فوضوية.
  • الحيلة (ب): "الوردية الليلية" (Async Offloading)

    • المشكلة: حتى مع وجود الصفحات، ستصبح كومة الملخصات في النهاية أكبر من مكتبك.
    • الحل: لدى OOMB مساعد "وردية ليلية" (وهو المعالج المركزي CPU). بينما تنشغل أنت بقراءة الفصل الحالي (القيام بالعمليات الحسابية)، يقوم المساعد بهدوء بنقل الملخصات القديمة من مكتبك إلى غرفة التخزين في القبو (ذاكرة الـ CPU).
    • السحر: المساعد سريع جداً ويعمل في الخلفية بحيث لا تلاحظ حتى قيامه بنقل الأشياء. وبحلول الوقت الذي تحتاج فيه إلى ملخص قديم، يكون جاهزاً بانتظارك بالفعل.
  • الحيلة (ج): "قلم التحديد" (Sparse Attention)

    • المشكلة: أحياناً، لفهم جملة ما، لا تحتاج إلى النظر في كل الصفحات السابقة من الكتاب. أنت تحتاج فقط إلى الأجز الأهم.
    • الحل: يستخدم OOMB تقنية "الانتباه المتفرق" (Sparse Attention). بدلاً من قراءة التاريخ بأكمله، يعمل مثل قلم التحديد، حيث يختار فقط أفضل 1% من الصفحات الأكثر صلة للنظر إليها. هذا يجعل عملية القراءة سريعة للغاية ويوفر مساحة أكبر بكثير.

النتيجة النهائية

بفضل هذه الحيل، يمكن لـ OOMB تدريب نموذج ذكاء اصطناعي ضخم (Qwen2.5-7B) لفهم سياق يصل إلى 4 ملايين توكن (كتاب الـ 4 ملايين صفحة) على شريحة كمبيوتر واحدة عالية الأداء (H200 GPU).

  • قبل OOMB: كنت ستحتاج إلى مجموعة ضخمة من 256 جهاز كمبيوتر تعمل معاً للقيام بذلك.
  • الآن: يمكنك القيام بذلك على جهاز واحد فقط.

لماذا يهم هذا الأمر؟

فكر في الأمر كأنه "ديمقراطية استكشاف الفضاء". في السابق، كان بإمكان الحكومات الضخمة التي تملك مليارات الدولارات فقط بناء صواريخ للذهاب إلى القمر. OOMB يشبه اختراع محرك موفر للوقود يسمح لشخص واحد ببناء صاروخ في مرآب منزله. إنه يجعل تدريب نماذج الذكاء الاصطناعي ذات الذاكرة الطويلة فائقة الذكاء متاحاً للباحثين العاديين والشركات الأصغر، مما يوفر المال والطاقة والوقت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →