← أحدث الأبحاث
🤖 AI

TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control

تعد TetraJet-v2 طريقة تدريب للنماذج اللغوية الكبيرة تعتمد على التكميم الكامل بـ 4 بت من البداية إلى النهاية، حيث تستخدم دقة NVFP4 عبر جميع الطبقات الخطية وتستحدث تقنيتي OsciReset وOutControl لتثبيط تذبذب الأوزان والتحكم في القيم المتطرفة بفعالية، مما يحقق أداءً يقارب الأداء غير المفقود مع تسريع ملحوظ مقارنة بـ FP8.

المؤلفون الأصليون: Yuxiang Chen, Yifan Liu, Xiaoming Xu, Pengle Zhang, Michael Beyer, Martin Rapp, Jun Zhu, Jianfei Chen

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuxiang Chen, Yifan Liu, Xiaoming Xu, Pengle Zhang, Michael Beyer, Martin Rapp, Jun Zhu, Jianfei Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب عملاق وعبقري (نموذج لغوي كبير) كمية هائلة من المعلومات. عادةً، لكي تفعل ذلك بفعالية، تحتاج إلى فصل دراسي عالي الجودة وباهظ الثمن مع إضاءة مثالية وسبورات بيضاء ضخمة (حوسبة عالية الدقة). وهذا يكلف ثروة من الكهرباء والأجهزة.

تقدم الورقة البحثية طريقة جديدة تسمى TetraJet-v2 تحاول تعليم نفس هذا الطالب في فصل دراسي صغير ومنخفض التكلفة، يحتوي على سبورة صغيرة وإضاءة خافتة (دقة 4 بت). الهدف هو جعل عملية التدريب أسرع بمقدار 1.67 مرة وأرخص بكثير، دون أن يتعلم الطالب أشياء خاطئة أو ينسى ما تعلمه للتو.

إليك كيف حلوا المشكلات التي تحدث عادةً عندما تحاول التدريس في مثل هذا الفصل الدراسي "منخفض الجودة":

1. المشكلة: "اليد المرتعشة" (تذبذب الأوزان)

تخيل أن الطالب يحاول كتابة رقم على السبورة. في فصل دراسي مثالي، يمكنه كتابة "0.25" بدقة. ولكن في هذا الفصل الدراسي منخفض الدقة، لا يمكنه سوى كتابة أرقام صحيحة أو أنصاف أرقام (مثل 0 أو 0.5).

إذا كان جواب الطالب الحقيقي هو 0.25 تماماً، فإن يده تبدأ بالارتعاش. في لحظة يكتب "0"، وفي اللحظة التالية يكتب "0.5"، ثم يعود إلى "0". إنه عالق في حلقة مفرغة، يتأرجح ذهاباً وإياباً. هذا يسمى في الورقة البحثية Weight Oscillation (تذبذب الأوزان). هذا الأمر يهدر الطاقة ويمنع الطالب من الاستقرار على الإجابة الصحيحة أبداً.

الحل: OsciReset (خدعة "التمركز")
ابتكر المؤلفون تقنية تسمى OsciReset. تخيل معلماً يراقب يد الطالب؛ بمجرد أن يرى يد الطالب تبدأ في الارتعاش بين خيارين، يقوم المعلم بلطف بالإمساك بالطباشير ووضعه مباشرة في منتصف المنطقة الآمنة (مركز الفئة أو الـ bin center).

  • لماذا ينجح هذا: إنه يوقف الارتعاش فوراً. هو لا يجمد الطالب (لأن ذلك سيوقف التعلم)، بل يمنحه فقط نقطة انطلاق مستقرة لمواصلة التعلم في اتجاه جديد وأكثر سلاسة. هذه هي المرة الأولى التي يتم فيها حل مشكلة "الارتعاش" هذه تحديداً لهذه النماذج الضخمة.

2. المشكلة: "الصراخ العالي" (القيم المتطرفة)

في الفصل الدراسي العادي، يتحدث معظم الطلاب بصوت طبيعي. ولكن في هذه النماذج الضخمة، تبدأ بعض "القنوات" المحددة (فكر فيها كأنها ميكروفونات معينة) فجأة بالصراخ بأقصى صوت لها. تُسمى هذه Outliers (القيم المتطرفة).

بسبب صغر حجم السبورة (الدقة المنخفضة)، إذا صرخ أحد الميكروفونات بصوت عالٍ جداً، يجب على المعلم خفض مستوى الصوت للجميع حتى لا يتسبب هذا الصراخ في كسر السبورة. وهذا يعني أن الهمسات الهامة والهادئة من الطلاب الآخرين ستضيع وسط الضجيج.

الحل: OutControl (الميكروفونات المميزة - VIP)
أدرك المؤلفون أن هذه الميكروفونات الصارخة يمكن التنبؤ بها؛ فهي دائماً نفس القنوات القليلة. لذا، أنشأوا نظاماً يسمى OutControl.

  • كيف يعمل: يقومون بتحديد "الميكروفونات المميزة" (القيم المتطرفة) في وقت مبكر، ويمنحونها ميكروفوناً خاصاً وعالي الجودة (بالاحتفاظ بتنسيق دقة أعلى مثل FP8). أما بقية الطلاب، فيستمرون في استخدام السبورة الصغيرة الرخيصة (FP4).
  • النتي نتيجة: الصارخ العالي لا يجبر الجميع على خفض أصواتهم، وبالتالي تظل الهمسات الهادئة والمهمة مسموعة بوضوح.

3. "السبورة مزدوجة الكتل" (Double-Block)

للتأكد من أن الرياضيات تعمل بشكل مثالي على هذه السبورة الصغيرة، قاموا بإعادة تصميم كيفية كتابة الأرقام. بدلاً من محاولة وضع رقم ضخم في مربع واحد صغير، يستخدمون نظام Double-Block.

  • تخيل مجموعة كبيرة من الطلاب (كتلة مكونة من 128) يتشاركون مسطرة واحدة كبيرة (مقياس عالمي)، ولكن داخل هذه المجموعة، يتم تقسيمهم إلى فرق أصغر مكونة من 16 فرداً، لكل منهم مسطرته الصغيرة الخاصة. هذا يسمح لهم بالتعامل مع كل من الأرقام الصغيرة جداً والأرقام الكبيرة جداً دون فقدان الدقة.

النتائج

عندما جمعوا كل هذه الحيل معاً (خدعة التمركز، الميكروفونات المميزة، والسبورة مزدوجة الكتل):

  • السرعة: قاموا بتدريب النماذج بسرعة أكبر بمقدار 1.67 مرة من المعيار الحالي (FP8).
  • الدقة: تعلمت النماذج بشكل جيد تقريباً كما لو تم تدريبها في الفصل الدراسي باهظ الثمن وعالي الدقة. لقد قللوا الفجوة في الأداء بين الطريقة الرخيصة والطريقة المكلفة بنسبة تزيد عن 50%.
  • النطاق: اختبروا ذلك على نماذج تصل إلى 370 مليون معلمة (parameter)، وتم تدريبها على أكثر من 200 مليار كلمة.

باختصار: TetraJet-v2 هي مجموعة جديدة من القواعد تسمح لنا بتدريب نماذج الذكاء الاصطناعي الضخمة على أجهزة أرخص وأسرع، وذلك عبر منعها من الارتعاش، وحماية الأصوات العالية، وتنظيم السبورة بشكل أكثر كفاءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →