TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
تقدم هذه الورقة البحثية TANGO، وهي بنية نموذج لغوي مبتكرة تستبدل الطبقات الفرعية القياسية لنموذج Transformer بتحديث متبقٍ بوابي عبر الرموز (cross-token gated residual update) لتحقيق أداء فائق في مجموعات البيانات الرياضية والتعليمية، إلى جانب متغيرها ذي التعقيد الخطي WANGO الذي يتفوق على النماذج الحالية ذات الوقت الخطي.
في عالم الذكاء الاصطناعي، تعتمد أقوى الأدوات لفهم اللغة على بنية تسمى "المحول" (Transformer). تخيل قارئاً يمسح وثيقة طويلة؛ لفهم كلمة معينة، يجب عليه العودة بالنظر إلى الكلمات التي سبقتها لاستيعاب السياق. تقوم نماذج الذكاء الاصطناعي القياسية بذلك عبر خطوتين متمايزتين. أولاً، تمسح التاريخ الكامل للنص لجمع المعلومات ذات الصلة من الكلمات الماضية، وهي عملية تشبه أميناً للمكتبة يحدد بسرعة كل كتاب قد يكون ذا صلة بموضوع ما. ثانياً، تأخذ تلك المعلومات المجموعة وتجري معالجتها من خلال مرشح منفصل ومستقل عند كل موضع في الجملة لصقل المعنى. لقد خدمت هذه "الرقصة الثنائية" المجال بشكل جيد، لكنها ثقيلة حسابياً، إذ تتطلب من النموذج إجراء كمية هائلة من الحسابات لكل كلمة جديدة ينتجها، خاصة عندما يصبح النص أطول. لطالما سعى الباحثون لإيجان طريقة لدمج هذه الخطوات أو تبسيطها، آملين في بناء نماذج تكون أكثر ذكاءً وكفاءة، وقادرة على التعامل مع كميات هائلة من المعلومات دون أن تغرق في وطأة الرياضيات المطلوبة لمعالجتها.
قدم باحث من جامعة إنديانا بلومنجتون نهجاً جديداً يعيد تشكيل كيفية تفاعل هذه النماذج مع اللغة بشكل جذري. أطلقوا على ابتكارهم اسم TANGO، وهو اختصار لـ "مشغلات البوابات غير الخطية المجمعة للرموز" (Token-Aggregated Nonlinear Gating Operators). وبدلاً من إبقاء خطوات جمع المعلومات وصقل المعلومات منفصلة، يقوم TANGO بدمجهما في إجراء واحد موحد. في هذا التصميم الجديد، تعمل كل كلمة في الجملة كمصدر للتحكم. وبينما يقرأ النموذج، تولد كل كلمة مجموعة محددة من التعليمات، أو "البوابات"، التي تحدد مقدار الأهمية التي يجب وضعها لميزات مختلفة من النص. وعندما يصل النموذج إلى كلمة جديدة، فإنه لا ينظر إلى الوراء فقط للعثور على الكلمات الماضية الأكثر صلة؛ بل ينظر إلى الوراء ليرى ما هي التعليمات التي أعدتها تلك الكلمات الماضية. ثم يقوم بتوسيط هذه التعليمات ويستخدمها لضبط، أو موازنة، ميزات الكلمة الحالية قبل إضافتها إلى ذاكرة النموذج. وهذا يعني أن تأثير الكلمة الماضية لا يتعلق فقط بما تقوله، بل بكيفية توجيهها للكلمة الحالية لتفسير نفسها.
طور الباحث نسختين من هذا النظام لاختبار مقايضات مختلفة بين الدقة والسرعة. النسخة الأولى، TANGO، تنظر في كل كلمة سبقت الكلمة الحالية، بغض النظر عن مدى بُعدها في النص. يسمح هذا النهج "ذي البادئة الكاملة" (full-prefix) للنموذج بالاستفادة من التاريخ الكامل للمحادثة أو الوثيقة، مما يؤدي إلى فهم عالي الدقة للسياق. ومع ذلك، ولأنه يجب عليه مقارنة الكلمة الحالية بكل كلمة سابقة، فإن حجم العمل الذي يتعين عليه القيام به ينمو بسرعة مع طول النص. أما النسخة الثانية، المسماة WANGO، فتتبع نهجاً أكثر عملية للنصوص الطويلة جداً. فهي تولي اهتماماً وثيقاً للكلمات الأخيرة، وتتعامل معها بنفس العناية التفصيلية والكاملة للتاريخ كما في النموذج الأول. أما بالنسبة للكلمات الأقدم التي تقع خارج نافذة زمنية حديثة، فإن WANGO تستخدم طريقة مختلفة وأكثر كفاءة لتلخيص تأثيرها؛ حيث تحتفظ بسجل مستمر للتعليمات التي ولدتها تلك الكلمات القديمة، مما يسمح لها بدمج حكمتها دون الحاجة إلى إعادة حساب العلاقة مع كل واحدة منها. هذا التعديل يجعل عبء العمل في نموذج Wango ينمو في خط مستقيم مع طول النص، بدلاً من الانفجار في التعقيد، مما يجعله أسرع بكثير في المتواليات الطويلة.
ولرؤية كيف صمدت هذه التصاميم الجديدة أمام التكنولوجيا الحالية، قام الباحث بتدريب ستة نماذج مختلفة باستخدام نفس كمية البيانات، ونفس عدد المعلمات، ونفس جدول التدريب. واختبر هذه النماذج على ثلاثة تحديات مختلفة تماماً: مجموعة كبيرة من النصوص التعليمية من الويب، ومكتبة من البراهين الرياضية الرسمية المكتوبة بلغة برمجة تسمى "لين" (Lean)، ومجموعة من المسائل الرياضية من "ديب مايند" (DeepMind). أظهرت النتائج أن نموذج TANGO، برؤيته الكاملة للتاريخ، حقق أعلى دقة عبر الاختبارات الثلاثة، منتجاً التنبؤات الأكثر موثوقية للكلمة التالية في المتوالية. لقد تفوق على جميع النماذج الأخرى، بما في ذلك تلك التي تستخدم الطرق التقليدية لمشاركة المعلمات عبر الطبقات. كما قدم نموذج Wango أداءً استثنائياً، لا سيما في فئة النماذج المصممة لتكون كفؤة. فمن بين البنيات التي يمكنها التعامل مع النصوص الطويلة دون أن تتصاعد تكلفتها الحسابية بشكل خارج عن السيطرة، أنتج Wango النتائج الأكثر دقة. بل إنه تفوق على نموذج يستخدم مقداراً مشابهاً من الحسابات ولكنه يعتمد على تقنيات قديمة ومعيارية.
تسلط الدراسة الضوء على تحول كبير في كيفية بناء هذه الأنظمة. فمن خلال السماح للكلمات بالتحكم في معالجة الكلمات الأخرى عبر هذه البوابات المجمعة، وجد الباحث طريقة لإنشاء نماذج تكون قوية، وفي حالة Wango، كفؤة أيضاً. أثبت نموذج TANGO أن خطوة واحدة موحدة لجمع المعلومات وصقلها يمكن أن تتفوق على عملية الخطوتين التقليدية، حتى عندما يُجبر النموذج على القيام بمزيد من العمل الرياضي. وفي الوقت نفسه، أثبت نموذج Wango أن هذا المستوى العالي من الأداء لا يجب أن يأتي على حساب السرعة؛ فمن خلال تلخيص المعلومات القديمة بذكاء، حافظ على دقة عالية مع إبقاء التكلفة الحسابية تحت السيطرة. وقد حرص الباحث على ملاحظة أن هذه النتائج تستند إلى قدرة النماذج على التنبؤ بالكلمة التالية في المتوالية، وهو معيار قياسي لفهم اللغة، ولم يدّعِ أن هذه النماذج يمكنها بالضرورة حل المسائل الرياضية أو كتابة البراهين بشكل مثالي بمفردها. ومع ذلك، تشير النتائج إلى أن هذه الطريقة الجديدة في بوابات المعلومات تقدم مساراً واعداً لبناء ذكاء اصطناعي يمكنه فهم اللغة المعقدة والسياقات الطويلة بدقة وكفاءة أكبر.
ملخص تقني: TANGO و WANGO
بيان المشكلة
تفصل بنيات المحولات (Transformer) القياسية بين التفاعل عبر الرموز (الذي يتم التعامل معه عبر الانتباه الذاتي - self-attention) والتحويل غير الخطي لكل موضع (الذي يتم التعامل معه عبر الشبكات الأمامية - feed-forward networks). يتطلب هذا التصميم طبقتين فرعيتين متميزتين لكل كتلة، وهو ما قد يكون غير مثالي من حيث الكفاءة واستغلال المعلمات. علاوة على على ذلك، تعتمد نماذج التسلسل الحالية ذات التعقيد الخطي غالباً على تقريبات قد تضحي بغنى التفاعل عبر الرموز أو تتطلب آليات بوابات معقدة لا تدمج التحويل غير الخني بشكل كامل مع آلية الانتباه.
المنهجية
البنية الأساسية: مشغلات البوابات غير الخطية المجمعة للرموز (TANGO)
يقدم البحث TANGO، وهو كتلة فك تشفير (decoder block) تستبدل طبقتي الانتباه الذاتي والشبكات الأمامية الموضعية بطبقة واحدة من التحديث المتبقي ذو البوابة العابرة للرموز (cross-token gated residual update).
بوابة SwiGLU المشروطة بالمصدر:
بخلاف وحدة SwiGLU التقليدية حيث يتم حساب البوابة والميزات من نفس الرمز، يسمح TANGO لبوابة يتم حسابها عند موضع مصدر (xj) بتعديل الميزات المسقطة في موضع الوجهة (xi).
ينتج كل موضع i متجه بوابة gi=SiLU(Wgxi) ومتجه ميزات مسقط vi=Wvxi.
بالنسبة للوجهة i، يحسب النموذج متوسطاً موزوناً يعتمد على المحتوى لمتجهات البوابات من جميع المصادر المرئية سببيّاً (j≤i)، ويُرمز له بـ gˉi.
يتم حساب التحديث المتبقي كالتالي: hi+=hi+Wo(gˉi⊙vi)
هنا، تعمل البوابة المجمعة gˉi كعامل قياس قطري (diagonal scaling operator) على ميزات الوجهة المسقطة vi قبل الإسقاط النهائي للمخرجات Wo.
آليات تجميع الأوزان: يقترح البحث متغيرين يختلفان في كيفية حساب الأوزان لتجميع المصادر:
TANGO (البادئة الكاملة - Full-Prefix): يحسب أوزان softmax بناءً على تشابه جيب التمام المقيّس (scaled cosine similarities) بين كل وجهة وكل مصدر مرئي سببيّاً. وينتج عن ذلك تعقيد تربيعي (O(T2)) بالنسبة لطول التسلسل T.
WANGO (التجميع النافذي - Windowed Aggregation): وهو متغير ذو تعقيد خطي (O(T) للأبعاد الثابتة/السمات).
المصادر الحديثة (النافذة): يستخدم نفس درجات تشابه جيب التمام الأسية المستخدمة في TANGO للمصادر ضمن نافذة متأخرة Li.
المصادر الأقدم (البادئة): يستخدم خريطة سمات موجبة حتمية ϕ(u) لحساب الدرجات. يسمح هذا للنموذج بالحفاظ على مجموع تراكمي (running sums) للمفاتيح المحولة وحاصل ضربها الخارجي مع متجهات البوابة. يتم حساب مساهمة المصادر الأقدم عبر هذه المجاميع التراكمية، مما يتجنب الحاجة إلى إعادة تقييم جميع الأزواج الماضية.
الإعداد التجريبي
يقارن المؤلف TANGO و WANGO بأربعة نماذج مرجعية:
Recurrent Transformer++: كتلة Transformer قياسية يتم إعادة استخدامها أربع مرات مع مشاركة المعلمات.
Untied Transformer++: أربع كتل Transformer ذات معلمات مستقلة.
Full-attention GAU (Gated Attention Unit): أربع كتل مستقلة تدمج الانتباه الزوجي الكامل.
FLASH: أربع كتل مستقلة تجمع بين الانتباه الزوجي المحلي وملخص انتباه خطي عالمي.
القيود:
تم مطابقة جميع النماذج في عدد المعلمات غير الخاصة بالتمثيل (حوالي 44.3 مليون معلمة متميزة).
تم تدريب النماذج باستخدام ترتيب بيانات، وبذور تهيئة (initialization seeds)، وميزانيات تدريب متطابقة.
أُجريت التجارب على FineWeb-Edu (اللغة الطبيعية)، و Lean (البراهث الرسمية والأكواد البرمجية)، و DeepMind Mathematics.
تمت المقارنات باستخدام تطبيقات متتالية بـ 4 كتل و 8 كتل.
المساهمات الرئيسية
نموذج TANGO: يقدم كتلة موحدة تستبدل شبكات الانتباه الذاتي والشبكات الأمامية الموضعية بتحديث بوابة واحد حيث تنتج الرموز المصدرية بوابات SwiGLU التي تعدل ميزات الوجهة.
نموذج WANGO: يطور متغيراً ذا تعقيد خطي يحتفظ بالتفاعلات الزوجية الدقيقة داخل نافذة محلية ويستخدم مجموعات بادئة لخريطة السمات للمصادر الأقدم، محتفظاً بنفس المعلمات المستخدمة في TANGO.
مقارنة صارمة: يوفر مقارنة منضبطة لست بنى تحت عدد دقيق من المعلمات، وأهداف التدريب، وترتيب البيانات، مما يعزل تأثيرات التصميم المعماري عن تباين التدريب.
النتائج
الأداء على الاختبارات المرجعية
FineWeb-Edu:
حقق TANGO أدنى متوسط للاحتمال السلبي اللوغاريتمي (NLL) للتحقق الإجمالي (3.293).
حقق WANGO أدنى NLL بين جميع البنى ذات التوسع الخطي لطول التسلسل (3.355)، متفوقاً على كل من FLASH (3.465) و Recurrent Transformer++ (3.392).
ومن الجدير بالذكر أن WANGO حقق NLL أقل من Recurrent Transformer++ عند عدد عمليات الضرب والجمع (MAC) التحليلي المتماثل تقريباً (1.90T مقابل 1.94T لتسلسل بطول 8,192 رمز).
Lean (الأكواد البرمجية وإكمال البراهث):
حصل TANGO على أدنى NLL مشترك (1.719) وأدنى Nalog NLL لكل من نمذجة الأكواد البرمجية وإكمال البراهث على حدة.
تفوق WANGO (2.271) على FLASH (2.377)، لكنه لم يتفوق على Recurrent Transformer++ (2.530) في تجربة الـ 4 كتل؛ ومع ذلك، في تجربة الـ 8 كتل، تفوق WANGO (2.231) على Recurrent Transformer++ (2.364).
DeepMind Mathematics:
حقق TANGO أدنى NLL للتحقق (0.473).
أدى WANGO (0.487) أداءً أفضل من Recurrent Transformer++ (0.537) و Untied Transformer++ (0.556).
التعقيد الحسابي
TANGO: تربيعي في طول التسلسل (O(T2)). بالنسبة لتسلسل بطول 8,192 رمز، يتطلب حوالي 9.44T عملية MAC.
WANGO: خطي في طول التسلسل (O(T)) للأبعاد الثابتة. لنفس التسلسل، يتطلب حوالي 1.90T عملية MAC.
Recurrent Transformer++: تعقيد تربيعي ولكن مع عمليات MAC أقل من TANGO (~1.94T) بسبب مشاركة المعلمات وعدم وجود تجميع البوابات العابر للرموز الكامل.
الأهمية والادعاءات
يدعي البحث أن TANGO يحقق أفضل احتمالية تحقق (validation likelihood) بين البنى المختبرة عبر مهام اللغة الطبيعية، والأكواد البرمجية الرسمية، والاستدلال الرياضي عند مقياس المعلمات الذي تم تقييمه.
يؤكد المؤلف أن WANGO يثبت أن النماذج ذات التعقيد الخطي يمكن أن تتفوق على النماذج المرجعية ذات التعقيد التربيعي (مثل Recurrent Transformer++) عند مطابقتها في عدد العمليات التحليلية وحجم المعلمات، وتحديداً في FineWeb-Edu. وبشكل خاص، فإن قدرة WANGO على تجميع بوابات SwiGLU عبر المجاميع التراكمية تسمح له بالحفاظ على أداء عالٍ مع التوسع الخطي.
يصرح المؤلف صراحةً بحدود ادعاءاته:
تعتمد النتائج على validation NLL تحت ظروف "الإجبار للمعلم" (teacher forcing) ولا تقيس دقة الإجابات المولدة، أو معدلات قبول البراهث، أو سرعة التنفيذ الفعلي (wall-clock speed).
لا تثبت التجارب قوانين القياس (scaling laws) بما يتجاوز عدد المعلمات المختبر (حوالي 70 مليون معلمة إجمالاً).
لا ينبغي تفسير انخفاض NLL الخاص بـ TANGO كميزة في السرعة أو الذاكرة، حيث إنه يتكبد تكاليف حسابية أعلى بكثير من WANGO أو Recurrent Transformer++.
باختاً، يقدم البحث كتلة معمارية مبتكرة توحد آليات الانتباه والشبكات الأمامية من خلال البوابات العابرة للرموز، مما يثبت أن هذا النهج ينتج احتمالية تنبؤية فائقة، مع وجود متغير ذي تعقيد خطي (WANGO) يوفر بديلاً تنافسياً للتطبيقات ذات السياق الطويل.