← أحدث الأبحاث
🤖 machine learning

Compositional Generalization in Autoregressive Models via Logit Composition

تقدم هذه الورقة استراتيجية مبدئية لتركيب اللوجيت (logit composition) للنماذج ذات الترتيب الذاتي، مستوحاة من طرق الانتشار، والتي تضمن التحكم الإسقاطي على الفضاءات الجزئية للمخرجات وتحافظ على تعميم الطول في ظل فرضيات الشروط المتجزئة.

المؤلفون الأصليون: Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقًا من ثلاثة طهاة متخصصين للغاية يعملون في مطبخ.

  • الشيف "بيس" (الأساس/الخلفية): هذا الشيف بارع في اتباع الوصفة بدقة كما هي مكتوبة. إذا طلبت منه شطيرة سادة، فسيصنع شطيرة سادة مثالية. هو لا يضيف أي شيء إضافي.
  • الشيف "ماث" (الرياضيات): هذا الشيف ساحر في إضافة الجبن والتوابل، ولكن فقط إذا كانت الوصفة تطلب ذلك. إذا قالت الوصفة "أضف جبناً"، فسيقوم بذلك ببراعة. وإذا لم تذكر ذلك، فسيترك الشطيرة كما هي.
  • الشيف "كود" (البرمجة): هذا الشيف خبير في إضافة الخس والطماطم، ولكن فقط عندما تطلب الوصفة ذلك.

المشكلة:
عادةً، إذا أردت شطيرة تحتوي على كل من الجبن و الخس، فعليك توظيف شيف واحد ضخم يعرف القيام بكل شيء في وقت واحد. أو تحاول دمج الطهاة الثلاثة معاً عن طريق مزج مآزرهم (الأوزان) أو جعلهم يتناوبون الأدوار (التوجيه). ولكن غالباً ما يسبب هذا فوضى: قد يحاول الشيف "ماث" إضافة الجبن بينما يحاول الشيف "كود" إضافة الخس، أو قد يتجادلون حول كيفية إنهاء الشطيرة، مما يؤدي إلى كومة من الطعام الفوضوي وغير الصالح للأكل.

حل الورقة البحثية: "تركيب اللوجيت" (Logit Composition)
يقترح مؤلفو هذه الورقة طريقة جديدة لدمج هؤلاء الطهاة. بدلاً من مزج مآزرهم أو جعلهم يتناوبون الأدوار، هم يتركون الطهاة الثلاثة يصرخون باقتراحاتهم للمكون التالي في نفس الوقت، ولكن مع قاعدة خاصة:

  1. القاعدة: نأخذ اقتراح الشيف "ماث"، ونضيف إليه اقتراح الشيف "كود"، ثم نطرح منه اقتراح الشيف "بيس".
  2. السحر: بما أن الشيف "بيس" هو النسخة "السادة" فقط، فإن طرح صوته يلغي الضجيج.
    • عندما تتطلب الوصفة جبناً، يكون الشيف "ماث" عالياً، والشيف "كود" هادئاً (لأنه لا يعرف شيئاً عن الجبن)، والشيف "بيس" محايداً. العملية الحسابية تعمل بحيث يكون القرار النهائي هو "أضف الجبن".
    • عندما تتطلب الوصفة خسًا، يكون الشيف "كود" عالياً، والشيف "ماث" هادئاً، والشيف "بيس" محايداً. العملية الحسابية تعمل بحيث يكون القرار النهائي هو "أضف الخس".
    • عندما لا تتطلب الوصفة أي شيء خاص، يكون الجميع هادئين، وتظل الشطيرة سادة.

لماذا ينجح هذا (سر "التجزئة" - Disjoint)
تجادل الورقة بأن هذا يعمل بشكل مثالي فقط إذا كانت وظائف الطهاة منفصلة (disjoint).

  • الشيف "ماث" يلمس فقط "خطوات الجبن".
  • الشيف "كود" يلمس فقط "خطوات الخس".
  • إنهما لا يحاولان القيام بوظيفة الآخر في نفس الوقت.

إذا حاول الشيف "ماث" إضافة الجبن بينما يحاول الشيف "كود" إضافة الخس، فقد يصطدمان ببعضهما البعض. ولكن إذا عرفا بالضبط متى يتحركان (على سبيل المثال: "أنا أعمل فقط في الخطوة 3، أنت تعمل فقط في الخطوة 5")، فيمكنهما العمل معاً بسلاسة دون قتال. تطلق الورقة على هذا اسم "الشرطيات العاملة" (Factorized Conditionals).

الضمان "الإسقاطي" (Projective Guarantee)
تثبت الورقة أنه إذا التزم الطهاة بمناطقهم المحددة، فإن الشطيرة النهائية (المخرج) ستكون تماماً كما لو كنت قد وظفت "شيفاً خارقاً" يعرف كلتا المهارتين ببراعة.

  • جزء "الجبن" من الشطيرة يأتي بنسبة 100% من الشيف "ماث".
  • جزء "الخس" يأتي بنسبة 100% من الشيف "كود".
  • جزء "الخبز" يأتي بنسبة 100% من الشيف "بيس".

هم لا يتداخلون مع بعضهم البعض. إنه يشبه الإسقاط: إذا نظرت إلى جزء الجبن فقط، فسيبدو تماماً كما صنعه الشيف "ماث". وإذا نظرت إلى الخس، فسيبدو تماماً كما صنعه الشيف "كود".

هل ينجح هذا للوصفات الطويلة؟ (تعميم الطول - Length Generalization)
اختبرت الورقة أيضاً ما إذا كان هذا ينجح مع الوصفات الطويلة جداً (مثل كتاب طبخ مكون من 100 صفحة) لم يره الطهاة من قبل. ووجدوا أنه طالما أن الطهاة يعرفون "مناطقهم" المحددة (على سبيل المثال: "أنا أتولى الخطوات من 10 إلى 20") وأن الوصفة تتبع نفس النمط، فإن الفريق المشترك يمكنه التعامل مع الوصفة الطويلة بنفس كفاءة الوصفة القصيرة. لن يرتبكوا لمجرد أن الكتاب أصبح أكثر سمكاً.

الاختبار في العالم الحقيقي
اختبر المؤلفون هذا مع نماذج ذكاء اصطناعي حقيقية (نماذج لغوية كبيرة):

  • أخذوا نموذجاً أساسياً (Gemma 2).
  • أخذوا نسخة تم ضبطها بدقة (fine-tuned) لمهام الرياضيات (Math).
  • أخذوا نسخة تم ضبطها بدقة لمهام البرمجة (Coding).
  • قاموا بدمجهما باستخدام قاعدة "الصرخة" الخاصة بهم.

النتيجة:
حصل النموذج المدمج الجديد على مهارة في البرمجة أفضل من خبير البرمجة وحده، وحافظ تقريباً على جميع مهارات خبير الرياضيات. لم يفقد قدرته على الرياضيات لمجرد أنه تعلم البرمجة. لقد كان وضع "أفضل ما في العالمين" دون الحاجة لإعادة تدريب الفريق بأك-مله من الصفر.

العائق
تعترف الورقة بأن هذا يعمل بشكل أفضل عندما تكون المهام منفصلة بوضوح. إذا حاولت دمج الكثير من الخبراء (مثل إضافة شيف "شعر" وشيف "تاريخ" إلى المزيج)، فقد يرتبك الفريق بشأن متى يتوقفون عن الكلام، مما يؤدي إلى كلام غير مفهوم. ولكن بالنسبة للمهارات الواضحة والمنفصلة، فإن هذا "التركيب اللوجيتي" (Logit Composition) هو طريقة مبدئية قوية لبناء أنظمة ذكاء اصطناعي نمطية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →