← أحدث الأبحاث
💻 computer science

To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning

تحدد هذه الورقة وتعالج انهياراً تمثيلياً في نماذج المحولات ذات فك التشفير فقط (decoder-only transformers)، حيث تتقارب متجهات عدم التضمين (unembeddings) للرموز غير المرئية لتصبح متشابهة، مما يتسبب في فشل التعميم في الاستدلال الرمزي، وتقترح مزيجاً من التعديلات الهيكلية، وتنوع البيانات، واستراتيجيات إعادة تعيين التضمين للتغلب على هذا القصور.

المؤلفون الأصليون: Nevena Lazić, Liam Fowl, András György, Csaba Szepesvári

نُشر 2026-04-24
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Nevena Lazić, Liam Fowl, András György, Csaba Szepesvári

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "رؤية غير المرئي" (To See the Unseen)، مقسمة إلى مفاهيم بسيطة باستخدام تشبيهات إبداعية.

المشكلة الكبرى: خلل "تغيير الاسم"

تخيل أنك تعلم روبوتًا كيفية لعب لعبة منطقية باستخدام مجموعة من البطاقات. تظهر له بطاقات تحمل الرموز A و B و C. تعلمه القاعدة التالية: "إذا رأيت A، يجب أن تقول B". يتعلم الروبوت هذه القاعدة ببراعة.

لكن بعد ذلك، تعطيه بطاقة جديدة تحمل الرمز Z (بطاقة لم يسبق له رؤيتها من قبل) وتسأله: "إذا رأيت Z، فماذا يحدث؟"

تفشل معظم نماذج الذكاء الاصطناعي الحديثة (المحولات/Transformers) فشلاً ذريعاً هنا. حتى لو كان المنطق متطابقاً، يرتبك الروبوت. قد يتجاهل البطاقة، أو يخمن الإجابة الخاطئة، أو يحاول فرض أسماء البطاقات القديمة (A, B, C) على الموقف الجديد. يبدو الأمر وكأن الروبوت يحفظ أسماء البطاقات بدلاً من فهم قواعد اللعبة.

المتسبب السري: تأثير "التكتل"

اكتشف مؤلفو هذه الورقة البحثية لماذا يفشل الروبوت. المسألة ليست مجرد أن الروبوت لم يرَ البطاقة من قبل؛ بل لأن "قاموسه" الداخلي يصبح فوضوياً.

التشبيه: خزانة الملفات الضبابية
تخيل ذاكرة الذكاء الاصطناعي كخزانة ملفات ضخمة حيث لكل كلمة أو رمز درج خاص به.

  • الكلمات المرئية (A, B, C): هذه الأدراج متميزة. الدرج A أحمر، والدرج B أزرق، والدرج C أخضر. الروبوت يعرف تماماً الفرق بينها.
  • الكلمات غير المرئية (Z, Q, X): عندما يواجه الروبوت كلمة جديدة لم يتدرب عليها، يحدث شيء غريب. بدلاً من تخصيص درج فريد لكل كلمة جديدة، تقوم عملية التدريب بالضغط على جميع الأدراج الجديدة لتوضع في نفس الزاوية من الغرفة. ويتم طلاؤها جميعاً بنفس الدرجة من اللون الرمادي.

يُسمى هذا "انهيار التضمين" (Embedding Collapse). المتجهات الرياضية (الإحداثيات) لجميع الرموز غير المرئية تنهار لتصبح في نفس البقعة تقريباً. بالنسبة للروبوت، تبدو المتغيرات الجديدة "Z" و "Q" متطابقتين تقريباً. وبما أنه لا يستطيع التمييز بينهما، فإنه لا يستطيع التفكير فيهما.

الإثبات النظري: لماذا تتكتل الخزانة؟

تثبت الورقة البحثية رياضياً أن هذا التكتل أمر حتمي تقريباً.

  • الآلية: أثناء التدريب، يحاول الذكاء الاصطناعي تقليل الأخطاء. إذا لم تظهر كلمة ما أبداً في بيانات التدريب، فإن الرياضيات تجبر "درجها" على الانجراف نحو مركز الغرفة، لتندمج مع الأدراج غير المستخدمة الأخرى.
  • النتيجة: يفقد الذكاء الاصطناعي القدرة على التمييز بين المتغيرات غير المرئية المختلفة. الأمر يشبه محاولة حل لغز حيث تبدو جميع القطع الجديدة متشابهة تماماً.

الحلول: كيف نصلح الروبوت؟

اختبر المؤلفون ثلاث طرق رئيسية لمنع الروبوت من الارتباك بسبب الأسماء الجديدة.

1. أداة "النسخ واللصق" (انتباه النسخ - Copy Attention)

  • المشكلة: تحاول نماذج الذكاء الاصطناعي القياسية "ابتكار" الإجابة لكلمة جديدة، وهو أمر صعب عندما تكون الكلمة غير مألوفة.
  • الحل: أضافوا "رأس نسخ" (Copy Head) خاصاً إلى البنية التحتية. فكر في هذا كإعطاء الروبوت محدد نص (Highlighter) وآلة تصوير.
  • كيف يعمل: بدلاً من محاولة توليد الرمز الجديد من الصفر، يُسمح للروبوت ببساطة بالإشارة إلى الرمز الموجود في السؤال ونسخه مباشرة إلى الإجابة. إنه مثل قول: "أنا لا أعرف معنى 'Z'، لكنني أرى 'Z' هنا، لذا سأقوم فقط بكتابة 'Z'".

2. استراتيجية "التجميد" (التضمينات المجمدة - Frozen Embeddings)

  • المشكلة: يستمر الروبوت في محاولة إعادة ترتيب خزانة الملفات الخاصة به، مما يتسبب في تكتل الأدراج الجديدة معاً.
  • الحل: أغلق الأدراج في مكانها.
  • كيف يعمل: منع الباحثون الروبوت من تغيير تعريفات الكلمات أثناء التدريب. لقد حافظوا على "الأدراج" الخاصة بالكلمات الجديدة في مواقعها الأصلية والمتميزة. ولأن الروبوت لم يستطع العبث بها، استطاع التمييز بينها والتفكير فيها بشكل صحيح.

3. "مسح الذاكرة" (النسيان النشط - Active Forgetting)

  • المشكلة: يتعلق الروبوت كثيراً بالأنماط القديمة وينسى وجود أشياء جديدة.
  • الحل: إعادة ضبط القاموس دورياً.
  • كيف يعمل: كل بضع خطوات من التدريب، يقوم الباحثون بمسح السجل نظيفاً للكلمات الجديدة، وإعادة "أدراجها" إلى مواقعها الأصلية المتميزة. هذا يمنعها من التكتل مع مرور الوقت. الأمر يشبه معلماً يقول لطالب: "انسَ ما حفظته للتو للحظة؛ لننظر إلى هذه المسألة الجديدة بعيون جديدة".

الاختبار الواقعي: نماذج Gemma 3

لم يختبر المؤلفون هذه الأفكار على نماذج صغيرة ومصطنعة فحسب، بل نظروا إلى Gemma 3، وهو نموذج ذكاء اصطناعي ضخم وحقيقي من إنتاج جوجل.

  • الاكتشاف: حتى في هذا النموذج الضخم والمتطور، كانت الرموز غير المستخدمة (الكلمات المحجوزة للاستخدام المستقبلي) متكتلة معاً، تماماً كما في تجاربهم الصغيرة.
  • النتيجة: عندما حاولوا تعليم Gemma 3 لعبة منطقية جديدة باستخدام هذه الرموز "غير المستخدمة"، استغرق الأمر 10 أضعاف الوقت لتعلمها مقارنة باستخدام الكلمات الشائعة. كان النموذج يعاني للتمييز بين الرموز الجديدة لأن تمثيلاتها الداخلية كانت ضبابية للغاية.

الخلاصة

لبناء ذكاء اصطناعي يمكنه حقاً التفكير في أفكار مجردة وجديدة (مثل عالم يكتشف عنصراً جديداً أو مبرمج يكتب كوداً بمتغيرات جديدة)، لا يمكننا فقط تغذيته بمزيد من البيانات. يجب علينا تغيير طريقة تخزين المعلومات.

نحن بحاجة إلى ضمان:

  1. أن يستطيع الذكاء الاصطناعي نسخ الرموز الجديدة مباشرة بدلاً من التخمين.
  2. أن لا يسمح "القاموس" الداخلي للذكاء الاصطناعي بدمج الكلمات الجديدة في كتلة ضبابية.

من خلال إصلاح مشكلة "التكتل" هذه، يمكننا جعل الذكاء الاصطناعي أفضل بكثير في التعميم — أي حل المشكلات التي لم يسبق له رؤيتها، وليس فقط حفظ تلك التي رآها بالفعل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →