← أحدث الأبحاث
🤖 machine learning

On the Power of Foundation Models

تستخدم هذه المساهمة نظرية الفئات لتبين أنه بينما يقتصر التعلم القائم على التلقين (prompt-based learning) بشكل صارم على المهام القابلة للتمثيل، فإن نموذج تأسيسي قوي بما يكفي مع الضبط الدقيق يمكنه نظرياً حل أي مهمة لاحقة ضمن الفئة المحددة بمهمة ما قبل التدريب والتعميم على كائنات غير مرئية من خلال التخطيط البنيوي.

المؤلفون الأصليون: Yang Yuan

نُشر 2026-04-27
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yang Yuan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح ورقة "On the Power of Foundation Models" بلغة بسيطة واستعارات إبداعية.

السؤال الكبير: هل يمكن لعقل خارق أن يفعل كل شيء؟

تخيل طالباً قرأ كل كتاب في الكون، ولديه وقت غير محدود للتعلم، ولا يرتكب خطأً واحداً في الاختبارات التجريبية. يطرح المؤلفون سؤالاً بسيطاً: إذا كان هذا الطالب مثالياً في اختباراته التجريبية، فهل يمكنه تلقائياً حل أي مشكلة جديدة تعرضها عليه؟

في عالم الذكاء الاصطناعي، هذا "الطالب" هو النموذج التأسيسي (Foundation Model) (مثل تلك التي تقف وراء ChatGPT أو مولدات الصور). و"الاختبارات التجريبية" تسمى مهام ما قبل النص (Pretext Tasks) (مثل التنبؤ بالكلمة التالية في جملة أو تخمين كيفية دوران صورة ما).

تجادل الورقة بأن النظريات الحالية (المتعلقة بكمية البيانات أو حجم الحاسوب) لا يمكنها الإجابة على هذا. بدلاً من ذلك، يستخدم المؤلفون فرعاً من الرياضيات يسمى نظرية الفئات (Category Theory) (فكر فيها كـ "قواعد بناء الهياكل") لتحديد ما يمكن لهذه النماذج فعله وما لا يمكنها فعله.

لقد اكتشفوا قاعدتين رئيسيتين لكيفية تعلم هذه النماذج لأشياء جديدة:


القاعدة رقم 1: حد "الأمر" (استعارة بطاقة المكتبة)

السيناريو: تريد من النموذج أداء مهمة جديدة (مثل تحديد القطط في الصور)، لكنك لا تريد إعادة تدريبه. أنت ببساطة تعطيه تعليمات محددة أو "أمراً" (Prompt) (مثل بطاقة مكتبة مكتوب عليها: "ابحث عن القطط").

الرؤية: يمكن للنموذج حل المهمة الجديدة فقط إذا كانت تلك المهمة "مخبأة" بالفعل داخل هيكل تدريبه الأصلي.

الاستعارة: تخيل النموذج كأنه مكتبة.

  • مهمة ما قبل النص (التدريب) هي الطريقة التي نظمت بها المكتبة كتبها. إذا نظمت المكتبة الكتب حسب "اللون" فقط، فستكون الكتب مصنفة إلى أحمر، وأزرق، وأخضر.
  • ضبط الأمر (Prompt Tuning) يشبه سؤال أمين المكتبة: "هل يمكنك العثور لي على كتاب عن التاريخ؟"
  • النتيجة: إذا كانت المكتبة منظمة فقط حسب اللون، فلن يستطيع أمين المكتبة العثور على كتاب عن التاريخ، حتى لو كان يمتلك أفضل ذاكرة في العالم. ففئة "التاريخ" ببساطة غير موجودة في هيكل المكتبة.
  • إثبات الورقة: يثبت المؤلفون أنه إذا كانت مهمة التدريب (مثل تخمين دوران الصور) تعلم النموذج فقط "الدوران"، فلا يمكن جعل النموذج يؤدي مهاماً معقدة مثل "التقطيع" (Segmentation) للأجسام، لأن مفهوم "التقطيع" لم يكن مبنياً في هيكل المكتبة.

الخلامة: إذا علمت النموذج لعب الشطرنج فقط، فلا يمكنك جعله يلعب كرة القدم بمجرد "أمر" (Prompt). يجب أن تكون المهمة الجديدة قابلة للتمثيل من خلال الهيكل القديم.


القاعدة رقم 2: قوة "الضبط الدقيق" (استعارة المفتاح الرئيسي)

السيناريو: أنت مستعد لإعطاء النموذج تدريباً جديداً قليلاً (الضبط الدقيق - Fine-tuning) باستخدام مجموعة بيانات صغيرة للمهمة الجديدة.

الرؤية: هذا أكثر قوة بكثير. إذا تعلم النموذج "هيكل" العالم بشكل جيد خلال تدريبه الأصلي، فيمكنه تعلم أي مهمة جديدة، بشرط أن تعطيه موارد كافية (بيانات وقوة حوسبة) لربط النقاط ببعضها.

الاستعارة: تخيل النموذج كأنه مفتاح رئيسي (Master Key) تم برده ليتناسب مع أقفال مبنى محدد (مهمة ما قبل النص).

  • الضبط الدقيق (Fine-Tuning) يشبه أخذ هذا المفتاح الرئيسي وبرده قليلاً ليتناسب مع باب جديد في مبنى مختلف.
  • النتيجة: طالما أن المفتاح الرئيسي قد استوعب "جوهر" أقفال المبنى الأول، يمكنك إعادة تشكيله لفتح أي باب في العالم تقريباً.
  • إثبات الورقة: يوضح المؤلفون أنه إذا كان النموذج "مثالياً" (أي تعلم هيكل التدريب بشكل مثالي)، فإنه يحتوي على جميع المعلومات اللازمة لحل أي مهمة لاحقة. بيانات التدريب للمهمة الجديدة تعمل مجرد دليل لإظهار كيفية إعادة تشكيل هذه المعلومات للنموذج.

الخلاصة: الضبط الدقيق ليس محدوداً بـ "قابلية التمثيل" للأمر (Prompt). إذا كان الأساس قوياً، يمكن تكييف النموذج مع أي شيء تقريباً.


القاعدة رقم 3: "الجسر السحري" (استعارة المترجم)

السيناريو: ماذا يحدث عندما نجمع أنواعاً مختلفة من النماذج، مثل نموذج يفهم النصوص وآخر يفهم الصور (التعلم متعدد الوسائط - Multimodal Learning)؟

الرؤية: تقدم الورقة "نظرية التعميم". وهي تنص على أنه إذا بنيت جسراً مثالياً (خريطة رياضية) بين عالمين مختلفين (مثل النص والصور)، فإن هيكل أحد العالمين يتم الحفاظ عليه في الآخر.

الاستعارة: تخيل قاموساً يترجم "النص" إلى "صور" بشكل مثالي.

  • في عالم النصوص، لديك مفهوم "كرسي الأفوكادو" (كرسي على شكل حبة أفوكادو). هذا الشيء قد لا يكون موجوداً في العالم الحقيقي، ولا توجد صورة له في بيانات تدريبك.
  • ومع ذلك، بما أن عالم النصوص يحتوي على هيكل منطقي حيث يمكن الجمع بين كلمتي "أفوكادو" و"كرسي"، وبما أن قاموسك (النموذج) يحافظ تماماً على هذا الهيكل عند الترجمة إلى عالم الصور...
  • النتيجة: يمكن للنموذج أن "يهلوس" أو يولد صورة مثالية لكرسي الأفوكادو، رغم أنه لم يره من قبل. هو لم يقم بالنسخ فحسب؛ بل فهم العلاقة بين الكلمات وطبق هذا الهيكل على عالم الصور.

إثبات الورقة: يفسر هذا سبب قدرة نماذج مثل DALL-E 2 أو CLIP على إنشاء صور لأشياء لم توجد من قبل في مجموعات تدريبها. إنها لا تقوم بالنسخ فقط؛ بل تستخدم المنطق الهيكلي للغة لبناء صور جديدة.


ملخص ادعاءات الورقة

  1. الأمر (Prompting) محدود: يمكنك فقط توجيه أمر لنموذج للقيام بأشياء "مبنية داخلياً" في الطريقة التي تم تدريبه بها. إذا لم يعلمه التدريب هيكل المهمة الجديدة، فلن ينجح مجرد "الأمر".
  2. الضبط الدقيق (Fine-tuning) قوي: إذا كنت مستعداً للقيام بقدر قليل من التدريب الإضافي، فيمكن تكييف النموذج الذي تعلم هيكلاً جيداً لحل أي مهمة تقريباً.
  3. الهيكل يخلق الجديد: من خلال رسم خريطة مثالية لهيكل مجال ما (مثل النص) على مجال آخر (مثل الصور)، يمكن للنماذج إنشاء أشياء لم توجد من قبل (مثل كرسي الأفوكادو) لأنها تتبع القواعد المنطقية للهيكل بدلاً من مجرد حفظ الصور.

يؤكد المؤلفون أنهم لا يتحدثون عن أحجام شبكات محددة أو كميات بيانات، بل عن الهيكل المنطقي للمهام نفسها. إنهم يستخدمون الرياضيات لإثبات أن "شكل" مهمة التدريب هو الذي يحدد "شكل" ما يمكن للنموذج القيام به في النهاية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →