← أحدث الأبحاث
💬 NLP

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

تقدم هذه الورقة "البرمجة عبر الانتشار العكسي" (PBB)، وهو نظام تدريب يُمكّن النماذج اللغوية الكبيرة من اكتساب سلوكيات إجرائية قابلة لإعادة الاستخدام بكفاءة من التعليمات التصريحية، محققةً كفاءة في العينات تصل إلى 100 ضعف مقارنة بالتعلم من أمثلة التوضيح وحدها.

المؤلفون الأصليون: Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

نُشر 2026-02-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت ذكي للغاية ولكنه حرفي التفكير كيفية الطبخ.

الطريقة القديمة (التدريب القياسي):
عادةً، لتعليم الروبوت وصفة جديدة، عليك أن تريه الطبخة وهي تُعد خطوة بخطوة. تقول له: "شاهدني وأنا أقطع البصل، ثم أقلي البصل، ثم أضيف التوابل". عليك القيام بذلك مئات المرات ليحفظ الروبوت النمط. إذا أردت تعليمه طبقاً جديداً، فعليك أن تريه ذلك الطبق تحديداً مئات المرات أيضاً. هذه العملية بطيئة، وتستهلك الكثير من البيانات، ومكلفة.

الطريقة الجديدة (البرمجة عبر الانتشار العكسي - PBB):
تقدم هذه الورقة البحثية طريقة جديدة تسمى البرمجة عبر الانتشار العكسي (Programming by Backprop - PBB). بدلاً من إظهار عملية الطبخ للروبوت 100 مرة، أنت فقط تسلمه الوصفة المكتوبة (التعليمات) وتقول له: "هذه هي القاعدة. تعلمها".

العنوان الرئيسي لهذه الورقة هو: "تعليمات واحدة تعادل 100 مثالاً".

إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:

1. الفكرة الجوهرية: "ترجمة المعرفة إلى كود" (Compiling Knowledge)

فكر في برنامج الكمبيوتر. يمكنك كتابة كود (التعليمات)، ويقوم الكمبيوتر بتشغيله في كل مرة.

  • الذكاء الاصطناعي القياسي: يتعلم الذكاء الاصطناعي من خلال مشاهدتك وأنت تشغل الكود 100 مرة. إنه يحفظ الأفعال.
  • الـ PBB: يقرأ الذكاء الاصطناعي الكود مرة واحدة، ويفهم المنطق، ثم "يترجمه" (Compiles) مباشرة إلى دماغه (أوزانه الداخلية). الآن، عندما تطلب منه القيام بالمهمة، فإنه لا يحتاج للنظر إلى الكود مرة أخرى؛ فالمنطق أصبح مبنياً بالفعل داخل خلاياه العصبية.

2. وصفتي التدريب (المناهج التعليمية)

وجد المؤلفون أنك لا تستطيع مجرد إلقاء الوصفة على الروبوت وتوقع أن يعمل فوراً. أنت بحاجة إلى جدول تدريبي محدد. لقد اختبروا نهجين:

أ. الـ PBB الاستباقي (منهج "المتدرب")

  • الخطوة 1: تعلم الروبوت مجموعة من الوصفات المختلفة (التعليمات) جنباً إلى جنب مع الطبخ الفعلي (الأمثلة). يتعلم الروبوت الارتباط بين "قراءة الوصفة" و"القيام بالطبخ".
  • الخطوة 2: تعطي الروبوت وصفة جديدة لم يسبق له رؤيتها من قبل، ولكنك لا تريه عملية الطبخ. أنت فقط تقول له: "هذا هو النص، استنتجه بنفسك".
  • النتيجة: لأن الروبوت تعلم بالفعل كيف يتعلم من الوصفات في الخطوة 1، يمكنه فوراً "ترجمة" الوصفة الجديدة إلى دماغه وتنفيذها.

ب. الـ PBB اللاحق (منهج "النظرية أولاً")

  • الخطوة 1: تغمر الروبوت بآلاف الوصفات (التعليمات) ولكن بدون أمثلة طبخ. يحفظ الروبوت نصوص الوصفات لكنه لا يعرف كيف يطبخ بعد. الأمر يشبه قراءة كتاب طبخ من الغلاف إلى الغلاف ولكن دون دخول المطبخ أبداً.
  • الخطوة 2: بعد ذلك، تري الروبوت كيف يطبخ بعض الأطباق المحددة.
  • النتيجة: فجأة، "يستيقظ" الروبوت. تعمل أمثلة الطبخ كـ "مفتاح" يفتح المعرفة التي خزنها في الخطوة 1. يدرك الروبوت: "أوه! هذه الوصفة التي حفظتها سابقاً تعني أن عليّ فعل هذا!". يمكنه بعد ذلك تطبيق ذلك المنطق على وصفات جديدة لم يرها من قبل.

3. لماذا هذا مهم (السحر)

  • كفاءة فائقة: في تجاربهم، كان إعطاء الذكاء الاصطناعي تعليمات واحدة فقط يعطي نتيجة تقارب إعطاءه 100 مثال. هذا يوفر وقتاً هائلاً وبيانات ضخمة.
  • إصلاح الانحيازات: تخيل أنك تظهر للروبوت فقط كيف يطبخ باستخدام "الملح" لأن هذا هو كل ما تملكه في مطبخك. سيعتقد الروبوت أن كل الطعام يحتاج إلى ملح. ولكن إذا أعطيته التعليمات "تبّل حسب الذوق"، فسيتعلم القاعدة العامة ولن ينحاز للملح فقط. يساعد الـ PBB النماذج على تعلم القاعدة بدلاً من مجرد نسخ الأمثلة.
  • الكود مقابل الكلمات: وجدت الورقة أن الروبوت يتعلم بشكل أفضل عندما تكون التعليمات مكتوبة بصيغة كود (مثل لغة بايثون) بدلاً من اللغة الطبيعية (مثل الجمل الإنجليزية). الأمر يشبه أن الروبوت يفهم "رياضيات" التعليمات بشكل أفضل من "القصة". ومع ذلك، مع كبر حجم الروبوتات وزيادة ذكائها، أصبحت أفضل في فهم تعليمات اللغة الطبيعية أيضاً.

4. العقبة (الجانب السلبي)

تعترف الورقة بأن هذه المعرفة "المترجمة" ليست مثالية بعد.

  • إذا أعطيت الروبوت التعليمات الآن (في الدردشة)، فإنها تعمل بشكل مثالي.
  • إذا اعتمدت على كون الروبوت قد "حفظ" التعليمات من مرحلة التدريب (PBB)، فإنها تعمل بنسبة 80-90% تقريباً. إنها "مشوشة" قليلاً، مثل راديو به بعض التشويش، لكنها تؤدي المهمة.

الصورة الكبيرة

تشير هذه الأبحاث إلى أننا لسنا بحاجة لتغذية الذكاء الاصطناعي بملايين الأمثلة لكل مهمة على حدة. بدلاً من ذلك، يمكننا تعليمهم القواعد والمنطق لكيفية القيام بالأشياء.

تحذير سلامة:
هذا سلاح ذو حدين. إذا استطعنا "برمجة" السلوكيات في الذكاء الاصطناعي بمجرد كتابة تعليمات في بيانات التدريب الخاصة به، فيجب أن نكون حذرين للغاية. إذا أدرجنا تعليمات خطيرة بالخطأ في بيانات التدريب، فقد يقوم الذكاء الاصطناعي بـ "ترجمة" هذا السلوك الخطير في دماغه وتنفيذه لاحقاً، حتى لو لم نخبره صراحةً بفعل ذلك أثناء الدردشة.

باختصار: الـ PBB يشبه تعليم طالب مبادئ الرياضيات حتى يتمكن من حل أي مسألة، بدلاً من جعله يحفظ إجابات 1000 سؤال واجب منزلي محدد. إنه أسرع، وأذكى، ويغير طريقة تفكيرنا في التدريب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →