← أحدث الأبحاث
🤖 AI

RLSF: Fine-tuning LLMs via Symbolic Feedback

تقدم الورقة البحثية "التعلم التعزيزي عبر التغذية الراجعة الرمزية" (RLSF)، وهو نموذج جديد للضبط الدقيق يستفيد من أدوات الاستدلال الرمزي لتوفير تغذية راجعة دقيقة على مستوى الرمز (token-level)، مما يمكّن النماذج اللغوية الكبيرة الأصغر حجماً من التفوق بشكل كبير على النماذج المغلقة الأكبر حجماً في المهام التي تتطلب توافقاً منطقياً خاصاً بمجال معين.

المؤلفون الأصليون: Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh

نُشر 2026-02-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم متدرب شيف موهوب للغاية ولكنه يفتقر للخبرة (وهو النموذج اللغوي الكبير أو LLM) كيفية طهي أطباق معقدة.

المشكلة: فخ "اختبار التذوق"

تقليديًا، لتعليم هذا الشيف، كنت ستستخدم طريقة تسمى RLHF (التعلم التعزيزي من خلال التعليقات البشرية). وإليك كيف تعمل:

  1. يقوم الشيف بطهي طبق ما.
  2. تقوم أنت بتذوقه وتعطي إشارة بسيطة بالإبهام للأعلى أو للأسفل (مكافأة عددية).
  3. تقول للشيف: "عمل جيد" أو "عمل سيء".

الخلل: إذا وضع الشيف ملحًا في الكعكة بدلاً من السكر، وقلت له فقط "عمل سيء"، فلن يعرف الشيف لماذا فشل. هل استخدم الكثير من الملح؟ هل كانت الفرن ساخنة جدًا؟ هل نسي البيض؟ بدون تفاصيل محددة، سيستمر الشيف في التخمين، ويرتكب نفس الأخطاء مرارًا وتكرارًا. كما أن توظيف بشر لتذوق كل طبق هو أمر بطيء ومكلف، وأحيانًا يختلف المتذوقون البشر فيما بينهم.

الحل: RLSF (المفتش الذكي)

يقترح مؤلفو هذه الورقة البحثية طريقة جديدة تسمى RLSF (التعلم التعزيزي عبر التغذية الراجعة الرمزية). بدلاً من متذوق بشري، سنستخدم أداة استدلال رمزي — تخيلها كمفتش آلي فائق الدقة ولا يرمش له جفن، يعرف القوانين الدقيقة للكيمياء أو الرياضيات أو البرمجة.

إليك كيف يغير RLSF قواعد اللعبة:

  1. الشيف يطهو: يقوم النموذج اللغوي الكبير (LLM) بإنشاء حل (قطعة من الكود البرمجي، أو صيغة كيميائية، أو معادلة رياضية).
  2. المفتش يفحص: بدلاً من مجرد قول "جيد/سيء"، يقوم المفتش الآلي بتشغيل الحل عبر كتاب قواعد صارم (مثل مترجم لغة البرمجة "Compiler" للكود، أو محاكي كيميائي للجزيئات).
  3. التغذية الراجعة بـ "الأشعة السينية": المفتش لا يكتفي بإعطاء إشارة سلبية فحسب، بل يقدم خريطة مفصلة للأخطاء.
    • مثال: "السطر 4 يحتوي على فاصلة منقوطة مفقودة. السطر 7 يستخدم عنصرًا كيميائيًا غير موجود. السطر 12 ينتهك قانون حفظ الكتلة."
  4. التصحيح: يتلقى الشيف (LLM) هذه التغذية الراجعة المحددة، سطرًا بسطر، ويتعلم بالضبط أين يجب عليه إصلاح الوصفة.

التشبيه السحري: "نظام تحديد المواقع (GPS) مقابل البوصلة"

  • RLHF التقليدي يشبه إعطاء سائق بوصلة تشير فقط إلى "الشمال" أو "الجنوب". هي تخبره أنه يسير في الاتجاه الخاطئ، لكنها لا تخبره كيف يعود إلى المسار الصحيح.
  • RLSF يشبه نظام تحديد المواقع (GPS) مع ملاحة خطوة بخطوة. فهو يقول لك: "لقد فاتك مخرج شارع Main. انعطف يسارًا بعد 200 قدم. أنت حاليًا على بُعد 5 أميال عن المسار الصحيح". إنه يعطي تعليمات دقيقة وقابلة للتنفيذ.

النتائج: الأسماك الصغيرة تغلب الحيتان

الجزء الأكثر إثارة في هذه الورقة هو قصة "داود ضد جالوت".

عادةً، للحصول على أفضل النتائج، تحتاج إلى نموذج "جالوت" ضخم ومكلف (مثل GPT-4، وهو ضخم ويكلف ثروة). أخذ المؤلفون نماذج "داود" أصغر وأرخص بكثير (مثل نماذج بـ 2 مليار أو 7 مليارات معلمة/Parameter) ودربوها باستخدام طريقة RLSF هذه.

النتيجة:

  • البرمجة: نموذج صغير تم تدريبه باستخدام RLSF كتب كود C++ أفضل من نموذج أكبر منه بـ 100 مرة (GPT-3.5).
  • الكيمياء: نموذج كيميائي صغير ولد جزيئات صالحة بشكل أفضل من نموذج أكبر منه بـ 1,000 مرة (GPT-4).
  • الرياضيات: نموذج صغير حل لغز "لعبة الـ 24" (لغز رياضي) بشكل أفضل من النموذج العملاق GPT-3.5.

لماذا يهم هذا الأمر؟

هذا النهج يغير قواعد اللعبة لأن:

  1. إنه أرخص: لا تحتاج لتوظيف آلاف البشر لتقييم كل إجابة. "المفتش الآلي" يقوم بذلك فورًا.
  2. إنه أذكى: يمكنه رصد الأخطاء الدقيقة التي قد يغفل عنها البشر.
  3. إنه مرن: لا تحتاج لأن يكون المفتش الآلي "ذكيًا" بالطريقة البشرية؛ يحتاج فقط لاتباع قواعد منطقية صارمة. وهذا يعني أنه يمكنك استخدامه للبرمجة، أو الرياضيات، أو الكيمياء، أو أي مجال له قواعد ثابتة.

باختصار: RLSF لا يعلم الذكاء الاصطناي ليس فقط ما هو الخطأ، بل بالضبط أين ولماذا هو خطأ، مما يسمح لنماذج الذكاء الاصطناعي الصغيرة والميسورة التكلفة بالتفوق على النماذج الضخمة والمكلفة في المهام التي تتطلب المنطق والدقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →