← أحدث الأبحاث
📊 statistics

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

توسع هذه الورقة البحثية نطاق محاذاة التفضيلات القائمة على التباعد لتشمل محاذاة النماذج اللغوية الكبيرة العامة من خلال تقديم ff-GRPO وff-HAL، اللذين يستفيدان من تقدير تباعد ff لتحسين الاستدلال القائم على المكافأة والتخفيف من حدة اختراق المكافأة في محاذاة السلامة.

المؤلفون الأصليون: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتدريب مساعد روبوت ذكي للغاية ولكنه مشاكس قليلاً (نموذج لغوي كبير) ليكون مفيداً، وآمناً، وجيداً في حل الألغاز. الورقة البحثية التي تقرأها تشبه دليل تعليمات جديد لكيفية تعليم هذا الروبوت، وتحديداً التركيز على طريقتين مختلفتين لتقديم التغذية الراجعة له.

إليك قصة الورقة البحثية، مقسمة إلى مفاهيم وأمثلة بسيطة.

الطريقتان لتعليم الروبوت

يوضح المؤلفون أن هناك "فصلين دراسيين" رئيسيين نعلم فيهما هذه الروبوتات، وعادة ما نستخدم أساليب تعليم مختلفة لكل منهما.

1. "حصة الرياضيات" (المكافآت القابلة للتحقق)

  • السيناريو: تخيل تعليم الروبوت الرياضيات. إذا حل المسألة 2+22+2، يمكنك التحقق من الإجابة فوراً. فهي إما صحيحة (درجة عالية) أو خاطئة (درجة منخفضة).
  • الطريقة القديمة (GRPO): الطريقة الأفضل حالياً هي تشبه مدرباً يقول: "عمل رائع على تلك الإجابة! افعل المزيد من أمثالها. عمل سيء على تلك؛ افعل أقل منها". إنه ينظر إلى مجموعة من الإجابات، ويحسب متوسط الدرجات، ثم يخبر الروبوت بأن يهدف إلى أي شيء فوق المتوسط.
  • المشكلة: إنها طريقة فظة بعض الشيء. فهي تعامل جميع الإجابات "فوق المتوسط" بنفس الطريقة، حتى لو كانت إحدى الإجابات أفضل بكثير من غيرها.

2. "حصة الفنون" (التفضيلات)

  • السيناريو: الآن تخيل تعليم الروبوت أن يكون مهذباً أو آمناً. لا توجد إجابة واحدة "صحيحة". بدلاً من ذلك، تعرض عليه استجابتين وتقول له: "أنا أفضل هذه عن تلك".
  • الطريقة القديمة: يتعلم الروبوت من خلال مقارنة هذه الأزواج. يحاول جعل الاستجابات "المفضلة" أكثر احتمالاً، والاستجابات "غير المفضلة" أقل احتمالاً.

الفكرة الكبرى: لغة موحدة واحدة

لاحظ المؤلفون شيئاً مثيراً للاهتمام: في كل من حصة الرياضيات وحصة الفنون، الهدف هو في الواقع نفسه. أنت تحاول دفع سلوك الروبوت بعيداً عن الاستجابات "السيئة" ونحو الاستجابات "الجيدة".

في لغة الرياضيات، يسمون هذا التباعد (Divergence). فكر في "التباعد" كالمسافة بين مجموعتين من الناس:

  • المجموعة (أ): الاستجابات "الجيدة" (المتوافقة).
  • المجموعة (ب): الاستجابات "السيئة" (غير المتوافقة).

تجادل الورقة بأنه يمكننا استخدام أداة رياضية واحدة لقياس المسافة بين هاتين المجموعتين، سواء كنا في حصة الرياضيات أو حصة الفنون. ويسمون هذه الأداة f-Divergence.

الأدوات الجديدة: f-GRPO و f-HAL

بنى المؤلفون أداتين جديدتين لـ "خوارزميات التعليم" بناءً على هذه الفكرة.

1. f-GRPO: ترقية "حصة الرياضيات"

  • ما هي: طريقة جديدة لتعليم الروبوت في حصة الرياضيات (حيث توجد إجابات صحيحة وخاطئة واضحة).
  • المثال التشبيهي: تخيل أن المدرب القديم (GRPO) كان يصرخ: "كل من هو فوق المتوسط، عمل جيد!". المدرب الجديد (f-GRPO) أكثر دقة. إنه يقول: "نحن نحاول دفع المجموعة 'الجيدة' بعيداً عن المجموعة 'السيئة' قدر الإمكان".
  • كيف تعمل: بدلاً من مجرد النظر إلى متوسط الدرجات، فإنه يخلق "قوة" رياضية تدفع الروبوت لإنتاج إجابات ذات درجات عالية، وتكبح بنشاط الإجابات ذات الدرجات المنخفضة. إنه يعامل الفرق بين الإجابات الجيدة والسيئة كمسافة فيزيائية يجب تعظيمها.
  • النتيجة: في تجاربهم، ساعد هذا المدرب الجديد الروبوت على حل مسائل الرياضيات بشكل أفضل من المدرب القديم، خاصة في الألغاز الصعبة جداً.

2. f-HAL: المعلم "الهجين"

  • المشكلة: أحياناً، لا نملك درجة "حصة رياضيات" مثالية. على سبيل المثال، عند تعليم السلامة، قد نستخدم "نموذج مكافأة" (ذكاء اصطناعي ثانٍ) لتخمين ما إذا كانت الإجابة آمنة. لكن هذا الذكاء الاصطنا الثاني قد يكون مخطئاً أو يمكن "خداعه" (وهذا ما يسمى اختراق المكافأة - Reward Hacking). قد يتعلم الروبوت قول أشياء تبدو آمنة للذكاء الاصطنا الثاني ولكنها في الواقع غريبة أو غير مفيدة.
  • الحل: f-HAL هو معلم هجين. يجمع بين إشارتين:
    1. إشارة السياسة الحالية (On-Policy): "انظر إلى ما يفعله الروبوت الآن وأعطه درجة". (جيدة لاستكشاف أفكار جديدة).
    2. إشارة السياسة الخارجية (Off-Policy): "إليك قائمة من الأمثلة المعتمدة بشرياً للسلوك الجيد والسيئ". (جيدة لإبقاء الروبوت متزناً).
  • المثال التشبيهي: تخيل طالباً يؤدي اختباراً.
    • السياسة الحالية الصرفة: الطالب يستمع فقط لمعلم يخمن الإجابات. إذا كان المعلم سيئاً في التخمين، سيفشل الطالب.
    • السياسة الخارجية الصرفة: الطالب يحفظ فقط مفاتيح الإجابات القديمة. قد يكون جامداً جداً ويفشل في التكيف مع الأسئلة الجديدة.
    • f-HAL (الهجين): الطالب يستمع للمعلم الذي يخمن، لكنه يحتفظ أيضاً بنسخة من مفاتيح الإجابات القديمة على مكتبه. إذا بدأ المعلم بقول شيء جنوني، يتحقق الطالب من المفاتيح ويقول: "مهلاً، هذا لا يتطابق مع القواعد".
  • النتيجة: أوقف هذا النهج الهجين الروبوت عن "الغش" (اختراق المكافأة) عندما كانت درجة السلامة غير مثالية. لقد أبقى الروبوت آمناً ومفيداً، حتى عندما كان نظام "التقييم" غير مثالي.

لماذا هذا مهم (وفقاً للورقة البحثية)

تدعي الورقة أنه من خلال النظر إلى "التوافق" (تعليم الروبوت) كمسألة قياس المسافة بين المجموعات، فقد أنشأوا إطاراً موحداً.

  • للرياضيات/المنطق: أثبتوا أن طريقتهم الجديدة (f-GRPO) تضمن حصول الروبوت على درجات أفضل، مما يدفعه نظرياً نحو أفضل الإجابات الممكنة.
  • للسلامة/التفضيلات: أثبتوا أن دمج التفضيلات البشرية مع درجات المكافأة (f-HAL) يمنع الروبوت من الارتباك أو التعرض للخداع من قبل أنظمة التقييم غير المثالية.

الملخص في جملة واحدة

اخترع المؤلفون طريقة جديدة لتعليم روبوتات الذكاء الاصطناعي عبر التعامل مع السلوك "الجيد" و"السيئ" كمجموعتين يجب دفعهما بعيداً عن بعضهما البعض، مما خلق نظاماً واحداً مرناً يعمل بشكل أفضل لكل من ألغاز الرياضيات وقواعد السلامة مقارنة بالطرق المستخدمة سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →