← أحدث الأبحاث
🤖 machine learning

ff-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

تقدم هذه الورقة "توازن المسار ff" (ff-Trajectory Balance)، وهي عائلة من دوال الخسارة التي توسع نهج متوسط مربع الخطأ ليشمل جميع تباعدات ff، مما يتيح تدريب النماذج التوليدية والنماذج اللغوية الكبيرة باستخدام بيانات خارج السياسة مع الحفاظ على خصائص التحسين المحددة (مثل تغطية الأنماط) لتدرجات تباعد ff المقابلة لها في السياسة.

المؤلفون الأصليون: Jake Fawkes, Jason Hartford

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jake Fawkes, Jason Hartford

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية استكشاف نظام كهوف شاسع ومظلم. الكهف يحتوي على العديد من الغرف المخفية (التي تسمى "الأنماط" أو modes)، وبعضها يحتوي على ذهب (مكافآت عالية)، والبعض الآخر مجرد غرف فارغة أو خطيرة. هدفك هو تعليم الروبوت كيفية العثور على أكبر عدد ممكن من غرف الذهب المختلفة، بدلاً من مجرد العثور على منجم ذهب واحد كبير وتجاهل كل ما عداه.

تقدم هذه الورقة البحثية مجموعة جديدة من "أدوات التعليم" (دوال الخسارة - loss functions) لمساعدة تدريب هذه الروبوتات، سواء كانت تولد جزيئات لأدوية جديدة، أو تصنع الفن، أو تكتب الأكواد البرمجية.

إليك تفصيل أفكار الورقة باستخدام تشبيهات بسيطة:

1. المشكلة: "حمى الذهب" مقابل "المستكشف"

في الماضي، كانت الطريقة القياسية لتعليم هذه الروبوتات تشبه "حمى الذهب". يجد الروبوت بقعة بها القليل من الذهب، فيتحمس، ثم يقضي كل وقته في الحفر هناك. إنه يتجاهل جميع مناجم الذهب الأخرى في الكهف.

  • من الناحية التقنية: يسمى هذا "البحث عن النمط" (mode-seeking). ينهار النموذج على عدد قليل من الإجابات ذات الاحتمالية العالية ويتجاهل بقية التنوع.
  • هدف الورقة: نريد "تغطية الأنماط" (mode-covering). نريد من الروبوت أن ينتشر ويستكشف كل مناجم الذهب، حتى الصغيرة منها، للحصول على خريطة كاملة للكهف.

2. الأداة القديمة: خسارة "KL المربعة" (Squared KL Loss)

مؤخرًا، وجد الباحثون حيلة ذكية لتعليم الروبوتات باستخدام طريقة "الخطأ المربع" (قياس المسافة بين ما يعتقده الروبوت وما يجب أن يعتقده).

  • التشبيه: تخيل معلمًا يصحح لطالب. إذا أخطأ الطالب في الإجابة، لا يكتفي المعلم بقول "خطأ" فقط، بل يحسب مربع الخطأ.
  • الفائدة: هذه الطريقة مستقرة جدًا. وهي تعمل حتى لو كان الطالب يتعلم من ملاحظات قديمة (بيانات خارج السياسة - off-policy) بدلاً من الدروس المباشرة.
  • العيب: على الرغم من أنها مستقرة، إلا أن هذه الطريقة "المربعة" المحددة لا تزال تعمل مثل "حمى الذهب". فهي تدفع الروبوت طبيعيًا للتركيز على إجابات قليلة فقط، مما يؤدي لتجاهل تنوع الكهف.

3. الحل الجديد: عائلة "توازن مسار f" (f-Trajectory Balance)

أدرك المؤلفون أن الطريقة "المربعة" هي مجرد نكهة محددة من عائلة أكبر بكثير من أدوات التعليم. هم يسمون هذه العائلة f-Trajectory Balance.

فكر في هذه العائلة كأنها مقبض تحكم أو مفتاح رفع الصوت في الراديو.

  • تدوير المقبض في اتجاه واحد (الأرقام المنخفضة): تحصل على أدوات تعمل مثل "المستكشف الفائق". هذه الأدوات تجبر الرابط على الانتشار والعثور على كل منجم ذهب ممكن، حتى تلك التي يصعب الوصول إليها. هذا مفيد جدًا في اكتشاف الأدوية حيث تريد العثور على أي جزيء قد يعمل، وليس فقط الأكثر وضوحًا.
  • تدوير المقبض في الاتجاه الآخر (الأرقام العالية): تحصل على أدوات تعمل مثل "منقب الذهب". هذه الأدوات تخبر الروبوت بتجاهل المناجم الصغيرة والتركيز بشدة على أكبر وأوضح كومة ذهب. هذا مفيد إذا كنت تريد أفضل إجابة واحدة فقط.
  • المنطقة الوسطى: يمكنك ضبط المقبض في أي مكان بينهما للحصول على مزيج من الاستكشاف والتركيز.

4. لماذا يعد هذا أمرًا مهمًا؟

أثبتت الورقة شيئين رئيسيين:

  1. "المفتاح السحري": أظهروا أنه يمكنك استبدال الأداة "المربعة" القياسية بأي من أدوات "المقبض" الجديدة هذه، والرياضيات ستعمل بشكل مثالي. يتعلم الروبوت بنفس الجودة، ولكن بشخصية مختلفة (أكثر استكشافًا أو أكثر تركيزًا).
  2. الاستقرار: تمامًا مثل الأداة القديمة، تعمل هذه الأدوات الجديدة حتى لو كان الروبوت يتعلم من بيانات قديمة (off-policy). وهذا أمر بالغ الأهمية لتطبيقات مثل نماذج اللغات الكبيرة (LLMs)، حيث يحدث التدريب غالبًا بشكل غير متزامن (asynchronously) (أي أن الروبوت يتعلم من بيانات تم إنشاؤها منذ فترة).

5. الاختبارات الواقعية (خرائط الكهوف)

اختبر المؤلفون هذه الأدوات في ثلاثة "كهوف" مختلفة:

  • لعبة الشبكة (Grid Game): متاهة كمبيوتر بسيطة بها أربعة أركان مليئة بالذهب. الأداة القياسية وجدت ركنًا واحدًا فقط، بينما وجدت أدوات "المستكشف" الجديدة جميع الأركان الأربعة بسرعة.
  • اكتشاف الجزيئات (SynFlowNet): حاولوا توليد جزيئات كيميائية جديدة. من خلال ضبط المقبض نحو "المستكشف"، أنتجوا تنوعًا أكبر بكثير من الجزيئات الفريدة التي يمكن أن تكون أدوية، بدلاً من مجرد تنويعات على نفس المواد الكيميائية القليلة.
  • نماذج اللغات (LLMs): قاموا بضبط نماذج الذكاء الاصطناعي لحل المسائل الرياضية. سمحت هذه الأدوات الجديدة للذكاء الاصطناعي باستكشاف طرق مختلفة لحل المشكلات دون الوقوع في حلقة مفرغة من تكرار نفس الإجابة، حتى عندما كان تدريب البيانات متأخرًا (غير متزامن).

الملخص

هذه الورقة لا تخترع نوعًا جديدًا من الروبوتات. بدًا من ذلك، تخترع مجموعة جديدة من التعليمات لكيفية تدريبها.

  • الطريقة القديمة: "ابحث عن أكبر منجم ذهب واحفر هناك." (مستقرة، لكنها مملة).
  • الطريقة الجديدة: "إليك مقبض تحكم. يمكنك اختيار أن تكون منقب ذهب، أو مستكشفًا فائقًا، أو أي شيء بينهما. ولا يهم أي خيار تختار، فإن التدريب سيكون مستقرًا وسيعمل مع البيانات القديمة."

هذا يمنح المهندسين مقبض تحكم بسيط للتحكم في مدى إبداع أو تركيز نماذج الذكاء الاصطنا st، دون إفساد عملية التدريب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →