← أحدث الأبحاث
🤖 machine learning

Best Policy Learning from Trajectory Preference Feedback

تقدم هذه الورقة خوارزمية "أخذ العينات اللاحقة لتعلم التفضيلات" (PSPL)، وهي خوارزمية مبتكرة تجمع بين بيانات التفضيل غير المتصلة بالإنترنت والاستكشاف الصرف المتصل بالإنترنت لتحقيق أول ضمانات للندم البسيط البايزي لتحديد السياسة الأفضل في تعلم التعزيز القائم على التفضيل، مما يظهر أداءً فائقًا على القواعد المرجعية الحالية في مختلف الاختبارات المعيارية.

المؤلفون الأصليون: Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

نُشر 2026-04-23
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية قيادة سيارة، لكن ليس لديك دليل تعليمات، ولا يمكنك سؤال الروبوت "ما هي المكافأة لهذا الإجراء؟" لأن الروبوت لا يفهم الأرقام. بدلاً من ذلك، عليك أن تتصرف كأب؛ تراقب الروبوت وهو يقود مسارين مختلفين، وتقول ببساطة: "لقد أعجبني المسار (أ) أكثر من المسار (ب)".

هذا هو التحدي الجوهري لـ التعلم المعزز من التغذية الراجعة البشرية (RLHF)، وهي تقنية تُستخدم لتدريب نماذج الذكاء الاصطناي (مثل روبوتات الدردشة أو مولدات الصور) لتتصرف بالطريقة التي يريدها البشر.

إليك تحليل بسيط لقصة الورقة البحثية، باستخدام تشبيهات من الحياة اليومية.

1. المشكلة: "المعلم السيئ" و"الخريطة المكسورة"

يعتمد تدريب الذكاء الاصطناعي حالياً في كثير من الأحيان على عملية مكونة من خطوتين، وهي عرضة للأخطاء:

  1. نموذج المكافأة: أولاً، يحاول البشر كتابة "بطاقة تقييم" (صيغة رياضية) تتنبأ بمدى إعجاب الإنسان بمخرج معين.
  2. التحسين (Optimization): يحاول الذكاء الاصطناعي تعظيم هذه الدرجة.

الفخ: البشر سيئون في كتابة بطاقات تقييم مثالية. أحياناً يجد الذكاء الاصطناعي ثغرة للحصول على درجة عالية دون أن يكون مفيداً حقاً (وهذا ما يسمى "اختراق المكافأة" أو reward hacking). أيضاً، البيانات المستخدمة لبناء بطاقة التقييم تلك غالباً ما تأتي من مجموعة معينة من الناس أو من وقت محدد، مما يجعلها منحازة. إذا لم يكن "المعلم" (المقيم البشري) خبيراً، فسوف يتعلم الذكاء الاصطناعي عادات سيئة.

2. الحل: "أخذ العينات اللاحقة لتعلم التفضيلات" (PSPL)

يقترح المؤلفون طريقة أذكى للتعلم تسمى PSPL. بدلاً من محاولة بناء بطاقة تقييم مثالية أولاً، يتركون الذكاء الاصطناعي يتعلم مباشرة من مقارنات "أ مقابل ب"، مع الاحتفاظ بـ "خريطة ذهنية" لما يعرفونه وما لا يعرفونه.

فكر في PSPL كـ محقق يمتلك كرة بلورية:

  • الأدلة غير المتصلة (ملفات القضايا القديمة): قبل أن يبدأ المحقق في التحقيق، يُعطى صندوقاً من ملفات القضايا القديمة (مجموعة بيانات غير متصلة/offline dataset). تحتوي هذه الملفات على مقارنات سابقة (على سبيل المثال: "في عام 2023، فضل الناس هذا المسار").
    • التحول: المحقق يعرف أن هذه الملفات قد تكون من محقق "متواضع الكفاءة" (مقيم ذو كفاءة منخفضة). ربما كان المحقق القديم متعباً أو لا يعرف المدينة جيداً.
  • التحقيق الميداني (الدورية الجديدة): يخرج المحقق إلى الشارع لجمع أدلة جديدة. يجرب مسارين مختلفين، ويسأل مجموعة جديدة من الناس أيهما أفضل، ويقوم بتحديث خريطته.
  • الكرة البلورية (أخذ العينات اللاحقة - Posterior Sampling): المحقق لا يكتفي بمجرد تخمين "أفضل مسار" واحد. بدلاً من ذلك، يتخيل نسختين مختلفتين من الواقع في آن واحد.
    • الواقع (أ): "ماذا لو كانت الملفات القديمة صحيحة في معظمها، والمدينة آمنة في الغالب؟"
    • الواقع (ب): "ماذا لو كانت الملفات القديمة خاطئة، والمدينة في الواقع خطيرة؟"
    • يحاول المحقق قيادة مسار يعمل بشكل جيد في كلا الواقعين. هذا يجبره على استكشاف المناطق التي لا يملك يقيناً بشأنها، بدلاً من مجرد الالتزام بما يعتقد أنه يعرفه.

3. السر الخفي: معرفة مدى "كفاءة" المُقيّم

تقدم الورقة البحثية مفهوماً ذكياً يسمى كفاءة المُقيّم (Rater Competence).

تخيل أنك تتعلم الطبخ.

  • السيناريو (أ): تحصل على ملاحظات من طاهٍ حائز على نجمة ميشلان. رأيه يعتبر ذهباً.
  • السيناريو (ب): تحصل على ملاحظات من طفل صغير يحب فقط الطعام الحار.

خوارزمية PSPL ذكية بما يكفي لتسأل: "إلى أي مدى يجب أن أثق في هذه التغذية الراجعة؟"

  • إذا كان المُقيّم خبيراً (كفاءة عالية)، فإن الذكاء الاصطناعي يعتمد بشدة على ملاحظاته.
  • إذا كان المُقيّم جاهلاً (كفاءة منخفضة)، فإن الذكاء الاصطناعي يعامل ملاحظاته كـ "ضجيج" ويعتمد أكثر على استكشافه الخاص.

تثبت الورقة البحثية رياضياً أنه حتى لو كانت البيانات غير المتصلة قادمة من مُقيّم "متوسط"، يمكن للذكاء الاصطناعي أن يتعلم السياسة الأفضل (أفضل مسار) من خلال الجمع بين تلك البيانات غير المثالية والاستكشاف الذكي عبر الإنترنت.

4. النسخة "المُدبّرة" (Bootstrapped) (لجعلها عملية)

النسخة المثالية من هذه الخوارزمية (PSPL) جميلة رياضياً ولكنها ثقيلة حسابياً — مثل محاولة حل مكعب روبيك بينما تقوم بالتلاعب بسلاسل حديدية.

لجعلها قابلة للاستخدام في العالم الحقيقي، ابتكر المؤلفون نسخة Bootstrapped PSPL.

  • التشبيه: بدلاً من حل مكعب روبيك بشكل مثالي، يأخذون لقطة سريعة للحالة الراهنة، يهزون المكعب قليلاً (بإضافة ضوضاء عشوائية)، ثم يحلون هذه النسخة المختلفة قليلاً. يفعلون ذلك عدة مرات.
  • النتيجة: هذا يخلق تقريباً "جيد بما يكفي" يعمل بسرعة على أجهزة الكمبيوتر ولكنه لا يزال يحتفظ بسحر استكشاف المجهول.

5. النتائج: هل نجح الأمر؟

اختبر المؤلفون هذا على:

  1. ألعاب الفيديو: مثل Mountain Car (سيارة تصعد تلة) و RiverSwim (سمكة تحاول السباحة عكس التيار).
  2. توليد الصور: تعليم الذكاء الاصطناعي توليد صور أفضل بناءً على تفضيلات البشر (باستخدام مجموعة بيانات "Pick-a-Pic").

النتيجة:
في كل اختبار، وجدت PSPL "السياسة الأفضل" (أفضل طريقة للقيادة، أو السباحة، أو توليد الصور) بشكل أسرع وبأخطاء أقل من الطرق الموجودة. لقد كانت بارعة بشكل خاص في التعامل مع المواقف التي كانت فيها البيانات الأولية منحازة أو عندما لم يكن المقيمون البشريون خبراء مثاليين.

ملخص

تتعلق هذه الورقة البحثية بتعليم الذكاء الاصطناعي التعلم من المقارنات ("أنا أفضل أ من ب") بدلاً من الدرجات. إنها تحل مشكلة "البيانات السيئة" باستخدام خدعة إحصائية ذكية (أخذ عينات من واقعين مختلفين) لمعرفة مدى الثقة في البيانات. الأمر يشبه امتلاك طالب يمكنه التعلم من كتاب مدرسي معيب ومن معلم واقعي في آن واحد، مع معرفة مقدار الاستماع لكل منهما، ليصبح الخبير النهائي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →