← أحدث الأبحاث
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

تقدم الورقة البحثية "تحسين السياسة المتجهية" (VPO)، وهو خوارزمية للتعلم المعزز تدرب النماذج اللغوية على توليد حلول متنوعة من خلال الاستفادة من المكافآت ذات القيم المتجهية، مما يحسن أداءها بشكل كبير في إجراءات البحث في وقت الاختبار مقارنة بتحسين المكافأة القياسية القياسية.

المؤلفون الأصليون: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك طاهٍ تقوم بتدريب متدرب جديد للطبخ لتقديم الطعام لناقد طعام صعب الإرضاء للغاية. الناقد لا يريد فقط "وجبة جيدة"؛ بل لديه قائمة معقدة من الرغبات المحددة: ربما يريد شريحة اللحم (الستيك) بنضج قليل، والصلصة حارة، والخضروات مقرمشة، وطريقة التقديم فنية.

الطريقة القديمة: الطاهي "الذي يناسب الجميع"

في الماضي، عندما كنا ندرب الذكاء الاصطناعي (مثل النماذج اللغوية الكبيرة)، كنا نستخدم طريقة تسمى تحسين المكافأة القياسية (Scalar Reward Optimization) (والتي تمثلها ورقة GRPO في البحث).

فكر في الأمر كأنك تقول للمتدرب: "هدفك هو الحصول على أعلى درجة ممكنة بناءً على رقم واحد: 50% جودة الستيك + 50% جودة الصلصة".

سيدرك المتدرب بسرعة أنه للحصول على أعلى درجة، يجب عليه التوقف عن التجربة. سيقوم بطبخ نفس "مزيج الستيك والصلصة المثالي" مراراً وتكراراً. سيصبح خبيراً في طبق واحد محدد.

  • المشكلة: عندما يأتي الناقد بالفعل، قد يقول: "في الواقع، أريد اليوم الستيك بنضج متوسط-قليل، والصلصة حلوة". المتدرب، الذي لم يتدرب إلا على وصفة واحدة محددة، ليس لديه أدنى فكرة عما يجب فعله. لديه إجابة واحدة فقط، وهي الإجابة الخاطئة لليوم.

الطريقة الجديدة: تحسين السياسة المتجهية (VPO)

يقترح البحث طريقة تدريب جديدة تسمى تحسين السياسة المتجهية (Vector Policy Optimization - VPO).

بدلاً من إعطاء المتدرب درجة واحدة، يقول له المدرب: "سأعطيك قائمة بأهداف مختلفة. أحياناً أريدك أن تركز على الستيك، وأحياناً على الصلصة، وأحياناً على الخضروات. أريدك أن تطبخ طبقاً من أطباق متنوعة في المرة الواحدة، حيث يكون كل طبق بمثابة تحفة فنية لمزيج مختلف".

يتعلم المتدرب إنشاء مجموعة متنوعة من الحلول:

  1. الطبق (أ): ستيك مثالي، صلصة بسيطة.
  2. الطبق (ب): ستيك متوسط النضج، صلصة معقدة وحارة.
  3. الطبق (ج): خضروات مقرمشة، تقديم فني.

هم لا يحاولون العثور على الطبق الواحد الأفضل. إنهم يحاولون تغطية "خريطة" كاملة من تركيبات الطعام اللذيذة الممكنة (ما يسميه البحث جبهة باريتو - Pareto Frontier).

"البحث وقت الاختبار" (وصول الناقد)

هنا يحدث السحر. يجادل البحث بأن أنظمة الذكاء الاصطناعي الحديثة لا تكتفي بإخراج إجابة واحدة وتأمل في الأفضل. بدلاً من ذلك، يعمل النظام مثل محرك بحث في لحظة الاستخدام (الاستنتاج).

عندما يصل الناقد بطلبه الفريد والمحدد (على سبيل المثال: "أريد الستيك بنضج قليل ولكن الصلصة حلوة")، لا يطلب النظام من الذكاء الاصطناعي طبخ طبق جديد من الصفر. بدلاً من ذلك، ينظر إلى طبق الأطباق المتنوعة الذي أعده المتدرب أثناء التدريب.

  • الطاهي القديم (GRPO): ينظر الناقد إلى الطبق. إنه مليء بـ 100 طبق من "الستيك والصلصة رقم 1" المتطابق. لا يستطيع الناقد العثية لما يريده.
  • طاهي VPO: ينظر الناقد إلى الطبق. هناك طبق به ستيك بنضج قليل وصلصة حلوة! يقوم النظام باختيار هذا الطبق.

لماذا هذا مهم؟

اختبر البحث هذه الطريقة في أربعة "مطابخ" مختلفة (مهام مثل حل الألغاز المنطقية، التنقل في المتاهات، وكتابة الأكواد البرمجية).

  1. عدد أكبر من المرشحين = نتائج أفضل: كلما سُمح للنظام بالنظر في المزيد من الأطباق (ميزانية بحث أكبر)، استمر طاهي VPO في التحسن في العثور على المطابقة المثالية. أما الطاهي القديم فقد وصل أداؤه إلى طريق مسدود لأن لديه نوعاً واحداً فقط من الأطبق ليعرضه.
  2. حل المستحيل: في تحدٍ برمجي صعب للغاية (LiveCodeWeb)، لم يستطع الطاهي القديم حل المشكلة على الإطلاق، مهما حاول. ومع ذلك، فإن طاهي VPO كان لديه مجموعة متنوعة من "المحاولات" التي، عند دمجها مع أداة بحث، تمكنت من حل المشكلة.
  3. "فخ التنوع": يشير البحث إلى أنه إذا كانت الأهداف متشابهة تماماً (على سبيل المثال: "اجعله أحمر" و"اجعله أزرق" حيث الأحمر والأزرق هما الشيء نفسه)، فإن VPO لن يساعد. إنه يتألق فقط عندما تكون الأهداف مختلفة حقاً وتتطلب مقايضات.

الخلاصة

يزعم البحث أنه إذا كنت تخطط لاستخدام ذكاء اصطناعي داخل نظام يبحث عبر خيارات عديدة للعثور على الأفضل، فلا ينبغي لك تدريب الذكاء الاصطناعي ليكون "متخصصاً" في إجابة واحدة مثالية. بدلاً من ذلك، يجب عليك تدريبه ليكون عاماً ينتج محفظة متنوعة من الخيارات عالية الجودة.

من خلال السماح للذكاء الاصطناعي باستكشاف "نكهات" مختلفة من الحلول أثناء التدريب، فإنك تمنح نظام البحث عند وقت الاختبار قائمة أغنى بكثير ليختار منها، مما يؤدي إلى نتائج أذكى وأكثر قدرة على التكيف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →