← أحدث الأبحاث
💬 NLP

References Improve LLM Alignment in Non-Verifiable Domains

تقترح هذه الورقة نهجاً موجهاً بالمرجع يستفيد من مخرجات مرجعية عالية الجودة لتعزيز المقيمين القائمين على النماذج اللغوية الكبيرة، مما يتيح التحسين الذاتي والضبط المحاذي الفعال في المجالات غير القابلة للتحقق حيث لا تتوفر مكافآت تقليدية قابلة للتحقق.

المؤلفون الأصليون: Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

نُشر 2026-02-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب جديد (ذكاء اصطناعي) كيفية كتابة مقالات مثالية. لديك كتاب مدرسي ("المرجع") يحتوي على الإجابات النموذجية.

في الماضي، كان تعليم الذكاء الاصطناعي يشبه محاولة تقييم المقالات دون وجود نموذج إجابة. كنت تطلب من معلم ذكي جداً ("ذكاء اصطناعي مُقيّم") أن ينظر إلى مقالين لطالبين ويخمن أيهما أفضل. أحياناً، كان المعلم يصاب بالارتباك، أو ينحاز، أو ببساطة يخطئ لأنه لم يكن لديه مثال ملموس للمقارنة به. هذا ما يحدث في "المجالات غير القابلة للتحقق" — وهي المهام التي لا توجد فيها إجابة واحدة صحيحة، مثل كتابة قصيدة أو تقديم نصيحة.

تقدم هذه الورقة فكرة بسيطة ولكنها قوية: أعطِ المعلم نموذج الإجابة.

إليك تفصيل اكتشافهم باستخدام تشبيهات من الحياة اليومية:

1. المشكلة: المصحح الأعمى

تخيل معلماً يصحح مقالين لطالبين.

  • الطريقة القديمة (بدون مرجع): يعتمد المعلم كلياً على ذاكرته وحدسه. قد يفضل المقال الأطول، أو الذي يستخدم كلمات أكثر فخامة، حتى لو لم يجب فعلياً على السؤال المطروح. يؤدي هذا إلى عدم اتساق في التقييم ودرجات خاطئة أحياناً.
  • الطريقة الجديدة (بإرشاد المرجع): يتم تسليم المعلم مقال "المعيار الذهبي" (تم إنشاؤه بواسطة ذكاء اصطناعي فائق الذكاء أو خبير بشري) يجيب على السؤال بشكل مثالي. الآن، لا يخمن المعلم فحسب؛ بل يقارن مقالات الطلاب مباشرة بهذا المعيار الذهبي. "هل يبدو المقال (أ) أكثر شبهاً بالمعيار الذهبي من المقال (ب)؟"

2. الاكتشاف: "المُقيّمون الموجهون بالمرجع"

اختبر الباحثون هذه الفكرة مع العديد من "المعلمين" (المُقيّمين) المختلفين من الذكاء الاصطناعي.

  • النتيجة: عندما تم تزويد المعلمين بالمرجع "المعيار الذهبي"، أصبحوا أفضل بكثير في التصحيح. حتى "المعلمين الأصغر سناً" أو الأقل ذكاءً تحسنوا بشكل كبير.
  • العقبة: لا يمكنك مجرد تسليمهم نموذج الإجابة وتوقع الأفضل. يجب أن تخبرهم كيف يستخدمونه. وجدت الورقة أنه إذا وجهت الذكاء الاصطناعي صراحةً: "قارن إجابة الطالب بهذا المرجع. تحقق مما إذا كان قد أغفل حقائق أو أضاف حشواً غير ضروري"، فإن دقة التصحيح ترتفع بشكل هائل. إنه يشبه إعطاء المعلم نموذج تقييم (Rubric)، وليس مجرد ورقة إجابات.

3. التطبيق: الطالب يصبح هو المعلم

هذا هو الجزء الأكثر روعة. عادةً، تحتاج إلى إنسان أو خبير فائق لتقييم الذكاء الاصطناعي حتى يتمكن الذكاء الاصطناعي من التعلم. لكن هذه الورقة تظهر أنه يمكنك إنشاء حلقة تحسين ذاتي:

  1. الخطوة 1 (التكرار/الاستخلاص): يقرأ الطالب (الذكاء الاصطناعي) مقالات "المعيار الذهبي" ويحاول تقليدها. هذا يشبه طالباً يحفظ الكتاب المدرسي عن ظهر قلب.
  2. الخطوة 2 (التحسين الذاتي): يقوم الطالب (الذكاء الاصطناعي) الآن بإنشاء مقالات جديدة خاصة به. ثم يعمل كمعلم لنفسه، مستخدماً "المعيار الذهبي" كمرجع لتقييم عمله.
    • يسأل الذكاء الاصطناعي نفسه: "لقد كتبت نسختين من هذه القصة. أيهما أقرب إلى المثال المثالي الذي حفظته؟"
    • يختار النسخة الأفضل ويتعلم من هذا الاختيار.

4. النتيجة: التغلب على الخبراء

وجد الباحثون أن طريقة "التحسين الذاتي الموجه بالمرجع" هذه كانت فعالة للغاية.

  • لقد تفوقت على الطريقة القديمة المتمثلة في مجرد حفظ الكتاب المدرسي (SFT).
  • وتفوقت على الطريقة التي يقيم فيها الذكاء الاصطناعي نفسه بدون مرجع.
  • والأهم من ذلك: لقد قدمت أداءً يضاهي استخدام "نموذج مكافأة" (Reward Model) متخصص ومكلف (وهو ذكاء اصطناعي مخصص فقط للتصحيح)، ولكن دون الحاجة إلى تدريب ذلك النموذج المكلف.

تشبيه الصورة الكبيرة

فكر في الأمر كتعلم لعب التنس:

  • بدون مراجع: أنت تتدرب على ضرب الكرات، والمدرب يصرخ "جيد!" أو "سيء!" بناءً على شعور غامض. أنت تتحسن، ولكن ببطء.
  • مع المراجع: لديك فيديو لبطل في بطولة "جراند سلام" وهو يؤدي ضربة مثالية. أنت تتدرب، ومدربك يقول لك: "قارن حركتك بالفيديو. هل ضربت الكرة بنفس الارتفاع؟ هل أكملت الحركة مثل المحترف؟"
  • سحر الورقة البحثية: لقد أظهروا أنه حتى لو لم يكن مدربك بطلاً في "جراند سلام"، فإذا كان لديه ذلك الفيديو للمقارنة به، فيمكنه تعليمك اللعب مثل المحترفين.

لماذا هذا مهم؟

في العالم الحقيقي، غالباً لا نملك "حقيقة مطلقة" (إجابة واحدة صحيحة) لأشياء مثل الكتابة الإبداعية، أو البرمجة، أو تقديم النصائح. تثبت هذه الورقة أنه باستخدام أمثلة عالية الجودة كـ "مُحقّق ناعم" (Soft Verifier)، يمكننا تدريب الذكاء الاصطناعي ليتماشى مع القيم البشرية ويكون أكثر فائدة، حتى في المجالات التي لا يمكننا فيها التحقق بسه l من أن الإجابة "صحيحة" أو "خاطئة". إنها تسد الفجوة بين المسائل الرياضية الجامدة (حيث نعرف الإجابة) والمحادثات البشرية المعقدة (حيث لا نعرفها).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →