← أحدث الأبحاث
💻 computer science

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

تقدم الورقة البحثية EvoLM، وهي طريقة تدريب لاحق ذاتية الإشراف تمكن النماذج اللغوية من التحسن بشكل تكراري عبر التناوب بين توليد معايير تمييزية خاصة بكل حالة وتحسين أداء السياسة باستخدام تلك المعايير كمكافآت، مما يحقق نتائج متفوقة دون الاعتماد على إشراف بشري أو نموذجي خارجي.

المؤلفون الأصليون: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب (نموذج السياسة - Policy Model) كيف يكتب مقالات مثالية. في الطريقة القديمة، كنت ستحتاج إلى معلم صارم (بشري أو ذكاء اصطناعي فائق الذكاء) ليقرأ كل مقال، ويضع له درجة، ويخبره بما فعله بشكل خاطئ. هذه العملية مكلفة، بطيئة، ومحدودة بمدى ذكاء ذلك المعلم.

EVOLM هي طريقة جديدة تسمح للطالب بأن يصبح معلماً لنفسه، ولكن مع لمسة ذكية. فبدلاً من مجرد التخمين حول شكل "المقال الجيد"، يتعلم الطالب كتابة قائمة مراجعة محددة (تسمى الروبريك/المعيار - Rubric) لكل مقال يكتبه.

إليك كيف تعمل هذه العملية، مقسمة إلى خطوات بسيطة:

1. الدورين: الكاتب وصانع القوائم

في هذا النظام، يلعب نفس نموذج الذكاء الاصطناعي دورين في آن واحد:

  • الكاتب (السياسة - Policy): هذا الجزء يولد الإجابات على الأسئلة.
  • صانع القوائم (مولد الروبريك - Rubric Generator): هذا الجزء ينظر إلى السؤال ويكتب مجموعة محددة من القواعد (روبريك) حول كيفية تقييم الإجابة.

فكر في الأمر كطاهٍ لا يكتفي بطهي الوجبة فحسب، بل يكتب أيضاً بطاقة الوصفة بعد الطهي، موضحاً بالضبط لماذا كان الطبق جيداً أو سيئاً.

2. حلقة التغذية الراجعة عبر "السفر عبر الزمن"

كيف يعرف النظام ما إذا كانت قائمة المراجعة جيدة؟ إنه لا يحتاج إلى إنسان ليقول له "عمل جيد!". بدلاً من ذلك، يستخدم السفر عبر الزمن.

  • الخطوة أ: يكتب الذكاء الاصطناعي إجابة اليوم.
  • الخطوة ب: ينظر إلى إجابة كتبها قبل بضعة أيام (نسخة "سابقة" من نفسه).
  • الخطوة ج: يفترض أن الإجابة الجديدة أفضل لأن الذكاء الاصطناعي قد تعلم وتطور.
  • الخطوة د: يقوم صانع القوائم بإنشاء "روبريك" لتقييم كلتا الإجابتين.

الهدف بسيط: يجب أن يكون الروبريك قادراً على التمييز بوضوح بين الإجابة "الجديدة والأفضل" والإجابة "القديمة والأسوأ". إذا كان الروبريك غامضاً، فلن يتمكن من رصد الفرق. أما إذا كان الروبريك حاداً ومحدداً، فسيمنح درجة عالية للإجابة الجديدة، ودرجة منخفضة للقديمة.

3. رقصة التطور المشترك

هنا يحدث السحر. يأخذ الدوران الأدوار لبعضهما البعض لتحسين كل منهما الآخر في حلقة مستمرة:

  1. الكاتب يصبح أفضل: باستخدام قوائم المراجعة، يتعلم الكاتب إنتاج إجابات أفضل للحصول على درجات أعلى.
  2. صانع القوائم يصبح أكثر حدة: مع تحسن الكاتب، تبدو الإجابات القديمة أسوأ بكثير بالمقارنة. ولكي يستمر في التمييز بين "الجيد" و"الممتاز"، يجب على صانع القوائم كتابة قواعد أكثر تحديداً وأكثر تفصيلاً. لا يمكنه الاكتفاء بالقول "قواعد لغوية جيدة"؛ بل يجب أن يقول "يجب استخدام فاصلة بعد العبارة التمهيدية".

مع مرور الوقت، تتطور قوائم المراجعة من تسميات غامضة مثل "اجعلها ممتعة" إلى تعليمات ملموسة وقابلة للتحقق مثل "يجب أن تحتوي الإجابة على الرقم 144 المستنتج من محيط الـ 48".

4. خدعة "القاضي الصغير"

عادةً، تحتاج إلى ذكاء اصطناعي ضخم وفائق الذكاء لتقييم المقالات المعقدة. لكن EVOLM يستخدم ذكاءً اصطناعياً صغيراً وثابتاً (قاضٍ صغير) للقيام بعملية التقييم الفعلية.

لأن صانع القوائم قد تعلم كتابة قواعد محددة وملموسة للغاية (مثل "تحقق مما إذا كانت كلمة 'ابتكار' تظهر مرتين")، يمكن حتى لذكاء اصطناعي صغير وبسيط اتباع التعليمات بدقة. الأمر يشبه إعطاء طفل صغير خريطة كنز محددة جداً: هو لا يحتاج لأن يكون محققاً؛ يحتاج فقط لاتباع الخريطة.

لماذا يعد هذا أمراً مهماً؟

  • لا حاجة لمعلمين خارجيين: لا يحتاج النظام إلى بشر لتقييم آلاف المقالات أو دفع تكاليف واجهات برمجة تطبيقات (APIs) باهظة الثمن. إنه يخلق إشارة تدريب خاصة به من أدائه السابق.
  • إنه يكسر السقف: إذا اعتمدت على معلم بشري، فلن يتفوق الذكاء الاصطناعي أبداً على ذلك المعلم. وإذا اعتمدت على معلم ذكاء اصطناعي محدد، فسيظل الذكاء الاصطناعي عالقاً عند مستوى ذلك المعلم. مع EVOLM، يتطور "معلم" الذكاء الاصطناعي (الروبريك) مع الذكاء الاصطناعي نفسه، لذا يستمر السقف في الارتفاع.
  • إنه يعمل: تُظهر الورقة البحثية أن هذا الذكاء الاصطناعي الذي علم نفسه بنفسه (باستخدام نموذج 8B بارامتر صغير) قد تفوق بالفعل على الأنظمة التي استخدمت نموذج GPT-4 (وهو نموذج أكبر بكثير وأكثر تكلفة) لتوليد القواعد.

باختصار: EVOLM هو حلقة تطوير ذاتي حيث يتعلم الذكاء الاصطناعي كتابة معايير تقييم (روبريك) مفصلة خاصة به. ومن خلال مقارنة نفسه الحالي بنفسه السابق باستمرار، فإنه يجبر نفسه على كتابة قواعد أكثر دقة، والتي بدورها تساعده على تعلم كتابة إجابات أفضل، وكل ذلك دون الحاجة لتدخل بشري.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →