← أحدث الأبحاث
💻 computer science

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

تقترح الورقة البحثية نظام GrowLoop، وهو نظام تقييم محادثة ذاتي التطور يستخدم حداً أدنى من التعليقات التوضيحية البشرية الأولية وتحسيناً تكرارياً للمعايير مدفوعاً بالنماذج اللغوية الكبيرة ليتكيف باستمرار مع النماذج المتقدمة والسيناريوهات المتغيرة، متجاوزاً بذلك قيود المعايير الثابتة في تقييم الشبه بالبشر.

المؤلفون الأصليون: Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu

نُشر 2026-05-29
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يكون محاوراً جيداً. تريد منه أن يبدو طبيعياً، متعاطفاً، وبشرياً. ولكن إليك المشكلة: أن تكون "بشرياً" هو شعور، وليس معادلة رياضية.

إذا سألت بشرياً: "هل كان ذلك الرد لطيفاً؟" قد يقول "نعم". واسأل بشرياً آخر، وقد يقول "لا". لا توجد إجابة واحدة "صحيحة"، وقواعد ما يُعتبر "لطفاً" تتغير مع ازدياد ذكاء الروبوت وتغير توقعات البشر.

هذه هي المشكلة التي يحاول ورقة بحث "GrowLoop" من مجموعة علي بابا (Alibaba Group) حلها. لقد بنوا نظاماً لا يكتفي فقط باختبار الروبوت؛ بل يعلّم نفسه كيفية تقييم الروبوت مع تحسن أداء الروبوت.

إليك كيف يعمل الأمر، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: فخ "المعرفة الضمنية"

فكر في "الشبه بالبشر" مثل ركوب الدراجة الهوائية. أنت تعرف كيف تفعل ذلك، ويمكنك معرفة ما إذا كان شخص آخر يقوم به بشكل جيد. ولكن إذا حاولت كتابة دليل يشرح بالضبط كيفية التوازن، فستواجه صعوبة. لديك "معرفة ضمنية" — أنت تعرف أكثر مما تستطيع قوله.

الاختبارات الحالية للذكاء الاصطناٍعي تشبه محاولة تقييم راكب دراجة باستخدام قائمة مراجعة جامدة لـ "سرعة التبديل" و"زاوية المقود". إنها تغفل الشعور الفعلي بالتوازن. أيضاً، مع تحسن الروبوت، يجب أن يصبح الاختبار أصعب، لكن الاختبارات القديمة تظل كما هي وتصبح عديمة الفائدة.

2. الحل: النظام "ذاتي التطور"

"GrowLoop" يشبه نظام تقييم حياً يتنفس، ينمو جنباً إلى جنب مع الذكاء الاصطناعي. يتكون من جزأين يساعد كل منهما الآخر، مثل شريك الرقص والمصمم (الكوريوجراف):

  • المصمم (الروبيريك/معيار التقييم): هذا هو كتاب القواعد. يحدد ما يبدو عليه "الشيء الجيد" (مثلاً: "كن متعاطفاً"، "لا تقدم نصائح طبية").
  • شريك الرقص (الحالات): هذه هي المحادثات الفعلية المستخدمة لاختبار الذكاء الاصطناعي.

في الأيام الخوالي، كان البشر يكتبون كتاب القواعد وأسئلة الاختبار، وكانت تظل ثابتة في الزمن. في "GrowLoop"، يتعلم النظام القواعد من بعض الأمثلة البشرية ثم يكتب أسئلة اختبار جديدة خاصة به ليجد أين لا يزال يفشل الذكاء الاصطناعي.

3. كيف يتعلم: حلقة "التعلم الاستدلالي"

تخيل أنك تعلم طالباً (الذكاء الاصطناعي) من خلال عرض بعض المقالات النموذجية (البذور البشرية - Human Seeds) عليه.

  1. النظام يقرأ العينات: ينظر إلى كيفية تقييم البشر لهذه المقالات ويحاول تخمين القواعد الخفية التي كان البشر يستخدمونها.
  2. يكتب كتاب قواعد: ينشئ مسودة لكتاب القواعد (الروبيريك).
  3. يختبر نفسه: يستخدم كتاب القواعد هذا لتقييم العينات مرة أخرى.
  4. الإصلاح "الاستدلالي": إذا اختلف تقييم النظام عن تقييم البشر، فهو لا يخمن فقط. بل يسأل نفسه: "لماذا أخطأت في هذا؟ هل كان تعريفي لـ 'التعاطف' غامضاً للغاية؟" ثم يعيد كتابة كتاب القواعد الخاص به لإصلاح تلك الفجوة المحددة.

يكرر هذه العملية حتى يتطابق تقييم النظام مع تقييم البشر بشكل شبه مثالي.

4. التعامل مع الخلاف: مناطق "الإجماع مقابل التباين"

أحياناً، يختلف البشر حول ما هو "جيد".

  • المنطقة (أ) (الإجماع): الجميع يتفق على أن الذكاء الاصطناعي كان فظاً. يجب على النظام أن يطابق هذا.
  • المنطقة (ب) (التباين): بشر يرى أن الذك de AI كان مقتضباً جداً؛ وآخر يرى أنه كان مثالياً. تقول الورقة البحثية إن هذا أمر مقبول. لا يحتاج النظام لفرض إجابة واحدة "صحيحة" هنا. يحتاج فقط لإظهار أن حكمه منطقي ويقع ضمن نطاق الآراء البشرية.

هذا يشبه حكماً في برنامج مواهب. إذا اتفق جميع الحكام على أن المغني كان خارج النغمة، فإن المغني يفشل. أما إذا انقسم الحكام (بعضهم أحب الأسلوب، وآخر كرهه)، فإن المغني لا يفشل لمجرد أنه لم يحصل على تصويت بالإجماع؛ بل يحتاج فقط لإظهار أن لديه أسلوباً صالحاً.

5. "الحلقة المزدوجة" للتطور

هذا هو الجزء السحري. للنظام حلقتان تغذيان بعضهما البعض:

  • الحلقة 1 (القواعد تقود الحالات): يستخدم النظام كتاب القواعد الجديد الخاص به لإنشاء أسئلة اختبار جديدة وأصعب تستهدف تحديداً نقاط ضعف الذكاء الاصطناعي.
  • الحلقة 2 (الحالات تقود القواعد): عندما يخوض الذكاء الاصطناعي هذه الاختبارات الجديدة والصعبة، قد يفشل بطريقة لم يتوقعها كتاب القواعد. يرى النظام هذا الفشل الجديد، ويطلب من إنسان نموذجاً سريعاً (بذرة) لهذا الفشل الجديد، ثم يحدث كتاب القواعد ليشمل هذه القاعدة الجديدة.

التشبيه: تخيل لعبة فيديو.

  • الطريقة القديمة: اللعبة لها مستوى ثابت. بمجرد تجاوزه، يتم "حل" اللعبة.
  • طريقة GrowLoop: بمجرد أن تجتاز مستوى ما، تقوم اللعبة تلقائياً بتصميم مستوى أصعب يستهدف تحديداً الحركات التي أتقنتها للتو. إذا وجدت ثغرة (طريقة جديدة للفوز)، تقوم اللعبة بتحديث قواعدها لسد تلك الثغرة. اللعبة لا تتوقف أبداً عن أن تصبح أصعب وأكثر إثارة.

6. النتائج

اختبرت الورقة البحثية هذا على محادثات مفتوحة (مثل الدردشة مع صديق).

  • تقييم أفضل: وافق "GrowLoop" الحكام البشر في كثير من الأحيان أكثر من الطرق الأخرى (مثل حكام الذكاء الاصطناعي القياسيين أو قوائم المراجعة المكتوبة بشرياً).
  • وجد عيوباً خفية: وجد أخطاءً فات البشر. على سبيل المثال، في إحدى الحالات، اعتقد إنسان أن رد الذكاء الاصطناعي كان جيداً، لكن كتاب قواعد "GrowLoop" صنف الرد على أنه خطير لأن الذكاء الاصطناعي كان يتصرف كطبيب (وهو ما لا ينبغي له فعله).
  • قابل للتكيف: نجح في الفصل بين النماذج الجيدة والسيئة، وكان بإمكانه إخبارك بالضبط لماذا كان النموذج ضعيفاً (مثلاً: "جيد في الحقائق، سيء في التعاطف").

الملخص

"GrowLoop" هو نظام تقييم ذاتي التحسين. بدلاً من قيام البشر بكتابة اختبارات وقواعد جديدة باستمرار، يراقب النظام كيف يقيم البشر بعض الأمثلة، ويتعلم "القواعد غير المنطوقة" للكون بشرياً، ويكتب اختباراته الخاصة، ويحدث قواعده الخاصة كلما تحسن الذكاء الاصطناعي أو تغير العالم. إنه يحول تقييم الذكاء الاصطناعي من امتحان ثابت إلى محادثة حية ومتنامية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →