← أحدث الأبحاث
💬 NLP

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

يُعد CoAct إطار عمل مبتكر يجمع بشكل تآزري بين التعلم ذاتي المكافأة والتعلم النشط من خلال التعاون الاستراتيجي بين الإنسان والذكاء الاصطناي لتجاوز ندرة بيانات التفضيلات عالية الجودة، محققاً تحسينات كبيرة في الأداء على معايير الاستدلال مثل GSM8K وMATH وWebInstruct.

المؤلفون الأصليون: Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب عبقري لكنه يفتقر للخبرة (وهو الذكاء الاصطناعي) كيفية حل المسائل الرياضية المعقدة. لديك كومة ضخمة من أسئلة التدريب، لكن ليس لديك الوقت أو المال لتوظيف معلم خبير ليقوم بتصحيح كل مسألة منها.

هذه هي المشكلة ذاتها التي يحلها بحث COACT. فهو يقدم طريقة جديدة لتدريب الذكاء الاصطناعي تجمع بين أفضل ما في عالمين: الذكاء الاصطناعي الذي يعلم نفسه بنفسه وتدخل الخبراء البشريين فقط عند الضرورة القصوى.

إليك التفاصيل باستخدام تشبيهات بسيطة:

المشكلة: معضلة "عمل كثير، وقت قليل"

لجعل الذكاء الاصطناعي ذكياً، فإنه يحتاج للتعلم من "بيانات التفضيل". وهذا يعني إظهار إجابتين لسؤال واحد وإخباره: "الإجابة (أ) جيدة، والإجابة (ب) سيئة".

  • الطريقة القديمة 1 (المكافأة الذاتية): الذكاء الاصطناعي يصحح واجبه المنزلي بنفسه.
    • المخاطرة: الأمر يشبه طالباً يصحح اختباره بنفسه؛ قد يعتقد أنه أجاب بشكل صحيح بينما هو مخطئ، مما يعزز أخطاءه. هي طريقة سريعة ورخيصة، لكنها غير موثوقة.
  • الطريقة القديمة 2 (التعلم النشط): توظيف خبير بشري لتصحيح الواجب.
    • المخاطرة: البشر مكلفون وبطيئون. يمكنك تصحيح عدد قليل جداً من الأسئلة، مما يترك آلاف مسائل التدريب الأخرى دون استخدام.

الحل: COACT (الـ "مجموعة الدراسة الذكية")

COACT يشبه مجموعة دراسية يعمل فيها الطالب (الذكاء الاصطناعي) والمعلم (البشر/الخبير) معاً في حلقة استراتيجية. وإليك كيف يعمل في ثلاث خطوات:

1. فحص "الاتساق الذاتي" (اختبار الحدس للذكاء الاصطناعي)

بدلاً من مجرد اختيار إجابة واحدة، يقوم الذكاء الاصطناعي بإنشاء ثماني طرق مختلفة لحل نفس المسألة الرياضية.

  • التشبيه: تخيل أنك تطلب من الطالب حل مسألة واحدة ثماني مرات. إذا حصل سبع مرات على النتيجة "42" ومرة واحدة على "100"، فإن الذكاء الاصطناعي يدرك: "مهلاً، أنا واثق تماماً من أن الإجابة هي 42".
  • السر السحري: إذا كان الذكاء الاصطناعي متسقاً، فإنه يثق في إجابته ويستخدمها كبيانات "ذاتية التصنيف". أما إذا كان مرتبكاً (والإجابات متضاربة)، فهو يعلم أنه بحاجة للمساعدة.

2. "المعلم الاستراتيجي" (الخبير)

الذكاء الاصطناعي لا يطلب المساعدة من المعلم البشري في كل شيء. بل يطلب المساعدة في نوعين محددين من المسائل فقط:

  • النوع (أ): المرتبكون. المسائل التي قدم فيها الذكاء الاصطناعي ثماني إجابات مختلفة. هنا يحتاج المعلم لتوضيح الأساسيات.
  • النوع (ب): فخاخ "الثقة المفرطة". هذا هو الجزء الذكي؛ فأحياناً يقدم الذكتا الاصطناعي نفس الإجابة الخاطئة ثماني مرات لأنه "واثق من خطئه" (مثل طالب حفظ معادلة خاطئة عن ظهر قلب). يستخدم COACT "راداراً" خاصاً (يسمى k-NN distance) لرصد هذه الإجابات الواثقة ولكن الخاطئة وإرسالها للمعلم لتصحيحها.

3. "مولد الواجبات المنزلية" (التعزيز الموجه من الخبير)

بمجرد أن يصحح المعلم بعض المسائل الصعبة، لا يتوقف الذكاء الاصطناعي عند هذا الحد. بل ينظر إلى الأمثلة الصحيحة التي تحقق منها المعلم ويقول: "حسناً، لقد فهمت هذا المستوى الآن. دعني أنشئ مسائل تدريب جديدة تناسب مستوى مهاراتي الحالي تماماً".

  • التشبيه: يشبه الأمر مدرساً يقول لطالبه: "لقد أتقنت هذا المفهوم، الآن حاول كتابة أسئلة تدريبية خاصة بك بناءً على ما تعلمته للتو". هذا يخلق مورداً لا ينتهي من مواد التدريب عالية الجودة التي يستطيع الذكاء الاصطناعي حلها فعلياً.

النتيجة: حلقة تعلم فائقة القوة

من خلال دمج التصحيح الذاتي للذكاء الاصطناعي (للأشياء السهلة) مع تصحيح الخبراء البشر (للأشياء الصعبة والمخادعة)، يخلق COACT مجموعة بيانات ضخمة وعالية الجودة دون الحاجة لملايين الساعات البشرية.

الدليل:
عندما اختبروا هذا النظام على معايير الرياضيات والاستدلال (مثل GSM8K و MATH)، تحسن أداء الذكاء الاصطناعي بشكل مذهل:

  • تحسن بنسبة 13% في رياضيات المرحلة الابتدائية.
  • تحسن بنسبة 8% في الرياضيات المتقدمة للمسابقات.
  • حتى أنه أصبح أفضل في الفيزياء والمعلومات العامة، مما يثبت أنه تعلم كيف يتعلم، وليس مجرد حفظ الإجابات.

الخلا الخلاصة

COACT يشبه سيارة ذاتية القيادة لتدريب الذكاء الاصطناعي.

  • تقود نفسها على الطرق السريعة المفتوحة (المكافأة الذاتية) عندما يكون الطريق واضحاً.
  • وتستدعي مدرباً بشرياً فقط عندما تصل إلى تقاطع ضبابي أو منعطف مربك (التعلم النشط).
  • وبمجرد تعلم مسار جديد، تقوم برسم طرق جديدة لاستكشافها (تعزيز التعليمات).

هذا النهج يوفر المال، ويوفر الوقت، ويخلق ذكاءً اصطناعياً أكثر ذكاءً مما يمكن لأي من الطريقتين تحقيقه بمفرده.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →