← أحدث الأبحاث
🤖 machine learning

Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision

تقدم الورقة البحثية إطار عمل "الحوسبة كمعلم" (CaT)، الذي يحول عمليات التوليد المتوازية أثناء وقت الاستدلال إلى إشراف خالٍ من المراجع عبر تجميع المراجع الزائفة والمعايير المقترحة ذاتياً، مما يمكّن النماذج من تحقيق مكاسب أداء كبيرة في المجالات القابلة للتحقق وغير القابلة للتحقق دون الاعتماد على الملصقات البشرية.

المؤلفون الأصليون: Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب (ذكاء اصطناعي) كيفية كتابة رسالة نصيحة طبية مثالية أو حل مسألة رياضية معقدة. عادةً، تحتاج إلى معلم يمتلك "مفتاح الإجابة الصحيحة" لتصحيح عمل الطالب. ولكن ماذا لو كنت في موقف لا يعرف فيه أحد الإجابة الصحيحة؟ ربما تكون حالة طبية معقدة يختلف عليها حتى الأطباء الحقيقيون، أو مهمة كتابة إبداعية لا توجد لها نهاية واحدة "صحيحة".

تقدم هذه الورقة البحثية طريقة جديدة تسمى الحوسبة كمعلم (Compute as Teacher - CaT). إنها طريقة ذكية تسمح للذكاء الاصطناعي بتعليم نفسه دون الحاجة إلى معلم بشري أو مفتاح للإجابة.

إليك كيف تعمل، باستخدام تشبيه بسيط:

المشكلة: "الفصل الدراسي الصامت"

عادةً، لكي يتحسن الطالب، فإنه يحتاج إلى تغذية راجعة.

  • في الرياضيات/البرمجة: يمكن للمعلم تشغيل برنامج للتحقق مما إذا كانت الإجابة صحيحة أم خاطئة. هذا أمر سهل.
  • في الرعاية الصحية/الكتابة الإبداعية: لا يوجد برنامج للتحقق من الإجابة. إذا سألت الذكاء الاصطناعي: "كيف يجب أن أعالج هذا العرض النادر؟"، فقد تكون هناك خمس طرق مختلفة وصحيحة للإجابة. كيف تعرف أيهما الأفضل؟ عادةً، ستحتاج إلى خبير بشري لتقييم الإجابة، لكن ذلك بطيء ومكلف.

الحل: "جلسة المذاكرة الجماعية"

أدرك المؤلفون أنه إذا طلبت من الذكاء الاصطناعي نفس السؤال ثماني مرات (توليد ثماني محاولات أو "rollouts" مختلفة)، فإن الذكاء الاصطناعي سيتعثر في أماكن مختلفة.

  • المحاولة رقم 1 قد تحتوي على التشخيص الصحيح ولكن بجرعة خاطئة.
  • المحاولة رقم 2 قد تحتوي على الجرعة الصحيحة ولكنها أغفلت التحذير من الحساسية.
  • المحاولة رقم 3 قد تكون مثالية في الأسلوب ولكنها أغفلت عرضاً طبياً رئيسياً.

بشكل فردي، هي محاولات معيبة. ولكن معاً، تحتوي هذه المحاولات على جميع قطع اللغز.

خدعة السحر ذات الخطوتين

يحول إطار عمل CaT جلسة المذاكرة الجماعية هذه إلى خطة درس باستخدام خطوتين:

1. "التوليف" (المحرر الذكي)

بدلاً من مجرد اختيار "أفضل" ثماني محاولات (والتي قد تظل معيبة)، يعمل الذكاء الاصطناعي كـ محرر ذكي. ينظر إلى المحاولات الثماني ويكتب إجابة "مرجع افتراضي" (Pseudo-Reference) مثالية جديدة.

  • تشبيه: تخيل مجموعة من ثمانية طلاب يكتبون مقالات. يقرأ محرر فائق الذكاء كل المقالات الثمانية، ويأخذ أفضل فقرة من واحدة، وأفضل بيانات من أخرى، وأفضل خاتمة من ثالثة، ويقوم بحياكتهم معاً في "مقال رئيسي" واحد.
  • يصبح هذا "المقال الرئيسي" هو الهدف الذي يحاول الذكاء الاصطناعي التعلم منه.

2. "المعيار" (قائمة التحقق)

الآن، كيف نقيم المحاولات الثمانية الأصلية مقابل هذا "المقال الرئيسي" الجديد؟

  • في الرياضيات: الأمر سهل. هل تطابقت الأرقام؟ نعم/لا.
  • في الرعاية الصحية (الجزء الصعب): لا يمكنك فقط قول "نعم/لا" لمقال كامل. لذا، يقوم الذكاء الاصطناعي بإنشاء قائمة تحقق (Rubric) بناءً على المقال الرئيسي.
    • مثال: بدلاً من سؤال "هل النصيحة جيدة؟"، ينشئ الذكاء الاصطناعي قائمة تحقق: "1. هل ذكر ضرورة رؤية الطبيب؟ 2. هل اقترح تغييرات في النظام الغذائي؟ 3. هل تجنب إعطاء تشخيص محدد؟"
    • ثم يقوم ذكاء اصطناعي مستقل بدور "القاضي" للتحقق من كل محاولة من المحاولات الثمانية الأصلية مقابل هذه القائمة. إذا حصلت محاولة ما على 4 من أصل 5 عناصر في قائمة التحقق، فإنه يحصل على درجة 0.8.

النتيجة: التعلم بدون معلم

يستخدم الذكاء الاصطناعي هذه الدرجات لتحديث دماغه (التعلم المعزز). إنه يتعلم: "آه، في المرة القادمة يجب أن أتأكد من تضمين عناصر قائمة التحقق التي فاتتني".

لماذا يعد هذا أمراً بالغ الأهمية؟

  1. لا حاجة لبشر: إنه يعمل في مجالات مثل الرعاية الصحية حيث لا يوجد "مفتاح إجابة"، وحيث يكون الخبراء البشريون مشغولين جداً لتقييم كل إجابة.
  2. أرخص على المدى الطويل: عادةً، للحصول على إجابة جيدة، عليك تشغيل الذكاء الاصطناعي 8 مرات واختيار الأفضل في كل مرة تسأل فيها. هذا بطيء ومكلف.
    • مع CaT، يتعلم الذكال الاصطناعي من المحاولات الثمانية مرة واحدة أثناء التدريب.
    • بعد التدريب، يصبح الذكاء الاصطناعي جيداً جداً لدرجة أنه يمكنه تقديم إجابة رائعة بمحاولة واحدة فقط.
    • ادعاء الورقة البحثية: وجدوا أن الذكاء الاصطناعي المدرب كان يؤدي بنفس جودة طريقة "الـ 8 محاولات" ولكنه استخدم قدرة حوسبية أقل بـ 9 مرات عند الإجابة فعلياً على الأسئلة.

الملخص

الحوسبة كمعلم (Compute as Teacher) تشبه أخذ مجموعة من الطلاب المرتبكين، وجعلهم يتجادلون ويتناظرون، ثم ترك محرر ذكي يصيغ ملخصاً "مثالياً" من نقاشاتهم، ثم تقييم الطلاب بناءً على مدى مطابقتهم لذلك الملخص. يتعلم الطلاب من أخطائهم الجماعية ويصبحون في النهاية بارعين جداً لدرجة أنهم لا يحتاجون إلى المجموعة بعد الآن.

اختبرت الورقة البحثية هذا الأسلوب على HealthBench (النصائح الطبية) و MATH-500 (المسائل الرياضية).

  • في الرياضيات، عمل بنفس كفاءة الأساليب الموجودة.
  • في النصائح الطبية (حيث لا يوجد مفتاح إجابة)، حسن أداء الذكاء الاصطناعي بنسبة تصل إلى 30% مقارنة بنقطة بدايته، محاكيًا جودة الإجابات التي يكتبها الأطباء الخبراء، وكل ذلك دون علامة بشرية واحدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →