← أحدث الأبحاث
🤖 AI

Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback

تقترح الورقة البحثية COSE، وهو إطار عمل ذاتي التطور يستفيد من الثقة الجوهرية للنماذج اللغوية الكبيرة لتعديل التعلم عبر تحديثات خوارزمية PPO الموزونة بالثقة وإعادة التشغيل ذات الأولوية، مما يقلل بفعالية من مخاطر الأحكام الذاتية الخاطئة ويحقق أداءً فائقاً عبر معايير الاستدلال والرياضيات.

المؤلفون الأصليون: Bowen Wei, Nan Wang, Yuqing Zhou, Jinhao Pan, Ziwei Zhu

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bowen Wei, Nan Wang, Yuqing Zhou, Jinhao Pan, Ziwei Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل طالباً يحاول تعلم الرياضيات، ولكن بدلاً من وجود معلم، يقوم بتعليم نفسه. يكتب هو بنفسه مسائل التدريب، ويحاول حلها، ثم يصحح عمله بنفسه. هذا هو مفهوم نماذج اللغات الكبيرة ذاتية التطور (Self-Evolving LLMs).

تجادل الورقة البحثية بأنه بينما تعد فكرة "التعليم الذاتي" هذه قوية، إلا أنها تعاني من عيب رئيسي: الطالب ليس دائماً حكماً جيداً على عمله. فأحياناً، يكتب الطالب سؤالاً سيئاً، أو يعتقد أن إجابة خاطئة هي إجابة صحيحة، وبالتالي يكافئ نفسه بالخطأ عن غير قصد. ومع مرور الوقت، يؤدي ذلك إلى إرباك الطالب ويجعله أسوأ حالاً.

تقترح المؤلفة طريقة جديدة تسمى COSE (التطور الذاتي الموجه بالثقة). وإليك كيف تعمل باستخدام تشبيهات بسيطة:

المشكلة: "الطالب الواثق بزيادة"

في التعليم الذاتي التقليدي، إذا قال الطالب: "لقد أجبت بشكل صحيح!" ومنح نفسه نجمة ذهبية، فإن الكمبيوتر يأخذ هذه النجمة كحقيقة مطلقة ويقوم بتحديث دماغه للقيام بذلك أكثر.

  • المخاطرة: إذا كان الطالب في الواقع يخمن وصادف أنه مخطئ، ولكنه يشعر بثقة كبيرة، فإنه يمنح نفسه نجمة ذهبية على أي حال. عندها يتعلم الكمبيوتر كيف يكون مخطئاً بثقة.

الحل: COSE (مقياس الثقة)

تضيف COSE قاعدة بسيطة: "لا تستمع فقط لما يقوله الطالب؛ بل استمع إلى مدى تأكده مما يقوله."

بدلاً من معاملة كل إجابة تم تصحيحها ذاتياً بالتساوي، تقوم COSE بفحص "مقياس ثقة" الطالب (والذي يتم حسابه من خلال النظر في مدى عدم يقين العمليات الحسابية الداخلية للكمبيوتر عند إنشاء الدرجة).

1. "مقبض التحكم في الصوت" (التحديثات الموزونة بالثقة)

تخيل أن الطالب يصرخ: "لقد أجبت بشكل صحيح!"

  • ثقة عالية: إذا كان الطالب يصرخ بيقين تام، تقوم COSE برفع مستوى الصوت. يستمع الكمبيوتر بتركيز ويتعلم من هذا التقييم.
  • ثقة منخفضة: إذا كان الطالب يتمتم أو يبدو غير متأكد (حتى لو قال "لقد أجبت بشكل صحيح")، تقوم COSE بخفض مستوى الصوت. هي تعامل التقييم كهمس؛ يسمعه الكمبيوتر، لكنه لا يغير دماغه بشكل جذري.
  • النتيجة: إذا كان الطالب مخطئاً ولكنه واثق، يكون مستوى الصوت منخفضاً، لذا لا تفسد الأخطاء عملية التعلم. وإذا كان الطالب غير متأكد ولكنه مصيب، يكون مستوى الصوت منخفضاً أيضاً، لذا لا يتجاهل الكمبيوتر درساً قد يكون مفيداً.

2. "قائمة تشغيل التدريب" (إعادة التشغيل ذات الأولوية للثقة)

تخيل أن لدى الطالب قائمة تشغيل لمسائل التدريب للمراجعة.

  • الطريقة القديمة: يختار الطالب المسائل بشكل عشوائي.
  • طريقة COSE: يختار الطالب المسائل التي هي "مثالية تماماً".
    • يتخطى المسائل السهلة جداً (التي يعرفها الطالب بالفعل).
    • يتخطى المسائل الصعبة جداً أو التي تم تقييمها بثقة منخفضة (حيث يكون الطالب مجرد مخمن).
    • يركز على "منطقة جولدي لوكس" (المنطقة المثالية): المسائل التي تم التحقق منها بثقة عالية وكانت صعبة قليلاً. هذا يضمن أن يتدرب الطالب على المواد الأكثر فائدة.

ما وجدته الورقة البحثية

اختبر الباحثون هذه الطريقة على 19 اختباراً مختلفاً (تغطي الاستنتاج العام، والرياضيات، والبرمجة) باستخدام أربعة نماذج ذكاء اصطناعي مختلفة.

  • الفوز الكبير: جعلت COSE نماذج الذكاء الاصطناعي أكثر ذكاءً في الاستنتاج والرياضيات باستمرار مقارنة بطرق التعليم الذاتي الأخرى. وكانت جيدة بشكل خاص في مساعدة النماذج الأضعف على التحسن دون أن ترتبك بسبب أخطائها الخاصة.
  • شبكة الأمان: بالنسبة لمهام البرمجة، حيث يمكن للكمبيوترات فعلياً تشغيل الكود لرؤية ما إذا كان يعمل (وهو حكم خارجي مثالي)، لم تضر COSE في الأداء. لقد أظهرت أن هذه الطريقة آمنة؛ فهي تغير فقط كيفية تعلم الذكاء الاصطناعي عندما يضطر للاعتماد على حكمه الخاص.
  • القصور: تعترف الورقة بأن COSE ليست سحراً. إذا كان الذكاء الاصطناعي مخطئاً بثقة بشأن شيء معقد (مثل برهان رياضي صعب)، فقد تسمح COSE بمرور القليل من هذا الخطأ، ولكن بمستوى صوت منخفض. إنها تقلل الضجيج، لكنها لا تقضي عليه تماماً.

باختة شديدة

فكر في COSE كـ مدرب تعليم ذاتي ذكي. هي لا تمنع الذكاء الاصطناعي من تعليم نفسه، ولكنها تضيف مرشحاً (فلتر): "إذا لم تكن متأكداً من تقييمك لنفسك، فلا تدع هذا التقييم يغير دماغك كثيراً." هذا يمنع الذكاء الاصطناعي من اكتساب عادات سيئة عن طريق الخطأ لمجرد أنه شعر بالثقة تجاهها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →