Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback
تقترح الورقة البحثية COSE، وهو إطار عمل ذاتي التطور يستفيد من الثقة الجوهرية للنماذج اللغوية الكبيرة لتعديل التعلم عبر تحديثات خوارزمية PPO الموزونة بالثقة وإعادة التشغيل ذات الأولوية، مما يقلل بفعالية من مخاطر الأحكام الذاتية الخاطئة ويحقق أداءً فائقاً عبر معايير الاستدلال والرياضيات.