Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning
تقدم هذه الورقة HeuristicEdu، وهو إطار عمل للتعلم التعزيزي ثنائي المراحل يعمل على مواءمة نموذج Qwen2.5-7B ليعمل كمرشد سقراطي بدلاً من مجرد مجيب مباشر، محققاً تحسينات كبيرة في فعالية الدعم التعليمي وتقليل تسرب المفاهيم من خلال المكافآت الاستدلالية وتحسين السياسة النسبي للمجموعات.