← أحدث الأبحاث
💬 NLP

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

تقدم الورقة البحثية **Dr. SCI**، وهو مسار تدريب لاحق منهجي يتميز بمجموعة بيانات ضخمة في مجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) وسير عمل تدريب مُعاد تصميمه — يتكون من ضبط دقيق للتعلم الخاضع للإشراف (SFT) بنمط الاستكشاف والتوسع، ومنهج صعوبة ديناميكي، وتعلم تعزيزي موجه بالمعايير — مما يحسن بشكل كبير قدرات الاستدلال العلمي وحل المشكلات مفتوحة النهايات للنماذج اللغوية الكبيرة.

المؤلفون الأصليون: Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتدريب عالم من الطراز العالمي، ولكن بدلاً من تدريب أستاذ بشري، أنت تقوم بتدريب ذكاء اصطناعي.

معظم تدريب الذكاء الاصطناعي يشبه تعليم طالب باستخدام كتاب مدرسي يعتمد على الاختيار من متعدد. من السهل تقييمه: إذا اختار "ج"، يحصل على نجمة ذهبية؛ وإذا اختار "ب"، فإنه يرسب. هذا يعمل بشكل رائع في الرياضيات أو الحقائق البسيطة، لكن العلم أكثر تعقيداً من ذلك بكثير. فالعلم الحقيقي يتضمن كتابة شروحات طويلة ومعقدة، وربط الأفكار المختلفة، والمرافعة عن وجهة نظر ما.

المشكلة هي أنه إذا طرحت على الذكاء الاصطناعي سؤالاً مفتوحاً مثل: "اشرح كيف يولد النجم"، فكيف تقيمه؟ إذا كتب الذكاء الاصطناعي مقالاً جميلاً من ثلاث صفحات يكون صحيحاً في معظمه ولكنه يفتقد تفصيلاً صغيراً جداً عن الجاذبية، فهل يحصل على درجة "امتياز" أم "رسوب"؟ إذا كان التقييم صارماً للغاية، سيشعر الذكاء الاصطناعي بالإحباط ويتوقف عن المحاولة. وإذا كان سهلاً للغاية، سيصبح الذكاء الاصطناعي "متكاسلاً" يتعلم كتابة جمل طويلة ومنمقة تبدو ذكية ولكنها لا تقول شيئاً في الواقع (وهو ما نسميه "اختراق المكافأة").

هذه الورقة البحثية، "Dr. SCI"، هي "مدرسة تدريب" جديدة صُممت لإصلاح هذا الأمر. وإليك كيف فعلوا ذلك باستخدام ثلاث استراتيجيات ذكية:

1. استراتيجية "المكتبة المتنوعة" (التدريب الفائق الموجه نحو توسيع الاستكشاف - Exploration-Expanding SFT)

تخيل لو أنك علمت طالباً فقط من خلال جعله يقرأ ثلاثة كتب مدرسية في علم الأحياء. سيصبح خبيراً في هذه الكتب، لكنه سيكون جاهلاً بالكيمياء أو الفيزياء.

قام الباحثون بإنشاء مكتبة ضخمة ومتنوعة تضم مليون سؤال علمي. ولكن بدلاً من إعطاء كل شيء للذكاء الاصطناعي دفعة واحدة، استخدموا مرشحاً خاصاً. لقد بحثوا عن البيانات التي تقدم طرقاً جديدة للتفكير—مصطلحات جديدة، وأنماط منطقية جديدة، وطرقاً جديدة للشرح. الأمر يشبه التأكد من أن الطالب لا يتعلم فقط ماذا يفكر، بل يتعلم مئة طريقة مختلفة لكيفية التفكير.

2. استراتيجية "تسلق الجبل" (منهج الصعوبة الديناميكية - Dynamic Difficulty Curriculum)

إذا حاولت تعليم طفل صغير حساب التفاضل والتكامل، فسوف يستسلم. وإذا علمت طالب دكتوراه الجمع والطرح الأساسي، فسيشعر بالملل. كلاهما سيفشل في التعلم.

أنشأ الباحثون "سلماً ذكياً". بدأوا بإعطاء الذكاء الاصطناي أسئلة سهلة لبناء ثقته بنفسه. ومع تحسن الذكاء الاصطناعي، كان "السلم" يتحرك تلقائياً للأعلى، ليقدم تحديات أصعب فأصعب. لقد أبقوا الذكاء الاصطناعي فعلياً في "منطقة التوازن الذهبية" (Goldilocks Zone)—ليست سهلة جداً، ولا صعبة جداً، بل مثالية تماماً للنمو المستمر.

3. استراتيجية "الأستاذ الخبير" (التعلم المعزز الموجه بمعايير SciRubric - SciRubric-Guided RL)

هذا هو الجزء الأهم. بدلاً من درجة بسيطة "صح/خطأ"، أعطوا الذكاء الاصطناعي "معايير تقييم" (Rubric)—تماماً كما يستخدم الأستاذ الحقيقي.

بدلاً من القول: "إجابتك هي 7/10"، يقوم "الأستاذ" (وهو ذكاء اصطناعي متخصص) بفحص الإجابة والتحقق من خانات محددة:

  • ✅ هل عرّف المصطلح الأساسي؟ (ضروري)
  • ✅ هل شرح "السبب" وراء العملية؟ (مهم)
  • ✅ هل ذكر مثالاً من العالم الحقيقي؟ (اختياري)
  • ❌ هل ارتكب ذلك الخطأ الشائع حول الجاذبية؟ (فخ)

والأهم من ذلك، أضافوا "حارس الحقيقة". حتى لو كتب الذكاء الاصطناعي مقالاً شعرياً جميلاً، إذا كانت الإجابة النهائية خاطئة واقعياً، يحصل الذكاء الاصطناعي على درجة رسوب. هذا يمنع الذكاء الاصطناعي من أن يصبح "متحدثاً لبقاً" يكون مخطئاً ولكنه يبدو واثقاً.

النتيجة

باستخدام طريقة "Dr. SCI" هذه، انتهى الأمر بنموذج ذكاء اصطناعي صغير نسبياً (نموذج "4B"، وهو بمثابة طالب مدمج وفعال) بأداء أفضل في العلوم المعقدة من نماذج أكبر بكثير وأكثر تكلفة مثل GPT-4o في بعض الاختبارات المفتوحة.

باختصار: لقد توقفوا عن معاملة الذكاء الاصطناعي كمجرد مقدم للاختبارات، وبدأوا يعاملونه كعالم حقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →