← أحدث الأبحاث
🤖 AI

VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning

يُعد Verify-RL إطار عمل للتعلم المعزز يعمل على تحسين الاستدلال الرياضي باستخدام التفاضل الرمزي لضمان أن تكون تفكيكات المسائل مستندة إلى أسس رياضية، وأبسط من الناحية الهيكلية، وقابلة للتحقق من خلال البناء.

المؤلفون الأصليون: Kaleem Ullah Qasim, Jiashu Zhang, Hao Li, Muhammad Kafeel Shaheen

نُشر 2026-02-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kaleem Ullah Qasim, Jiashu Zhang, Hao Li, Muhammad Kafeel Shaheen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طفل كيفية حل المسائل الرياضية المعقدة والمتعددة الخطوات.

معظم نماذج الذكاء الاصطناعي الحالية تُعلّم كطلاب يُسلم إليهم كتاب ضخم ومرعب عن التفاضل والتكامل المتقدم في اليوم الأول. إنهم يحاولون "تخمين" طريقهم عبر المسائل من خلال البحث عن مسائل مشابهة رأوها من قبل. أحياناً يحالفهم الحظ، لكنهم غالباً ما يشعرون بالارتباك، أو يحاولون حل أشياء أصعب مما ينبغي، أو يتبعون "طرقاً مختصرة" لا معنى لها في الواقع.

قرر الباحثون وراء VERIFY-RL تغيير طريقة التدريس هذه تماماً. فبدلاً من ترك الذكاء الاصطناعي "يخمن" كيفية تفكيك مسألة صعبة، قاموا ببناء دورة تدريبية رياضية يستحيل الغش فيها.

إليك كيف يعمل ذلك، مشروحاً من خلال ثلاث تشبيهات بسيطة:

1. قاعدة "تعليمات الليغو" (التحقق من خلال البناء)

تخيل أنك تريد بناء قلعة ليغو ضخمة ومعقدة.

  • الطريقة القديمة (الاستدلال): تخبر طالباً: "حاول تفكيك هذه القلعة إلى قطع أصغر". قد يأخذ الطالب حفنة من القطع العشوائية ويقول: "ها هي، هذه هي القطع الأصغر!". لكن تلك القطع قد لا تنتمي فعلياً للقلعة، أو قد تكون بنفس صعقة تجميع القلعة نفسها. هذا يخلق "ضجيجاً" وارتباكاً.
  • طريقة VERIFY-RL: تستخدم هذه الطريقة "كتيب التعليمات" الفعلي للرياضيات (قواعد التفاضل والتكامل). فهي تقول: "يمكنك فقط تفكيك هذه القلعة إذا اتبعت هذه الخطوات المحددة والمثبتة". إذا حاول الطالب فك قطعة لا تتبع القواعد، سيقول له النظام فوراً: "لا، هذه ليست خطوة صالحة". هذا ما يسمونه "التحقق من خلال البناء"—القطع مضمونة الصحة لأنها ولدت من القواعد.

2. استراتيجية "مستوى ألعاب الفيديو" (التعلم المنهجي)

فكر في كيفية عمل لعبة فيديو مثل Super Mario. أنت لا تبدأ بمحاربة الزعيم النهائي في قلعة من الحمم البركانية. بل تبدأ بالقفز فوق فطر واحد في حقل أخضر. ومع تحسن مستواك، تصبح المستويات أصعب.

يقوم VERIFY-RL بإنشاء "سلم رياضي".

  • الخطوة 1: تعلم الأساسيات المطلقة (الفطر).
  • الخطوة 2: تعلم كيفية دمج أساسيين (الـ Goombas).
  • الخطوة 3: تعلم كيفية دمج تلك التجميعات (الـ Koopas).
  • الخطوة 4: أخيراً، واجه "الزعيم النهائي" (مسألة التفاضل والتكامل المعقدة).

لأن الباحثين يستخدمون القواعد الرياضية لبناء هذا السلم، يمكنهم ضمان أن الخطوة 2 هي بالفعل أسهل من الخطوة 3. في الطرق القديمة، كان "السلم" غالباً ما يكون مكسوراً—حيث كانت بعض الخطوات في الواقع أصعب من الخطوات التي سبقتها، مما يتسبب في تعثر الذكاء الاصطناعي وسقوطه.

3. القواعد الذهبية الثلاث (خصائص V1، V2، V3)

للتأكد من أن التدريب مثالي، يجب أن تجتاز كل "مسألة فرعية" يتعلمها الذكاء الاصطناعي فحصاً ثلاثي الأجزاء:

  1. هل هي أسهل حقاً؟ (قاعدة "الخطوة الصغيرة"): لا يمكنك تعليم طفل على المشي للركض في ماراثون. يجب أن تكون المسألة الفرعية أبسط من المسألة الكبيرة.
  2. هل هي مفيدة حقاً؟ (قاعدة "لبنة البناء"): إذا كنت تتعلم خبز الكعكة، فإن تعلم كيفية كسر البيضة أمر مفيد. أما تعلم كيفية ربط حذائك فليس كذلك. يجب أن تكون المسألة الفرعية قطعة من اللغز النهائي.
  3. هل هي مرتبطة حقاً؟ (قاعدة "شجرة العائلة"): لا يمكنك حل مسألة رياضية عبر اتخاذ قرار مفاجئ بتعلم التاريخ. يجب أن تكون المسألة الفرعية "سليلة" مباشرة للمسألة الرئيسية.

النتيجة: طالب أكثر ذكاءً

باستخدام هذا التدريب الصارم القائم على القواعد، رأى الباحثون نتائج مذهلة. عندما واجه الذكاء الاصطناعي أصعب المسائل الممكنة، زادت دقته أكثر من الضعف (قفزت من 32% إلى 68%).

باختصار: بدلاً من مطالبة الذكاء الاصطناعي بـ "اكتشاف الأمر"، أعطوه سلماً منظماً بشكل مثالي ومضموناً رياضياً ليتسلقه، مما يضمن أن كل خطوة يخطوها كانت صلبة، ذات معنى، وتنقله نحو القمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →