ASTER: Agentic Scaling with Tool-integrated Extended Reasoning
تقدم الورقة البحثية إطار عمل ASTER، الذي يتغلب على انهيار التفاعل في الاستدلال المتكامل مع الأدوات من خلال الاستفادة من استراتيجية بدء بارد مستهدفة باستخدام مسارات كثيفة التفاعل، مما يمكن نموذجاً بـ 4 مليارات معلمة من تحقيق أداء رائد في الاختبارات المعيارية للرياضيات مثل AIME 2025.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب ذكي جداً ولكنه يفتقر إلى الخبرة (نموذج لغوي كبير) كيفية حل مسائل رياضية صعبة للغاية. الطالب بارع في التفكير، لكنه غالباً ما يرتكب أخطاء حسابية صغيرة تتراكم لتؤدي إلى إجابات خاطئة لأنه يحاول القيام بكل شيء في ذهنه.
تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى ASTER (التوسع الوكيل مع الاستدلال الممتد المتكامل مع الأدوات) لإصلاح هذه المشكلة. إليك قصة كيف فعلوا ذلك، باستخدام تشبيهات بسيطة.
المشكلة: الطالب "المفرط في الثقة"
في السابق، حاول الباحثون تعليم هذه النماذج الذكية استخدام الأدوات (مثل الآلة الحاسبة أو مفسر الأكواد) من خلال تركها تمارس وتتعلم من أخطائها (التعلم التعزيزي).
ومع ذلك، أدى ذلك غالباً إلى مشكلة يسميها المؤلفون "انهيار التفاعل" (Interaction Collapse).
- التشبيه: تخيل طالباً من المفترض أن يستخدم آلة حاسبة في اختبار رياضيات طويل ومعقد. بدلاً من ذلك، يحاول إجراء العمليات الحسابية الصعبة في ذهنه، فيصاب بالارتباك، وفي النهاية، يقوم فقط بكتابة
1+1في الآلة الحاسبة "ليتحقق" من عمله. لم يستخدم الأداة فعلياً لمساعدته في التفكير؛ بل استخدمها فقط كشبكة أمان صغيرة في النهاية. - النتيجة: يتوقف الذكاء الاصطائي عن استخدام الأدوات بفعالية. يعود إلى "التفكير" الشديد داخلياً، ويرتكب أخطاء، ويفشل في حل المسائل الطويلة والمعقدة.
الحل: تلمذة "الشيف الماهر"
أدرك المؤلفون أنه قبل أن تترك الطالب يمارس بمفرده، يجب أن تريه أولاً كيف يستخدم الأدوات بشكل صحيح. هم يسمون هذا Cold-Start SFT (الضبط الدقيق الخاضع للإشراف للبداية الباردة).
لقد اختبروا طرقاً مختلفة لتعليم الطالب:
- طريقة "الإصلاح السريع": إظهار حلول حيث تُستخدم الأداة مرة أو مرتين فقط.
- طريقة "الغوص العميق" (ASTER): إظهار مجموعة صغيرة من الأمثلة (4,000 مثال فقط) حيث تُستخدم الأداة باستمرار.
الاكتشاف الرئيسي: كثافة التفاعل
وجدت الورقة أن كثافة استخدام الأدوات في أمثلة التدريب هي التي تهم أكثر من أي شيء آخر.
- التشبيه: إذا كنت تريد تعليم شيف (طباخ) كيفية طهي وجبة مكونة من 10 أطباق، فإن إظهار وصفة يستخدم فيها الفرن مرة واحدة فقط ليس كافياً. أنت بحاجة لإظهاره وصفة يكون فيها مشغولاً باستمرار بالتقطيع، والتحريك، والتذوق، وضبط درجة الحرارة.
- نهج ASTER: قاموا بإنشاء مجموعة بيانات "الشيف الماهر" حيث كان على الذكاء الاصطناعي استخدام الأداة (مفسر الأكواد) مراراً وتكراراً — أحياناً أكثر من 9 مرات في مسألة واحدة — لحلها. هذا علم الذكاء الاصطناعي "عادة" (أو سلوكاً سابقاً) للتحقق من عمله باستمرار باستخدام الأداة، بدلاً من مجرد التخمين.
عملية التدريب: مرحلتان
بمجرد أن تعلم الذكاء الاصطناعي هذه "العادة" من الـ 4,000 مثال، تركوه يمارس بمفرده باستخدام التعلم التعزيزي.
- المرحلة الأولى (جولة الممارسة): يمارس الذكاء الاصطناعي مع وضع حد لعدد المرات التي يمكنه فيها استخدام الأداة. يتعلم أن يكون فعالاً.
- المرحلة الثانية (الماراثون): يعطون الذكاء الاصطناعي "مساحة تفكير" أطول بكثير (ذاكرة أكبر) ويسمحون له باستخدام الأداة حتى 50 مرة. ولأن النموذج تعلم عادة "الغوص العميق" سابقاً، فإنه لا ينهار؛ بل يستمر في استخدام الأداة بفعالية لحل المسائل الأصعب.
النتائج: صغيرة ولكن قوية
الجزء الأكثر إثارة للدهشة في الورقة هو حجم النموذج.
- قاموا بتدريب نموذج صغير نسبياً (4 مليارات بارامتر).
- التشبيه: الأمر يشبه سيارة سباق صغيرة ورشيقة، لأنها تعلمت تقنية القيادة المثالية، يمكنها هزيمة الشاحنات الضخمة والثقيلة (نماذج ذكاء اصطناعي أكبر بكثير) في مضمار صعب.
- النتيجة: في مسابقة رياضيات صعبة جداً (AIME 2025)، سجل هذا النموذج الصغير 90.0%، متفوقاً على نماذج أكبر بكثير مثل DeepSeek-V3.2 (الذي يحتوي على 671 مليار بارامتر) وحتى على بعض أفضل النماذج من OpenAI.
ملخص "الخلطة السرية"
تدعي الورقة أنه لجعل الذكاء الاصطناعي جيداً في استخدام الأدوات للمهام الطويلة والصعبة، لا ينبغي عليك فقط رميه في العمق. بدلاً من ذلك:
- لا تقلق بشأن المثالية الفورية: لم تجعل أمثلة التدريب الأولية الذكاء الاصطناعي مثالياً في الرياضيات على الفور.
- ركز على "التدفق": يجب عليك إجبار الذكاء الاصطناعي على استخدام الأداة كثيراً جداً خلال التدريب الأولي.
- المكافأة: هذا يخلق عادة قوية. عندما يبدأ الذكاء الاصطناعي في الممارسة بمفرده، فإنه يستمر بشكل طبيعي في استخدام الأداة، مما يسمح له بحل المسائل التي كانت مستحيلة بالنسبة له سابقاً.
باخت-القول: علم الذكاء الاصطناعي أن يستخدم الآلة الحاسبة باستمرار، وليس فقط في النهاية، وسوف يصبح عبقرياً في الرياضيات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.