← أحدث الأبحاث
💬 NLP

SAGE-32B: Agentic Reasoning via Iterative Distillation

تقدم هذه الورقة البحثية نموذج SAGE-32B، وهو نموذج لغوي بـ 32 مليار معلمة مبني على Qwen2.5-32B يتخصص في الاستدلال الوكيل والتخطيط بعيد المدى من خلال التقطير التكراري ونهج الاستدلال العكسي، محققاً أداءً فائقاً في اختبارات الأدوات المتعددة مقارنة بالنماذج ذات الحجم المماثل.

المؤلفون الأصليون: Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح بسيط ومبدع لورقة بحث SAGE-32B، مصمم ليكون مفهوماً لأي شخص، حتى من ليس لديهم خلفية تقنية.

تخيل أنك بحاجة لتوظيف مساعد شخصي لإدارة منزل معقد مليء بالأجهزة، والوثائق، والمواعيد النهائية.

١. المشكلة: المساعد "الثرثار" مقابل المساعد "العملي"

حتى وقت قريب، كانت الذكاءات الاصطناعية (مثل روبوتات الدردشة التي نستخدمها جميعاً) تشبه المتحدثين اللبقين. إذا سألتهم: "ما رأيك في الطقس؟"، سيجيبون بطلاقة ولطافة. لكن إذا قلت لهم: "اذهب وتفقد الثلاجة، إذا كانت فارغة فاشترِ الحليب، ثم اتصل بشركة الشحن لإرسال طرد، وتأكد من إغلاق الباب"، فغالباً ما يفقدون التركيز.

  • كانوا يرتبكون بعد الخطوة الثانية.
  • كانوا يختلقون أشياء من خيالهم (مثلاً: "لقد اشتريت الحليب" بينما لم يفعلوا ذلك في الواقع).
  • لم يكونوا يعرفون كيفية التعافي من الخطأ إذا ساءت الأمور.

للقيام بهذه المهام، كانت هناك حاجة لنماذج ضخمة (مثل تلك التي تمتلك ١٠٠ مليار "عصبون")، لكنها كانت مكلفة للغاية وبطيئة، كمن يستخدم صاروخاً للذهاب لإحضار الجريدة.

٢. الحل: SAGE-32B، "مدير الموقع"

قام المؤلفون بابتكار SAGE-32B. هو نموذج أصغر حجماً (٣٢ مليار بارامتر)، لكنه تم تدريبه بطريقة مختلفة. هو ليس مجرد متحدث لبق؛ بل هو مدير موقع.

  • لا يتحدث لمجرد التملق: هدفه هو "الفعل" وإنجاز المهام.
  • إنه متخصص: تم تدريبه خصيصاً على استخدام الأدوات (واجهات برمجة التطبيقات API، قواعد البيانات، الأكواد البرمجية) وعلى التخطيط للمهام الطويلة.

٣. السرّان وراء السحر

أ. التدريب "المرآتي" (التقطير التكراري)

تخيل تعليم طفل القيادة.

  • الطريقة القديمة: تعطيه عجلة القيادة وتقول له "قُد!". إذا ارتكب خطأ، توبخه.
  • طريقة SAGE (التقطير التكراري): استخدموا "معلماً" (ذكاءً اصطناعياً قوياً جداً) يقود بمفرده. ثم، في كل مرة يرتكب فيها المعلم خطأ، يقول النظام له: "مهلاً، انظر هنا! لقد ارتكبت خطأً عند إدخال الكود. هكذا كان ينبغي عليك فعل ذلك".
    لقد جعلوا النموذج يقوم بالملايين من هذه "المحاكاة للأخطاء والتصحيحات". والنتيجة؟ SAGE لا يعرف فقط كيف يفعل الأشياء، بل يعرف أيضاً كيف يدرك أنه على وشك ارتكاب خطأ وكيف يصحح نفسه قبل وقوع الخطأ. إنه يشبه طياراً أجرى ملايين عمليات محاكاة للهبوط وسط العواصف.

ب. "التفكير الثاني" (الاستدلال العكسي)

هذا هو الجزء الأكثر ابتكاراً.
عادةً، يفكر الذكاء الاصطناعي بشكل خطي: "أحتاج للقيام بـ أ، ثم ب، ثم ج". إذا كان "أ" خاطئاً، ينهار كل شيء لاحقاً.
يمتلك SAGE "عقلاً ناقداً" (يسمى Meta-Cognitive Head) يعمل مثل فكرة ثانية أو "محامي شيطان" داخلي.

  • قبل تنفيذ أي إجراء، يسأل SAGE نفسه: "انتظر، إذا فعلت هذا، ماذا سيحدث بعد ١٠ دقائق؟ هل هذا منطقي؟".
  • إنه يستخدم تقنية تسمى "الاستدلال العكسي": بدلاً من مجرد النظر للأمام، يتخيل النتيجة النهائية ويتأكد مما إذا كان المخطط الحالي يؤدي إليها بالفعل. إذا لم يصمد المخطط، يتخلص منه ويجرب واحداً آخر.
  • التشبيه: الأمر يشبه عندما تكتب بريداً إلكترونياً مهماً. أنت لا ترسله فوراً، بل تعيد قراءته وتسأل نفسك: "إذا قرأ المستلم هذا، هل سيفهم ما أريده؟". إذا كانت الإجابة لا، تعيد الكتابة. SAGE يفعل ذلك في أجزاء من الثانية.

٤. النتائج: أسرع، أرخص، وأكثر موثوقية

تظهر الورقة البحثية أن SAGE-32B:
١. يتفوق على العمالقة: في المهام العملية (مثل حل المسائل الرياضية المعقدة أو استخدام البرامج)، يتفوق على نماذج أكبر بكثير وأكثر تكلفة (مثل GPT-4 Turbo أو Llama-70B).
٢. يوفر المال: لكونه أصغر حجماً، فإن تشغيله يكلف أقل بكثير.
٣. لا يضيع في الطريق: إذا كانت المهمة تتطلب ٢٠ خطوة، يصل SAGE إلى النهاية دون أن يفقد تركيزه، بينما تتعثر النماذج الأخرى غالباً بعد الخطوة الخامسة.

٥. الحدود (للأمانة)

SAGE ليس مثالياً لكل شيء.

  • ليس فناناً: إذا طلبت منه كتابة قصيدة مضحكة أو الدردشة، سيكون جامداً ومملاً. لقد تم تدريبه ليكون "عاملاً"، لا "شاعراً".
  • يضيع في الفوضى: إذا أعطيته تعليمات مشوشة أو غامضة، فقد يتعثر. إنه يحتاج إلى قواعد واضحة، مثل روبوت في مصنع.

باختدصار

SAGE-32B يشبه الانتقال من سيارة رياضية سريعة جداً ولكن قيادتها صعبة (النماذج الضخمة) إلى مركبة دفع رباعي قوية وموثوقة. قد لا يكون الأسرع في كل شيء، ولكن إذا كنت بحاجة لعبور تضاريس وعرة (مهام معقدة، استخدام أدوات، تصحيح أخطاء)، فهو الخيار الذي سيصل إلى الوجهة دون أن يتعطل، وباستهلاك أقل للوقود.

إنه دليل على أنك لكي تفعل الأشياء جيداً، لا تحتاج دائماً لأن تكون "أكبر"؛ بل تحتاج فقط لأن تكون أذكى في طريقة تفكيرك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →