← أحدث الأبحاث
🤖 AI

Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction

تقترح هذه الورقة تقنية "الضغط الواعي بالاستدلال" (Reasoning-Aware Compression - RAC)، وهي تقنية تقليم تعمل على إعادة بناء مدخلات التنشيط ومسارات "سلسلة الأفكار" (chain-of-thought) المتبعة أثناء السياسة بشكل مشترك، وذلك لتقليل تكاليف نشر نماذج الاستدلال بفعالية مع تجنب تدهور الأداء وزيادة زمن الاستجابة الناتجين عن طرق التقليم القياسية.

المؤلفون الأصليون: Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

نُشر 2026-05-06
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً ومتميزاً يُدعى "الذكاء الاصطناعي الاستنتاجي". هذا الطالب مذهل في حل المسائل الرياضية المعقدة وكتابة الأكواد البرمجية، لكن لديه عادة غريبة: قبل أن يعطيك الإجابة النهائية، يكتب مذكرات ضخمة ومفصلة عن مسار تفكيره. هو لا يكتفي بقول "الإجابة هي 42"؛ بل يكتب 50 صفحة من "دعني أرى، إذا جربت هذا، فسيحدث ذاك، ولكن مهلاً، ربما ليس هذا..." قبل أن يستقر أخيراً على الإجابة.

هذا يجعله دقيقاً للغاية، لكنه أيضاً بطيء جداً ومكلف في التشغيل. أنت تريد توظيف نسخة أصغر وأرخص من هذا الطالب (نموذج "مُقلم") للقيام بنفس المهمة.

المشكلة: خطأ "الواجب المنزلي الخاطئ"
عادةً، عندما يحاول المهندسون تقليص هذه النماذج الذكية الكبيرة، يستخدمون طريقة تُسمى "التقليم" (Pruning). فكر في التقليم كعملية تحرير كتاب لجعله أقصر عبر حذف الكلمات التي لا تعتقد أنها مهمة.

ولتحديد الكلمات التي يجب حذفها، ينظر "المحررون" (خواروات التقليم) عادةً إلى عينة من مدخلات الطالب — أي الأسئلة التي طُرحت عليه. ويفترضون: "حسناً، الطالب جيد في الإجابة على هذه الأسئلة، لذا إذا احتفظنا بالأجزاء من دماغه التي تتعامل مع الأسئلة، فسنكون بخير".

تجادل الورقة البحثية بأن هذا خطأ فادح لنماذج الاستنتاج. الأمر يشبه محاولة تدريب عداء ماراثون عبر مراقبته وهو يربط حذاءه فقط. أنت تتجاهل الجزء الذي يقوم فيه بـ "الجري" فعلياً.

بالنسبة لنماذج الاستنتاج، فإن جزء "الجري" هو سلسلة التفكير الطويلة (CoT). إذا قمت بتدريب خوارزمية التقليم الخاصة بك على الأسئلة فقط (المدخلات) وتجاهلت عملية التفكير الطويلة، فسيصاب النموذج المصغر بالارتباك. سيبدأ بالثرثرة أكثر من ذي قبل، ويكتب 100 صفحة من الأفكار المرتبكة بدلاً من 50، ومع ذلك سيصل إلى إجابة خاطئة. سيصبح أبطأ وأغبى في آن واحد.

الحل: "الضغط الواعي بالاستنتاج" (RAC)
يقترح المؤلفون حلاً بسيطاً يسمى "الضغط الواعي بالاستنتاج" (Reasoning-Aware Compression - RAC).

بدلاً من مجرد عرض الأسئلة على خوارزمية التقليم، يقولون لها: "اجعل النموذج يجيب على الأسئلة أولاً، ويكتب مسار تفكيره الكامل، ثم استخدم ذلك المسار بأكره لتحديد ما يجب قصه".

التشبيه: البروفة
تخ de تخيل أنك تقوم بتحرير مسرحية.

  • الطريقة القديمة: تقرأ السطور الافتتاحية للنص وتقرر أي ممثلين ستطرد بناءً على مظهرهم في المشهد الأول.
  • طريقة RAC: تشاهد البروفة كاملة، بما في ذلك المشاهد الوسطى الطويلة والفوضوية حيث يحاول الممثلون فهم الحبكة. أنت تطرد الممثلين الذين يخطئون فقط أثناء الأداء الفعلي.

من خلال السماح للنموذج بـ "بروفة" عملية تفكيره أثناء مرحلة التحرير، تتعلم خوارزمية التقليم بالضبط أي أجزاء من الدماغ مطلوبة لخطوات الاستنتاج الطويلة والمعقدة.

ماذا حدث عندما جربوا ذلك؟
اختبر الفريق هذه الطريقة على عدة نماذج ذكاء اصطناعي قوية (مثل DeepSeek-R1 و Qwen) باستخدام اختبارات الرياضيات والبرمجة.

  1. الدقة: عندما استخدموا الطريقة القديمة، فإن قطع 50% من دماغ النموذج جعله يفشل في كل شيء تقريباً. أما مع RAC، فقد حافظ النموذج المصغر على معظم ذكائه، حتى بعد إزالة 50% من أوزانه.
  2. السرعة: جعلت الطريقة القديمة النماذج مرتبكة لدرجة أنها بدأت تثرثر لساعات، مما استغرق وقتاً طويلاً للإجابة. أما RAC فقد حافظت على تركيز النماذج؛ حيث أجابت بسرعة تماثل النماذج الكبيرة، أو حتى أسرع، لأنها لم تقع في فخ الحلقات المفرغة من التفكير المرتبك.
  3. تعدد الاستخدامات: نجحت هذه الحيلة سواء كانوا يقطعون النموذج بشكل عشوائي أو في أنماط محددة، كما نجحت مع أنواع مختلفة من النماذج.

الخلاصة
إذا كنت تريد جعل ذكاء اصطناعي استنتاجي ذكي أصغر وأرخص، فلا يمكنك الاكتفاء بالنظر إلى الأسئلة التي تُطرح عليه. يجب أن تراقب كيف يفكر أثناء الإجابة عليها. من خلال تضمين "مذكرات التفكير" الخاصة بالنموذج في عملية التحرير، يمكنك تصغير النموذج دون فقدان عقله أو جعله أبطأ. إنها لمسة بسيطة تمنع النموذج من الضياع في أفكاره الخاصة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →