← أحدث الأبحاث
🤖 AI

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

تقدم هذه الورقة تصنيفاً لسلاسل التفكير المضغوطة (الصريحة، والمؤلفة، والضمنية)، وتثبت من خلال تجارب منضبطة أنه بينما يتطلب الاستنتاج الأكثر خشونة المزيد من البيانات ويظهر سلوكيات تميز وتذكر مختلفة، فإن التعلم المعزز اللاحق باستخدام مكافآت قابلة للتحقق يمكن أن يفكك بفعالية هذه الخطوات المضغوطة التي تم تعلمها أثناء الضبط الدقيق الخاضع للإشراف.

المؤلفون الأصليون: Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت ذكي جداً ولكنه حرفي للغاية كيفية حل لغز رياضي معقد. يتضمن اللغز سلسلة طويلة من الخطوات: "خذ هذا الرقم، اضرب في كذا، أضف كذا، اقسم على كذا..."

لتعليم الروبوت، يمكنك عرض الحل عليه بثلاث طرق مختلفة. يستكشف هذا البحث أي طريقة هي الأفضل، وكم مقدار البيانات التي تحتاجها، وماذا يحدث إذا حاولت جعل الروبوت "يفكر بشكل أسرع" عن طريق تخطي الخطوات.

إليك تفصيل لنتائجهم باستخدام تشبيهات بسيطة:

1. الطرق الثلاث للتعليم (التصنيف)

قام الباحثون بتصنيف كيفية عرض الحل على الروبوت:

  • سلسلة التفكير الصريحة - Explicit CoT (الجولة البطيئة والمستقرة): أنت تعرض للروبوت كل خطوة بمفردها. "اضرب في 2. الآن أضف 5. الآن اقسم على 3." إنها عملية طويلة، لكن الروبوت يرى بالضبط كيف تم بناء الإجابة.
  • سلسلة التفكير المركبة - Composed CoT (الخطوات المجمعة): أنت تجمع خطوتين معاً. بدلاً من قول "اضرب في 2" ثم "أضف 5"، تقول: "اضرب في 2 وأضف 5". يرى الروبوت العمليات، لكن الأرقام الوسيطة تكون مخفية.
  • سلسلة التفكير الضمنية - Implicit CoT (خدعة السحر): أنت تتخطى المنتصف تماماً. أنت تعرض فقط الرقم البداية والنتيجة النهائية لمجموعة من الخطوات، دون إظهار "كيف" وصلت إلى هناك. الأمر يشبه قول: "ابدأ بـ 3، وانتهِ بـ 15"، وعلى الروبوت أن يخمن الرياضيات التي حدثت في المنتصف.

2. تكلفة "الضغط" (الحاجة لمزيد من البيانات)

وجد البحث وجود مقايضة: كلما زدت من ضغط التعليمات، احتجت إلى المزيد من الأمثلة لتعليم الروبوت.

  • تشبيه: تخيل تعليم شخص ما كيفية خبز كعكة.
    • إذا أعطيته وصفة بكل خطوة بالتفصيل (صريحة)، فقد يتعلمها بعد رؤيتها 10 مرات.
    • إذا أعطيته وصفة "مضغوطة" تقول "اخلط المكونات الجافة مع المكونات السائلة" دون إظهار عملية الخلط (مركبة/ضمنية)، فسيصاب بالارتباك. لتعليمه هذا، يجب أن تريه هذه الوصفة المضغوطة مئات المرات (بيانات أكثر) قبل أن يفهم النمط أخيراً.
  • النتيجة: التفكير الأكثر خشونة وضغطاً يتطلب بيانات تدريب أكثر بكثير للوصول إلى نفس المستوى من المهارة.

3. التكرار مقابل التنوع (تأثير "التدريب المستمر")

بمجرد أن تقرر استخدام البيانات المضغوطة، كيف يجب تقديمها؟ هل يجب أن تعرض على الروبوت نفس الـ 10 مسائل مراراً وتكراراً (التكرار)، أم 10,000 مسألة مختلفة (التوسع)؟

  • سلسلة التفكير المركبة - Composed CoT (الخطوات المجمعة): هذا النوع يعشق التكرار. إذا عرضت على الروبوت نفس الخطوات المجمعة مراراً وتكراراً، فسيصبح بارعاً جداً في ذلك النمط المحدد. الأمر يشبه التدريب على حركة معينة في الرياضة؛ التكرار يجعلها تتحول إلى ذاكرة عضلية.
  • سلسلة التفكير الضمنية - Implicit CoT (خدعة السحر): هذا النوع يكره التكرار. إذا عرضت على الروبوت نفس "الخدعة السحرية" مراراً وتكراراً، فإنه سيقوم فقط بحفظ الإجابة لتلك الخدعة المحددة. سيفشل عندما تعطيه لغزاً جديداً. هو يحتاج إلى التنوع (بيانات مختلفة) ليتعلم المنطق الكامن فعلياً، وإلا فإنه سيغش عبر الحفظ فقط.

4. مرحلة "إلغاء التعلم" (SFT مقابل RL)

هذا هو الجزء الأكثر إثارة للدهشة. قام الباحثون أولاً بتعليم الروبوت باستخدام البيانات المضغوطة (SFT)، ثم تركوه يتدرب بمفرده باستخدام المكافآت (RL).

  • المشكلة: عندما يتم تعليم الروبوت بالبيانات المضغوطة، فإنه يعلق في نمط محدد. إذا طلبت منه حل لغز يتطلب "نصف خطوة" (خطوة لا تتناسب مع المجموعات المضغوطة)، فإنه يفشل تماماً. الأمر يشبه روبوتاً تدرب فقط على المشي في خطوات مزدوجة؛ إذا طلبت منه اتخاذ خطوة واحدة، فسوف يسقط.
  • الحل: عندما انتقلوا إلى التعلم المعزز (Reinforcement Learning - RL)، بدأ الروبوت "يفكر" مجدداً. أدرك قائلاً: "انتظر، يمكنني تفكيك هذه الكتلة الكبيرة مرة أخرى إلى قطع صغيرة!" الـ RL يقوم بـ "فك ضغط" المعرفة المضغوطة.
  • تشبيه: تخيل طالباً حفظ صيغة رياضية ككتلة واحدة. لا يمكنه حل مسألة تتطلب تقسيم هذه الصيغة. ولكن إذا تركته يتدرب على حل المسائل بمفرده (RL)، فسيدرك في النهاية: "أوه! يمكنني تفكيك هذه الكتلة الكبيرة مرة أخرى إلى الخطوات الصغيرة التي تعلمتها سابقاً". مرحلة الـ RL هي التي تقوم بفك ضغط المعرفة.

5. الترتيب مهم (طرق الاتجاه الواحد)

أخيراً، نظروا في اتجاه التفكير.

  • للأمام/للخلف (اتجاه واحد): التفكير من البداية إلى النهاية، أو من النهاية إلى البداية، يعمل بشكل رائع. الروبوت يعمم بشكل جيد على الألغاز الأطول والأصعب.
  • الهيكلي (الشجري): هذا هو المكان الذي تحل فيه أجزاء صغيرة ثم تجمعها (مثل بناء شجرة). وجد البحث أن هذا يفشل عندما تصبح الألغاز أطول. الروبوت يضيع في محاولة الاحتفاظ بالكثير من "الأغصان" الوسيطة في رأسه في وقت واحد.
  • الخلاصة: بالنسبة لسلاسل التفكير الطويلة، الخط المستقيم (اتجاه واحد) أفضل بكثير من هيكل الشجرة المعقد.

الملخص

لجعل الذكاء الاصطناعي ذكياً وفعالاً (تفكير أقصر) دون فقدان ذكائه:

  1. لا تبالغ في الضغط إلا إذا كان لديك كمية هائلة من البيانات.
  2. إذا كنت ستقوم بالضغط، فاستخدم الخطوات المركبة (إظهار العمليات) وكررها كثيراً. تجنب الخطوات الضمنية (إخفاء العمليات) ما لم يكن لديك بيانات ضخمة ومتنوعة.
  3. الـ SFT (الضبط الدقيق تحت الإشراف) يعلم الروبوت الاختصارات المضغوطة، ولكن الـ RL (التعلم المعزز) ضروري لتعليم الروبوت كيفية تفكيك تلك الاختصارات مرة أخرى عندما يصبح الأمر غريباً أو أطول.
  4. حافظ على عملية التفكير في خط مستقيم، وليس في هيكل شجري معقد، للحصول على أفضل النتائج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →