Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
تقدم هذه الورقة تصنيفاً لسلاسل التفكير المضغوطة (الصريحة، والمؤلفة، والضمنية)، وتثبت من خلال تجارب منضبطة أنه بينما يتطلب الاستنتاج الأكثر خشونة المزيد من البيانات ويظهر سلوكيات تميز وتذكر مختلفة، فإن التعلم المعزز اللاحق باستخدام مكافآت قابلة للتحقق يمكن أن يفكك بفعالية هذه الخطوات المضغوطة التي تم تعلمها أثناء الضبط الدقيق الخاضع للإشراف.
تخيل أنك تقوم بتعليم روبوت ذكي جداً ولكنه حرفي للغاية كيفية حل لغز رياضي معقد. يتضمن اللغز سلسلة طويلة من الخطوات: "خذ هذا الرقم، اضرب في كذا، أضف كذا، اقسم على كذا..."
لتعليم الروبوت، يمكنك عرض الحل عليه بثلاث طرق مختلفة. يستكشف هذا البحث أي طريقة هي الأفضل، وكم مقدار البيانات التي تحتاجها، وماذا يحدث إذا حاولت جعل الروبوت "يفكر بشكل أسرع" عن طريق تخطي الخطوات.
إليك تفصيل لنتائجهم باستخدام تشبيهات بسيطة:
1. الطرق الثلاث للتعليم (التصنيف)
قام الباحثون بتصنيف كيفية عرض الحل على الروبوت:
سلسلة التفكير الصريحة - Explicit CoT (الجولة البطيئة والمستقرة): أنت تعرض للروبوت كل خطوة بمفردها. "اضرب في 2. الآن أضف 5. الآن اقسم على 3." إنها عملية طويلة، لكن الروبوت يرى بالضبط كيف تم بناء الإجابة.
سلسلة التفكير المركبة - Composed CoT (الخطوات المجمعة): أنت تجمع خطوتين معاً. بدلاً من قول "اضرب في 2" ثم "أضف 5"، تقول: "اضرب في 2 وأضف 5". يرى الروبوت العمليات، لكن الأرقام الوسيطة تكون مخفية.
سلسلة التفكير الضمنية - Implicit CoT (خدعة السحر): أنت تتخطى المنتصف تماماً. أنت تعرض فقط الرقم البداية والنتيجة النهائية لمجموعة من الخطوات، دون إظهار "كيف" وصلت إلى هناك. الأمر يشبه قول: "ابدأ بـ 3، وانتهِ بـ 15"، وعلى الروبوت أن يخمن الرياضيات التي حدثت في المنتصف.
2. تكلفة "الضغط" (الحاجة لمزيد من البيانات)
وجد البحث وجود مقايضة: كلما زدت من ضغط التعليمات، احتجت إلى المزيد من الأمثلة لتعليم الروبوت.
تشبيه: تخيل تعليم شخص ما كيفية خبز كعكة.
إذا أعطيته وصفة بكل خطوة بالتفصيل (صريحة)، فقد يتعلمها بعد رؤيتها 10 مرات.
إذا أعطيته وصفة "مضغوطة" تقول "اخلط المكونات الجافة مع المكونات السائلة" دون إظهار عملية الخلط (مركبة/ضمنية)، فسيصاب بالارتباك. لتعليمه هذا، يجب أن تريه هذه الوصفة المضغوطة مئات المرات (بيانات أكثر) قبل أن يفهم النمط أخيراً.
النتيجة: التفكير الأكثر خشونة وضغطاً يتطلب بيانات تدريب أكثر بكثير للوصول إلى نفس المستوى من المهارة.
3. التكرار مقابل التنوع (تأثير "التدريب المستمر")
بمجرد أن تقرر استخدام البيانات المضغوطة، كيف يجب تقديمها؟ هل يجب أن تعرض على الروبوت نفس الـ 10 مسائل مراراً وتكراراً (التكرار)، أم 10,000 مسألة مختلفة (التوسع)؟
سلسلة التفكير المركبة - Composed CoT (الخطوات المجمعة): هذا النوع يعشق التكرار. إذا عرضت على الروبوت نفس الخطوات المجمعة مراراً وتكراراً، فسيصبح بارعاً جداً في ذلك النمط المحدد. الأمر يشبه التدريب على حركة معينة في الرياضة؛ التكرار يجعلها تتحول إلى ذاكرة عضلية.
سلسلة التفكير الضمنية - Implicit CoT (خدعة السحر): هذا النوع يكره التكرار. إذا عرضت على الروبوت نفس "الخدعة السحرية" مراراً وتكراراً، فإنه سيقوم فقط بحفظ الإجابة لتلك الخدعة المحددة. سيفشل عندما تعطيه لغزاً جديداً. هو يحتاج إلى التنوع (بيانات مختلفة) ليتعلم المنطق الكامن فعلياً، وإلا فإنه سيغش عبر الحفظ فقط.
4. مرحلة "إلغاء التعلم" (SFT مقابل RL)
هذا هو الجزء الأكثر إثارة للدهشة. قام الباحثون أولاً بتعليم الروبوت باستخدام البيانات المضغوطة (SFT)، ثم تركوه يتدرب بمفرده باستخدام المكافآت (RL).
المشكلة: عندما يتم تعليم الروبوت بالبيانات المضغوطة، فإنه يعلق في نمط محدد. إذا طلبت منه حل لغز يتطلب "نصف خطوة" (خطوة لا تتناسب مع المجموعات المضغوطة)، فإنه يفشل تماماً. الأمر يشبه روبوتاً تدرب فقط على المشي في خطوات مزدوجة؛ إذا طلبت منه اتخاذ خطوة واحدة، فسوف يسقط.
الحل: عندما انتقلوا إلى التعلم المعزز (Reinforcement Learning - RL)، بدأ الروبوت "يفكر" مجدداً. أدرك قائلاً: "انتظر، يمكنني تفكيك هذه الكتلة الكبيرة مرة أخرى إلى قطع صغيرة!" الـ RL يقوم بـ "فك ضغط" المعرفة المضغوطة.
تشبيه: تخيل طالباً حفظ صيغة رياضية ككتلة واحدة. لا يمكنه حل مسألة تتطلب تقسيم هذه الصيغة. ولكن إذا تركته يتدرب على حل المسائل بمفرده (RL)، فسيدرك في النهاية: "أوه! يمكنني تفكيك هذه الكتلة الكبيرة مرة أخرى إلى الخطوات الصغيرة التي تعلمتها سابقاً". مرحلة الـ RL هي التي تقوم بفك ضغط المعرفة.
5. الترتيب مهم (طرق الاتجاه الواحد)
أخيراً، نظروا في اتجاه التفكير.
للأمام/للخلف (اتجاه واحد): التفكير من البداية إلى النهاية، أو من النهاية إلى البداية، يعمل بشكل رائع. الروبوت يعمم بشكل جيد على الألغاز الأطول والأصعب.
الهيكلي (الشجري): هذا هو المكان الذي تحل فيه أجزاء صغيرة ثم تجمعها (مثل بناء شجرة). وجد البحث أن هذا يفشل عندما تصبح الألغاز أطول. الروبوت يضيع في محاولة الاحتفاظ بالكثير من "الأغصان" الوسيطة في رأسه في وقت واحد.
الخلاصة: بالنسبة لسلاسل التفكير الطويلة، الخط المستقيم (اتجاه واحد) أفضل بكثير من هيكل الشجرة المعقد.
الملخص
لجعل الذكاء الاصطناعي ذكياً وفعالاً (تفكير أقصر) دون فقدان ذكائه:
لا تبالغ في الضغط إلا إذا كان لديك كمية هائلة من البيانات.
إذا كنت ستقوم بالضغط، فاستخدم الخطوات المركبة (إظهار العمليات) وكررها كثيراً. تجنب الخطوات الضمنية (إخفاء العمليات) ما لم يكن لديك بيانات ضخمة ومتنوعة.
الـ SFT (الضبط الدقيق تحت الإشراف) يعلم الروبوت الاختصارات المضغوطة، ولكن الـ RL (التعلم المعزز) ضروري لتعليم الروبوت كيفية تفكيك تلك الاختصارات مرة أخرى عندما يصبح الأمر غريباً أو أطول.
حافظ على عملية التفكير في خط مستقيم، وليس في هيكل شجري معقد، للحصول على أفضل النتائج.
ملخص تقني: ضغط التفكير: متى وكيف تعمل بيانات الاستدلال المضغوطة في مرحلة ما بعد التدريب للنماذج اللغوية الكبيرة (LLMs)
1. بيان المشكلة
أظهرت النماذج اللغوية الكبيرة (LLMs) قدرة على حل المشكلات المعقدة من خلال سلاسل التفكير الطويلة (Chain-of-Thought - CoT). ومع ذلك، تظل المقايضة بين أداء الاستدلال وتكلفة الرموز (tokens) تحديًا مركزيًا لنشر الوكلاء الذكيين. وللتخفيف من تكاليف الرموز، يلجأ الممارسون غالبًا إلى الضبط الدقيق تحت الإشراف (SFT) باستخدام بيانات استدلال "مضغوطة"، حيث يتم تقصير مسارات CoT عن طريق تجميع أو حذف الخطوات الوسيطة.
على الرغم من شيوع هذه الممارسة، يحدد البحث فجوة حرجة في الفهم:
آلية الضغط: من غير الواضح كيف تؤثر الأشكال الهيكلية المختلفة لضغط CoT (مثل تجميع العمليات مقابل حذفها) على ديناميكيات التعلم.
متطلبات البيانات: العلاقة بين دقة الضغط (granularity)، وحجم البيانات، وخطوات التدريب المطلوبة لـ SFT غير مفهومة بشكل جيد.
قدرة التفكيك: لا يزال من غير المعروف ما إذا كانت النماذج المدربة على بيانات مضغوطة يمكنها تفكيك هذه الخطوات المجمعة لحل مهام تتطلب استدلالًا أكثر دقة، وما إذا كان التعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR) يمكن أن يسهل عملية التفكيك هذه.
2. المنهجية
2.1 تصنيف ضغط CoT
يقترح المؤلفون تصنيفًا رسميًا لتصنيف مسارات استدلال CoT بناءً على كيفية تقديم العمليات الذرية (fi) والقيم (si):
CoT الصريح (Explicit CoT): يُخرج كل عملية وكل قيمة وسيطة بالتتابع (s1=f1(s0),s2=f2(s1),…). وهذا يقابل دقة ضغط (g) تساوي 1.
CoT المركب (Composed CoT): يجمع عمليات متعددة في خطوة واحدة، حيث يسرد العمليات صراحةً ولكنه يحذف القيم الوسيطة (على سبيل المثال، s2=f2(f1(s0))). هنا، تكون g>1.
CoT الضمني (Implicit CoT): يحذف كلاً من القيم الوسيطة والسرد الصريح للعمليات الوسيطة، ويخرج فقط النتيجة النهائية لمجموعة معينة (على سبيل المثال، s4=f4(s3)). هذا يخفي كل من العمليات والقيم، مما يقابل g أعلى.
2.2 بناء المهمة الاصطناعية
للتحكم في متغيرات مثل الصعوبة، ودقة الضغط، وحجم البيانات، قام المؤلفون ببناء مهمة استدلال حسابي اصطناعية.
هيكل المهمة: تتضمن المشكلات تبعيات تسلسلية بين المعلمات (على سبيل المثال، "عدد A يساوي B مضروبًا في 4").
الصعوبة ($op$): تُعرف بأنها إجمالي العمليات الذرية المطلوبة لحل المهمة.
الدقة (g): عدد العمليات التي يتم تجميعها في خطوة CoT واحدة.
التقييم: تم تدريب النماذج على مهام ذات قيم $op$ محددة (مثل 8، 16، 24) وتقييمها على مهام خارج نطاق التوزيع (OOD) ذات تسلسلات أطول (مثل 32 إلى 104 عملية) لاختبار التعميم.
2.3 الإعداد التجريبي
النماذج: أُجريت التجارب عبر عائلات وأحجام نماذج مختلفة، بما في ذلك Qwen2.5 (من 0.5B إلى 14B) و Llama-3 (من 1B إلى 8B).
أنظمة التدريب:
SFT: التدريب على بيانات Explicit و Composed و Implicit CoT مع قيم g متفاوتة (2، 4، 8).
توسع البيانات مقابل التكرار: مقارنة التدريب على مجموعات بيانات متنوعة كبيرة (384 ألف عينة، دورة واحدة/epoch) مقابل مجموعات بيانات صغيرة مكررة عدة مرات (6 آلاف عينة، 64 دورة).
RLVR: تطبيق تحسين السياسة النسبي المجموع (GRPO) على النماذج المدربة مسبقًا بـ SFT لاختبار ما إذا كان التعلم التعزيزي (RL) يمكنه تفكيك الخطوات المضغوطة.
النتيجة: يتطلب الـ CoT المضغوط ذو الدقة الأخشن (قيمة g أعلى) خطوات تدريب وحجم بيانات أكبر بكثير لتحقيق نفس مستوى الأداء الذي يحققه الـ Explicit CoT.
الاستنتاج: لتدريب النماذج على مسارات استدلال مضغوطة للغاية، يجب على الممارسين إعداد مجموعات بيانات أكبر للتعويض عن زيادة تعقيد إشارة التعلم.
3.2 توسع البيانات مقابل تكرار البيانات
التوسع (Scaling): يستفيد الـ CoT المركب (سواء Composed أو Implicit) من توسع البيانات (زيادة عدد العينات الفريدة) أكثر من الـ Explicit CoT.
التكرار (Repetition):
CoT المركب (Composed CoT): يستفيد من تكرار البيانات (التدريب على عينات أقل لعدد أكبر من الدورات).
CoT الضمني (Implicit CoT): يعاني من تدهور الأداء عند تكرار البيانات. يشير المؤلفون إلى أن هذا يعود إلى الإفراط في التخصيص (overfitting) أو حفظ أطوال محددة، حيث أن الـ Implicit CoT يخفي البنية التشغيلية اللازمة للتعميم.
الخلاصة: عندما تكون البيانات محدودة، يُفضل استخدام الـ Composed CoT للتدريب القائم على التكرار، بينما يجب تجنب الـ Implicit CoT وتفضيل توسع البيانات المتنوعة.
3.3 تفكيك سلاسل الاستدلال
قصور SFT: تفشل النماذج المدربة على CoT مضغوط (مثل g=2) في حل المهام التي تتطلب تفكيكًا إلى خطوات ذرية (مثل المهام ذات قيم $opالفرديةعندماتمالتدريبعلىقيمop$ زوجية). فهي لا تستطيع تلقائيًا تفكيك الكتل المجمعة التي لوحظت أثناء الـ SFT.
قدرة RLVR: ينجح الـ RLVR اللاحق في تمكين التفكيك. عند تطبيقه على مهام تتطلب التفكيك (قيم $opفردية)،يسمحRLVRللنماذجبتفكيككتلg=2إلىخطواتذريةg=1$.
الديناميكيات: خلال RLVR، يزدباد طول الاستجابة في البداية (مما يشير إلى أن النموذج يستكشف الخطوات الصريحة المفككة) قبل أن يستقر على استراتيجية فعالة تستخدم الخطوات المضغوطة لمعظم الحسابات والخطوات الصريحة فقط عند الضرورة.
الخلاصة: يتعلم الـ SFT محاكاة الأنماط المضغوطة، ولكن RLVR ضروري لاكتشاف المهارات الذرية الأساسية وإعادة دمجها للتركيبات غير المرئية.
3.4 ترتيب CoT والتعميم
أحادي الاتجاه مقابل الهرمي: تتعمم ترتيبات CoT الأمامية والخلفية بشكل جيد على المهام التسلسلية الأطول (OOD). في المقابل، يفشل الـ Hierarchical CoT (الذي يقسم المشكلات إلى كتل ويخزن المتغيرات الوسيطة) في التعميم على المهام الأطول.
كفاءة البيانات: يتطلب الـ Backward CoT بيانات أكثر من الـ Forward CoT لتحقيق تعميم مماثل، ويرجع ذلك على الأرجح إلى عدم التوافق مع توزيع البيانات المستخدم في التدريب المسبق.
الخلاصة: بالنسبة للمهام التركيبية التسلسلية، تعتبر تصميمات CoT أحادية الاتجاه أكثر قوة وكفاءة في البيانات من التقسيم الهرمي.
4. الأهمية والادعاءات
يدعي البحث أنه يقدم فهمًا تأسيسيًا للمقايضات المتضمنة في ضغط بيانات الاستدلال في مرحلة ما بعد التدريب للنماذج اللغوية الكبيرة. وتتمثل مساهماته الأساسية في:
إرشادات تصميم البيانات: يقدم قواعد عملية لبناء مجموعات بيانات مضغوطة في ظل قيود الموارد. وتحديدًا، ينصح بأن الضغط الأخشن يتطلب المزيد من البيانات، وأن الـ Composed CoT يستفيد من التكرار بينما لا يستفيد الـ Implicit CoT، وأن الترتيب أحادي الاتجاه هو الأفضل للتعميم.
الرؤية الميكانيكية لـ SFT مقابل RL: يوضح العمل الأدوار المتميزة لكل من SFT و RL في مرحلة ما بعد التدريب. ويفترض أن SFT فعال لتعلم التمثيلات المضغوطة ولكنه محدود في تفكيكها، بينما يعمل RLVR كآلية لـ "فك ضغط" هذه الكتل، مما يسم un للنموذج من التعميم على تركيبات جديدة من خلال استعادة العمليات الذرية.
تحسين تكاليف الرموز: من خلال تحديد متى تكون البيانات المضغوطة فعالة وكيفية اقترانها مع RL، يهدف البحث إلى المساعدة في إدارة التوازن بين طول الاستدلال (تكلفة الرموز) والأداء، مما يدعم تطوير وكلاء لغويين أكثر كفاءة.
يحافظ المؤلفون على التواضع بشأن ادعاءاتهم، مشيرين إلى أن نتائجهم مستمدة من مهام حسابية اصطناعية وقد لا تترجم مباشرة إلى جميع مجالات العالم الحقيقي أو بنى غير الـ Transformer دون مزيد من البحث. ويؤكدون أنه بينما تدعم نتائجهم وجهة النظر القائلة بأن RL يمكنه اكتشاف حلول جديدة من خلال تركيب المهارات، فإن الآليات المحددة في الاستدلال المعقد في العالم الحقيقي تظل مجالًا للدراسة المستقبلية.