← أحدث الأبحاث
🤖 machine learning

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

تقدم هذه الورقة البحثية Extra-CoT، وهو إطار عمل مبتكر يحقق ضغطاً فائقاً لسلسلة الأفكار (Chain-of-Thought) مع حد أدنى من فقدان الدقة عبر الجمع بين ضاغطٍ يحافظ على المعنى الدلالي، والضبط الدقيق الخاضع للإشراف بنسب مختلطة، واستراتيجية تحسين النسبة الهرمية والمقيدة (CHRPO) لتمكين الاستدلال عالي الدقة والفعالية في النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً ومتحمساً للغاية (وهو الذكاء الاصطناعي) يحاول حل مسألة رياضية. عندما تسأله سؤالاً بسيطاً مثل "ما هو 2+2؟"، فإنه لا يكتفي بقول "4". بدلاً من ذلك، يكتب مقالاً من 50 صفحة يشرح فيها تاريخ الأرقام، ومفهوم الجمع، ولما لماذا الرقم 2 مميز، قبل أن يضع في النهاية دائرة حول الإجابة "4".

هذا ما يسمى بـ سلسلة الأفك‏ (Chain-of-Thought - CoT). وهي تساعد الذكاء الاصطناعي على الوصول إلى الإجابة الصحيحة، لكنها بطيئة للغاية ومكلفة لأن الذكاء الاصطناعي "يفرط في التفكير" وينتج الكثير جداً من الكلمات (الرموز/Tokens).

تقدم هذه الورقة البحثية نظاماً جديداً يسمى Extra-CoT لحل هذه المشكلة. فكر في الأمر كبرنامج تدريبي من ثلاث خطوات لتعليم هذا الطالب المتحمس جداً كيف يكون موجزاً دون أن يفقد ذكاءه.

المشكلة في "المحررين" الحاليين

قبل هذه الورقة، حاول الباحثون استخدام "محررين" لتقليص مقالات الطالب الطويلة. كان هؤلاء المحررون يقومون فقط بقص الكلمات بشكل عشوائي أو بناءً على قواعد بسيطة.

  • التشبيه: تخيل محرراً يقص جملة تقول: "الجذر التربيعي لـ 109 هو تقريباً 10.44". إذا قام بقصها إلى النصف، فقد يتبقى لك "الجذر التربيعي لـ 10..." وهو ما لا يعطي أي معنى.
  • النتيجة: عندما حاولت هذه المحررات تقليص المقال إلى حجم ضئيل جداً (مثل 20% من الأصل)، أصبحت إجابات الطالب غير منطقية. انهار المنطق لأن "الخطوات الحرجة" قد تم تقطيعها.

حل Extra-CoT: معسكر تدريبي من ثلاث خطوات

يقترح المؤلفون طريقة جديدة تعامل الطالب والمحرر بشكل مختلف.

الخطوة 1: المحرر "الخبير بالرياضيات" (الضاغط)

أولاً، قاموا بتدريب محرر خاص يفهم الصيغ الرياضية بشكل أفضل من أي شخص آخر.

  • كيف يعمل: بدلاً من مجرد النظر إلى الكلمات، يتعامل هذا المحرر مع الصيغة الرياضية الكاملة (مثل x2+12x=73x^2 + 12x = 73) ككتلة واحدة غير قابلة للتجزئة. فهو يعلم أنه إذا قمت بقص صيغة رياضية إلى نصفين، فإن الصيغة بأكملها ستتعطل.
  • التشبيه: تخيل أميناً للمكتبة يعرف أن فصلاً معيلاً في كتاب هو "الدليل" لحل لغز ما. إذا احتاج إلى تقليص حجم المكتبة، فلن يمزق صفحات من هذا الفصل؛ بل سيحتفظ بالفصل كاملاً ويقص الأوصاف المملة المحيطة به.
  • الهدف: يؤدي هذا إلى إنشاء "معيار ذهبي" لإجابات مختصرة لا تزال مثالية من الناحية المنطقية.

الخطوة 2: الفصل الدراسي "متعدد الأنماط" (SFT)

بعد ذلك، يعلمون طالب الذكاء الاصطنا الرئيسي اتباع تعليمات هذا المحرر الجديد.

  • كيف يعمل: يعرضون للطالب أمثلة حيث يقول المحرر: "احتفظ بـ 80% من النص"، ثم "احتفظ بـ 60%"، ثم "احتفظ بـ 20%".
  • التشبيه: يشبه الأمر مدرباً يدرب رياضياً على الجري لمسافات مختلفة. يتعلم الرياضي أنه عندما يصرخ المدرب "انطلاق سريع قصير!"، فإنه لا يتوقف عن الجري فحسب، بل يجري بكفاءة لتلك المسافة المحددة. هذا يعلم الذكاء الاصطناعي أن يكون مطيعاً لمختلف "ميزانيات" الكلمات.

الخطوة 3: المدرب "المخاطر" (CHRPO)

أخيراً، يستخدمون نظام مكافأة خاص (التعلم المعزز) لدفع الطالب ليكون أكثر كفاءة.

  • المشكلة: الطالب يخشى أن يكون قصيراً جداً لأنه قد يخطئ في الإجابة.
  • الحل: يمنح المدرب (CHRPO) مكافأة ضخمة إذا أجاب الطالب بشكل صحيح واستخدم كلمات قليلة جداً. ولكن، إذا حاول أن يكون قصيراً جداً وأخطأ، فإن العقوبة تكون هائلة.
  • التشبيه: تخيل برنامج مسابقات تحصل فيه على جائزة لحل لغز في 10 ثوانٍ. إذا حللت اللغز في 5 ثوانٍ، ستحصل على جائزة مضاعفة. ولكن إذا تسرعت وأخطأت، فستخسر كل شيء. هذا يشجع الذكاء الاصطناعي على إيجاد "النقطة المثالية" ليكون فائق السرعة ومع ذلك دقيقاً.

النتائج

اختبرت الورقة هذا النظام على مسائل رياضية صعبة (مثل تلك الموجودة في مسابقات المدارس الثانوية).

  • الفوز: استطاع النظام الجديد (Extra-CoT) تقليل عدد الكلمات التي يولدها الذكاء الاصطناعي بنسبة 73% (لتصل إلى 27% فقط من الطول الأصلي) بينما في الواقع حصل على إجابات صحيحة في أسئلة أكثر من ذي قبل.
  • المقارنة: الطرق القديمة (مثل "TokenSkip") انهارت عندما طُلب منها أن تكون بهذا القصر. فإما أنها رفضت اتباع الأوامر أو أعطت إجابات خاطئة. أما Extra-CoT فقد ظل هادئاً ودقيقاً حتى عند الحدود القصوى.
  • السرعة: نظرًا لأن الذكاء الاصطناعي يكتب كلمات أقل بكثير، فإنه يحل المسائل بسرعة أكبر بـ 3 مرات في الوقت الفعلي.

الملخص

باخت_صار، Extra-CoT هو نظام يعلم الذكاء الاصطناعي التوقف عن "الإفراط في التفكير". فهو يستخدم محرراً ذكياً يحترم الصيغ الرياضية، ويدرب الذكاء الاصطناعي على اتباع حدود صارمة للكلمات، ويكافئه ليكون سريعاً ودقيقاً في آن واحد. والنتيال هو ذكاء اصطناعي يمكنه حل ألغاز منطقية معقدة باستخدام جزء ضئيل من قدرة الحوسبة والوقت الذي كان يحتاجه سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →