Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning
تقدم الورقة البحثية ReCo، وهو إطار عمل منسق بالمكافأة يعمل على تحسين نماذج الاستدلال الكبيرة عبر الضبط الديناميكي لضغط ذاكرة التخزين المؤقت (KV-cache)، وكبح عمليات التأمل الزائدة، وتمكين التوقف المبكر بناءً على مكافآت العمليات، مما يقلل بشكل كبير من تكاليف الاستدلال وزمن الاستجابة مع الحفاظ على الدقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتًا فائق الذكاء يحل الألغاز الصعبة من خلال التحدث مع نفسه. هو لا يكتفي بالتخمين فحسب؛ بل يكتب قصة طويلة ومفصلة لعملية تفكيره، خطوة بخطوة، قبل أن يعطيك الإجابة النهائية. هكذا تعمل "نماذج الاستدلال الكبيرة" الحديثة. إنهم يشبهون المحققين البارعين الذين يرفضون حل قضية ما حتى يدونوا كل دليل، وكل طريق مسدود، وكل لحظة "وجدتها!". المشكلة هي أن هذا المحقق يصبح ثرثارًا أكثر من اللازم. فأحيانًا، لسؤال بسيط مثل "ما هو 2+2؟"، يكتب مقالاً بطول رواية عن تاريخ الرياضيات قبل أن يجيب بـ "4". هذا "الإفراط في التفكير" يستهلك كمية هائلة من ذاكرة الكمبيوتر والوقت، مما يجعل الروبوت بطيئًا ومكلفًا في التشغيل.
ولإصلاح ذلك، حاول العلماء جعل ذاكرة الروبوت أكثر كفاءة. فكر في ذاكرة الروبوت كأنها سبورة يكتب عليها أفكاره. ومع استمرار الروبوت في التفكير لفترة أطول، تمتلئ السبورة. هناك حيلة شائعة وهي مسح الملاحظات القديمة "الأقل أهمية" لإفساح المجال لملاحظات جديدة. وهذا ما يسمى "ضغط ذاكرة الـ KV-cache". ومع ذلك، لاحظ الباحثون وراء هذه الورقة البحثية وجود خلل في كيفية إجراء عملية المسح هذه. فقد وجدوا أنه إذا تم مسح الملاحظات الخاطئة، فإن الروبوت يصاب بالارتباك ويبدأ في التحدث أكثر ليحاول فهم الأمور، مما يلغي كل الوقت الذي وفرته عبر مسح الملاحظات في المقام الأول. الأمر يشبه محاولة توفير الوقت عبر تخطي بعض الخطوات في وصفة طعام، لتدرك في النهاية أنك نسيت مكونًا رئيسيًا وعليك الآن البدء في إعداد الطبخة من جديد.
تقدم هذه الورقة نظامًا جديدًا يسمى ReCo (الضغط المنسق بالمكافأة) لحل هذه المشكلة الفوضوية. بدلاً من مجرد مسح الملاحظات القديمة عشوائيًا أو استخدام قاعدة ثابتة للجميع، يعمل ReCo كمدرب حكيم يقف بجانب الروبوت. فبعد كل خطوة يتخذها الروبوت، يسأل المدرب: "ما مدى ثقتك بأنك على المسار الصحيح؟". إذا كان الروبوت يبلي بلاءً حسنًا وهو على مسار صلب (خطوة "عالية المكافأة")، يقول المدرب: "أنت تبلي بلاءً جيدًا جدًا، لست بحاجة للاحتفاظ بكل ملاحظة قديمة. دعنا نمسح بعضها لتوفير المساحة". ولكن إذا كان الروبوت يعاني أو يستكشف أفكارًا جديدة (خطوة "منخفضة المكافآت")، يقول المدرب: "تمهل، أنت بحاجة إلى كل ملاحظاتك الآن؛ لا تحذف أي شيء".
الجزء الذكي هو أن "درجة الثقة" هذه تقوم بوظيفتين في آن واحد. أولاً، هي تقرر مقدار الذاكرة التي سيتم الاحتفاظ بها أو حذفها. ثانيًا، هي تخبر الروبوت بالتوقف عن الإفراط في التفكير. إذا كان الروبوت واثقًا وعلى المسار الصحيح، يدفع المدرب الروبوت بلطف للتوقف عن الثرثرة وإعطاء الإجابة فقط. أما إذا كان لا يزال مرتبكًا، فيسمح له المدرب بالاستمرار في التفكير والاستكشاف. ومن خلال تنسيق هذين الإجراءين — تنظيف الذاكرة ومراقبة مقدار حديث الروبوت — يمنع النظام الروبوت من الارتباك وكتابة قصص أطول للتعويض عن النقص.
النتائج مثيرة للإعجاب. فعندما اختبر الباحثون ReCo على ثلاثة نماذج استدلال مختلفة عبر ستة أنواع مختلفة من الألغاز (من المسائل الرياضية إلى الأسئلة العلمية)، أصبح الروبوت أسرع بكثير واستخدم كلمات أقل بكثير. وتحديدًا، قلل النظام عدد الكلمات التي يولدها الروبوت بنسبة تتراوح بين 37% إلى 65% وجعل العملية بأكملبة أسرع بمقدار 2.08 إلى 2.35 مرة من الطريقة القياسية غير المحسنة. والأهم من ذلك، فعل كل هذا دون أن يجعل الروبوت أغبى بشكل ملحوظ؛ حيث ظلت الدقة كما هي تقريبًا مثل النسخة البطيئة والثرثارة. تشير الورقة البحثية إلى أن مجرد محاولة تقليص الذاكرة ليست كافية بمفردها؛ بل يجب عليك إدارة عملية تفكير الروبوت في الوقت نفسه للحصول على مكاسب حقيقية في السرعة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.