Developing Adaptive Context Compression Techniques for Large Language Models (LLMs) in Long-Running Interactions
تقترح هذه الورقة إطار عمل لضغط السياق التكيفي يدمج بين اختيار الذاكرة المدرك للأهمية، والترشيح الحساس للتماسك، والتخصيص الديناميكي للميزانية للحفاظ على استقرار المحادثة ودقة الاسترجاع مع تقليل استخدام الرموز (tokens) وزمن الاستجابة في التفاعلات طويلة الأمد مع النماذج اللغوية الكبيرة، كما تم التحقق من ذلك من خلال الأداء المتفوق في اختبارات LOCOMO وLOCCO وLongBench.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تجري محادثة مع صديق ذكي جداً (ذكاء اصطناعي) يتحدث معك منذ أسابيع، وربما أشهر. لقد ناقشتما طفولتك، وعملك، وأفلامك المفضلة، وحلمك الغريب الذي راودك الثلاثاء الماضي.
الآن، تخيل أن عقل صديقك عبارة عن حقيبة ظهر. في كل مرة تقول فيها شيئاً جديداً، فإنه يحشر ورقة تحتوي على تلك المحادثة داخل الحقيبة.
المشكلة: حقيبة الظهر ممتلئة
في النهاية، تصبح حقيبة الظهر مزدحمة جداً بالأوراق لدرجة أن:
- تصبح ثقيلة جداً لحملها (يصبح الكمبيوتر بطيئاً).
- لا يستطيع صديقك العثور على الملحوظة المحددة حول اسم كلبك لأنها مدفونة تحت 5000 ملحوظة أخرى (ينسى الذكاء الاصطناعي التفاصيل المهمة).
- يبدأ في الهلوسة، حيث يخلط بين اسم كلبك واسم قطتك لأن الأوراق متداخلة ومجعدة معاً (يصاب الذكاء الاصطناعي بالارتباك).
هذه هي مشكلة "التفاعل طويل الأمد". فكلما طالت المحادثات، يصبح نماذج الذكاء الاصطناعي أبطأ وأقل ذكاءً لأنها تحاول تذكر كل شيء في وقت واحد.
الحل: "أمين المكتبة الذكي"
تقدم هذه الورقة نظاماً جديداً يسمى الضغط التكيفي للسياق (Adaptive Context Compression). فكر في هذا كتوظيف أمين مكتبة فائق الذكاء لإدارة حقيبة ظهر صديقك.
إليك كيف يعمل أمين المكتبة هذا، باستخدام ثلاث قواعد بسيطة:
1. "فلتر الأهمية" (ما الذي يهم الآن؟)
أمين المكتبة لا يقوم فقط برمي الأوراق القديمة، بل ينظر إلى ما تتحدث عنه الآن.
- السيناريو: أنت تتحدث عن كلبك.
- الإجراء: يقوم أمين المكتبة بسحب الأوراق المتعلقة بكلبك وإبقائها في المقدمة وفي المركز. قد يقوم بتصغير الأوراق المتعلقة بعطلتك في عام 2010 إلى ملحوظة ملخصة صغيرة ويضعها في الخلف. كما يتخلص من الأوراق التي تتحدث عما تناولته في الإفطار قبل ثلاثة أسابيع لأنها لم تعد مهمة.
- التقنية: يُسمى هذا اختيار الذاكرة الواعي بالأهمية (Importance-Aware Memory Selection). فهو يقيم كل جزء من المحادثة بناءً على مدى فائدته للحظة الحالية.
2. "فحص استمرارية القصة" (هل الحبكة منطقية؟)
أحياناً، إذا لخصت قصة بسرعة كبيرة، فقد تفقد الحبكة. أمين المكتبة حذر جداً من كسر تسلسل القصة.
- السيناريو: ذكرت بشكل عابر أن لديك حساسية من الفول السوداني.
- الإجراء: حتى لو لم تتحدث عن الطعام منذ فترة، فإن أمين المكتبة يعرف أن هذه "حقيقة حرجة". لذا، سيحتفظ بلوحة كبيرة وواض-ة حول هذا الأمر حتى لا يقترح صديقك بالخطأ كعكة بزبذة الفول السوداني.
- التقنية: هذا هو الفلترة الحساسة للتماسك (Coherence-Sensitive Filtering). وهو يضمن عدم تناقض الذكاء الاصطناعي مع نفسه أو نسيان التفاصيل الجوهرية لمجرد توفير المساحة.
3. "حقيبة الظهر الديناميكية" (تعديل الحجم)
يتغير حجم حقيبة الظهر اعتماداً على مدى فوضوية المحادثة.
- السيناريو: أنت تجري دردشة هادئة حول الطقس.
- الإجراء: يقوم أمين المكتبة بتقليص حقيبة الظهر. فأنت لا تحتاج إلى مساحة كبيرة للدردشة البسيطة.
- السيناريو: أنت تحل مسألة رياضية معقدة أو تناقش حبكة فيلم مفاجئة.
- الإجراء: يقوم أمين المكتبة فوراً بتوسيع حقيبة الظهر لتوفير مساحة لجميع التفاصيل اللازمة لحل اللغز.
- التقنية: هذا هو التخصيص الديناميكي للميزانية (Dynamic Budget Allocation). يقرر الذكاء الاصطناعي تلقائياً مقدار الذاكرة التي سيستخدمها بناءً على صعوبة المهمة.
النتائج: صديق أسرع وأذكى
اختبر المؤلفون نظام "أمين المكتبة الذكي" هذا على بعض الاختبارات الصعبة (تسمى LOCOMO و LOCCO و LongBench) حيث يفشل الذكاء الاصطناعي عادةً بعد المحادثات الطويلة.
إليك ما حدث:
- أقل ازدحاماً: قلل النظام من كمية "الأوراق" (رموز الكمبيوتر/Tokens) المطلوبة بنسبة 25% إلى 55%. أصبحت حقيبة الظهر أخف بكثير.
- تفكير أسرع: لأن حقيبة الظهر أصبحت أخف، استطاع الذكاء الاصطناعي التفكير أسرع بنسبة 10% إلى 35%.
- ذاكرة أفضل: للمفارقة، تذكر الذكاء الاصطناعي الأشياء بشكل أفضل مما سبق. فمن خلال إزالة الحشو، استطاع التركيز على الأشياء المهمة. لم ينسَ اسم كلبك، ولم يختلط عليه الأمر.
الخلا-صة
قبل هذا، إذا كنت تريد من الذكاء الاصطناعي أن يتذكر محادثة طويلة، كان عليك منحه عقلاً ضخماً ومكلفاً وبطيئاً.
تقول هذه الورقة: "لا، أنت لا تحتاج إلى عقل أكبر. أنت فقط بحاجة إلى نظام أرشفة أفضل."
من خلال تلخيص الماضي بذكاء، والحفاظ على الحقائق الحاسمة، والتخلص من الضجيج، يمكننا الحصول على مساعدين ذكاء اصطناعي يتذكرون تاريخنا بالكامل دون أن يصبحوا بطيئين أو مشوشين. الأمر يشبه الترقية من صندوق أحذية فوضوي للذكريات إلى ملفات سحرية ومنظمة بدقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.