← أحدث الأبحاث
💬 NLP

KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

يُعد KV-Fold بروتوكول استدلال بسيط للسياقات الطويلة لا يتطلب تدريباً، حيث يعامل ذاكرة التخزين المؤقت لـ KV كمتراكم طي يساري (left-fold accumulator) لتمكين معالجة تسلسلية مستقرة وفعالة من حيث الذاكرة عبر السلاسل العميقة دون الحاجة إلى إعادة تدريب النموذج أو تغييرات هيكلية.

المؤلفون الأصليون: Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة عبقرياً وفائق الذكاء (النموذج البرمجي للذكاء الاصطناعي) يمكنه قراءة كتاب والإجابة عن أسئلة حوله. لكن هناك عقبة: مكتب هذا الأمين صغير جداً، حيث لا يمكنه إلا حمل بضع صفحات من الكتاب مفتوحة في وقت واحد. إذا أعطيته رواية مكونة من 1,000 صفحة، فلن يتمكن من قراءتها بالكامل دفعة واحدة دون أن يفيض مكتبه.

عادةً، لحل هذه المشكلة، نطلب من أمين المكتبة إما:

  1. نسيان البداية: النظر فقط إلى الصفحات الأخيرة (مثل النافذة المنزلقة).
  2. تلخيص الماضي: محاولة ضغط القصة بأكملها في ملاحظة صغيرة (وهو ما يؤدي غالباً إلى فقدان التفاصيل).
  3. بناء مكتب أكبر: وهو أمر مكلف وغالباً ما يكون مستحيلاً للكتب الضخمة.

KV-Fold هي حيلة ذكية جديدة تسمح لأمين المكتبة بقراءة الكتاب بالكامل دون الحاجة إلى مكتب أكبر، ودون الحاجة إلى التلخيص، ودون نسيان البداية.

الفكرة الجوهرية: حيلة "الطي"

تخيل الكتاب كأنه شريط طويل من الورق. بدلاً من محاولة قراءة الشريط بأكتمله دفعة واحدة، قم بتقسيمه إلى أجزاء صغيرة يمكن التحكم فيها.

  1. الجزء الأول: يقرأ أمين المكتبة الجزء الأول. وبينما يقرأ، يدون ملاحظات على "ملحوء ملاحظات لاصقة" خاصة (هذا هو KV Cache). تحتوي هذه الملاحظة على جوهر ما قرأه للتو، ولكن بطريقة تسمح له بالرجوع إلى تفاصيل محددة لاحقاً.
  2. الجزء التالي: عندما ينتقل إلى الجزء الثاني، فإنه لا يرمي الملحوظة اللاصقة الأولى. بدلاً من ذلك، يقوم بلصق الملاحظات الجديدة من الجزء الثاني بجانب الملاحظات الأولى مباشرة. الآن أصبح لديه شريط أطول من الملاحظات.
  3. التكرار: يستمر في القيام بذلك. يقرأ جزءاً، يضيف الملاحظات إلى الشريط المتنامي، ثم ينتقل إلى الجزء التالي.

تسمي الورقة البحثية هذا بـ "الطي الأيسر" (Left Fold). تخيل أنك تطوي ورقة طويلة مراراً وتكراراً. كل طية تضيف طبقة جديدة، لكن الطبقات السابقة لا تزال موجودة بالأسفل، ويمكن الوصول إليها. يحمل أمين المكتبة هذه المجموعة المتزايدة من الملاحظات معه خطوة بخطوة.

المفاجأة الكبرى: لا يصبح الأمر "فوضوياً"

قد تعتقد: "إذا استمررت في إضافة ملاحظات إلى كومة، فسينتهي الأمر بأمين المكتبة في حالة من الارتباك. قد تضيع ملاحظات الصفحة رقم 1 وسط ضجيج الصفحة رقم 500".

لقد اكتشفت الورقة البحثية شيئاً مذهلاً: أمين المكتبة لا يرتبك.

  • "هضبة الانجراف" (Drift Plateau): في البداية، عندما ينتقل أمين المكتبة من الجزء الأول إلى الجزء الثاني، يتغير أسلوب تفكيره قليلاً (مثل الاعتياد على غرفة جديدة). ولكن بعد بضع خطوات فقط، يتوقف هذا التحول. إنه يصل إلى "هضبة مسطحة".
  • الحالة المستقرة: حتى بعد قراءة مئات الأجزاء (ما يصل إلى 511 خطوة في اختباراتهم)، لا يسوء أداء أمين المكتبكتب. يظل مستقراً. يبدو الأمر كما لو أن أمين المكتبة وجد إيقاعاً مريحاً وتمسك به.
  • الدقة لا تهم: حتى لو غيرت "المسطرة" التي يستخدمها أمين المكتبة للقياس (تغيير من رياضيات عالية الدقة إلى رياضيات منخفضة الدقة)، فإن النتيجة تظل كما هي. الاستقرار مبني في المنطق نفسه، وليس فقط في الرياضيات.

اختبار "الإبرة في كومة القش"

لإثبات نجاح هذا، لعب الباحثون لعبة تسمى "الإبرة في كومة القش".

  • اللعبة: أخفوا جملة محددة (الإبرة) داخل وثيقة ضخمة (كومة القش).
  • الاختبار: طلبوا من أمين المكتبة العثور على تلك الجملة بعد قراءة الوثيقة بأكملها.
  • النتيجة:
    • الطرق القديمة (البث/Streaming): إذا كانت الإبرة في الصفحات الأولى، يجدها أمين المكتبة. أما إذا كانت في المنتصف أو النهاية، فإنه ينساها لأن "مكتبه" كان صغيراً جداً.
    • KV-Fold: وجد أمين المكتبة الإبرة بنسبة 100% من المرات، حتى لو كانت مدفونة في بداية وثيقة مكونة من 128,000 كلمة. لقد تمكن من استدعاء التفاصيل الدقيقة من الجزء الأول تماماً، حتى بعد قراءة مئات الأجزاء منذ ذلك الحين.

لماذا يهم هذا الأمر (بدون المصطلحات المعقدة)

  • لا حاجة لإعادة التدريب: لست بحاجة لتعليم أمين المكتبة طريقة جديدة للتفكير. أنت فقط تغير كيفية تسليم الكتاب إليه. أمين المكتبة ذكي بما يكفي للقيام بذلك؛ نحن فقط أعطيناه سير عمل أفضل.
  • مقايضة الذاكرة: لا يزال أمين المكتبة بحاجة للاحتفاظ بكل الملاحظات (الـ KV cache) على مكتبه. لذا، ينمو المكتب مع طول الكتاب. ومع ذلك، فإن هذا أفضل بكثير من محاولة حمل الكتاب بأكمله في رأسك في وقت واحد، وهو أمر مستحيل للحواسيب الحالية.
  • الاستدعاء الدقيق: على عكس الطرق التي تلخص أو ترمي الصفحات القديمة، يحافظ KV-Fold على كل تفصيل متاحاً. إذا سألت عن شيء من الجملة الأولى تماماً، فلا يزال بإمكان أمين المكتبة العثور عليه.

ملخص التشبيه

تخيل أنك تروي قصة طويلة لصديق.

  • الطريقة القديمة: تتذكر فقط آخر 5 دقائق من القصة. إذا سألتك عن البداية، تقول: "لا أعرف".
  • طريقة KV-Fold: تحتفظ بقائمة جارية لكل شخصية وكل نقطة حبكة ذكرتها حتى الآن. وبينما تروي الجزء التالي من القصة، تنظر إلى قائمتك لتتذكر من هم الأشخاص. وعلى الرغم من أن القائمة تصبح أطول، إلا أنك لا ترتبك بها. يمكنك دائماً الإجابة على سؤال: "ما كان اسم الكلب من الجملة الأولى تماماً؟" لأن هذا الاسم لا يزال موجوداً في قائمتك، محفوظاً بدقة.

تظهر الورقة البحثية أن نماذج الذكاء الاصطناعي تمتلك بالفعل قدرة "القائمة" هذه مدمجة فيها. نحن فقط أدركنا أنه يمكننا استخدامها كحلقة تكرارية لقراءة كتب ذات طول غير محدود دون كسر ذاكرة الكمبيوتر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →