← أحدث الأبحاث
🤖 machine learning

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

يقدم Irminsul نظام تخزين مؤقت أصلي مستقل عن الموضع للنماذج اللغوية الكبيرة الوكيلية (Agentic LLMs) يستفيد من البنية الهيكلية لانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention) لتمكين التخزين المؤقت للمفاتيح والقيم القائم على المحتوى، محققاً استرداداً لرموز المطالبة (prompt tokens) يصل إلى 83% وتوفيراً في طاقة مرحلة الملء المسبق (prefill energy) بنسبة 63% عبر التغلب على مشكلات إبطال التخزين المؤقت المتأصلة في نهج مطابقة البادئة التقليدي.

المؤلفون الأصليون: Bole Ma, Jan Eitzinger, Harald Köstler

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bole Ma, Jan Eitzinger, Harald Köstler

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة مزدحمة للغاية وعالية السرعة، حيث يتعين على أمين المكتبة (الذكاء الاصطادي) قراءة كومة ضخمة من المستندات للإجابة على سؤال ما. لكي يكون سريعاً، يحتفظ أمين المكتبة بـ "ورقة غش" (ذاكرة مؤقتة/cache) لأحدث الصفحات التي قرأها حتى لا يضطر لإعادة قراءتها من الصفر في كل مرة.

المشكلة: "أين" مقابل "ماذا"

في الطريقة القديمة (المسماة التخزين المؤقت للبادئة - Prefix Caching)، كان تنظيم ورقة الغش الخاصة بأمين المكتبة يعتمد بدقة على الموقع:

  • "الصفحة 1 هي أمر النظام (System Prompt)."
  • "الصفحة 2 هي المستند أ."
  • "الصفحة 3 هي المستند ب."

إذا سأل أمين المكتبة سؤالاً جديداً وتغير الترتيب قليلاً — على سبيل المثال، "الصفحة 1 لا تزال هي أمر النظام، ولكن المستند أ أصبح الآن في الصفحة 5" — فإن ورقة الغش القديمة تتعطل. يفكر أمين المكتبة: "أوه، الصفحة 2 مختلفة، لذا يجب عليّ رمي ورقة الغش بأكملها وإعادة قراءة كل شيء من البداية".

في عالم الذكاء الاصطناعي الوكيل (Agentic AI) (الذكاء الاصطناعي الذي يستخدم الأدوات، ويبحث في الويب، ويتحدث مع ذكاء اصطناعي آخر)، يحدث هذا باستمرار. قد يستدعي الذكاء الاصطناعي نفس المستند، ولكن لأنه يدرجه في جزء مختلف من المحادثة، يتغير "الموقع". النظام القديم يرى ذلك كفوضى جديدة تماماً غير قابلة للقراءة، مما يجبر الذكاء الاصطناعي على إضاعة الوقت والطاقة في إعادة قراءة أشياء يعرفها بالفعل.

الحل: إيرمينسول (أمين مكتبة "المحتوى")

تقدم الورقة نظاماً جديداً يسمى إيرمينسول (Irminsul). بدلاً من تنظيم ورقة الغش بناءً على أين تقع الصفحة، يقوم إيرمينسول بتنظيمها بناءً على ما تقوله الصفحة فعلياً.

فكر في الأمر كالتالي:

  • الطريقة القديمة: "أنا لا أتذكر الكتاب إلا إذا كان على الرف الثالث."
  • إيرمينسول: "أنا أتذكر الكتاب لأنه نسخة من هاري بوتر، بغض النظر عن الرف الذي يوجد عليه."

يقوم إيرمينسول بتقسيم المحادثة إلى أجزاء (chunks) بناءً على النص الفعلي (المحتوى). إذا رأى الذكاء الاصطناعي "المستند أ" مرة أخرى، حتى لو كان في مكان مختلف، يقول إيرمينسول: "لقد رأيت هذا النص المحدد من قبل! يمكنني إعادة استخدام ملاحظاتي".

السر الخفي: تعديل "الموقع"

قد تتساءل: "إذا كان النص هو نفسه، ولكن الموقع مختلف، ألن يرتبك الذكاء الاصطناعي؟"

نعم، عادةً. في الذكاء الاصطناعي، "موقع" الكلمة مهم جداً (مثل معرفة ما إذا كانت الكلمة في بداية أو نهاية الجملة).

  • المشكلة القديمة: لإصلاح الموقع، كان على الأنظمة القديمة إعادة كتابة ورقة الغش بالكامل لكل كلمة. كان الأمر يشبه إعادة كتابة كتاب كامل لمجرد تغيير رقم الصفحة. كان ذلك بطيئاً ومكلفاً.
  • خدعة إيرمينسول: تركز الورقة على نوع محدد من بنية الذكاء الاصطناعي يسمى MLA (الانتباه الكامن متعدد الرؤوس). هذه البنية مميزة لأنها تقسم "الملاحظات" إلى جزأين:
    1. المحتوى (90%): المعنى الفعلي للكلمات. هذا الجزء متطابق بغض النظر عن الموقع.
    2. الموقع (10%): علامة صغيرة تقول "أنا هنا".

يدرك إيرمينسول أنه يحتاج فقط إلى تعديل علامة الموقع الصغيرة هذه (10%). إنه يستخدم "التواءً" رياضياً ذكياً (يسمى δ\delta-rotation) لتحديث علامة الموقع فوراً دون إعادة كتابة الكتاب بأكمله. الأمر يشبه التقاط صورة لمستند ثم تمريره ببساطة إلى مكان جديد على المكتب، بدلاً من التقاط صورة جديدة للغرفة بأكملها.

النتائج

اختبرت الورقة هذا النظام على ثلاثة أنظمة ذكاء اصطناعي حقيقية (DeepSeek و Kimi و JoyAI) تعمل كوكلاء.

  • الاستعادة: في المهام المعقدة حيث يقوم الذكاء الاصطناعي بتحريك المستندات حول بعضها، تمكن إيرمينسول من إعادة استخدام حوالي 77% إلى 83% من العمل الذي كان النظام القديم يتخلص منه.
  • الطاقة: نظرًا لأنه لا يضطر لإعادة قراءة النص، فإنه يوفر حوالي 63% من الطاقة اللازمة لمعالجة تلك الأجزاء المتكررة.
  • الدقة: يجيب الذكاء الاصطناعي بنفس دقة السابق؛ فهو لا يرتبك بسبب الطريقة الجديدة.

قاعدة "الصفحة الأولى"

هناك عقبة صغيرة واحدة. الكلمات القليلة الأولى من أي محادثة تعمل مثل "مرساة جاذبية" لانتباه الذكاء الاصطناعي. وجدت الورقة أنه إذا حاولت إعادة استخدام جزء يبدأ في بداية المحادثة مباشرة، فإن الذكاء الاصطناعي يرتبك.

  • الحل: يقوم إيرمينسول ببساطة بإعادة قراءة الجزء الأول من النص (أول 32 كلمة) في كل مرة، ولكن بالنسبة لكل شيء بعد ذلك، فإنه يستخدم "إعادة الاستخدام القائم على المحتوى" الذكي. هذه التكلفة الضئيلة تضمن أن يعمل بقية النظام بشكل مثالي.

الملخص

إيرمينسول هو طريقة أذكى لكي يتذكر الذكاء الاصطناعي الأشياء. بدلاً من القول: "أنا أتذكر هذا لأنه كان في الفتحة رقم 5"، يقول: "أنا أتذكر هذا لأنه نفس القصة". ومن خلال إدراك أن "القصة" (المحتوى) أكثر أهمية من "الفتحة" (الموقع)، ومن خلال استخدام خدعة خاصة لتعديل علامة الموقع بسرعة، فإنه يجعل وكلاء الذكاء الاصطناعي أسرع، وأرخص في التشغيل، وأفضل بكثير في التعامل مع المحادثات المعقدة والمتغيرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →