← أحدث الأبحاث
💻 computer science

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

تقدم الورقة البحثية CacheTTL، وهو نظام جديد لإدارة ذاكرة التخزين المؤقت لـ KV يستخدم آلية زمن بقاء ديناميكي للاحتفاظ الانتقائي بالذاكرة المخبأة أثناء فترات التوقف الناتجة عن استدعاء الأدوات في سير عمل وكلاء النماذج اللغوية الكبيرة متعدد الخطوات، مما يحقق تحسناً يزيد عن 8 أضعاف في وقت إكمال المهام وتعزيزاً في معدل الإنتاجية مقارنة بسياسات الإخلاء الحالية.

المؤلفون الأصليون: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مطبخاً فائق الكفاءة والسرعة، حيث يقوم طاهٍ ماهر (الذكاء الاصطناعي) بطهي وجبات معقدة لعديد من الزبائن في وقت واحد.

المشكلة: المطبخ الذي "يتوقف ويبدأ"

في نظام الدردشة العادي للذكاء الاصطناعي، يطهو الطاهي طبقاً، ثم يقدمه، ثم يبدأ فوراً في تحضير الطبق التالي. إذا ازحم المطبخ، يقوم الطاهي برمي المكونات التي تم تحضيرها جزئياً للطبق الحالي لإفساح المجال لطلب زبون جديد. هذا يعمل بشكل جيد للمحادثات البسيطة.

لكن "وكلاء" الذاء الاصطناعي الحديثين مختلفون؛ فهم لا يكتفون بالدردشة فحسب، بل يتصرفون أيضاً. إنهم يفكرون، ثم يستدعون أداة (مثل التحقق من حالة الطقس أو البحث في الويب)، ثم ينتظرون النتيجة، وبعد ذلك يواصلون طهي نفس الوجبة.

إليك الخلل في الأنظمة الحالية:

  1. يبدأ الطاهي في طهي وجبة.
  2. يتوقف الطاهي لاستدعاء أداة (مثلاً: "تحقق من حالة الطقس").
  3. ولأن الطاهي في حالة "توقف"، يفترض نظام المطبخ أن الطلب قد انتهى. فيقوم برمي المكونات التي تم تحضيرها جزئياً (ذاكرة الـ KV Cache) لإفساح المجال لطلبات أخرى.
  4. تنتهي الأداة في ثانيتين. يعود الطاهي ليكون جاهزاً للمواصلة.
  5. الكارثة: المكونات اختفت! يتعين على الطاهي إما إعادة شراء المكونات من مستودع بعيد (إخراج البيانات إلى المعالج CPU offloading) أو إعادة تقطيع كل شيء من الصفر (إعادة الحوسبة).
  6. والأسوأ من ذلك، ولأن المكونات قد رُميت، يتعين على الطاهي الانتظار في الطابور خلف زبائن آخرين لمجرد الحصول على مكان على لوح التقطيع مرة أخرى.

يتكرر هذا الأمر مراراً وتكراراً. إذا استغرق الوكيل 20 خطوة لحل مشكلة ما، فقد يهدر 20 ضعف الجهد في إعادة العمل والانتظار في الطابور.

الحل: CacheTTL (مؤقت "ابقِهِ جاهزاً")

قام الباحثون ببناء نظام جديد يسمى CacheTTL. تخيل أن هذا النظام يمنح الطاهي "مؤقت ابقِهِ جاهزاً" خاصاً لكل طلب.

بدلاً من رمي المكونات فور توقف الطاهي، يقول النظام: "انتظر! قد يعود هذا الطاهي خلال ثانيتين. دعونا نبقي المكونات على الطاولة لفترة زمنية محددة (وقت البقاء - TTL)."

إليك كيف يعمل الأمر ببساطة:

  1. التنبؤ الذكي: ينظر النظام إلى السجل. "عادةً، عندما يستدعي الطاهي 'التحقق من الطقس'، يستغرق الأمر حوالي ثانيتين. وعندما يستدعي 'البحث في الويب'، يستغرق 5 ثوانٍ".
  2. المؤقت: يضبط النظام مؤقتاً بناءً على هذا التنبؤ. إذا كان من المتوقع أن تستغرق الأداة ثانيتين، فستبقى المكونات على الطاولة لمدة 2.5 ثانية.
  3. العائد:
    • إذا عاد الطاهي في الوقت المناسب: ستكون المكونات لا تزال هناك! سيكمل الطاهي من حيث توقف تماماً. لا إعادة تقطيع، ولا انتظار في الطابور.
    • إذا تأخر الطاهي: إذا استغرقت الأداة 10 ثوانٍ بدلاً من ثانيتين، سينتهي المؤقت. يقوم النظام بأمان برمي المكونات لإفساح المجال لزبائن آخرين، مما يمنع ازدحام المطبخ.

لماذا يعد هذا أفضل مما كان لدينا من قبل؟

الأنظمة السابقة حاولت التخمين فيما إذا كان ينبغي لها الاحتفاظ بالمكونات، لكنها كانت تنظر إلى شيء واحد فقط: "هل إعادة شراء المكونات مكلفة؟" لقد تجاهلت المشكلة الأكبر: "كم سيضطر الطاهي للانتظار في الطابور للعودة إلى العمل؟"

نظام CacheTTL ينظر إلى كليهما:

  • تكلفة إعادة صنع الطعام.
  • تكلفة الانتظار في الطابور (تأخير الطابور).

إنه يحسب الوقت المثالي للاحتفاظ بالمكونات على الطاولة لتوفير أكبر قدر من الوقت الإجمالي.

النتائج

اختبر الباحثون هذا النظام مع وكلاء ذكاء اصطناعي حقيقيين يحلون أخطاء البرمجيات، ويبحثون في الويب، ويكتبون الأكواد. ووجدوا أن:

  • السرعة: أنهوا مهامهم بسرعة تصل إلى 8 أضعاف في بعض الاختبارات الواقعية.
  • الكفاءة: استطاع المطبخ (وحدة معالجة الرسوميات GPU) التعامل مع المزيد من الطلبات في وقت واحد دون أن يعلق.
  • المتانة: حتى لو استغرقت استدعاءات الأدوات وقتاً أطول من المتوقع، لم يتعطل النظام أو يتوقف؛ بل سمح للمؤقت بالانتهاء فقط وتحرك للأمام.

باخت إجراء مختصر

CacheTTL يشبه مدير مطبخ ذكي يعرف أنه عندما يتوقف الطاهي لإجراء مكالمة هاتفية، فإنه لم ينتهِ من الطهي بعد. من خلال إبقاء المكونات جاهزة للفترة المناسبة تماماً، فإنه يمنع الطاهي من الاضطرار للبدة من جديد أو الانتظار في الطابور، مما يجعل المطبخ بأكل يعمل بسلاسة وسرعة أكبر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →