← أحدث الأبحاث
💬 NLP

Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

تقوم هذه الورقة البحثية بقياس تكاليف الخدمة ودقة ثلاثة أنظمة ذاكرة وكيلية مقابل الاستراتيجيات القياسية، كاشفةً أن التكاليف مدفوعة بسلوكيات النظام الداخلية وليس بطول المحادثة وحدها، وتتفاوت بشكل كبير عبر مختلف النماذج الأساسية والأنظمة، وتتضمن مقايضة لا يوجد فيها حل واحد يحسن كلاً من التكلفة والدقة معاً.

المؤلفون الأصليون: Natchanon Pollertlam, Witchayut Kornsuwannawit

نُشر 2026-08-13
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Natchanon Pollertlam, Witchayut Kornsuwannawit

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تتحدث إلى صديق آلي ذكي للغاية، ولكنه نساي قليلاً. لقد كنت تدردش معه لأسابيع، وتشاركه القصص والخطط والأسرار. الآن، تريد أن تسأل: "هل تتذكر مطعم البيتزا الذي تحدثنا عنه قبل ثلاثة أسابيع؟". إذا لم يكن لدى الروبوت ذاكرة، فسيتعين عليك إعادة سرد قصة صداقتكما بأكملها من اليوم الأول في كل مرة تطرح فيها سؤالاً. هذا يشبه إرسال حقيبة ظهر ضخمة وثقيلة تحتوي على كل كلمة قلتها للروبوت لمجرد طرح سؤال بسيط. هذا الأسلوب ينجح، لكنه يصبح ثقيلاً وبطيئاً ومكلفاً للغاية بسرعة كبيرة.

لإصلاح ذلك، بنى المهندسون "أنظمة ذاكرة" لهذه الروبوتات. فبدلاً من حمل الحقيبة الثقيلة بأكملها، يقوم الروبوت بكتابة ملاحظات صغيرة أو حقائق أو ملخصات في دفتر ملاحظات خاص. عندما تسأل سؤالاً، فإنه يكتفي بقلب الصفحة الصحيحة وقراءة الملاحظة. يبدو هذا مثالياً: أخف وزناً، وأسرع، وأرخص. ولكن هنا تكمن المشكلة: كتابة الملاحظات، وتنظيمها، وإيجاد الصفحة الصحيحة يتطلب جهداً أيضاً. السؤال الكبير هو: هل يوفر الروبوت المال باستخدام دفتر الملاحظات، أم أن تكلفة إدارة دفتر الملاحظات تجعل الأمر في الواقع أكثر تكلفة من مجرد حمل الحقيبة الثقيلة؟ هذه الورقة البحثية تغوص في هذا الغموض تحديداً، حيث تقيس التكلفة الحقيقية لهذه الحيل الذاكرية لترى ما إذا كانت تستحق التكلفة بالفعل.


مواجهة تكلفة الذاكرة الكبرى

في هذه الدراسة، أقام الباحثون سباقاً هائلاً لمعرفة التكلفة الحقيقية لإبقاء ذاكرة روبوت الدردشة حية. لم يكتفوا بالتخمين؛ بل أجروا تجربة منضبطة باستخدام ثلاثة "أنظمة ذاكرة" مختلفة (فكر فيها كطرق مختلفة لتنظيم ذلك الدفتر): Mem0، وHindsight، وMastra Observational Memory.

ولضمان عدالة الاختبار، قارنوا هذه الأنظمة باستراتيجيتين متطرفتين:

  1. "النافذة المتدحرجة" (الأساس الرخيص): وهي تشبه تذكر آخر 10 أشياء قلتها فقط. إنها رخيصة جداً ولكنها تنسى كل شيء آخر.
  2. "النص الكامل" (الأساس المكلف): هذه هي طريقة "الحقيبة الثقيلة". في كل مرة تسأل فيها سؤالاً، يعيد الروبوت قراءة تاريخ محادثتك بالكامل من أول كلمة.

قاموا بتشغيل هذه الأنظمة عبر محادثات تصل إلى 400 دورة (أي 400 رسالة متبادلة) واختبروها عبر 665 سؤالاً محدداً لمعرفة ما إذا كان الروبوت يتذكر الأشياء الصحيحة بالفعل. كما اختبروا "عقلين" مختلفين (نماذج أساسية) للروبوت لمعرفة ما إذا كان نوع العقل سيغير التكلفة.

المفاجأة الكبرى: لا يمكنك توقع فاتورة التكلفة

الاكتشاف الكبير الأول هو أنه لا يمكنك مجرد النظر إلى طول المحادثة أو حجم الرسائل لتخمين التكلفة. حاول الباحثون بناء معادلة رياضية بسيطة للتنبؤ بالتكلفة بناءً على طول المحادثة وحجم الرسائل.

  • بالنسبة لاستراتيجيات "النص الكامل" و"النافذة المتدحرجة"، نجحت الرياضيات بشكل مثالي. إذا كنت تعرف عدد الكلمات التي أرسلتها، فأنت تعرف بالضبط كم ستكلفك.
  • أما بالنسبة لأنظمة الذاكرة، فقد فشلت الرياضيات فشلاً ذريعاً. لقد أخطأت المعادلة في تقدير التكلفة الفعلية بنسبة تتراوح بين 18% إلى 69%.

لماذا؟ لأن تكلفة نظام الذاكرة لا تتعلق فقط بمقدار ما تتحدث عنه؛ بل تتعلق بما يفعله النظام داخلياً أثناء حديثك. أحياناً يقرر النظام كتابة ملخص طويل، وأحياناً أخرى يلتقط حقيقة سريعة فقط. وأحياناً يعيد تنظيم دفتر ملاحظاته بالكامل. هذه القرارات الداخلية مدفونة في محتوى المحادثة، وليس في طولها فقط. إنه يشبه محاولة التنبؤ بتكلفة رحلة برية بمجرد النظر إلى الخريطة، دون معرفة ما إذا كان السائق سيتوقف لتناول غداء فاخر أو سيكتفي بقطعة بسكويت سريعة. "الغداء" (المعالجة الداخلية) يختلف بشكل كبير، مما يجعل الفاتورة الإجمالية غير قابلة للتنبؤ بها. إن محاولة التنبؤ بتكلفة الرحلة من خلال الخريطة فقط لن تنجح إذا لم تكن تعرف ما إذا كان السائق سيتوقف لتناول وجبة دسمة أو مجرد وجبة خفيفة.

نقطة "التعادل": متى يستحق دفتر الملاحظات العناء؟

سأل الباحثون سؤالاً حاسماً: عند أي نقطة يصبح استخدام نظام الذاكرة أرخص من مجرد إعادة قراءة التاريخ الكامل؟

الإجابة هي: يعتمد ذلك كلياً على النظام وعقل الروبوت.

  • كان Mastra Observational Memory هو الأسرع. في بعض الحالات، كان أرخص من طريقة "النص الكامل" منذ الدورة الأولى (الدورة 0).
  • استغرق Mem0 وقتاً أطول قليلاً، حيث وصل عادةً إلى نقطة التعادل حول الدورة 82، ولكن فقط إذا كانت الرسائل طويلة بما يكفي.
  • كان Hindsight هو الأبطأ. في كثير من الحالات، لم يصبح أرخص من طريقة "النص الكامل" حتى بعد 400 دورة. في الواقع، بالنسبة لبعض الإعدادات، ظل أكثر تكلفة في نهاية الاختبار.

هذا يعني أنه إذا كانت لديك محادثة قصيرة، فإن استخدام نظام ذاكرة معقد قد يكلف أكثر من مجرد إعادة إرسال تاريخ الدردشة بالكامل. يجب أن تتحدث لفترة معينة (نقطة التعادل) قبل أن يبدأ نظام الذاكرة في توفير المال لك.

الدقة مقابل التكلفة: لا يوجد غداء مجاني

تحققت الدراسة أيضاً مما إذا كانت أنظمة الذاكرة جيدة في الإجابة على الأسئلة. أظهرت النتائج نطاقاً واسعاً من الأداء:

  • تراوحت الدقة بين 21% و54%.
  • سجل Mem0 أكبر التقلبات في الدقة، حيث كان يؤدي جيداً مع بعض عقول الروبوتات وسوءاً مع عقول أخرى.
  • كان Hindsight هو الأكثر دقة بشكل عام (غالباً فوق 50%)، ولكنه كان أيضاً الأكثر تكلفة في التشغيل.
  • كان Mastra أداءً متوسطاً، ولكنه غالباً ما كان الأكثر فعالية من حيث التكلفة عند احتساب عدد الإجابات الصحيحة التي قدمها.

وجد الباحثون أن اختيار "عقل" الروبوت (النموذج الأساسي) كان مهماً بقدر اختيار نظام الذاكرة. فنظام الذاكرة الذي كان رخيصاً على عقل روبوت معين قد يكون مكلفاً على عقل آخر.

الحكم النهائي

تخلص الورقة البحثية إلى أنه لا يوجد نظام ذاكرة واحد "أفضل".

  • إذا كنت تريد الخيار الأرخص لكل إجابة صحيحة على عقل روبوت محدد، فقد كان Mastra على عقل gpt-oss-20b هو الفائز (بتكلفة حوالي 0.028 دولار لكل إجابة صحيحة عند 100 دورة).
  • إذا استخدمت عقل روبوت مختلف (Gemma 4 26B A4B)، يصبح Mem0 هو الخيار الأرخص.
  • أما Hindsight، ورغم دقته، فغالباً ما يكون مكلفاً للغاية بحيث لا يستحق العناء إلا إذا كانت المحادثة طويلة جداً.

الخلاصة الرئيسية هي أنه لا يمكنك اختيار نظام ذاكرة لمجرد أنه يبدو رائعاً. يجب أن تنظر إلى حالتك الخاصة: كم ستكون مدة المحادثة؟ ما هو حجم الرسائل؟ وأي عقل روبوت ستستخدم؟ عندها فقط يمكنك معرفة ما إذا كان نظام الذاكرة سيوفر لك المال أم سيضيف فقط إلى فاتورتك. إن "الاستدعاء الكامل" لنظام الذاكرة يأتي بتكلفة، وهذه التكلفة أكثر تعقيداً بكثير من مجرد عد الكلمات التي تكتبها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →