Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation
تقدم هذه الورقة xMemory، وهو إطار عمل مبتكر لذاكرة الوكيل يعمل على تحسين تقنية RAG القياسية من خلال فصل سجلات التفاعل إلى مكونات قابلة لإعادة الاستخدام وتجميعها هرمياً لتمكين الاسترجاع من الأعلى إلى الأسفل، مما يقلل من التكرار مع الحفاظ على التفاصيل الجوهرية، وبالتالي يعزز جودة الإجابة وكفاءة الاستدلال.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث "Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation" (xMemory)، باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة: "المكتبة المليئة بالضجيج" مقابل "أمين المكتبة الذكي"
تخيل أنك مساعد ذكاء اصطناعي ("عميل" أو Agent) تتحدث مع إنسان على مدار عدة أشهر. لديك ذاكرة ضخمة لكل محادثة أجريتها معه.
الطريقة القديمة (RAG القياسي):
تخيل ذاكرتك كمكتبة ضخمة وفوضوية حيث كل كتاب هو مجرد نص خام لمحادثة ما. عندما يطرح المستخدم سؤالاً، يقوم "أمين المكتبة" (الذكاء الاصطناعي) بجلب أفضل 5 كتب تحتوي على كلمات مشابهة للسؤال.
- العيب: في المحادثات الطويلة، غالباً ما يكرر الناس أنفسهم أو يتحدثون عن نفس الموضوع بطرق مختلفة قليلاً. إذا سألت: "متى فقدت وظيفتي؟"، قد يجلب النظام القديم خمس صفحات مختلفة من خمسة أيام مختلفة ذكرت فيها فقدان وظيفتك. هذا يعطيك كومة من المعلومات المتكررة والمربكة. الأمر يشبه طلب تاريخ محدد، فيقوم أمين المكتبة بإعطائك خمس تقاويم مختلفة تقول جميعها "يناير" ولكنها لا تخبرك أي يناير تقصد.
الطالطريقة الجديدة (xMemory):
يرى المؤلفون أن ذاكرة العميل ليست مثل مكتبة من الكتب العشوائية؛ بل هي أشبه بتدفق مستمر من الأحداث حيث تكون التفاصيل متراصة بدقة. ولحل هذه المشكلة، اقترحوا نظاماً جديداً يسمى xMemory.
الفكرة الجوهرية: "الفصل قبل التجميع"
تقترح الورقة عملية من خطوتين: الفصل (Decouple) (استخراج الأجزاء المهمة) ثم التجميع (Aggregate) (تنظيمها).
1. الفصل: "مستخرج الحقائق"
بدلاً من التعامل مع المحادثة بأكملها ككتلة واحدة كبيرة، يعمل xMemory كمحرر ماهر. فهو يقرأ المحادثة ويستخرج منها الحقائق المحددة والقابلة لإعادة الاستخدام والتحديثات والتفاصيل، ويفصلها عن "الحشو" (مثل "مرحباً"، "كيف حالك"، أو التحيات المتكررة).
- تشبيه: تخيل أن لديك مكتباً فوضوياً مغطى بالملاحظات اللاصقة. بعض الملاحظات تقول "اجتماع في الساعة 2 ظهراً"، وأخرى تقول "اجتماع في الساعة 2 ظهراً (مؤكد)"، وأخرى تقول "اجتماع في الساعة 2 ظهراً (ملغى)".
- الطريقة القديمة تجلب كومة الملاحظات بأكملها.
- xMemory ينزع فقط الملاحظة الوحيدة الأكثر دقة: "اجتماع في الساعة 2 ظهراً". إنه يعزل الحقيقة عن الضجيج.
2. التجميع: "نظام الملفات الذكي"
بمجرد عزل الحقائق، لا يقوم xMemory بمجرد رميها في سلة، بل ينظمها في تسلسل هرمي:
- الأجزاء (Segments): مجموعات صغيرة من الأحداث ذات الصلة (مثل موضوع محادثة معين).
- المكونات (Components): الحقائق المحددة المستخرجة من تلك الأجزاء (مثلاً: "المستخدم فقد وظيفته في DoorDash في يناير").
- المجموعات (Groups): مجلدات عالية المستوى تحتوي على مكونات ذات صلة (مثلاً: "تاريخ توظيف المستخدم").
الأمر الجوهم هو أن هذا النظام قابل للمراجعة. إذا كانت لديك محادثة جديدة توضح حقيقة قديمة، يمكن لـ xMemory العودة، وتقسيم مجلد فوضوي، أو دمج مجلدين صغيرين للحفاظ على التنظيم المثالي. إنه يشبه خزانة ملفات تعيد تنظيم نفسها تلقائياً عند إضافة مستند جديد.
كيف يجد الإجابات: "المحقق من الأعلى إلى الأسأس"
عندما تطرح سؤالاً، لا يبحث xMemory عن الكلمات المفتاحية فحسب، بل يستخدم نهجاً من الأعلى إلى الأسفل (Top-Down):
- المرحلة الأولى: البحث عن الهيكل العظمي. يبحث أولاً في "المجموعات" و"المكونات" عالية المستوى (الحقائق). يختار "العمود الفقري" الأكثر صلة من الأدلة. ويسأل نفسه: "هل لدي الحقائق الصحيحة للإجابة على هذا؟"
- المرحلة الثانية: فحص عدم اليقين. فقط إذا لم تكن الحقائق واض-حة بما يكفي، فإنه يتعمق أكثر. يتوسع ليشمل أجزاء المحادثة الأصلية والرسائل الخام فقط إذا كان بحاجة إلى مزيد من التفاصيل لتقليل "عدم اليقين" لديه.
- تشبيه: تخيل محققاً يحل جريمة ما.
- الطريقة القديمة: يمسك المحقق بـ 20 إفادة شاهد تبدو جميعها متشابهة بشكل غامض ويقرأها جميعاً.
- xMemory: يتحقق المحقق أولاً من "ملخص ملف القضية" (المجموعة). إذا قال الملخص "المشتبه به كان في البنك"، يتوقف المحقق عند هذا الحد. ولكن إذا كان الملخص غامضاً، فإنه يسحب بعد ذلك النص المحدد للشهادة (الجزء) للحصول على الوقت الدقيق.
- تشبيه: تخيل محققاً يحل جريمة ما.
لماذا يهم هذا (النتائج)
اختبرت الورقة هذا النظام على مجموعتي بيانات (LoCoMo و PerLTQA) باستخدام نماذج ذكاء اصطناعي مختلفة. وهذا ما وجدوه:
- إجابات أفضل: لأن xMemory يفصل "الأدلة الحاسمة" عن "الضجيج المتكرر"، فإن الذكاء الاصطناعي يقدم إجابات أكثر دقة، خاصة بالنسبة للأسئلة الصعبة المتعلقة بالوقت أو التغييرات المحددة في حياة المستخدم.
- أرخص وأسرع: يستخدم النظام عدداً أقل من "الرموز" (Tokens) (وهي عملة معالجة الذكاء الاصطناعي). بدلاً من تغذية الذكاء الاصطناعي بكتلة ضخمة وفوضوية من النص، فإنه يغذيه بحزمة مركزة ومكثفة من الحقائق.
- الكفاءة: يقوم باسترجاع أدلة "أكثر كثافة". بدلاً من العثود إلى 10 صفحات تقول "أنا أحب البيتزا"، فإنه يجد الملاحظة المحددة التي تقول "أنا أحب بيتزا الببروني".
ملخص في جملة واحدة
يعالج xMemory مشكلة ارتباك الذكاء الاصطناعي بسبب محادثاته الطويلة من خلال فصل الحقائق المهمة عن الضجيج أولاً، ثم تنظيمها في تسلسل هرمي ذاتي التحديث، ثم استرجاع القدر المطلوب فقط من التفاصيل للإجابة على السؤال، مما يوفر الوقت والمال مع الوصول إلى الإجابة الصحيحة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.